· liyu · ai
大模型位置编码核心解析:从绝对位置编码到 RoPE 旋转位置编码
一文搞懂 Transformer 位置编码的本质:为什么需要位置编码?从 APE 的加法注入到 RoPE 的复数旋转几何证明,再到长上下文扩展(PI、NTK、YaRN、Base 缩放)演进全貌。
一文搞懂 Transformer 位置编码的本质:为什么需要位置编码?从 APE 的加法注入到 RoPE 的复数旋转几何证明,再到长上下文扩展(PI、NTK、YaRN、Base 缩放)演进全貌。
聚焦大模型三大核心注意力机制:多头注意力(MHA)、多查询注意力(MQA)与分组查询注意力(GQA)。从张量维度(Tensor Shapes)与计算流出发,深度解读前向传播中矩阵的行、列、元素物理含义,剖析三者的优缺点与显存带宽权衡。