大语言模型基础
Transformer 架构
注意力机制
自注意力原理
# 查询、键、值计算
Q = X × WQ
K = X × WK
V = X × WV
# 注意力权重
Attention(Q, K, V) = softmax(QK^T / √dk) V
其中:
- dk: 键向量维度
- softmax: 归一化函数
多头注意力
# 多头计算
MultiHead(Q, K, V) = Concat(head1, ..., headh)WO
where headi = Attention(QWQi, KWKi, VWVi)
特点:
- 并行计算多个注意力
- 捕获不同类型关系
- 提升模型表达能力
位置编码
正弦位置编码
PE(pos, 2i) = sin(pos / 10000^(2i/dmodel))
PE(pos, 2i+1) = cos(pos / 10000^(2i/dmodel))
特点:
- 绝对位置信息
- 周期性函数
- 外推性有限
可学习位置编码
# 参数化位置嵌入
position_embeddings = Embedding(max_seq_len, dmodel)
特点:
- 灵活学习位置关系
- 需要大量训练数据
- 可能过拟合