注意力演算器 · Scaled Dot-Product Self-Attention
5 个 token「我 爱 自然 语言 处理」、d=4 的迷你自注意力,客户端真实计算 Attention(Q,K,V)=softmax(QKᵀ/√dk)V。逐步看每一步矩阵;点热力图任意一行看该 query 注意到谁。可开 Causal Mask(自回归遮罩)与双头(多头注意力)。
头数
一句话总结:注意力就是加权平均——输出 zi 是各 value 向量 vj 的加权和,权重 αij 由 query qi 与 key kj 的点积相似度经 softmax 归一化得到。缩放 ÷√dk 防止点积过大使 softmax 饱和;Causal Mask 把「未来」置 −∞ 实现自回归(GPT 类 Decoder);多头让不同的头学到不同的注意模式。
查看 / 编辑 Q · K · V 向量(每 token 一行,d=4;双头时前 2 维归头 1、后 2 维归头 2)
改任意数值即时重算。真实模型中 Q=XWQ, K=XWK, V=XWV 由可学习矩阵投影得到,这里直接给出投影后的向量。