注意力演算器 · Scaled Dot-Product Self-Attention

5 个 token「我 爱 自然 语言 处理」、d=4 的迷你自注意力,客户端真实计算 Attention(Q,K,V)=softmax(QKᵀ/√dk)V。逐步看每一步矩阵;点热力图任意一行看该 query 注意到谁。可开 Causal Mask(自回归遮罩)与双头(多头注意力)。

步骤
头数
当前步骤
一句话总结:注意力就是加权平均——输出 zi 是各 value 向量 vj 的加权和,权重 αij 由 query qi 与 key kj点积相似度softmax 归一化得到。缩放 ÷√dk 防止点积过大使 softmax 饱和;Causal Mask 把「未来」置 −∞ 实现自回归(GPT 类 Decoder);多头让不同的头学到不同的注意模式。
查看 / 编辑 Q · K · V 向量(每 token 一行,d=4;双头时前 2 维归头 1、后 2 维归头 2)
改任意数值即时重算。真实模型中 Q=XWQ, K=XWK, V=XWV 由可学习矩阵投影得到,这里直接给出投影后的向量。
示意/数据取自课件:缩放点积公式与「÷√dk:112,96 → 14,12 → softmax 0.88/0.12」算例见《机器翻译》p119–120;Scale→Mask(opt.)→SoftMax 流水线与 Multi-Head 结构见《预训练语言模型》p18;Masked Self-Attention 与自回归见《大语言模型》GPT 部分。Q/K/V 数值为教学预设(头 1 预置「语义/词组」模式、头 2 预置「看前一词」模式),省略 Concat 后的 WO。快捷键 切换步骤。