Self-Attention 自注意力
一个词如何决定该「关注」句子里的哪些词 —— Transformer 的核心机制
Attention(Q, K, V) = softmax( Q·Kᵀ / √dk ) · V
步 1 / 6
记住这点:注意力 = 先用相似度(Query·Key)打分决定「看谁」, 再把「看到的内容」(Value)按权重揉成新表示。分数越大 → 权重越高 → 越关注。 √dk 只是缩放,防止点积过大让 softmax 梯度消失。