缩放点积注意力 · Scaled Dot-Product Attention

一个 Query 如何从一排 Key–Value 里"按相关度"取信息:打分 → 缩放归一 → 加权求和

Attention(Q,K,V) = Softmax( QKT / √dk ) V

Q · query "我现在要找什么信息" K1 K2 K3 K4 8.0 2.0 5.0 1.0 ÷ √dₖ 缩放 压小幅值,避开 softmax 饱和区 .65 .08 .22 .05 Σ = 1 V1 V2 V3 V4 context 输出向量
💡 考点:softmax 沿 Key 维归一,每个 Query 的注意力权重和恒为 1;÷√dk 缩放是为了让 logits 不过大、避免 softmax 进入梯度极小的饱和区;输出 = 各 Value权重的凸组合。