缩放点积注意力 · Scaled Dot-Product Attention
一个 Query 如何从一排 Key–Value 里"按相关度"取信息:打分 → 缩放归一 → 加权求和
Attention
(
Q
,
K
,
V
) =
Softmax
(
Q
K
T
/ √d
k
)
V
Q · query
"我现在要找什么信息"
K1
K2
K3
K4
8.0
2.0
5.0
1.0
÷ √dₖ 缩放
压小幅值,避开 softmax 饱和区
.65
.08
.22
.05
Σ = 1
V1
V2
V3
V4
context
输出向量
▶ 播放
单步
↺ 重置
💡 考点:softmax 沿
Key 维
归一,
每个 Query
的注意力权重和恒为 1;÷√d
k
缩放是为了让 logits 不过大、避免 softmax 进入梯度极小的饱和区;输出 = 各
Value
按
权重
的凸组合。