交叉熵 vs MSE:只惩罚正确类
为什么分类用交叉熵:one-hot 时只盯正确类的概率,梯度 ŷ−y 干净不饱和。
目标 y(one-hot)
0
类a
0
类b
1
类c ✓
0
类d
DNN 预测 v = softmax(z)
v_c=.20
正确类
损失 J = −log v_c
v_c→1
J↑
饱和区梯度对比(z 很大/很小时)
CE
∂J/∂z = ŷ − y 恒不为零 ✓
MSE
∂J/∂z ∝ f′(z) → 0 梯度消失 ✗
▶ 播放
单步
↺ 重播
💡 分类用交叉熵:one-hot 时退化为 NLL(J=−log v_c,只盯正确类);梯度 ŷ−y 干净,避免 softmax+MSE 在饱和区的梯度消失。