交叉熵 vs MSE:只惩罚正确类

为什么分类用交叉熵:one-hot 时只盯正确类的概率,梯度 ŷ−y 干净不饱和。

目标 y(one-hot) 0 类a 0 类b 1 类c ✓ 0 类d DNN 预测 v = softmax(z) v_c=.20 正确类 损失 J = −log v_c v_c→1 J↑ 饱和区梯度对比(z 很大/很小时) CE ∂J/∂z = ŷ − y 恒不为零 ✓ MSE ∂J/∂z ∝ f′(z) → 0 梯度消失 ✗
💡 分类用交叉熵:one-hot 时退化为 NLL(J=−log v_c,只盯正确类);梯度 ŷ−y 干净,避免 softmax+MSE 在饱和区的梯度消失。