ResNet 残差捷径:+I 保住梯度

恒等捷径让反向传播至少有一条「无衰减」的高速路,根治深层梯度消失。

x 输入 weight W₁ ReLU weight W₂ F(x) = 残差 y 输出 identity 捷径 (x) ∂F/∂x 经 W·ReLU → 可能很小,衰减 捷径梯度 = I:等粗等亮,无衰减直达 x +I y = F(x)x ∂y/∂x = ∂F/∂xI 若最优解 ≈ 恒等,只需把 F(x) 压到 ≈ 0
💡 考点:捷径把映射写成 y=F(x)+x,求导得 ∂y/∂x=∂F/∂x+I。即使主路 ∂F/∂x 衰减到≈0,那个 +I 仍保证一条无衰减回流通路 → 深层网络也能稳定训练。