ResNet 残差捷径:+I 保住梯度
恒等捷径让反向传播至少有一条「无衰减」的高速路,根治深层梯度消失。
x
输入
weight
W₁
ReLU
weight
W₂
F(x) = 残差
+
y
输出
identity 捷径 (x)
∂F/∂x 经 W·ReLU → 可能很小,衰减
捷径梯度 = I:等粗等亮,无衰减直达 x
+I
y =
F(x)
+
x
∂y/∂x =
∂F/∂x
+
I
若最优解 ≈ 恒等,只需把 F(x) 压到 ≈ 0
▶ 播放
单步 ›
↺ 重播
💡
考点
:捷径把映射写成 y=F(x)+x,求导得 ∂y/∂x=∂F/∂x
+I
。即使主路 ∂F/∂x 衰减到≈0,那个
+I
仍保证一条无衰减回流通路 → 深层网络也能稳定训练。