梯度下降「下山」演算器

从随机起点出发,沿梯度反方向一步步挪动参数,滑到损失谷底。 调学习率 η与起点,点「迭代」逐步走:核心更新式 θ ← θ − η∇L。第2章《损失函数与梯度下降》。

0.24
-4.5
第 0 步

当前状态

步数 t0
参数 θ
损失 L(θ)
梯度 ∇L
学习率 η
状态:就绪
调好参数后点「迭代一步」开始下山。

本步更新(θ ← θ − η∇L)

θθη · ∇L
梯度指向上坡方向,减去它就朝下坡走。

一句话直觉:梯度下降就是「摸黑下山」——脚下最陡的上坡是 ∇L,反着迈一步 −η∇L 就下降。 步子(η)太大会在谷底两侧来回震荡甚至发散,太小则收敛慢,恰当才能平滑滑到谷底。