梯度下降「下山」演算器
从随机起点出发,沿梯度反方向一步步挪动参数,滑到损失谷底。
调学习率 η与起点,点「迭代」逐步走:核心更新式
θ ← θ − η∇L。第2章《损失函数与梯度下降》。
当前状态
步数 t0
参数 θ—
损失 L(θ)—
梯度 ∇L—
学习率 η—
状态:就绪
调好参数后点「迭代一步」开始下山。
本步更新(θ ← θ − η∇L)
θ ← θ − η · ∇L
—
梯度指向上坡方向,减去它就朝下坡走。
一句话直觉:梯度下降就是「摸黑下山」——脚下最陡的上坡是 ∇L,反着迈一步 −η∇L 就下降。 步子(η)太大会在谷底两侧来回震荡甚至发散,太小则收敛慢,恰当才能平滑滑到谷底。