梯度下降
Gradient Descent常用沿损失函数梯度的反方向一步步调参数,让损失越来越小的优化方法。
梯度下降是训练神经网络的核心优化方法,一般认为由数学家柯西在 1847 年最早提出。梯度是损失函数对每个参数的偏导数,指向损失上升最快的方向;每一步把参数往反方向挪一点,挪多少由学习率决定:太小收敛慢,太大会来回震荡甚至发散。深度学习数据量大,每步只用一小批数据估算梯度,这叫随机(小批量)梯度下降,即 SGD。梯度本身由反向传播算出。现在训练 VLA 等大模型常用的 Adam、AdamW 优化器,是在梯度下降基础上加了动量和自适应步长的改进版。
例子训练一个行为克隆策略:每步取 64 帧演示,算预测动作和演示动作之间的均方误差,反向传播得到梯度,再按「参数 ← 参数 − 学习率 × 梯度」更新一次。
- 也叫
- 随机梯度下降、SGD、小批量梯度下降、Mini-batch Gradient Descent
- 相关
- 反向传播、学习率、优化器、损失函数、批大小、AdamW 优化器
- 来源
- Wikipedia: Gradient descent
Google Machine Learning Glossary