具身智能新手名词表English

梯度消失 / 梯度爆炸

Vanishing / Exploding Gradients常用

反向传播时梯度逐层连乘后变得极小或极大,导致深层网络难以训练。

深度网络靠反向传播算梯度,靠前层的梯度是后面许多层导数(矩阵)的连乘。这些因子普遍偏小,梯度传到浅层就趋近于零,前面的层几乎学不动,叫梯度消失;普遍偏大则会指数级增长,一步更新就让参数发散、损失变成 NaN,叫梯度爆炸。Bengio 等人 1994 年分析过循环神经网络中的这一问题,Pascanu 等人 2013 年提出用梯度范数裁剪应对爆炸。常用对策还有:ReLU 等不易饱和的激活函数(sigmoid 输入过大或过小时导数都接近零)、Xavier/He 初始化、残差连接、归一化层,以及 LSTM 的门控结构。训练 VLA、扩散策略时常设的梯度裁剪也是为了防止这类数值不稳定。

例子用 sigmoid 激活堆几十层全连接网络,前几层的梯度往往接近 0、参数几乎不动;换成 ReLU 并加上残差连接后,同样深度的网络就能正常训练。

也叫
梯度消失、梯度爆炸、梯度弥散、Vanishing Gradient、Exploding Gradient
相关
反向传播、梯度裁剪、残差网络、激活函数、归一化层(层归一化 / RMSNorm / 批归一化)、长短期记忆网络 / 门控循环单元
来源
Dive into Deep Learning: Numerical Stability and Initialization
On the difficulty of training Recurrent Neural Networks (Pascanu et al., arXiv 1211.5063)

在完整名词表里查看 →