具身智能新手名词表English

梯度裁剪

Gradient Clipping进阶

梯度太大时按比例缩小到阈值以内,防止一步更新把模型带崩。

训练中偶尔会出现梯度爆炸:某一步梯度特别大,参数被推得太远,损失突然飙升甚至变成 NaN。梯度裁剪在优化器更新前检查梯度大小,超过阈值就把它缩小。最常用的是按范数裁剪:把所有参数的梯度看成一个长向量算总范数,超过 max_norm 就整体乘以 max_norm 除以总范数,方向不变、只缩长度;另一种是按值裁剪,把每个分量截断到固定区间。2013 年 Pascanu、Mikolov、Bengio 分析循环神经网络的梯度爆炸时提出了梯度范数裁剪。现在训练 Transformer、扩散策略时基本是默认配置,PPO 的常见实现一般也带这一项。

例子PyTorch 中在 loss.backward() 之后、optimizer.step() 之前调用 torch.nn.utils.clip_grad_norm_(model.parameters(), max_norm=1.0)。

也叫
梯度范数裁剪、Gradient Norm Clipping
相关
梯度消失 / 梯度爆炸、学习率、优化器、反向传播、循环神经网络、近端策略优化
来源
On the difficulty of training Recurrent Neural Networks (arXiv 1211.5063)
torch.nn.utils.clip_grad_norm_ (PyTorch 文档)

在完整名词表里查看 →