具身智能新手名词表English

正则化

Regularization常用

训练时加约束或惩罚,防止模型死记训练数据,提升在新数据上的表现。

正则化是机器学习里一大类防止过拟合的手段:模型在训练集上越学越好、在新数据上反而变差时,就要用它约束模型复杂度。显式正则化是在损失函数里加惩罚项,如 L2 正则(也叫权重衰减,惩罚权重平方和,让权重整体变小)和 L1 正则(惩罚绝对值,让很多权重变成 0);隐式正则化包括早停、Dropout(训练时随机丢弃部分神经元)、数据增强等。强化学习里还有几种专门的正则:熵正则化鼓励策略保持随机以便探索,KL 正则化让微调后的策略别偏离原模型太远,行为正则化让离线强化学习的策略贴近数据集里的动作。

例子训练视觉运动策略时对相机图像做随机裁剪(数据增强),并在 AdamW 优化器里设置权重衰减;RLHF 在奖励里减去 KL 惩罚项,防止模型为刷高分而偏离原始语言模型。

也叫
正则项、正则化项、Regularization Term
相关
过拟合、随机失活、早停、数据增强、熵正则化、KL 正则化
来源
Wikipedia: Regularization (mathematics)
Dive into Deep Learning: Weight Decay

在完整名词表里查看 →