具身智能新手名词表English

学习率

Learning RateLR常用

梯度下降每次更新参数时迈出的步子大小,是最关键的超参数之一。

学习率是优化算法里控制每一步参数更新幅度的超参数:参数沿负梯度方向移动,移动量等于学习率乘以梯度(Adam 等自适应优化器还会按每个参数的历史梯度再做缩放)。设得太大,参数会越过最低点,损失来回震荡甚至发散成 NaN;设得太小,收敛很慢,或停在不理想的位置。它通常是调参时最先要调的量,并且和批大小有关:批大小加大时常按比例放大学习率(线性缩放规则)。实际训练很少全程用一个固定值,而是配合学习率调度,先预热、再逐步衰减。微调预训练大模型时一般用比从零训练小得多的学习率,以免破坏已经学到的能力。

例子LLaVA 第一阶段只训练投影层时学习率取 2e-3,第二阶段连同语言模型一起微调时降到 2e-5;OpenVLA 训练全程固定用 2e-5,作者发现加学习率预热没有带来收益;ACT 则用 1e-5。

也叫
步长、step size
相关
学习率调度(预热与余弦退火)、梯度下降、优化器、AdamW 优化器、批大小、超参数
来源
Learning rate(Wikipedia)
Visual Instruction Tuning (LLaVA, arXiv 2304.08485)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)

在完整名词表里查看 →