后训练
Post-training入门必知预训练之后的训练阶段,用精选数据或强化学习把基础模型调成好用的样子。
后训练指基础模型预训练完之后的训练步骤,这个说法随大语言模型流行起来。大模型先在海量网页数据上预训练,再经过监督微调(SFT)、偏好优化、强化学习等后训练,才变成能按指令回答的助手;Ai2 的 Tulu 3 就公开了一套由 SFT、DPO 和可验证奖励强化学习组成的后训练方案。具身智能沿用了这种分工:π0 论文说,预训练阶段负责广泛能力和泛化,后训练阶段用更窄、更精心整理的数据让模型熟练完成目标任务。后训练常和微调混用,但它更强调「阶段」,里面可能包含多轮微调和强化学习微调。
例子π0 预训练后,针对叠衣服等复杂任务做后训练:最简单的任务只需约 5 小时数据,最复杂的任务用了 100 小时以上。
- 也叫
- 后训练阶段、Posttraining
- 相关
- 预训练、微调、监督微调、强化学习微调、基于人类反馈的强化学习、中训练
- 来源
- Lambert et al. 2024: Tulu 3: Pushing Frontiers in Open Language Model Post-Training
Black et al. 2024: π0: A Vision-Language-Action Flow Model for General Robot Control