具身智能新手名词表English

强化学习微调

Reinforcement Fine-Tuning (RL Fine-Tuning)RFT常用

在预训练或监督微调过的模型上,再用奖励信号做强化学习来提升能力。

强化学习微调是拿一个已预训练或监督微调(SFT)过的模型当初始策略,让它自己生成回答或执行动作,按奖励打分,再用策略梯度等算法更新参数。和只模仿示范的 SFT 不同,它能从自己的成败中学习,学到示范里没有的做法。「RFT」一词因 OpenAI 面向 o 系列推理模型的强化微调服务流行开来:用户提供评分器,模型对每道题采样多个回答再按分数强化。具身领域 2025 年起涌现大量 VLA 强化学习微调工作,奖励常用任务成败的二值信号,算法多用 PPO、GRPO;流匹配动作头算不出动作概率,需要专门改造(如 πRL)。

例子πRL 用在线强化学习微调流匹配 VLA:π0 先在 LIBERO 上用少量示范做 SFT,成功率 57.6%,强化学习后升到 97.6%;π0.5 从 77.1% 升到 98.3%。SimpleVLA-RL 则只用「成功记 1、失败记 0」的奖励配合 GRPO 训练 OpenVLA-OFT。

也叫
强化微调、RL 微调、RL fine-tuning、强化学习后训练
相关
后训练、监督微调、近端策略优化、组相对策略优化、πRL、SimpleVLA-RL
来源
OpenAI API Docs: Reinforcement fine-tuning
πRL: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
信息截至
2026-01

在完整名词表里查看 →