具身智能新手名词表English

VLA-OPD

VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation进阶

让强教师在学生自己跑出的轨迹上逐 token 纠错的 VLA 后训练方法。

VLA-OPD 是港科大(广州)团队 2026 年 3 月提出的 VLA 后训练框架。离线监督微调(SFT)只学演示数据,遇到自己走偏的状态就不会处理,还容易灾难性遗忘预训练能力;在线强化学习又受稀疏奖励拖累,样本效率低。VLA-OPD 走中间路线,即在线策略蒸馏:学生策略自己在环境里执行,由一个更强的教师策略在这些学生亲自到达的状态上给出逐 token 的稠密监督,不依赖环境奖励。损失用反向 KL 散度,作者认为它偏向「选定一个模式」,比正向 KL(易使熵爆炸)和硬交叉熵(易使熵过早坍缩)训练更稳。实验中教师是 SimpleVLA-RL 训练出的专家,学生是 OpenVLA-OFT,在 LIBERO 和 RoboTwin 2.0 上比强化学习样本效率更高、比 SFT 更稳健,也更少遗忘。

例子LIBERO 上,学生只用 1 条演示微调后平均成功率 48.9%;经 VLA-OPD 蒸馏升到 87.4%,再接 GRPO 强化学习到 93.4%,接近教师的 93.9%。

也叫
On-Policy VLA Distillation、VLA 在线策略蒸馏
相关
在线策略蒸馏、监督微调、强化学习微调、灾难性遗忘、KL 散度、SimpleVLA-RL
来源
VLA-OPD (arXiv 2603.26666)
VLA-OPD 项目主页
信息截至
2026-03

在完整名词表里查看 →