具身智能新手名词表English

VLA-RL

VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning进阶

用在线强化学习继续提升自回归 VLA(如 OpenVLA)的早期框架。

VLA-RL 由清华大学深圳国际研究生院与南洋理工大学的研究者 2025 年 5 月提出,代码开源。靠模仿演示训练的 VLA 只见过有限状态,一出分布就容易失败;VLA-RL 让预训练好的自回归 VLA 在环境里自己试错、在线改进。它把一次机器人操作轨迹看成多轮多模态对话,用 PPO(近端策略优化)做轨迹级强化学习;为缓解稀疏奖励,把一个视觉语言模型微调成机器人过程奖励模型,训练标签来自自动切分出的任务片段(以夹爪稳定时刻等为关键帧)。工程上还用了课程式选任务、GPU 负载均衡的并行环境、批量解码和价值网络预热等技巧。它是较早系统展示「VLA + 在线 RL」可行性的工作之一,作者还观察到增加测试时优化能继续提升效果。

例子在 LIBERO 的 40 个操作任务上,VLA-RL 把 OpenVLA-7B 的平均成功率从 76.5% 提到 81.0%,与 π0-FAST 相当。

相关
强化学习微调、近端策略优化、奖励模型、OpenVLA、LIBERO、SimpleVLA-RL
来源
VLA-RL (arXiv 2505.18719)
GuanxingLu/vlarl (GitHub)
信息截至
2025-05

在完整名词表里查看 →