具身智能新手名词表English

SimpleVLA-RL

SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning进阶

只用「成功/失败」奖励,对 VLA 做大规模在线强化学习的开源框架

清华大学、上海人工智能实验室等机构 2025 年 9 月发布并开源,论文被 ICLR 2026 接收。VLA 通常靠监督微调(SFT)模仿人类演示,但高质量真机演示很贵,模仿出来的策略遇到分布外情况也容易失败。SimpleVLA-RL 借鉴大语言模型用强化学习提升推理能力的做法,在大模型强化学习框架 veRL 上做了面向 VLA 的改造,包括交互式轨迹采样、多环境并行渲染和分布式训练;奖励只看任务最后成没成功(0 或 1),不用人工设计奖励。以 OpenVLA-OFT 为基础模型,它在 LIBERO 上达到当时最好水平,在 RoboTwin 1.0 和 2.0 上超过 π0;每个任务只给 1 条演示做 SFT 时,LIBERO-Long 成功率可从 17.3% 提到 91.7%。作者还观察到「pushcut」现象:RL 训练中策略自己发现了演示里没有的做法,比如把本该抓起的物体直接推到位。

例子在 LIBERO 仿真里,先用每个任务 1 条演示把 OpenVLA-OFT 微调到偶尔能成功,再让它在大量并行环境里反复尝试、只按最终成败给奖励,成功率就能大幅上升。

相关
强化学习微调、OpenVLA-OFT、veRL、基于可验证奖励的强化学习、RoboTwin、LIBERO
来源
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning (arXiv 2509.09674)
PRIME-RL/SimpleVLA-RL (GitHub)
信息截至
2026-01

在完整名词表里查看 →