V-GPS
Value-Guided Policy Steering (Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance)进阶部署时用离线强化学习学到的价值函数给通用策略的候选动作重新排序
UC Berkeley 与 CMU 的 Mitsuhiko Nakamoto、Sergey Levine 等人 2024 年 10 月发布,发表于 CoRL 2024。通用机器人策略用的演示数据质量参差不齐,数据越大越难挑干净。V-GPS 不动原策略:先用离线强化学习(只用已有数据,主要用 Cal-QL)在 BridgeData V2 和 RT-1 数据上训练一个 Q 函数(给「状态+动作」打分);部署时让通用策略一次采样 K 个候选动作(论文试了 10 和 50),用 Q 函数挑分最高的执行。它不需要微调、也不需要拿到策略权重,同一个价值函数在 Octo、RT-1-X、OpenVLA 等 5 种策略上都带来提升,是「推理时多花计算换性能」在机器人上的早期代表。
例子在真机上让 Octo 抓寿司放进碗里:Octo 每步先生成若干个候选动作,V-GPS 的 Q 函数给每个打分,只执行分最高的那个,项目页报告这类任务成功率明显上升。
- 也叫
- Value-Guided Policy Steering、价值引导策略操控
- 相关
- 价值引导采样、校准 Q 学习、离线强化学习、Q 函数、推理时计算、Octo
- 来源
- Steering Your Generalists (arXiv 2410.13816)
V-GPS project page - 信息截至
- 2024-10