价值引导采样
Value-Guided Sampling进阶先从策略采样多个候选动作,再用价值函数打分,挑最好的执行。
价值引导采样在推理时提升策略:不改原策略权重,每步先从策略采样多个候选动作,再用单独训练的价值函数(Q 函数)打分,选最高分的,或按分数做 softmax 抽样。代表工作是 Levine 组的 V-GPS(CoRL 2024):用 Cal-QL 等离线强化学习在 Bridge 和 RT-1 数据上训练语言条件 Q 函数,给 Octo、OpenVLA 等五种通用策略做重排序,12 个任务上都有提升。通用策略的训练数据质量参差,价值函数负责把「做得好」的动作挑出来。它和最优 N 采样、RoboMonkey 用 VLM 校验动作同属推理时计算。
例子V-GPS 真机实验中,每一步从通用策略采样 50 个候选动作,用 Q 函数挑出得分最高的执行;据论文报告,WidowX 机械臂 6 个任务的平均成功率相对提升 82.8%。
- 也叫
- 价值引导策略重排序、价值重排序、Value-Guided Policy Steering
- 相关
- 推理时计算、最优 N 采样、V-GPS、Q 函数、离线强化学习、RoboMonkey
- 来源
- Nakamoto et al. 2024: Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance (V-GPS, CoRL 2024)
Kwok et al. 2025: RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models - 信息截至
- 2025-07