具身智能新手名词表English

最优 N 采样

Best-of-N SamplingBoN进阶

一次采样 N 个候选输出,用打分器挑出分数最高的那个去执行。

最优 N 采样是一种推理时计算(推理阶段多花算力换效果)的方法:让生成式模型对同一输入采样 N 个候选,再用验证器(奖励模型、价值函数或 VLM 裁判)给每个候选打分,只保留最高分的那个。它在大语言模型里用得很普遍,好处是不用重新训练原模型。机器人里的代表工作有两个:V-GPS(CoRL 2024)用离线强化学习学到的价值函数给通用策略的候选动作重排序,同一个价值函数在 5 种不同策略、共 12 个任务上都带来提升;RoboMonkey(CoRL 2025,斯坦福、伯克利、英伟达等)先采样多个动作、加高斯扰动并投票,再用训练好的 VLM 验证器挑选,分布外任务上绝对提升 25%。代价是每一步要多次前向计算,推理延迟增加;效果上限取决于验证器打分准不准。

例子RoboMonkey 在每个控制步里让 OpenVLA 等 VLA 模型对同一帧画面生成多个候选动作,由 VLM 验证器逐个打分,机器人只执行得分最高的那个动作。

也叫
测试时验证器、Test-Time Verifier、多采样重排序、Best-of-N 重排序
相关
推理时计算、价值引导采样、RoboMonkey、V-GPS、奖励模型、VLM 作奖励模型
来源
RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models (arXiv 2506.17811)
RoboMonkey 项目页
Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance (arXiv 2410.13816)
信息截至
2025-09

在完整名词表里查看 →