具身智能新手名词表English

Robometer

Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons进阶

用任务进度加轨迹两两比较训练的通用机器人奖励模型

Robometer 由南加州大学、华盛顿大学、MIT、艾伦人工智能研究所、英伟达等机构在 2026 年 3 月发布,RSS 2026 录用。强化学习和数据筛选都需要一个能判断机器人「做得怎么样」的奖励模型,但以往方法主要依赖专家演示上的逐帧进度标注,大量失败和次优轨迹用不上。Robometer 同时用两种监督:帧级进度损失,在专家数据上锚定奖励的大小;轨迹比较的偏好损失,学会判断两条轨迹哪条更好,从而能利用失败数据。作者整理了超过 100 万条轨迹、覆盖 21 种机器人本体的 RBM-1M 数据集,模型基于 Qwen3-VL(主版本 4B)。得到的奖励可用于在线和离线强化学习、失败检测以及模仿学习的数据检索。

例子给一段机器人执行「把杯子放进抽屉」的视频,Robometer 逐帧输出任务进度分数,这条曲线可直接当强化学习的稠密奖励,也可用来判断这次尝试是否失败。

也叫
RBM-1M
相关
奖励模型、进度奖励模型、VLM 作奖励模型、稠密奖励、成功检测器、失败数据
来源
arXiv 2603.02115: Robometer
Robometer 项目主页
信息截至
2026-05

在完整名词表里查看 →