AutoEval
AutoEval (Autonomous Evaluation of Generalist Robot Manipulation Policies in the Real World)进阶伯克利搭建的全天候无人值守真机评测系统,自动判成败、自动复位。
AutoEval 由伯克利 Sergey Levine 组的 Zhiyuan Zhou、Pranav Atreya 等人提出(其中一位作者同时隶属英伟达),2025 年 3 月上线 arXiv,代码仓库注明发表于 CoRL 2025。它把真机评测里最费人的两件事自动化:用微调过的 PaliGemma 视觉语言模型当成功检测器,回答「抽屉开了吗」这类问题;用几十条遥操作演示微调 OpenVLA(或回放录好的轨迹)作为复位策略,把场景恢复原状。用户像向计算集群提交作业一样,在网页上提交自己的策略服务器,系统在 WidowX 机械臂的 Bridge 场景里排队执行。论文报告:与人工评测的平均皮尔逊相关系数为 0.942,一个工位 24 小时约跑 850 个回合、只需 3 次人工介入,人工时间减少 99% 以上,并向社区开放了公共场景。
例子研究者把自己的 VLA 策略部署成可公网访问的服务器,在 AutoEval 网页上提交「把茄子放进篮子」任务的评测,系统自动跑数十个回合后返回成功率报告。
- 也叫
- 自动真机评测、AutoEval 真机评测平台
- 相关
- 真机评测、成功检测器、BridgeData V2 数据集、OpenVLA、RoboArena、仿真-真机相关性
- 来源
- AutoEval: Autonomous Evaluation of Generalist Robot Manipulation Policies in the Real World (arXiv 2503.24278)
AutoEval project page
GitHub: zhouzypaul/auto_eval - 信息截至
- 2025-09