评测协议
Evaluation Protocol进阶规定策略在什么条件下测、测几次、怎样算成功的一套规则
评测协议是一套写清楚「策略怎么测」的规则:在哪些场景和物体上测,初始状态怎么摆,每个条件测多少次,一次试验最长多久,什么算成功,中途能否人工干预,最后用什么指标汇总。机器人评测结果对这些细节很敏感,同一个策略换一种摆放或放宽成功标准,成功率可能差很多;论文不交代协议,读者就无法判断结果能否复现、不同方法能否比较。2024 年 Kress-Gazit 等人的论文「Robot Learning as an Empirical Science」建议:明确报告实验条件和成功标准,成功率之外补充其他指标,做统计分析,并定性描述失败模式。仿真基准(如 LIBERO、CALVIN)一般自带固定协议;真机评测则常用固定初始位置表、多个方法交替测试、双盲成对比较等做法来保证公平。
例子一份协议可以这样写:每个任务测 20 次,物体初始位置依次取自事先标好的 20 个点位,单次最长 60 秒,物体完全放进盒子且夹爪松开才算成功,中途不允许人工重置。
- 也叫
- 评估协议、测试协议
- 相关
- 基准测试、真机评测、仿真评测、成功率、评测统计显著性(置信区间 / 序贯检验 / 多随机种子)、双盲成对比较
- 来源
- Robot Learning as an Empirical Science: Best Practices for Policy Evaluation (arXiv 2409.09491)
RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies (arXiv 2506.18123)