基准测试
Benchmark入门必知一套固定的任务、数据和评分规则,让不同方法在同样条件下比高低。
基准测试指用一组标准测试衡量对象的相对性能,比如电脑硬件的跑分。在具身智能里,一个基准通常包括固定的任务集合、仿真环境或真实场景、演示数据(如有)、评测协议和指标,指标多为成功率。常见的仿真基准有 LIBERO、CALVIN、SimplerEnv、RoboTwin 等,也有 RoboArena 这类真机评测网络。它的价值是可复现、能横向对比;风险是方法可能专门对着榜单调优(刷榜),分数高不等于真机好用,而且头部方法接近满分后基准就失去区分度,即基准饱和。
例子VLA 论文常在 LIBERO 的四个任务套件上报告平均成功率,并和 OpenVLA 等基线放在同一张表里比较。
- 也叫
- 评测基准、榜单、基准
- 相关
- 基线方法、评测协议、成功率、LIBERO、基准饱和、刷榜
- 来源
- Wikipedia: Benchmark (computing)
LIBERO (NeurIPS 2023 Datasets and Benchmarks Track)