具身智能新手名词表English

基准测试

Benchmark入门必知

一套固定的任务、数据和评分规则,让不同方法在同样条件下比高低。

基准测试指用一组标准测试衡量对象的相对性能,比如电脑硬件的跑分。在具身智能里,一个基准通常包括固定的任务集合、仿真环境或真实场景、演示数据(如有)、评测协议和指标,指标多为成功率。常见的仿真基准有 LIBERO、CALVIN、SimplerEnv、RoboTwin 等,也有 RoboArena 这类真机评测网络。它的价值是可复现、能横向对比;风险是方法可能专门对着榜单调优(刷榜),分数高不等于真机好用,而且头部方法接近满分后基准就失去区分度,即基准饱和。

例子VLA 论文常在 LIBERO 的四个任务套件上报告平均成功率,并和 OpenVLA 等基线放在同一张表里比较。

也叫
评测基准、榜单、基准
相关
基线方法、评测协议、成功率、LIBERO、基准饱和、刷榜
来源
Wikipedia: Benchmark (computing)
LIBERO (NeurIPS 2023 Datasets and Benchmarks Track)

在完整名词表里查看 →