仿真评测
Simulation-based Evaluation入门必知把策略放进仿真环境里批量跑任务、统计成功率,代替或补充真机测试。
仿真评测指把训练好的机器人策略放进仿真器,按统一的初始条件和判定规则执行任务,统计成功率等指标。真机评测要人工摆物体、复位场景,每个策略跑几十上百次很费时,不同实验室的场地也难复现;仿真评测能自动、批量、可重复地跑,常用于比较算法、做消融实验和挑选检查点。常见基准有 LIBERO、CALVIN、SimplerEnv、RoboTwin 等。主要问题是仿真成绩未必反映真机表现:画面、物理和控制器都与现实有差距,而且不少基准已接近满分。因此研究者会检查仿真与真机成绩的相关性,并用真机评测或世界模型评测作补充。
例子OpenVLA-OFT 论文在 LIBERO 的四个任务套件上做仿真评测,把 OpenVLA 的平均成功率从 76.5% 提到了 97.1%。
- 也叫
- 仿真测评、仿真基准评测、Sim Evaluation
- 相关
- 真机评测、基准测试、成功率、SimplerEnv、LIBERO、仿真-真机相关性
- 来源
- Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT) - 信息截至
- 2025-02