平均最大排名违背
Mean Maximum Rank ViolationMMRV进阶衡量仿真评测给策略排的名次是否与真机一致的指标,越低越好。
MMRV 由 2024 年的 SIMPLER(SimplerEnv)论文提出。作者认为仿真评测不必复现真机成功率的绝对值,关键是把策略的好坏排对。计算方法:任取两个策略,若仿真里的高低顺序与真机相反,就记一次「排名违背」,大小等于两者真机成功率之差;每个策略取它最严重的一次违背,再对所有策略求平均,取值 0 到 1。这样,真机上本就差不多的两个策略被排反只算小错,差距大的被排反才算大错。它通常和皮尔逊相关系数一起报告:后者只衡量线性关系,而且在策略水平接近时容易被真机评测的噪声带偏。
例子SIMPLER 论文给 6 个谷歌机器人策略排名:按验证集动作 MSE 排,平均 MMRV 为 0.375;用 SIMPLER「视觉匹配」仿真评测排,降到 0.056。
- 相关
- SimplerEnv、仿真-真机相关性、视觉匹配、变体聚合、仿真评测、真机评测
- 来源
- Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)
- 信息截至
- 2024-05