具身智能新手名词表English

平均最大排名违背

Mean Maximum Rank ViolationMMRV进阶

衡量仿真评测给策略排的名次是否与真机一致的指标,越低越好。

MMRV 由 2024 年的 SIMPLER(SimplerEnv)论文提出。作者认为仿真评测不必复现真机成功率的绝对值,关键是把策略的好坏排对。计算方法:任取两个策略,若仿真里的高低顺序与真机相反,就记一次「排名违背」,大小等于两者真机成功率之差;每个策略取它最严重的一次违背,再对所有策略求平均,取值 0 到 1。这样,真机上本就差不多的两个策略被排反只算小错,差距大的被排反才算大错。它通常和皮尔逊相关系数一起报告:后者只衡量线性关系,而且在策略水平接近时容易被真机评测的噪声带偏。

例子SIMPLER 论文给 6 个谷歌机器人策略排名:按验证集动作 MSE 排,平均 MMRV 为 0.375;用 SIMPLER「视觉匹配」仿真评测排,降到 0.056。

相关
SimplerEnv、仿真-真机相关性、视觉匹配、变体聚合、仿真评测、真机评测
来源
Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)
信息截至
2024-05

在完整名词表里查看 →