双盲成对比较
Double-blind Pairwise Comparison进阶评测者不知道谁是谁,只判断两个策略哪个更好的评测方式
双盲成对比较是一种评测方法:每次拿两个模型或策略在同样条件下各跑一次,评测者事先不知道哪个是哪个,只判断谁做得更好,最后把大量「谁赢」的记录汇总成排名。大模型领域的 Chatbot Arena 就用匿名两两对比来排榜。具身智能里的代表是 2025 年的 RoboArena:7 所高校在 DROID 平台上做了 600 多次真机成对评测,比较 7 个通用策略;评测者可以自己选任务和场景,但必须双盲对比两个策略。这样做不必事先统一场景和成功标准,也能减少评测者偏向自家模型;多个评测点的胜负记录再用 Elo 或 Bradley-Terry 模型(根据胜负估计每个选手实力分的统计模型)换算成分数。论文称这种分布式评测比集中式评测排序更准、更易扩展。
例子评测者在自己的实验室给出指令「把毛巾叠起来」,系统依次派出两个匿名策略 A、B 执行,评测者判定 B 更好,这条偏好记录计入排行榜。
- 也叫
- A/B 对比评测、双盲 A/B 评测、Pairwise Preference Evaluation
- 相关
- Elo 评分、RoboArena、真机评测、评测协议、DROID 数据集、基准测试
- 来源
- RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies (arXiv 2506.18123)
- 信息截至
- 2025-06