EWMBench 具身世界模型评测
EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models进阶智元等提出的基准,专门评测机器人操作视频生成模型生成得对不对。
EWMBench 是智元机器人联合上海交大、港中文 MMLab、哈工大在 2025 年 5 月发布的评测基准,评测对象是具身世界模型,即给定初始画面和任务指令、生成机器人操作视频的模型。作者认为 FVD(弗雷歇视频距离)、VBench 这类指标主要看画面质量,看不出机械臂动作是否合理,于是从三个维度打分:场景一致性(用在具身数据上微调过的 DINOv2 比较帧间特征)、运动正确性(末端轨迹与真值的豪斯多夫距离、归一化动态时间规整,以及速度和加速度分布)、语义对齐(用多模态大模型给生成视频写描述、查逻辑错误,再与真值对比)。测试数据取自 AgiBot World 的 10 个任务,数据集和评测代码已在 GitHub 开源。
例子论文用它比较了 OpenSora 2.0、LTX、COSMOS-7B、Kling-1.6、海螺、EnerVerse 等 7 个模型,结论是现有视频生成模型用在具身任务上仍有明显短板。
- 也叫
- EWMBench、具身世界模型基准
- 相关
- 世界模型、视频生成模型、弗雷歇视频距离、VBench 视频生成评测基准、WorldArena 具身世界模型基准、AgiBot World 数据集
- 来源
- EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models (arXiv 2505.09694)
- 信息截至
- 2025-05