具身智能新手名词表English

VLABench

VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks进阶

复旦发布的语言条件操作基准,侧重常识、隐含意图和长程多步推理。

VLABench 是复旦大学 OpenMOSS 团队 2024 年 12 月发布的开源基准,2025 年被 ICCV 接收,评测按自然语言指令操作机械臂的能力。它基于 MuJoCo 和 dm_control 搭建,默认用 7 自由度 Franka 机械臂,共 100 类任务(60 类原子、40 类组合),物体资产 2000 多个。和指令多为固定模板的已有基准相比,它的任务需要常识和世界知识,指令带隐含意图,长程任务需要多步推理,而且 VLA 策略和 VLM 驱动的工作流都能评。项目还提供自动生成的训练数据和六个评测赛道。

例子它的指令不一定直说要拿什么,而是带着隐含意图,需要模型先推断出目标物体再动手;论文结果显示当时最强的预训练 VLA 和基于 VLM 的流程在这些任务上都表现吃力。

相关
视觉-语言-动作模型、指令跟随、长程任务、LIBERO、MuJoCo、基准测试
来源
VLABench (arXiv 2412.18194)
VLABench GitHub 仓库(OpenMOSS)
信息截至
2025-06

在完整名词表里查看 →