CoT-VLA
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models进阶先生成一张未来子目标图像当「思考」,再输出动作的 7B 视觉-语言-动作模型。
英伟达、斯坦福、MIT 等 2025 年 3 月提出,发表于 CVPR 2025。以往的 VLA(视觉-语言-动作模型)直接把图像和指令映射成动作,中间没有推理步骤。CoT-VLA 把思维链换成视觉形式:模型先自回归生成若干步之后的一帧子目标图像(任务做到那时画面应该是什么样),再以这张图为目标输出一段动作块,闭环执行。底座是能同时理解和生成图像的多模态模型 VILA-U,共 7B 参数;生成图像用因果注意力,解码动作用全注意力。由于预测子目标图像不需要动作标签,EPIC-KITCHENS 这类没有动作标注的视频也能用来训练。论文报告真机任务比当时最强 VLA 基线高 17%,仿真基准高 6%。
例子收到「把碗放进抽屉」时,CoT-VLA 先画出几步之后碗已被拿起、靠近抽屉的画面,再输出一段能到达这个画面的机械臂动作,执行完后看新画面再重复。
- 也叫
- 视觉思维链 VLA
- 相关
- 视觉思维链、视觉-语言-动作模型、思维链、动作分块、无动作标签视频、SuSIE
- 来源
- CoT-VLA (arXiv:2503.22020, CVPR 2025)
CoT-VLA 项目主页 - 信息截至
- 2025-03