具身智能新手名词表English

具身思维链

Embodied Chain-of-ThoughtECoT常用

让机器人模型先写出计划、子任务、物体位置等推理,再输出动作。

具身思维链由 UC 伯克利、斯坦福等机构的研究者在 2024 年提出。普通 VLA(视觉-语言-动作模型)看图听指令后直接出动作;ECoT 让模型先依次写出任务复述、整体计划、当前子任务、下一步移动方向、夹爪位置和画面中物体的边界框,再输出动作。和大语言模型的思维链不同,这些推理必须落在具体画面和机器人状态上。作者用现成基础模型自动给 BridgeData V2 标注推理过程,在 OpenVLA 上训练后,高难度泛化任务的绝对成功率提升 28%,没用额外机器人数据。代价是要多生成大量 token、推理变慢;2025 年同一团队的后续工作给出更轻量的训练方式,推理约快 3 倍。

例子指令「把蘑菇放进锅里」时,ECoT 模型先写出计划(找蘑菇→抓起→移到锅上方→放下)、当前子任务「抓起蘑菇」、移动方向「向左下」,并标出蘑菇、锅的边界框和夹爪位置,最后才输出 7 维机械臂动作。

也叫
具身推理链、Embodied Chain-of-Thought Reasoning
相关
思维链、具身推理、视觉-语言-动作模型、OpenVLA、视觉思维链、推理延迟
来源
Robotic Control via Embodied Chain-of-Thought Reasoning (arXiv 2407.08693)
Embodied Chain-of-Thought Reasoning 项目页
Training Strategies for Efficient Embodied Reasoning (arXiv 2505.08243)
信息截至
2025-05

在完整名词表里查看 →