ThinkAct
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning进阶先让多模态大模型想出视觉规划,再交给动作模型执行的推理型 VLA
英伟达与台湾大学(Chi-Pin Huang、Fu-En Yang 等)2025 年 7 月发布,发表于 NeurIPS 2025。多数 VLA 直接从画面和指令输出动作,缺少显式推理,难做多步长程任务。ThinkAct 采用快慢双系统:「思考」部分是以 Qwen2.5-VL 7B 初始化的多模态大模型,先监督微调冷启动,再用 GRPO 强化学习训练它生成具身推理计划,奖励来自视觉信号——规划出的轨迹终点是否与示范一致、整条轨迹是否与示范相符。推理结果被压缩成一个视觉规划隐变量,作为条件输入下游动作模型输出具体动作。在 SimplerEnv、LIBERO 等操作基准和多个具身推理基准上,它表现出少样本适应、长程规划和自我纠错能力。后续版本 Fast-ThinkAct 发表于 CVPR 2026。
例子面对「把胡萝卜放到盘子上」,ThinkAct 先推理出要先抓胡萝卜、再移到盘子上方,并规划出夹爪的运动轨迹,动作模型按这个规划执行;中途失手时还能重新规划。
- 也叫
- Fast-ThinkAct(后续版本)
- 相关
- 具身推理、快慢双系统、思维链、组相对策略优化、潜在推理、LIBERO
- 来源
- ThinkAct (arXiv 2507.16815)
ThinkAct project page
Fast-ThinkAct (arXiv 2601.09708) - 信息截至
- 2026-01