大模型任务规划
LLM-based Task Planning常用让大语言模型或视觉语言模型把一句高层指令拆成机器人能执行的子任务序列。
任务规划决定先做什么、后做什么。传统方法要人工写 PDDL(规划领域定义语言)这类形式化描述,换个场景就得重写。2022 年起,研究者让大语言模型直接读指令生成步骤:谷歌的 SayCan 让 LLM 给候选技能打分,再乘上技能价值函数估计的「当前能否做成」来选下一步;代码即策略让模型写调用感知和控制接口的程序;Inner Monologue 把执行反馈写回提示,实现闭环重规划。LLM 容易给出看似合理却执行不了的步骤,LLM+P 因此只让模型把自然语言翻成 PDDL,再交给经典规划器求解。现在多用 VLM 看图规划,如 Gemini Robotics-ER,把子任务交给 VLA 执行。
例子对「我把可乐洒了,能拿个东西来清理吗」,SayCan 在移动机械臂上依次选出「找到海绵」「拿起海绵」「拿给你」「完成」;项目页报告 101 条指令的规划成功率 84%、执行成功率 74%。
- 也叫
- LLM 规划、VLM 规划、大模型规划
- 相关
- 任务规划、SayCan、代码即策略、规划领域定义语言、Gemini Robotics-ER、快慢双系统
- 来源
- SayCan 项目主页 (Do As I Can, Not As I Say)
Do As I Can, Not As I Say: Grounding Language in Robotic Affordances (arXiv 2204.01691)
LLM+P: Empowering Large Language Models with Optimal Planning Proficiency (arXiv 2304.11477) - 信息截至
- 2025-09