具身智能新手名词表English

视觉预见 / 基于学习模型的规划

Visual Foresight / Planning with Learned (World) Models进阶

先学会预测「做这个动作后画面会变成什么样」,再在想象里挑最好的动作。

视觉预见由 UC Berkeley 的 Chelsea Finn 与 Sergey Levine 在 ICRA 2017 提出(Deep Visual Foresight),2018 年 Ebert、Finn 等整理成完整框架。它分两步:先用机器人自主推动物体收集的无标注数据,训练一个以动作为条件的视频预测模型,输入当前画面和一串候选动作,输出未来几帧画面;再做视觉模型预测控制(MPC):采样大量候选动作序列(常用交叉熵方法迭代优化),让模型「想象」结果,按离目标有多近打分,只执行最优序列的第一步,然后重新规划。目标可以是「把某个像素移到某处」、一张目标图片或一个分类器。它不需要奖励函数和人工标注,能用在没见过的物体上。这就是今天「世界模型 + 规划」路线的前身:DINO-WM、V-JEPA 2-AC 等把预测从像素搬到预训练特征空间,仍用 MPC 选动作。

例子在机器人相机画面上点出桌面某个物体上的一个像素,再指定它该去的位置;机器人在想象中试推大量动作序列,选出预测中把该像素推得最近的那组,执行一步后重新规划。

也叫
Visual Foresight、Visual MPC、视觉模型预测控制、Planning with Learned World Models
相关
世界模型、视频预测模型、模型预测控制、交叉熵方法、DINO-WM、V-JEPA 2
来源
Finn, Levine: Deep Visual Foresight for Planning Robot Motion (arXiv:1610.00696, ICRA 2017)
Ebert et al.: Visual Foresight: Model-Based Deep RL for Vision-Based Robotic Control (arXiv:1812.00568)
DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning (arXiv:2411.04983)
信息截至
2025-06

在完整名词表里查看 →