具身智能新手名词表English

4D 世界模型

4D World Model进阶

预测三维场景随时间如何变化的世界模型(3D 空间加时间)

世界模型是给定当前观测和动作、预测世界接下来会变成什么样的模型。多数视频世界模型只生成 2D 画面,缺少深度和几何,机器人很难从中精确读出物体在空间里的位置。4D 世界模型把预测对象换成「3D 空间 + 时间」:每一帧都带几何信息,可以拼成随时间变化的三维场景。代表作是 UMass Amherst 等团队 2025 年 4 月发布的 TesserAct:在 CogVideoX 视频生成模型上微调,同时预测 RGB、深度和法向量(RGB-DN)视频,再重建成时序一致的 4D 场景;动作则由逆动力学模型(根据前后状态反推动作的网络)从点云特征里算出 7 自由度机械臂动作。它和 4D 重建、视频生成、空间智能都有交叉。

例子TesserAct 给定当前画面和一条语言指令,生成带深度和法向的未来视频,转成 4D 场景后,用 PointNet 编码点云并结合指令,输出 7-DoF 动作。

也叫
4D 具身世界模型、4D Embodied World Model
相关
世界模型、4D重建、视频生成模型、逆动力学模型、3D VLA、空间智能
来源
TesserAct: Learning 4D Embodied World Models (arXiv 2504.20995)
TesserAct 论文 HTML 版
信息截至
2025-04

在完整名词表里查看 →