具身智能新手名词表English

12代表性模型与工作

按发展脉络看有名的模型:从 SayCan、RT-2 到 π 系列、GR00T 和世界模型。 · 332 条

  1. 12.1具身借用的基础大模型11
  2. 12.2大模型当大脑27
  3. 12.3端到端学习与 RT 系列16
  4. 12.4模仿学习经典策略21
  5. 12.5开源通用策略与 VLA32
  6. 12.6π 系列与强化学习28
  7. 12.7海外巨头与明星公司35
  8. 12.8国内具身模型45
  9. 12.9世界模型与视频学习43
  10. 12.10足式、灵巧手与敏捷技能16
  11. 12.11人形全身控制与遥操作37
  12. 12.12导航与自动驾驶21

12.1具身借用的基础大模型

具身模型的「眼睛」和「大脑」多是借来的:先认识这些大模型和视觉编码器

12.2大模型当大脑

有了大模型,最早的用法是当大脑:拆任务、写代码和奖励、看懂空间,再调现成技能

12.3端到端学习与 RT 系列

另一条路是端到端学控制:从真机学抓取到通才模型,再到 RT-2 首提 VLA

12.4模仿学习经典策略

同期小模型模仿学习也在进化:从 PerAct 到扩散策略、ACT,学会精细双臂活

12.5开源通用策略与 VLA

RT 与模仿学习汇成开源 VLA:Octo、OpenVLA 之后,改进百花齐放

12.6π 系列与强化学习

PI 的 π 系列是 VLA 标杆;再看强化学习怎样让策略从经验里变强

12.7海外巨头与明星公司

技术路线讲完看公司:英伟达、Figure、谷歌等海外公司各自的基座模型

12.8国内具身模型

再看国内:大厂、研究院和创业公司的基座,多在 VLA 与世界动作模型两条路上

12.9世界模型与视频学习

回到世界模型这条线:先在想象里练策略,再生成世界、从视频里学动作

12.10足式、灵巧手与敏捷技能

从操作转向运动:四足越野跑酷、灵巧手转物体,都在仿真里强化学习练成再上真机

12.11人形全身控制与遥操作

同一套方法搬到人形:从动画角色模仿、双足行走,到全身遥操作和动作跟踪

12.12导航与自动驾驶

最后看移动:导航从拼模块找路到导航大模型,自动驾驶从 ALVINN 走到 VLA

在完整名词表里查看 →