具身智能新手名词表English

11模型与架构

学出来的模型长什么样:Transformer、VLM、动作怎么生成、VLA 和世界模型。 · 184 条

  1. 11.1神经网络基础16
  2. 11.2从注意力到大语言模型24
  3. 11.3视觉编码器与视觉语言模型28
  4. 11.4生成模型入门10
  5. 11.5扩散模型与流匹配22
  6. 11.6动作怎么表示和输出17
  7. 11.7VLA 的结构与扩展17
  8. 11.8分层系统与具身推理12
  9. 11.9世界模型与视频生成23
  10. 11.10推理加速、部署与可靠性15

11.1神经网络基础

从最基本的神经网络零件和经典结构学起,后面所有模型都用它们搭成。

11.2从注意力到大语言模型

大模型的共同主干:token、注意力和 Transformer,再到大语言模型。

11.3视觉编码器与视觉语言模型

给语言模型装上眼睛:先看图像怎样变成 token,再看 VLA 的底座 VLM。

11.4生成模型入门

前面的模型只给一个答案;这里学整个数据分布,以及把向量变成离散码。

11.5扩散模型与流匹配

上节生成模型的主力路线:加噪去噪与流匹配,动作和视频生成都靠它。

11.6动作怎么表示和输出

有了网络和生成方法,看机器人动作怎样表示,又怎样回归、离散或生成出来。

11.7VLA 的结构与扩展

VLM 接上动作输出就成了 VLA:看它怎样出动作、跨机器人、接更多传感器。

11.8分层系统与具身推理

和上节端到端相对:规划与控制分给不同模型,再让模型先推理后行动。

11.9世界模型与视频生成

用前面的生成模型预测「做了动作世界会怎样」,最后与动作生成合二为一。

11.10推理加速、部署与可靠性

前面所有模型最终都要上机:怎样更快更省,以及怎样知道它没把握。

在完整名词表里查看 →