具身智能新手名词表English

原生多模态

Native Multimodal (Model)常用

从预训练一开始就同时学多种模态,而不是给语言模型后接视觉模块。

原生多模态指模型从预训练阶段起就用文本、图像、音频、视频等数据一起训练,各模态在同一个骨干网络里处理。它对应的是「拼接式」做法:先分别训好视觉编码器和语言模型,再用投影层把两者接起来补训。谷歌 2023 年 12 月发布 Gemini 时强调它是原生多模态;Meta 2024 年的 Chameleon 把图像也离散成 token,与文字从头混合训练(早期融合);2025 年 4 月的 Llama 4 同样宣称原生多模态、采用早期融合。支持者认为这样各模态结合得更深,也更容易同时做到理解和生成;代价是训练成本高、各模态数据配比难调。具身领域的统一多模态模型、把视频和动作放进同一序列训练的世界动作模型,也在沿这个思路走。

例子Gemini 从一开始就用文本、图像、音频、视频等数据联合预训练;而 LLaVA 是在训好的语言模型前面接一个视觉编码器再补训,属于拼接式。

也叫
原生多模态模型、Natively Multimodal
相关
多模态大语言模型、统一多模态模型、多模态融合、视觉 token、BAGEL、世界动作模型
来源
Google Blog: Introducing Gemini
Chameleon: Mixed-Modal Early-Fusion Foundation Models (arXiv:2405.09818)
Meta AI Blog: The Llama 4 herd
信息截至
2025-04

在完整名词表里查看 →