具身智能新手名词表English

统一多模态模型

Unified Multimodal ModelUMM进阶

一个模型既能看懂图像视频、回答问题,又能生成或编辑图像视频。

统一多模态模型指把多模态理解(看图回答问题)和视觉生成(按文字画图、改图、生成视频)放进同一个模型。过去两条路线是分开的:理解多用自回归的多模态大语言模型,生成多用扩散模型。GPT-4o 的原生图像生成让这个方向受到广泛关注,开源代表有字节 Seed 2025 年 5 月发布的 BAGEL(混合 Transformer 专家结构,70 亿激活参数、140 亿总参数)。按生成方式大致分为自回归、扩散、自回归-扩散混合三类。具身智能关心它,是因为同一个模型如果既能理解场景,又能想象「做完这个动作画面会变成什么样」,就可以同时充当策略和世界模型。

例子阿里达摩院的 WorldVLA 把 VLA 和世界模型放进同一个自回归框架:既根据画面输出动作,也根据画面和动作预测下一帧图像,论文报告两者互相促进,效果好于单独的动作模型和世界模型。

也叫
理解生成一体化模型、统一理解与生成模型、Unified Multimodal Understanding and Generation Model
相关
多模态大语言模型、原生多模态、BAGEL、自回归-扩散混合架构、世界模型、WorldVLA
来源
Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities (arXiv:2505.02567)
BAGEL (ByteDance-Seed GitHub)
WorldVLA: Towards Autoregressive Action World Model (arXiv:2506.21539)
信息截至
2025-06

在完整名词表里查看 →