BAGEL
BAGEL: Emerging Properties in Unified Multimodal Pretraining (ByteDance Seed)进阶字节 Seed 开源的统一多模态模型,同一个模型既能看懂图也能生成和编辑图
BAGEL 是字节跳动 Seed 团队 2025 年 5 月开源的统一多模态基础模型,代码和权重以 Apache 2.0 协议发布,一个模型同时做图文理解、文生图和图像编辑。它以 Qwen2.5 大语言模型为基础,采用混合 Transformer(MoT)结构:理解专家和生成专家各有一套参数,但每层所有 token 共享自注意力,激活参数 7B、总参数 14B;理解侧用 SigLIP2 视觉编码器,生成侧用 FLUX 的 VAE 把图像压到潜空间。模型在数万亿 token 的图文、视频、网页交错数据上预训练,论文报告随规模增大出现了自由形式图像编辑、未来帧预测、视角旋转和「世界导航」等能力。它展示了把理解和生成放进同一个模型的做法,和具身方向的统一多模态模型、世界模型路线相关。
例子给 BAGEL 一张图和一句修改指令,它能直接输出编辑后的图片;给出前进、转向等导航指令,它能生成视角移动后的画面。
- 也叫
- BAGEL-7B-MoT
- 相关
- 统一多模态模型、混合 Transformer 架构、SigLIP、变分自编码器、世界模型、字节跳动 Seed
- 来源
- BAGEL: Emerging Properties in Unified Multimodal Pretraining (arXiv 2505.14683)
ByteDance-Seed/Bagel GitHub
BAGEL 论文 HTML 版 - 信息截至
- 2025-05