具身智能新手名词表English

混合 Transformer 架构

Mixture-of-TransformersMoT进阶

不同模态各用一套 Transformer 参数,但每层通过全局自注意力互相看见。

混合 Transformer 架构由斯坦福的 Weixin Liang 与 Meta 研究者在 2024 年 11 月提出。它把前馈网络、注意力投影矩阵、层归一化等参数按模态分开:文本 token 用文本那套权重,图像 token 用图像那套,但每层的自注意力仍在整条序列上计算,各模态照常交互。与混合专家模型(MoE,由路由器给每个 token 挑专家)不同,MoT 按模态固定分工,不用学路由。论文报告在 7B 规模的文本加图像生成设置中,它只用约 55.8% 的计算量就追平稠密模型。具身领域 π0 的「VLM 主干 + 动作专家」是类似做法(论文称其类似两个成员的混合专家),字节 BAGEL 则直接采用 MoT 结构。

例子π0 的约 30 亿参数主干来自 PaliGemma,另加约 3 亿参数的动作专家:图像和文字 token 走主干权重,机器人状态和带噪动作 token 走动作专家权重,两部分在每层注意力里互相可见。

也叫
Transformer 混合架构、Mixture-of-Transformer-Experts
相关
混合专家模型、动作专家、π0、BAGEL、统一多模态模型、自注意力
来源
Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models (arXiv:2411.04996)
π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)
Emerging Properties in Unified Multimodal Pretraining (BAGEL, arXiv:2505.14683)
信息截至
2025-05

在完整名词表里查看 →