混合专家模型
Mixture of ExpertsMoE常用模型里放多个「专家」子网络,每次只激活其中几个,用少量计算换大容量。
混合专家的思想最早由 Jacobs、Jordan、Nowlan 和 Hinton 在 1991 年提出:多个专家网络加一个门控网络(也叫路由器),由门控决定每个输入交给哪几个专家处理。2017 年 Shazeer 等人把它做成稀疏门控的 MoE 层放进大规模语言模型,参数上千亿,但每个输入只算其中一小部分。它解决的问题是:想让模型更大、装下更多知识,又不想每次推理都付出全部参数的计算量。Mixtral 8x7B、DeepSeek-V3、Llama 4 等大语言模型都用了 MoE。要注意,π0 论文把自己的结构比作「只有两个专家的 MoE」:图像和文字走 VLM 权重,状态和动作走动作专家权重,按 token 类型固定分工,不是由门控网络学出来的路由。
例子Mixtral 8x7B 每层有 8 个专家,每个 token 只选其中 2 个,总参数约 46.7B,但每个 token 实际只用到约 12.9B 参数。
- 也叫
- 专家混合模型、稀疏混合专家、Sparse MoE
- 相关
- 混合 Transformer 架构、动作专家、大语言模型、参数量、Transformer、多层感知机
- 来源
- Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer (arXiv:1701.06538)
Wikipedia: Mixture of experts
π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)