模型合并
Model Merging (Weight Interpolation)进阶不再训练,直接把几个同源模型的参数按比例加权,合成一个新模型。
模型合并是把结构相同、通常从同一个预训练模型微调出来的多个模型在参数层面直接组合,不需额外训练,推理成本也不增加。最简单的是线性插值:新参数 =(1−α)× 预训练参数 + α × 微调参数。代表工作有插值零样本模型与微调模型以保鲁棒性的 WiSE-FT、平均多组超参数微调结果的 Model Soups,以及把「微调后减预训练」的参数差当任务向量加减的任务算术。具身领域用它缓解微调造成的灾难性遗忘:Levine 团队 2025 年的 RETAIN 把微调后的 π0-FAST-DROID 与原模型插值,新技能和原有泛化能力兼得。但也有研究发现,把在不同任务上各自微调的 VLA 直接合并,成功率可能接近零。
例子RETAIN 用几十条演示把 π0-FAST-DROID 微调到「用板擦擦白板」任务,再与原模型按 α 在 0.25–0.75 之间插值;合并后的模型在新物体、新视角等分布外变体上明显好于只做微调的版本。
- 也叫
- 权重插值、权重平均、模型汤(Model Soups)、任务算术(Task Arithmetic)
- 相关
- 灾难性遗忘、微调、持续学习、低秩适配、指数移动平均、检查点
- 来源
- Yadav et al. 2025: Robust Finetuning of Vision-Language-Action Robot Policies via Parameter Merging (RETAIN)
Wortsman et al. 2022: Model soups
Ilharco et al. 2022: Editing Models with Task Arithmetic - 信息截至
- 2025-12