早退机制
Early Exit进阶让简单输入在网络中间层就提前输出结果、省掉后面几层计算的方法。
深度网络对每个输入都要跑完全部层,但很多简单样本用浅层特征就足以判断。早退机制在网络中间插入若干「出口」(小的分类头或输出头),推理时某个出口已经足够有把握,就直接输出,不再往下算,只有难样本才走完整个网络。哈佛大学 Teerapittayanon 等人提出的 BranchyNet 是较早的代表工作,这一思路后来被用到 BERT 和大语言模型上。机器人控制里大部分时刻动作简单、少数时刻才需要复杂推理,正适合这种做法:清华大学黄高团队等在 NeurIPS 2024 提出 DeeR-VLA,把多模态大模型改成多出口结构,按算力、延迟和显存预算决定何时退出。
例子DeeR-VLA 在 CALVIN 基准上报告,大语言模型部分的计算量降低 5.2–6.5 倍、GPU 显存降低 2–6 倍,任务性能基本不受影响。
- 也叫
- 提前退出、多出口网络、动态推理
- 相关
- 推理延迟、端侧模型、视觉 token 剪枝、剪枝、投机解码、混合专家模型
- 来源
- BranchyNet: Fast Inference via Early Exiting from Deep Neural Networks (arXiv:1709.01686)
DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution (arXiv:2411.02359)