剪枝
Pruning进阶删掉模型里不重要的权重、通道或层,让模型变小变快。
剪枝是一类模型压缩方法:找出网络中对输出影响小的部分并删掉。删单个权重叫非结构化剪枝,删整个通道、注意力头或层叫结构化剪枝。这一思路可追溯到 LeCun 等人 1989 年的 Optimal Brain Damage;2015 年 Song Han 等人提出「先训练、剪掉小权重、再重新训练」的三步法,把 AlexNet 参数从 6100 万减到 670 万、VGG-16 压缩 13 倍,ImageNet 精度基本不降。非结构化剪枝得到的是稀疏矩阵,要专门的硬件或库才能真正提速;结构化剪枝直接让矩阵变小,更容易提速。在具身智能里,剪枝常和量化、知识蒸馏一起用来把大模型塞进机器人的端侧算力,针对 VLA 还出现了剪冗余语言层、剪视觉 token 的做法。
例子EfficientVLA 不额外训练,剪掉 CogACT 语言模块里功能冗余的层、筛掉不重要的视觉 token,并缓存扩散动作头的中间特征,在 SIMPLER 上推理提速 1.93 倍,成功率只降 0.6%。
- 也叫
- 模型剪枝、网络剪枝、Network Pruning
- 相关
- 视觉 token 剪枝、训练后量化、量化感知训练、知识蒸馏、端侧部署、早退机制
- 来源
- Learning both Weights and Connections for Efficient Neural Networks (Han et al., arXiv 1506.02626)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models (arXiv 2506.10100) - 信息截至
- 2025-06