具身智能新手名词表English

视觉 token 剪枝

Visual Token Pruning进阶

推理时丢掉或合并不重要的图像 token,让视觉语言模型和 VLA 跑得更快。

VLM 和 VLA 会把每张图切成几百个视觉 token(图像小块对应的向量)送进语言模型,多相机、多帧时数量成倍增加,而注意力计算量随 token 数大致平方增长,是推理延迟的主要来源之一。视觉 token 剪枝按某种重要性分数(常用文本或动作 token 对它的注意力大小)只保留少数关键 token,其余删掉或合并,很多方法无需重训、即插即用。代表工作 FastV(ECCV 2024)发现第 2 层之后模型对图像 token 的注意力很稀疏,于是在浅层后砍掉一半,LLaVA-1.5-13B 的计算量降约 45% 而效果基本不变。机器人上它直接关系到控制频率:EfficientVLA 把视觉 token 筛选、跳层和缓存结合,让 CogACT 提速 1.93 倍;2025–2026 年又出现了大量 VLA 专用剪枝方法。

例子FastV 让图像先照常经过语言模型的前两层,之后按注意力分数只保留一半最受关注的图像 token 进入后续层,不改权重、不用再训练,就明显减少了 LLaVA-1.5 的推理计算量。

也叫
token 压缩、视觉 token 压缩、Token Pruning
相关
视觉 token、推理延迟、剪枝、注意力机制、KV 缓存、端侧部署
来源
An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models (FastV, arXiv:2403.06764)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models (arXiv:2506.10100)
信息截至
2026-09

在完整名词表里查看 →