具身智能新手名词表English

训练后量化

Post-Training QuantizationPTQ进阶

模型训练完后,直接把权重和激活换成低比特数值,不用重新训练。

训练后量化是一种模型压缩方法:模型按正常精度(FP32、BF16 等)训练完后,把权重、有时连同激活值,换成 INT8、INT4 等低比特表示。它通常只需一小批校准数据来统计数值范围,不需要标注数据,也不重新训练。高通 AI 研究院的量化白皮书总结,多数模型用 PTQ 做到 8 比特时精度接近浮点;再往下压就容易掉点,需要 GPTQ 这类利用二阶信息的方法,或者改用量化感知训练。对具身智能来说,它主要服务于部署:VLA 动辄几十亿参数,机器人上的显存和算力有限,量化能直接降低显存占用、加快推理。TensorRT、ONNX Runtime 等部署工具都支持 PTQ。

例子OpenVLA 论文把 7B 模型做 4 比特量化推理,在 BridgeData V2 任务上成功率 71.9%,和 BF16 的 71.3% 持平,显存从 16.8GB 降到 7.0GB。

也叫
后训练量化、离线量化
相关
量化感知训练、剪枝、端侧部署、推理延迟、TensorRT、数值精度格式(FP32 / FP16 / BF16 / FP8 / INT8 / INT4)
来源
A White Paper on Neural Network Quantization (Nagel et al., arXiv 2106.08295)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)
GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers (arXiv 2210.17323)
信息截至
2024-06

在完整名词表里查看 →