量化感知训练
Quantization-Aware TrainingQAT进阶训练时就模拟低比特带来的误差,让模型提前适应,量化后精度掉得更少。
量化感知训练是在训练或微调时插入「伪量化」操作:前向计算中先把权重和激活取整到低比特(如 INT8、INT4)再参与运算,反向传播时把取整当作恒等函数(直通估计器)绕过不可导的步骤,让模型学会在量化误差下工作。谷歌 Jacob 等人 2018 年面向纯整数推理的论文是这一做法的代表。和训练后量化相比,QAT 需要训练数据和额外算力,但在 4 比特及更低位宽时精度保持得明显更好,常见流程是先正常训练,再做一小段 QAT 微调。具身方向上,BitVLA 用「先量化再蒸馏」的量化感知训练,由全精度教师模型引导,把视觉编码器压到 1.58 比特,论文报告显存比 OpenVLA-OFT 少 11 倍而性能相当。
例子谷歌 2025 年 4 月发布 Gemma 3 的 QAT 版本:做约 5000 步 QAT 后再量化到 int4,27B 模型显存从 BF16 的 54GB 降到 14.1GB,谷歌称量化造成的困惑度损失比直接量化少 54%。
- 也叫
- 量化训练、伪量化训练
- 相关
- 训练后量化、剪枝、知识蒸馏、端侧部署、混合精度训练、数值精度格式(FP32 / FP16 / BF16 / FP8 / INT8 / INT4)
- 来源
- Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference (arXiv 1712.05877)
Gemma 3 QAT Models: Bringing state-of-the-Art AI to consumer GPUs (Google Developers Blog)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation (arXiv 2506.07530) - 信息截至
- 2025-06