量化与蒸馏(Quantization and Distillation)

两种把大模型压小的技术,但它们压掉的东西不一样——这是理解”压缩后的模型还行不行”的关键。


1. 量化(Quantization):降低每个参数的精度

做法:把权重从 FP16(2 字节)压到 INT8(1 字节)甚至 INT4(0.5 字节)。

成本账:显存 ≈ 总参数 × 每参数字节数。7B 模型 FP16 约 14 GB,INT4 约 3.5 GB。

三条技术路线:

方法做法关键数字
GPTQ(ICLR 2023)一次性权重量化,用二阶信息175B 模型约 4 GPU 小时完成量化;降到 3–4 bits “negligible accuracy degradation”;首次把 175B 装进单卡;A100 上端到端加速 3.25×
AWQ(MLSys 2024 最佳论文)激活感知,保护 1% 显著权重”Protecting only 1% salient weights can greatly reduce quantization error”;TinyChat 相比 HF FP16 >3× 加速
LLM-QAT量化感知训练,数据无关蒸馏可推到 4-bit,同时量化权重、激活与 KV cache

到底掉多少(ACL 2025 大规模实证)

Kurtic et al.(arXiv:2411.02355)在整个 Llama-3.1 家族上做了 50 万次以上评测:

格式精度损失部署建议
FP8(W8A8-FP)effectively lossless(跨所有规模无损)—
INT8(W8A8-INT)1–3% 准确率下降(调好时)异步连续批处理占优
INT4(W4A16-INT,仅权重)比预期更有竞争力,“rivaling 8-bit quantization”同步部署成本效益最佳

注意一个张力:2023 年的 LLM-QAT 说 “post-training quantization methods … break down at lower bit precision”;2025 年的精细调优让 INT4 变得可用。技术在快速演进,别拿旧印象下判断。

量化的一个重要边界

知识容量缩放定律论文 的手结论:int8 量化不损害知识容量,2 bits/parameter 仍然成立。

2. 蒸馏(Distillation):把大模型的”行为”教给小模型

做法:让小模型(学生)去模仿大模型(教师)的输出分布。

MiniLLM(arXiv:2306.08543)的关键改进:把标准知识蒸馏的前向 KLD 换成反向 KLD(reverse KLD),防止学生模型高估教师分布的低概率区域。

蒸馏能转移多少(DeepSeek-R1 的完整对照)

DeepSeek-R1 论文(arXiv:2501.12948)Table 5 给出的蒸馏梯度:

模型AIME 2024 pass@1MATH-500 pass@1
GPT-4o-05139.3—
OpenAI-o1-mini63.6—
R1-Distill-Qwen-1.5B28.983.9
R1-Distill-Qwen-7B55.592.8
R1-Distill-Qwen-14B69.793.9
R1-Distill-Qwen-32B72.694.3

蒸馏 vs 直接强化学习(Table 6)——这组数字最能说明问题:

方法AIME 2024 pass@1
Qwen-32B-Base 上做 >10K 步大规模 RL47.0
蒸馏(R1-Distill-Qwen-32B)72.6

论文的两条结论:

“First, distilling more powerful models into smaller ones yields excellent results, whereas smaller models relying on the large-scale RL … require enormous computational power and may not even achieve the performance of distillation. Second, while distillation strategies are both economical and effective, advancing beyond the boundaries of intelligence may still require more powerful base models and larger-scale reinforcement learning.”

第一,把强模型蒸馏到小模型效果极好,而让小模型自己跑大规模强化学习又贵、又可能还不如蒸馏。第二,但蒸馏再好用,也只能在教师已有的能力范围内传递——想突破智能边界,最终还是得靠更强的基座加大规模强化学习。

3. 两种压缩的本质差别

量化蒸馏
压掉了什么数值精度(每个参数用几个 bit)参数量(换一个更小的模型)
参数量变不变不变变少
能力损失小(FP8 无损,INT8 掉 1–3%)取决于目标大小与学生基座
能不能创造新能力不能不能

一句话总结:能力可以从大参数压缩进小参数(蒸馏有效),但压缩不能创造新能力。

4. 对你的实际意义

  • 看到”4-bit 量化版”,别默认它变笨了——FP8 基本无损,INT4 在 2025 年后的调优下可与 8-bit 抗衡。
  • 看到”蒸馏版小模型”,要知道它继承的是教师的行为边界,不会超出教师。
  • 量化省的是显存与带宽,蒸馏省的是参数量与算力——两者可以叠加。

相关页面

  • 模型参数 —— 参数量与精度的换算
  • 知识容量 —— 量化对知识的影响
  • 激活参数 —— 部署成本的两个来源