模型蒸馏
本质:让小模型"学会"大模型的推理方式,而非简单缩小参数。从"传递答案"进化到"传递思考过程"。
技术路线
类型 | 访问要求 | 特点 |
响应蒸馏(黑盒) | 仅 API | Alpaca 式,学最终输出,无暗知识 |
Logit 蒸馏(白盒) | 开源权重 | 学完整概率分布,每样本信息量大 |
特征蒸馏 | 开源权重 | 对齐中间层表征,DistilBERT 路线 |
思维链蒸馏 | API 即可 | 学推理轨迹,DeepSeek-R1 路线 |
标志性成果
DistilBERT:参数 -40%,速度 +60%,保留 97% 能力
DeepSeek-R1:800K 推理链样本蒸馏出的 14B 模型,数学超越 32B 的 QwQ-Preview
NVIDIA Minitron(剪枝+蒸馏):训练 token 仅为从头训练 1/40,MMLU 反升 16%
扩散模型:SDXL Turbo 将 50 步压缩到 1 步
工程配方:先蒸馏出中等基础模型(70B→7B),再做领域 SFT/RLHF——兼顾成本与灵活性。
风险
容量差距:学生太小吸收不了,师生比例需调
创造力衰减:高熵输出压缩到小参数空间必然丢失多样性
安全对齐弱化:蒸馏数据通常不含拒绝样本,小模型需独立安全评估
合规:API 蒸馏违反多数厂商 ToS(2026 已有重大诉讼案例)
