推理优化与部署
核心问题:模型训好了,推理太慢/太贵。优化目标 = 降延迟、提吞吐、省显存。
四大优化手段
手段 | 效果 | 适用场景 |
模型量化 | 显存降50-75%,速度提2-4倍 | 99%场景可用 |
KV Cache优化 | 吞吐提3-5倍,显存降40% | 长上下文必备 |
高效推理引擎 | 速度提5-10倍 | 生产必选 |
投机解码 | 延迟降1.5-2.5倍 | 大模型加速 |
量化选型
GPTQ 4bit:最快最稳,生产首选
AWQ 4bit:略快于GPTQ
GGUF/GGML:本地部署,CPU可跑
FP8:精度最好,需A100/H100
KV Cache核心
本质:存储已生成token的Key/Value向量,避免重算
痛点:128K上下文+8并发,KV Cache可达343GB(Llama 70B)
PagedAttention(vLLM默认):像虚拟内存管理KV,利用率50%→95%+
FP8 KV Cache:显存减半,精度损失<1%
Prefix Caching:复用公共前缀(如system prompt),命中率60-85%时成本降5-12×
推理引擎排名(2026)
vLLM:生产标准,一行启动,PagedAttention+连续批处理
TensorRT-LLM:NVIDIA官方,极致性能
SGLang:低延迟场景
TGI:HuggingFace生态
投机解码:小模型(1-7B)快速生成候选token → 大模型一次验证多个 → 接受率70-90%,无质量损失。
DeepSeek MLA:多头潜在注意力,KV Cache压缩7-14×(vs GQA的4-8×),V4-Pro支持1M上下文的经济推理。
生产部署清单
设
gpu-memory-utilization0.90-0.95
max-model-len设实际需求,不无脑32K
启用
--enable-prefix-caching
流式输出,动态限制
max_new_tokens
监控:KV利用率>85%推到极限,>95%需扩容
