模型合并
核心:不训练,直接在权重空间融合多个微调模型的能力。
价值:CPU 可跑、分钟级实验,基准常见 +5-10%;HuggingFace 榜单顶尖模型多数经过合并
四大方法:
Linear / Model Soup:加权平均,适合同源相似模型
SLERP:球面插值,保留权重模长,最适合 2 模型平滑融合
TIES:Trim 降噪 + 符号投票解决参数冲突,3+ 模型最稳(density 0.5 是可靠默认)
DARE:随机丢弃 90-99% delta 参数再缩放,作为 TIES 前置(DARE-TIES 组合)
硬约束:必须同架构同基座(Mistral 医疗版+法律版可合,Mistral+Llama=灾难);float32 合并,量化模型先反量化
工具:mergekit(YAML 配置,Arcee AI)、Unsloth Studio(LoRA 合并)
局限:不产生新知识,只是权重重组;结果难以理论预测,合并后必跑基准验证
