模型合并(Model Merging)指把两个或多个已训练模型的参数直接融合,产出一个兼具各方能力的新模型——全程不需要重新训练,只需推理和算术。
直觉
从同一个基座模型微调出的两个模型(如一个擅长数学、一个擅长代码),它们的权重差异各自编码了“学到的东西”。把这些差异按比例叠加或更聪明地组合,就能得到数学+代码双修的模型。
代表方法
- 线性插值(SLERP / 加权平均):最简单直接,社区大量合并模型由此而来
- TIES-Merging:解决多模型叠加时的“符号冲突”,先修剪小幅变动、统一符号再合并
- DARE:随机丢弃大部分差异权重并重新缩放,证明微调变动高度冗余
- 线性模式连通性:理论上解释了为什么同一基座的微调模型可以“抄近路”直接融合
生态意义
HuggingFace 上常年霸榜的不少开源模型是合并产物(如各种 MoE-upcycled 与 merge 模型)。它把“定制模型”的成本从一次完整训练降到几次推理,是开源社区独有的玩法,闭源模型无法参与。