🧬

模型合并(Model Merging)

Model Merging
技术原理
开源效率

模型合并(Model Merging)指把两个或多个已训练模型的参数直接融合,产出一个兼具各方能力的新模型——全程不需要重新训练,只需推理和算术。

直觉

从同一个基座模型微调出的两个模型(如一个擅长数学、一个擅长代码),它们的权重差异各自编码了“学到的东西”。把这些差异按比例叠加或更聪明地组合,就能得到数学+代码双修的模型。

代表方法

  • 线性插值(SLERP / 加权平均):最简单直接,社区大量合并模型由此而来
  • TIES-Merging:解决多模型叠加时的“符号冲突”,先修剪小幅变动、统一符号再合并
  • DARE:随机丢弃大部分差异权重并重新缩放,证明微调变动高度冗余
  • 线性模式连通性:理论上解释了为什么同一基座的微调模型可以“抄近路”直接融合

生态意义

HuggingFace 上常年霸榜的不少开源模型是合并产物(如各种 MoE-upcycled 与 merge 模型)。它把“定制模型”的成本从一次完整训练降到几次推理,是开源社区独有的玩法,闭源模型无法参与。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

☆ 0