一句话定义:模型合并(Model Merging)指把多个已经微调好的模型权重(weights)直接按规则融合成一个新模型,过程中基本不做梯度训练。
大模型微调(fine-tuning)往往会得到一个“偏科”模型:在代码数据上微调就擅长代码,在医疗问答上微调就擅长医疗。想同时要几种能力,传统做法是重新做多任务训练,成本高。模型合并提供另一条路:把每个微调模型减去基座模型得到的“任务向量(task vector)”看作一份差异,然后把多份差异加起来,再叠回基座;也可以用简单的加权平均(weight averaging)、球面插值(SLERP)等。
直观比方:基座模型是一本通用教材,微调是在上面用不同颜色笔做的批注。合并就是把几本批注本的关键批注叠到同一本上——不用重抄整本书,但前提是页码、章节要对得上,也就是模型同源、架构和分词器(tokenizer)兼容。
它和相邻概念的区别可以用一张表看清:
| 做法 | 要不要重新训练 | 推理时成本 | 典型用途 |
|---|---|---|---|
| 模型合并 | 基本不需要 | 一个模型 | 低成本组合多个微调能力 |
| 集成(Ensemble) | 不需要 | 多份推理 | 追求稳定与精度 |
| 多任务学习(multi-task learning) | 需要联合训练 | 一个模型 | 从数据层面统一能力 |
| 蒸馏(Distillation) | 需要训练学生模型 | 一个模型 | 压缩、迁移 |
对从业者来说,合并是“事后补救”和“能力拼装”的实用工具。开源社区里常能看到把几个微调模型合在一起,快速得到一个综合型模型,省去重新训练。对普通职场人,可以这样理解:你拿到的“全能助手”,不一定是一个从零训练的巨无霸,也可能是几个专科助手“合体”的结果。
但合并不是万能药。多个能力之间会互相干扰,合并后必须重新评测;不同架构、不同分词器的模型通常不能直接合并。具体支持哪些合并方法、参数怎么设,以所用框架的官方文档为准。
