跳到主内容
快讯直播
AI智模界
AI 词典

模型合并(Model Merging):不训练,把几个模型合成一个

一句话定义:模型合并(Model Merging)指把多个已经微调好的模型权重(weights)直接按规则融合成一个新模型,过程中基本不做梯度训练。

大模型微调(fine-tuning)往往会得到一个“偏科”模型:在代码数据上微调就擅长代码,在医疗问答上微调就擅长医疗。想同时要几种能力,传统做法是重新做多任务训练,成本高。模型合并提供另一条路:把每个微调模型减去基座模型得到的“任务向量(task vector)”看作一份差异,然后把多份差异加起来,再叠回基座;也可以用简单的加权平均(weight averaging)、球面插值(SLERP)等。

直观比方:基座模型是一本通用教材,微调是在上面用不同颜色笔做的批注。合并就是把几本批注本的关键批注叠到同一本上——不用重抄整本书,但前提是页码、章节要对得上,也就是模型同源、架构和分词器(tokenizer)兼容。

它和相邻概念的区别可以用一张表看清:

做法要不要重新训练推理时成本典型用途
模型合并基本不需要一个模型低成本组合多个微调能力
集成(Ensemble)不需要多份推理追求稳定与精度
多任务学习(multi-task learning)需要联合训练一个模型从数据层面统一能力
蒸馏(Distillation)需要训练学生模型一个模型压缩、迁移

对从业者来说,合并是“事后补救”和“能力拼装”的实用工具。开源社区里常能看到把几个微调模型合在一起,快速得到一个综合型模型,省去重新训练。对普通职场人,可以这样理解:你拿到的“全能助手”,不一定是一个从零训练的巨无霸,也可能是几个专科助手“合体”的结果。

但合并不是万能药。多个能力之间会互相干扰,合并后必须重新评测;不同架构、不同分词器的模型通常不能直接合并。具体支持哪些合并方法、参数怎么设,以所用框架的官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。