模型集成(Ensemble)就是把多个模型的预测结果合起来,得到一个最终答案。它不追求每个成员都最强,而追求“合起来更不容易错”。
原理像问路。你要去一个陌生地方,只问一个人,他可能记错路口;问十个人,有人错左、有人错右,但多数人指对方向,按多数走通常更稳。模型也一样:每个模型都有自己的偏好和盲区,单个模型在某个样本上犯错,另一个可能正好答对。只要它们的错误不完全一样,投票、平均或加权就能把随机错误抵消掉,留下更稳定的判断。统计学里常说,集成主要降低方差,让结果对数据扰动没那么敏感。
常见做法有:装袋(Bagging),让多个模型在不同数据子集上训练再投票;提升(Boosting),让后来的模型重点修正前面的错误;堆叠(Stacking),再训练一个“元模型”来汇总各模型输出。到了大模型时代,思路也类似:同一个问题让多个模型回答,或者让同一个模型用不同提示、不同随机种子多答几次,再投票、重排、取多数。自洽性(AI 词典:Self-Consistency">Self-Consistency)就是典型例子。
但集成不是万能。如果所有模型都同源、同错,比如都基于同一份有偏数据,那投票也救不了。多样性才是关键:不同结构、不同数据、不同随机性,才能互补。另外,成员越多,成本和延迟越高,所以实际系统常在效果和开销之间折中。
和相邻概念的区别:
| 概念 | 核心 | 与集成的区别 |
|---|---|---|
| 模型集成 Ensemble | 多个独立模型输出合并 | 成员是并列的,最终靠投票/平均/堆叠 |
| 混合专家 MoE | 一个模型内部按输入路由到不同专家 | 通常只激活部分参数,不是多个完整模型投票 |
| 模型蒸馏 Distillation | 用大模型教小模型 | 目标是压缩,不是合并多个答案 |
| 微调 Fine-tuning | 在一个模型上继续训练 | 改变单个模型,不涉及多模型汇总 |
对从业者,集成是提升稳健性的常用手段,在风控、推荐、竞赛和医疗影像里很常见;做大模型应用时,多模型投票、多次采样再筛选,能降低单次回答的波动和幻觉风险,但要算清延迟和成本。对普通人,看到多个 AI 给出相近答案,通常比只看一个回答更可信;同时别只迷信某个榜单第一名,稳定往往比峰值更重要。具体产品怎么实现,以官方页面为准。
