跳到主内容
快讯直播
AI智模界
AI 词典

自我一致性(Self-Consistency):让模型多算几遍再投票

一句话定义:自我一致性是一种推理阶段的技巧——同一个问题让模型算多遍,每遍走不同的推理路径,最后把各遍得到的答案拿来投票,得票最多的那个就是最终答案。

它是怎么工作的

它建立在思维链AI 词典:Chain-of-Thought">Chain-of-Thought, CoT)之上。普通的思维链提示是让模型"一步一步想",然后按概率最高的那条路走到底:一条路走到黑,中途拐错一个弯,最后答案就错了。

自我一致性的做法是:把采样温度调高一些,让模型对同一道题生成多条推理路径。这些路径的措辞、步骤顺序往往各不相同,但每条最终都会落到一个答案上。然后做多数投票——比如十条里有七条算出同一个结果,那就输出它。

打个比方:公司来了道难题,你交给十个同事各算各的,不许对答案。有人抄错一个符号,有人把题意理解偏了,但十个人的错误往往各不相同;而算对的人,答案一定是同一个。把答卷摊开数票,多数票大概率就是正确答案。

为什么投票能提升准确率

关键在于:错误的路径是发散的,正确的路径是收敛的。模型推理中随机犯的错方向五花八门,很难让同一个错误答案反复出现;而正确答案只有一个,只要这道题模型"会做",多条采样里就有相当比例能走到它上面。投票相当于用一个很便宜的机制把随机噪声抹平。

和相邻概念的区别

方法采样几条怎么选答案需要额外模型吗
单条思维链1 条直接取输出不需要
自我一致性多条对最终答案投票不需要
Best-of-N 加验证器多条用奖励模型打分需要一个验证器

一句话概括:自我一致性是"没有裁判的集成",只依赖答案本身能否对齐。

对从业者的实际意义

  • 纯粹的推理期手段,不用重新训练模型,改几行调用代码就能用,性价比很高。
  • 代价是 token 与延迟成倍上涨。采样十条就是约十倍的推理开销,通常用在"答案可验证、错了代价大、又不太在乎慢一点"的场景,比如数学题、结构化信息抽取、代码判题。
  • 只适用于最终答案能离散化、能比对是否相同的任务。写文案、开放式问答这类没有唯一答案的任务,投票没有意义。
  • 采样温度不能太低,否则多条路径几乎一模一样,投票等于白做;也不能高到语无伦次。具体取值要按任务实测,没有通用数字。
  • 不少推理产品"想久一点、多想几遍"的背后是类似思路,具体实现各家不同,以官方文档为准。

对普通职场人,启发很朴素:当一个任务有明确对错、而你又不太信任单次判断时,让同一个工具多做几遍再取多数,往往比只做一遍更靠得住——前提是你有办法判断各遍答案是否一致。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。