跳到主内容
快讯直播
AI智模界
AI 词典

胜率(Win Rate):60% 这个数,最不重要的是 60%

一句话定义:胜率是某模型(或策略)在一批两两对决中赢下来的比例。它衡量的不是"有多强",而是"对着这批对手、按这套规则,赢了多少"。

打个比方

棋馆里有人说自己"胜率 60%"。厉害吗?先别急,得问三件事:跟谁下?和棋怎么算?下的什么棋?同一个人,陪练换成职业棋手,胜率能掉几十个点;和棋算半胜还是直接踢出分母,也能差出一截。AI 领域的胜率是同一个道理。

以模型竞技场(arena)为例:系统把用户的一个问题同时丢给两个模型,用户盲选哪个答得好。某模型在若干场这样的对决中赢了 60%——这就是一个典型胜率。它没有标准答案,只有相对偏好。

看到胜率,先补全三件事

一、分母是什么。 平局(tie)算不算?投票作废的算不算?同一个问题被投了多轮,算一场还是多场?分母口径一变,数字就不可比。两个团队各自报"胜率 60%",很可能连算法都不一样。

二、对手是谁。 如果对手是固定版本的老模型,这叫"对某基线的胜率",换个基线就归零重算。如果是从一个模型池里随机抽对手,那么池子里弱模型越多,胜率越高。对手池的强弱,往往比胜率数值本身更能说明问题。

三、裁判是谁、判什么。 人类盲投、模型当评委(LLM-as-a-judge)、还是自动判分?人类投票已知会受答案长度、排版、语气影响——这是系统性偏差,和"谁更聪明"不是一回事。

和相邻概念的区别

指标参照物回答的问题主要坑
准确率(accuracy)固定标准答案答对了多少题目集能否代表真实场景
胜率一组特定对手对着这组对手赢了多少分母口径、对手池构成
Elo / Bradley-Terry 分全部对局的整体综合排位大概如何本身由胜率换算而来,同样受对手池牵制

一句话:准确率是绝对题,胜率是相对赛,Elo 是把无数场相对赛压成一个数。

对从业者与普通人的意义

从业者:做内部评测时,把分母口径、对手池版本、裁判方式一起写进报告。否则下一次换了对手池,"涨了 5 个点"根本解释不清是模型变强了还是对手变弱了。要判断真实进步,固定对手池、只换自己的模型,是比较干净的做法。

普通人:看到两个产品都宣称"胜率更高",先看它们是不是对同一批对手、同一套题、同一种裁判。不是的话,就当两条独立广告看。它的价值在于"相对谁",脱离了对手,这个数字什么也没说。

各平台的计分与投票细则会调整,具体以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。