一句话定义:胜率是某模型(或策略)在一批两两对决中赢下来的比例。它衡量的不是"有多强",而是"对着这批对手、按这套规则,赢了多少"。
打个比方
棋馆里有人说自己"胜率 60%"。厉害吗?先别急,得问三件事:跟谁下?和棋怎么算?下的什么棋?同一个人,陪练换成职业棋手,胜率能掉几十个点;和棋算半胜还是直接踢出分母,也能差出一截。AI 领域的胜率是同一个道理。
以模型竞技场(arena)为例:系统把用户的一个问题同时丢给两个模型,用户盲选哪个答得好。某模型在若干场这样的对决中赢了 60%——这就是一个典型胜率。它没有标准答案,只有相对偏好。
看到胜率,先补全三件事
一、分母是什么。 平局(tie)算不算?投票作废的算不算?同一个问题被投了多轮,算一场还是多场?分母口径一变,数字就不可比。两个团队各自报"胜率 60%",很可能连算法都不一样。
二、对手是谁。 如果对手是固定版本的老模型,这叫"对某基线的胜率",换个基线就归零重算。如果是从一个模型池里随机抽对手,那么池子里弱模型越多,胜率越高。对手池的强弱,往往比胜率数值本身更能说明问题。
三、裁判是谁、判什么。 人类盲投、模型当评委(LLM-as-a-judge)、还是自动判分?人类投票已知会受答案长度、排版、语气影响——这是系统性偏差,和"谁更聪明"不是一回事。
和相邻概念的区别
| 指标 | 参照物 | 回答的问题 | 主要坑 |
|---|---|---|---|
| 准确率(accuracy) | 固定标准答案 | 答对了多少 | 题目集能否代表真实场景 |
| 胜率 | 一组特定对手 | 对着这组对手赢了多少 | 分母口径、对手池构成 |
| Elo / Bradley-Terry 分 | 全部对局的整体 | 综合排位大概如何 | 本身由胜率换算而来,同样受对手池牵制 |
一句话:准确率是绝对题,胜率是相对赛,Elo 是把无数场相对赛压成一个数。
对从业者与普通人的意义
从业者:做内部评测时,把分母口径、对手池版本、裁判方式一起写进报告。否则下一次换了对手池,"涨了 5 个点"根本解释不清是模型变强了还是对手变弱了。要判断真实进步,固定对手池、只换自己的模型,是比较干净的做法。
普通人:看到两个产品都宣称"胜率更高",先看它们是不是对同一批对手、同一套题、同一种裁判。不是的话,就当两条独立广告看。它的价值在于"相对谁",脱离了对手,这个数字什么也没说。
各平台的计分与投票细则会调整,具体以官方页面为准。
