一句话定义:匿名义测模型(Stealth Model)指厂商把还没正式发布的模型,用一个和自家品牌毫无关联的代号,丢进公开的盲测擂台,让陌生用户两两对比投票,再用票数估排名、定版本。社区管这个动作叫"代号空投"。
它怎么运作
以 LMArena 这类平台为例:你提一个问题,屏幕上出现两个匿名回答,你只知道它们叫"模型 A"和"模型 B",然后选一个更好的。
票攒够之后,平台用 Elo rating 或 Bradley-Terry 这类统计模型,把"谁赢过谁"折算成分数和排名;票越多,置信区间越窄。
厂商那边通常同时挂着好几个候选版本——不同训练阶段、不同对齐口味的——看哪一版在真实人群的偏好上分更高,就把哪一版推去正式发布。这就是"按投票定版本"。
打个比方:像蒙面歌手去参加选秀,不靠海报和名气,只靠现场那一嗓子让人投票;也像车企给测试车贴满伪装贴纸,开进真实路况收反馈。蒙着脸的意义是,观众不会因为你爸是谁而加一分或减一分。代号的取名常是随机词、动物或神话人物,模型卡上信息能少就少,有时只写一句"匿名模型"。
和相邻概念的区别
| 概念 | 谁来评 | 看什么 | 目的 |
|---|---|---|---|
| 匿名义测 | 平台上的陌生用户 | 两两对比的偏好票 | 排名、选版本 |
| 内部基准测试 | 自家团队、固定题库 | 客观正确率 | 卡门槛、防退化 |
| 灰度 / A-B 测试 | 自家真实用户 | 留存、转化 | 优化产品指标 |
| 正式发布 | 所有人 | 综合口碑 | 卖 API、讲故事 |
关键差别:基准测试测的是"会不会做对题",匿名义测算的是"人更喜欢哪个回答"。它是大众口味调查,不是能力证书。
为什么团队怕被"认出来"
当一个只有代号、没有公司名的模型突然在多个榜单上排到前列,社区就会开始"考古",顺着回答风格反推是谁。一旦有人在 Hacker News、Reddit 或 X 上发帖说"我知道这个代号是谁家的",麻烦是成串的:
- 盲测不盲了:投票者知道对面是巨头还是新锐,光环效应和逆反心理都会混进那一票,数据被污染,版本决策的依据也就脏了。
- 情报提前泄露:对手提前知道你在做什么方向、什么量级,可以从容调整节奏。
- 预期被锁死:代号期的表现会被记住,正式发布时惊喜没了,评价却已经写好。
- 节奏失控:公关口径、定价、合规都还没准备好,却被逼着回应。
有意思的是,社区认模型靠的常是些小破绽:固定口头禅、拒绝回答的边界、格式癖好、知识截止时间,甚至中文标点的习惯。像靠口音认老乡。
对从业者与普通人
榜单分数是偏好信号,不是能力证明。它受投票人群构成、问题分布、回答长度和排版风格影响——写得长、爱用列表的回答往往更占便宜。把它当唯一 KPI,容易把模型训成讨好型人格。
普通人这边有两件事:你随手点的一票,可能真的决定了某家公司下个版本发哪一个;再看到"神秘模型屠榜",先问三句——投了多少票、置信区间多宽、投票的是谁。榜单规则以官方页面为准。
