一句话定义
Agent Evaluation Reliability(智能体评估可靠性),指的是一个智能体评测结果在重复运行、更换任务、更换评测环境之后是否还站得住脚。它关心的不是"谁排第一",而是"这个名次里有多少是真实差距,有多少只是噪音"。
打个生活化的比方
用 10 道题考两个学生,一个 8 分一个 7 分,就说前者更聪明——这结论靠谱吗?如果换一套卷子名次就翻转,那这次排名基本等于抛硬币。而且,就算把题量从 10 道加到 100 道,只要这 100 道都出自同一个题库、同一个出题人偏好,你也只是把同一个偏差放大了一百倍,并不会更接近真相。
分数失真的三个来源
1. 运行方差(run-to-run variance)。智能体是随机系统:采样温度、工具调用顺序、网页状态、重试次数都会影响结果。同一个模型同一个任务跑两次,结果可能不同。只报一次跑分,等于只抛了一次硬币。
2. 任务选择偏差。评测任务集(task set)不是从"所有真实任务"里均匀抽样出来的,而是人挑的。挑题的人会偏向可自动判分、边界清晰、演示效果好的任务。于是评测测的是"这批题上的能力",不是"真实工作里的能力"。
3. 任务之间不独立。很多任务共用同一套工具、同一套环境、同一类失败模式。一个智能体在某个环节卡住,会在几十道题上同时失败。这时"任务数"看起来很大,有效样本量(effective sample size)却小得多。
容易混淆的两组概念
| 常被当成一回事 | 实际区别 |
|---|---|
| 评测准确性 | 分数算得对不对;可靠性问的是换个时间、换批任务,结论还成不成立 |
| 增加任务数量 | 降低抽样误差,通常按任务数的平方根量级收敛;但降不了系统性偏差 |
| AI 词典:pass@k">pass@k(k 次里成功一次) | 衡量"有没有可能做成";pass^k(连续 k 次都成功)才更接近"能不能稳定交付" |
对实际工作的意义
对做智能体的团队:报告结果时给方差或置信区间,别只给一个数。两个方案差一两个百分点、且差距小于波动范围时,不要当成胜负。
对选型采购的人:先问三件事——差多少分、跑了几次、题从哪来。如果榜单上的任务和你自己的业务场景差得远,那榜单第一对你几乎没有参考价值。更实用的做法,是用二三十个贴近自己业务、能自动判分的小任务,自己跑三遍看稳定性。
对普通职场人:看到"某智能体登顶"的新闻,先在心里加一句"差距在误差范围内吗"。多做题不等于更可信,题从哪来、跑了几次、波动多大,才决定这个结论能不能拿来做决策。具体的评测方法、任务集构成与统计口径,以各评测方的官方页面为准。
