Jagged Frontier(锯齿状能力前沿)说的是:AI 的能力边界不是一条平滑上升的曲线,而是一道参差的锯齿——它在某个任务上像资深专家,在紧挨着的、看上去更简单的任务上却像刚入门的新手。
那道锯齿长什么样
想象一张地图,上面标着"人类觉得难 / 人类觉得容易"。传统假设是 AI 会从易到难逐格点亮:先做翻译,再做总结,最后做科研。现实里被点亮的格子是散落的斑点。它可以在几分钟内读完一份长合同、指出前后矛盾的条款,却可能数不清合同里"甲方"出现了几次;可以顺着你的意思把一段话改写成五种语气,却在"这句话里到底是谁答应了谁"上翻车;能生成一段看起来合理的代码,却在需要严格逐字对齐的格式约束上漏掉一个字段。
更好懂的比方是一个偏科到离谱的实习生:语言能力惊人,逻辑时好时坏,态度极好、从不喊累,但也极少主动说"这块我不确定"。
为什么会出现锯齿
人类判断任务难度,靠的是推理步数、常识和工作记忆。模型判断"难度",靠的是另一套东西:这类任务在训练数据里出现过多少相似样本、后训练阶段有没有被特意强化、答案能不能逐个词元(token)地顺出来。于是难度的坐标系被重排了——人类觉得难的(写论文、做考试题)可能轻松;人类觉得毫不费力的(数数、盯住长文里某个细节、保持多步一致),反而可能是它的坑。
和相近概念的区别
| 概念 | 关注点 | 与锯齿前沿的关系 |
|---|---|---|
| 幻觉(hallucination) | 输出错误还很自信 | 是锯齿的典型表现,不是锯齿本身 |
| 缩放定律(scaling law) | 模型规模与能力的关系 | 把整条前沿往外推,但不会磨平锯齿 |
| 通用人工智能(AGI) | 是否全面达到人类水平 | 锯齿提醒:平均分高不等于没有深坑 |
对从业者意味着什么
一,别问"这个模型行不行",要问"这个模型在这个具体任务上行不行"。榜单是平均分,你的业务只是其中一格,任务级评测比总分有用。二,把锯齿当常态来设计流程:让 AI 干它擅长的那一齿(起草、改写、归类、写样板代码),在它薄弱的那一齿上接外部工具(计算器、检索、结构化校验)或人类复核。三,权限给得保守些:能读完全部文档,不等于能替你做合规判断。
对普通职场人:不要因为一次惊艳就认定它万能,也不要因为一次犯傻就彻底否定。更实在的做法是亲手摸一遍——自己工作里哪些格子它稳、哪些格子它飘。锯齿会移动、会变形,但不会消失;具体能力请以官方模型文档和自己的实测为准。
