Andrej Karpathy 在 X 上发文指出,关于大语言模型(LLM)能力的共同理解正在出现越来越大的缺口(the gap in shared understanding of LLM capability is widening)。这一表述指向一个正在发生的变化:随着模型能力持续演进,不同人群对"模型究竟能做什么"的认知差异不是在收敛,而是在扩大。
对 AI 从业者来说,这个观察值得认真对待。LLM 的能力并不是一个可以直接读取的数值,它由基准测试分数、真实任务表现、产品演示和个人使用体验共同塑造,而这些来源之间往往并不一致。研究者关注训练与推理的机制边界,工程师关注模型在自己的数据和延迟约束下是否可用,企业决策者关注成本与稳定性,普通用户则更多依据少数几次对话形成印象。当模型迭代速度超过共识形成的速度,这些视角就会彼此脱节。
缺口扩大的后果是具体的。评估标准难以对齐,同一模型能否承担某项任务,不同团队的判断可能截然不同;采购与部署决策容易建立在过时的体感之上;关于能力边界与风险的公共讨论,也缺少共同的事实基础。当"谁说的更接近真相"无法被快速验证时,沟通成本会转化为实际的工程与决策成本。
Karpathy 的这条发言把问题摆上台面:在模型能力快速变化期,建立对 LLM 能力的共同语言、以及可复现、可对照的评测习惯,本身就是一个需要持续投入的工程问题,而不是某一次发布或某一张榜单能够自动解决的。
