据 Epoch AI 发布的一项研究(发布页:epoch.ai/publications/innovationeval,从地址看项目名为 InnovationEval),近期 AI 模型在匹敌人类的算法创新方面表现吃力。该研究把"算法创新"本身作为评测对象,其标题直接给出了结论性表述:在面对一项人类做出的算法创新时,近期模型未能达到同等水平。
为什么重要?算法创新长期被视为衡量研究级智能的硬指标之一。它要求的不是检索已有的人类解法,而是生成此前不存在的思路——新的算法结构、复杂度更优的路径,或对问题的重新表述。这与当前大量基准偏重知识问答、竞赛题求解与代码修复形成对照:后者的解法往往已存在于训练语料中,模型可以通过覆盖面获得高分,评测结果难以区分"记住了"与"想出来了"。
该研究所传达的判断是:在真正需要新思路的场合,当前模型与人类之间仍有可观差距。对 AI 从业者而言,这至少提示两点。其一,评估模型的研究能力时,需要把记忆复现与真实创新分开设计任务,否则容易高估模型能力、误判进展节奏。其二,对"AI 自动做科研、自动改进算法"这类叙事,宜采取更谨慎的时间表预期——模型在既有解法分布内的高效表现,并不自动外推为提出新算法的能力。
需要说明的是,该评测的具体任务构成、参与模型与各项得分,应以原文为准,本文不作展开。
