量子位报道的一则消息,把ChatGPT置于一个反差明显的讨论中:标题称它能破解千禧数学难题,但同时提到论文复现率低至13.98%。两者并列,外界难以用单一结论评价其能力。
需要区分的是,“破解千禧数学难题”与“复现论文”并不是同一种任务。前者往往被当作单点能力展示,后者更接近科研工作流,要求依据论文完成方法、实验或结论的再现。若13.98%确为论文复现评测结果,它反映的不是某一次回答是否精彩,而是模型在系统性、可验证任务上的稳定表现。单次成功不能自动推广为普遍能力,低复现率也不必然否定数学推理表现,但两者共同提示:模型能力存在明显的任务差异。
对AI从业者而言,这条消息的重要性在于评测视角。演示型案例容易制造“模型已能替代研究”的印象,而复现率等指标更接近真实科研场景。涉及千禧数学难题这类目标时,仍需同行评审与独立复现。当前信息有限,13.98%对应的论文集合、复现标准与判定规则尚未展开,不宜直接外推为ChatGPT的整体科研能力。后续应关注原报道是否披露评测细节,明确任务定义与验证方式,才能判断这一数字的含义。公开成功与失败案例,比单点突破叙事更有参考价值。
