据量子位报道,GPT-6 Astra 在 FrontierMath 的 Tier 4 层级上取得突破,被形容为"刷穿"了这道被称为 AI 数学最后一道高墙的评测关卡。
FrontierMath 是面向大模型数学推理能力的评测基准,题目由数学家设计,难度对标研究前沿,而非中学或竞赛题库。Tier 4 是该基准中难度最高的层级,题目通常需要跨领域的专业数学知识、长链条推理以及构造性证明能力,长期以来被视为衡量模型能否触及"真正数学研究"的分水岭。
如果这一结果得到确认,意味着模型在最高难度数学推理上的能力边界再次被推高:从此前主要解决竞赛数学与标准化题目,转向处理需要原创思路的研究级问题。这对自动化定理证明、形式化数学以及"AI 辅助数学家"的工程路径都具有直接意义——数学因其结论可严格验证,一直被视为检验模型通用推理能力的理想试验场。一旦模型能稳定通过此类高难度题目,其推理能力就有可能迁移到同样需要严格逻辑的其他领域。
不过,单次评测结果与实际研究能力之间仍有距离。解读时值得关注几点:评测是否采用官方完整题集与标准评分口径、是否存在数据污染或题目泄露的可能、以及结果是否经过人工核验。FrontierMath 的高难度题目数量有限,个别题目的通过容易被放大解读,而模型在无提示条件下的稳定泛化能力,才是更能说明问题的指标。
Tier 4 被"刷穿"本身是一个信号:数学这堵墙正在变薄。接下来值得关注的是官方评测结果的披露,以及其他模型在同一基准上的跟进表现。
