AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4

数学大模型评测的“最高防线”FrontierMath Tier 4正式宣告饱和。这套专门为当前最强AI模型设计的顶级数学测试,自2025年7月上线以来首次被完全“刷穿”,标志着AI数学能力迈过了此前被认为极难跨越的门槛。

AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4

曾定位“顶尖数学系级难度”的FrontierMath Tier 4

FrontierMath是由第三方AI评测机构Epoch AI推出的数学能力基准测试,随着推理模型的能力提升, tiers 1到3逐渐无法区分顶级模型的数学水平差距,2025年7月Epoch专门推出Tier 4,公开目标是把题目难度做到“等同于整个顶尖数学系的综合能力”。该层级题目由全球各高校的数学教授、博士后围绕自身研究方向打磨,每人耗时数周完成原创研究后将成果压缩为可自动验证的数学问题,最初共收录50道题,覆盖分析、数论、组合数学、拓扑、代数几何等核心数学领域。上线时所有模型累计测试成绩最高仅约5%,仅有3道题曾被AI解出,且解答依赖了未充分论证的假设,Epoch官网曾公开表示“部分题目可能几十年都不会被AI解决”。

此后OpenAI在内部测试中发现FrontierMath题库的错误率远超预期,Epoch随即启动独立审计:

  • 先调用GPT-5.5、Claude Opus 4.7筛查题目疑点
  • 再交由专业数学家逐题复核
    2026年6月推出v2版本,最终修正了12道题目、移除了7道存在错误的题目,Tier 4剩余43道有效测试题。

GPT-6 Astra攻克最后一道未被AI破解的题目

题库修订后,顶级模型的成绩开始快速攀升:GPT-5.6