谷歌最强数学推理 AI 模型曝光:100 万词元上下文,专攻数学难题
9月16日,海外科技博主@lyraxana在X平台发布推文,爆料称谷歌正基于DeepThink V3模型构建内部代号为Mathematica的实验AI模型,该模型针对繁重计算、复杂符号问题求解进行了专项优化,预估将成为谷歌旗下最强的数学推理AI模型。

内部测试代号Mathematica的数学专项模型遭曝光
泄露的API配置显示,该模型内部标识符为models/deepthink-mathematica-tf-raw-thoughts,同时标注了“UNSTABLE_EXPERIMENTAL”状态,表明其仍处于不稳定实验阶段,尚未达到稳定运行标准。配置中还带有“Teamfood”标签,这是谷歌内部用于区分员工测试版本与公开服务的专属术语,意味着当前版本仅限谷歌内部人员使用,尚未进入外部测试或公开阶段。
百万词元上下文加持专攻复杂数学推理
技术参数方面,Mathematica模型展现出远超当前主流AI模型的运算能力,核心参数如下:
- 底层架构:基于DeepThink V3构建,内部标识符为
models/deepthink-mathematica-tf-raw-thoughts - 上下文窗口:最高支持100万个词元(token),可承载超长数学公式推导与复杂符号运算序列,其中上下文窗口指模型单次处理时可读取的文本单位总量
- 输出上限:单次回答最高可生成65536个词元,满足长步骤数学证明的生成需求,其中输出上限指模型单次回答可生成的文本单位总量
- 测试状态:标注“UNSTABLE_EXPERIMENTAL”,附带谷歌内部测试专属“Teamfood”标签,当前仅限内部员工使用
谷歌近期密集布局数学AI产品矩阵
此次Mathematica模型的曝光并非谷歌首次布局数学AI领域。此前谷歌已推出面向高阶数学竞赛的Gemini DeepThink IMO模式,就在9月15日,谷歌还刚上线了Gemini 3.8 Live及Live Extended Thinking版本,覆盖从日常对话到复杂推理的多种场景。而本次曝光的Mathematica模型进一步补全了谷歌在垂直数学科研场景的产品布局,其数学推理能力已达到国际数学奥林匹克竞赛金牌得主的水平。
已攻克多道卡壳学界数十年的埃尔德什难题
据海外科技平台披露的信息,该模型已在多项顶级数学难题上取得突破,成功解决了包括Erdős #125、Erdős #846在内的10道悬赏难题。其中Erdős #125于1996年提出,困扰学界30年,要求构造一个满足“任意三个数中不存在一个数整除另外两个数的和、且集合在自然数中保持一定密度”的无限整数集合,Mathematica通过中国剩余定理将大问题拆分为多个独立区块,用三项等差数列的回避集满足约束后拼接为完整解;Erdős #846同样于1996年提出,卡壳人类34年,涉及两个稀疏整数集合相加后的密度问题,Mathematica通过证明log₄除以log₃为无理数,构建归纳性稀疏化论证,最终证明密度为零。
研究团队透露,这些成果的取得并未依赖复杂的进化算法或多工具组合系统,仅通过大模型循环加Lean编译器反馈的简单路径完成,单题解题成本仅需几百美元。团队认为,这一结果一方面得益于Gemini 3.1 Pro本身足够强的底层能力,另一方面Lean编译器实打实的纠错反馈对AI的引导作用远超外界预期。
业内人士:或降低复杂数学研究的算力门槛
针对谷歌此次的进展,相关行业观察人士指出,Mathematica的研发方向直指当前AI数学能力的核心瓶颈——尽管现有模型在基础计算、简单推理上表现优异,但面对需要多步骤推导的复杂问题时,仍存在逻辑断裂、精度不足的问题,谷歌从底层架构重构入手的思路,可能为解决这类问题提供新方向。中科院相关专家也表示,AI模型更类似于强大的计算工具,未来可以帮助人类提出数学证明,但AI系统目前仍缺乏人类数学家的想象力,无法自主提出有价值的创新问题。目前该模型仍处于内部测试阶段,距离正式公开仍有段时间,但其低成本、高效率的解题路径,有望在未来为数学科研人员提供有力辅助,降低复杂数学研究的算力门槛。