刚刚,Gemini 4 Pro偷跑上线,碾压Astra和Fable
AI模型竞技场Arena近日突现一款匿名新模型,注册名称为“gemini-3.8-flash”,经全球开发者多轮实测交叉验证,极有可能是谷歌DeepMind打磨半年的下一代旗舰Gemini 4 Pro的早期测试版本。要知道谷歌上一次大版本更新Gemini 3.1 Pro还是7个月前的事,此前在I/O大会上预告的Gemini 3.5 Pro也因表现不及预期直接取消,此番突然出现的测试模型直接让沉寂已久的AI圈沸腾。

匿名模型穿旧名马甲,偷跑逻辑不寻常
这款模型的“马甲”身份本身就充满疑点:gemini-3.8-flash是谷歌早在9月初就已正式发布的模型,同型号再次出现极不寻常。结合此前华尔街日报曝出的Gemini 3.5 Pro因进化程度甚至不及Flash而被砍掉的消息,业内普遍判断这是谷歌为提前测试市场反馈,故意用旧型号名称隐藏旗舰新版本的偷跑操作。而谷歌官方此前透露的“Gemini 4预训练评估优秀,后训练正顺利推进”的消息,也进一步印证了该匿名模型的身份。
多维度基准测试屠榜,全面压制两大竞品
从流出的官方基准测试数据来看,Gemini 4 Pro在多项核心能力测试中均拿下最高分,实现了对Astra和Fable的全面压制:
- 在评估AI智能体编码能力的DeepSWE v1.1测试中,Gemini 4 Pro获得约88%的分数,比Astra高出近2个百分点;
- 在衡量真实知识工作任务表现的GDPval-AA v2测试中,Gemini 4 Pro是唯一获得2064 Elo评级的模型;
- 在Terminal-bench 2.1终端编码能力测试中,Gemini 4 Pro以95.3%的得分位列第一;
- 在OSWorld-2.0电脑操作能力测试中,Gemini 4 Pro斩获86.8%的分数,击败Astra与Fable 5.1。
此外,该模型的定价也展现出了极高的性价比,每百万Token输入价格仅为2.25美元,每百万Token输出价格11.25美元,是当前“御三家”旗舰模型中定价最低的产品。有AI研究员进入Gemini 4 Pro后端后发现,该模型支持1000万token输入上限、25.6万token输出上限,具备永久跨会话记忆功能,且无需调用API即可联网。
全网实测惊喜不断,创意生成能力突破预期
跑分之外,全球开发者的实机测试更是带来了诸多惊喜。有开发者用Gemini 4 Pro测试SVG生成能力,仅需简单指令就生成了细节完美的猫咪形象,而对比的GPT-6 Astra生成的则是似猫非猫的异常形象,差距十分明显。另有开发者仅用14分钟,就让Gemini 4 Pro打造出了一个以素描、铅笔与石墨质感为主题的创意展示网页,成品完成度远超预期。业内传言谷歌内部已实现“递归自我改进(RSI)”闭环,让AI可以自主迭代升级,这也是Gemini 4 Pro能够正面硬刚Astra和Fable的核心原因,沉寂半年的谷歌AI巨兽正强势回归。
行业竞争格局生变,谷歌技术领先地位再夯实
在OpenAI与Anthropic近期接连推出强竞品的背景下,Gemini 4 Pro的突然现身直接改写了当前大模型的性能排名。作为支撑谷歌4.23万亿美元市值的核心业务板块,此次Gemini 4 Pro展现出的领先优势,也向市场证明了谷歌在AI领域的技术储备依然处于全球第一梯队,未来大模型行业的竞争格局将进一步向技术实力倾斜。