刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable
AI圈许久没有迎来如此重量级的模型动态了。此前谷歌旗舰Pro系列已经沉寂7个月,被寄予厚望的Gemini 3.5 Pro更是鸽了又鸽最终宣布取消,没想到谷歌直接甩出了下一代产品Gemini 4 Pro的早期版本,匿名登录AI模型竞技场Arena,一经亮相就直接杀疯了。

匿名马甲现身Arena引发开发者猜疑
这款模型的名字叫“gemini-3.8-flash”,但谷歌早在9月初就已经发布过同名的Gemini 3.8 Flash模型,同名模型再度现身本就极不寻常。多位上手实测的开发者很快发现,该模型的能力远高于已发布的3.8 Flash版本,结合谷歌此前Gemini 4预训练评估表现优异的爆料,几乎可以确定这就是Gemini 4 Pro的首个公开检查点版本。
leaked跑分曝光四大维度全面领跑
从网络疯传的基准测试图来看,Gemini 4 Pro的表现堪称“恐怖”,在多个核心能力测试中均拿下最高分:
- DeepSWE v1.1 AI智能体编码能力测试中,Gemini 4 Pro拿下约88%的分数,比OpenAI Astra高出近2个百分点;
- GDPval-AA v2真实知识工作任务测试中,Gemini 4 Pro是唯一获得2064 Elo评级的模型;
- Terminal-bench 2.1终端编码能力测试中,Gemini 4 Pro以95.3%的成绩位列第一;
- OSWorld-2.0计算机使用能力测试中,Gemini 4 Pro斩获86.8%,击败Astra和Claude Fable 5.1。
外界普遍认为,Gemini 4 Pro能力快速提升的背后,离不开谷歌内部已经落地的RSI(递归式自我改进)技术支撑,此前谷歌DeepMind策略总监Jasjeet Sekhon曾在公开活动中表示,RSI已成为AI巨额投资逻辑的重要一环,模型可通过自我迭代持续提升能力,大幅加快进化速度。
更令人惊喜的是其定价策略,相较于Astra和Fable,Gemini 4 Pro是“御三家”中性价比最高的选择,每百万Token输入价格仅为2.25美元,每百万Token输出价格为11.25美元。另有AI研究员进入模型后端发现,该模型支持1000万Token输入上限、25.6万Token输出上限,还具备永久跨会话记忆、无需API即可直接连网的能力。若相关数据属实,Gemini 4 Pro当真能称得上“地表最强”AI模型。
实测表现惊艳UI设计等能力超预期
比起跑分数据,实际使用体验更让开发者震惊。有开发者用Gemini 4 Pro进行UI网页设计测试,仅用14分钟就打造出了一款以素描、铅笔与石墨质感为主题的创意展示网页,测试者直呼“Gemini 4 Pro太不真实了”。还有测试者用生成SVG猫咪图的 prompt 进行对比测试,GPT-6 Astra生成的是似猫非猫、形似“老fu”的奇怪形象,而Gemini 4 Pro的生成效果完全符合预期。开发者Vidhi在多次实测后表示,Gemini 4 Pro的体验完全超越了当前的Astra和Fable,相关实测内容很快登上热搜,引发全网讨论。
谷歌大版本迭代曾多次跳票终交底
谷歌上一次对Gemini Pro系列进行大版本更新还是7个月前(2月19日)推出的Gemini 3.1 Pro。今年谷歌I/O大会上,皮查伊曾