谷歌Meta被锤刷榜
近期AI圈最热的两款模型——谷歌Gemini 3.8 Flash与Meta Muse Spark 1.3同时发布,均凭借亮眼跑分登顶多个大模型排行榜,然而不到一周,就被多方实锤存在刷榜行为,真实能力遭到严重质疑。
TB4.0新基准揭穿刷榜套路
知名AI研究机构SemiAnalysis最先发出指控,称谷歌、Meta两款模型的刷分证据就藏在过往评测中:二者在TB 2.1评测基准中拿下极高分数,但换成全新发布的TB 4.0评测基准后,跑分直接出现断崖式下跌,真实泛化能力完全匹配不上此前的高分表现。
随后有网友对两款模型做了后端级3D约束压力测试,进一步揭穿了二者的“老底”:测试结果显示Muse Spark 1.4并没有官方宣传的那么强大,而Gemini Flash 3.5则是实打实的“刷榜选手”。
跑分虚高难掩真实体验短板
多家评测机构的报告都指向了同一问题:当前大模型行业已经陷入“为了跑分而训练”的怪圈,以下评测基准成了各家疯狂“刷题”的目标:
- DeepSWE
- Tau3-Bench
- GPQA
发布的模型必然伴随吊打友商的雷达图和排行榜截图,但真实使用体验毫无长进。
知名AI机构BridgeMind的公开吐槽精准戳中了行业痛点:“这个月的AI发布如出一辙,分数飙升,但真实世界的体验却毫无长进。我对基准测试的信任每周都在减少,而对那些玩弄基准的实验室,信任更是所剩无几。”
Artificial Analysis的深度报告也佐证了这一问题:Muse Spark 1.3在AA-Omniscience测试的xhigh、max版本中均出现跑分退步,原因在于模型的“弃权率”大幅提升——面对不确定的问题,模型更倾向于不回答而非胡编乱造,虽然降低了幻觉率,但也侧面说明其绝对知识储备并没有像跑分显示的那么夸张。性价比成Meta破局核心优势
在跑分饱受质疑的同时,Muse Spark 1.3却凭借极致的性价比收获了大批开发者好感。Meta首席AI官Alexandr Wang公开评价该模型“便宜到不值一提”,“前沿性能,成本只是零头”。
据悉,Muse Spark 1.3走的是与行业“大力出奇迹、疯狂堆叠参数”完全不同的路线:通过针对性训练优化长周期编程、指令遵循能力,减少不必要的交互轮次,让输出更加简洁,最终实现了1美元可运行2小时的超低使用成本,被开发者称为“性能怪兽”。北大校友、Meta研究员孙之清也透露,团队针对此前的牛油果(avocado)模型做了再次后训练,实现了更好的测试scaling,为7×24小时个人智能体的落地铺平了道路。迭代速度差距让谷歌陷入被动
两款模型的竞争也暴露了谷歌和Meta的迭代效率差距。有网友调侃:“谷歌辛辛苦苦四个月发了4个Gemini Flash版本,Meta这边五个月里一口气迭代了4个Muse Spark。但谷歌刚领跑几个小时,就被Meta超车,这剧情太精彩了。”
Alexandr Wang也公开“吐槽”谷歌:“在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。”曾经的搜索巨头在AI大模型赛道上,已经呈现出被Meta追赶甚至反超的态势。