超 GPT-5.6 Sol:月之暗面 Kimi K3 模型 AI 智能体知识工作跑分仅次于 Claude Fable 5

模拟真实办公:AA-Briefcase跑分揭晓,K3超越GPT-5.6 Sol

独立AI评测机构Artificial Analysis于7月22日更新了AA-Briefcase基准测试,该测试专为评估AI在长周期、高复杂度真实业务中的表现而设计。它模拟企业真实且混乱的办公环境,要求AI处理海量碎片化上下文——包括25000+条Slack消息、3500+封电子邮件、会议纪要和财务报表,并最终生成Excel财务模型、董事会汇报PPT等实际商务交付物。在这个“智能体知识工作”的硬核考场中,Kimi K3模型斩获1543分,不仅大幅超越自身上一代K2.6的816分,更以明显优势超过GPT-5.6 Sol(最高1501分),仅次于Claude Fable 5的1574分。这一成绩意味着K3在数据科学、产品管理、企业战略等场景中的综合交付能力已达到全球顶尖水平。

超 GPT-5.6 Sol:月之暗面 Kimi K3 模型 AI 智能体知识工作跑分仅次于 Claude Fable 5

2.8万亿参数加持:K3在编程与智能体领域全面开花

Kimi K3由月之暗面于7月16日正式上线,拥有2.8万亿参数和100万Tokens的默认上下文窗口,是全球首个接近3万亿级别的开源模型。在多项权威基准测试中,K3展现了全面碾压的实力:

  • 前端代码竞技场(Frontend Code Arena):K3以1679分超越Claude Fable 5(1631分)和GPT-5.6 Sol(1618分)登顶,在品牌营销、数据分析等七个前端领域中的六个位居第一。
  • 终端代码生成与调试(Terminal Bench 2.1):K3拿下88.3分,与榜首GPT-5.6 Sol仅差0.5分,超越Opus 4.8和Fable 5。
  • 极限编码挑战(SWE Marathon):K3以42.0分领跑全场,远超Fable 5的35.0分。
  • 表格处理智能体(SpreadsheetBench 2):K3以34.8分拿下全场第一。
  • 网页深度调研(BrowseComp):K3以91.2分超越Fable 5的88.0和GPT-5.6 Sol的90.4,证明其在复杂信息检索与整合方面的能力。

成本仅为对手三分之一:开源旗舰的性价比冲击

在性能逼近顶尖闭源模型的同时,Kimi K3在成本上展现出惊人的优势。其API定价为:每100万Tokens输入费用(缓存命中)2元,未命中20元,输出费用100元。折算后,K3的单任务成本约0.94美元,与GPT-5.6 Sol的1.04美元接近,但仅为Claude Opus 4.8(1.80美元)的一半左右。更值得注意的是,K3完全开源,任何团队均可部署使用。据近期报道,微软正在内部测试Kimi K3模型,评估将其部分接入Copilot AI助手的可行性,以降低推理成本。特斯拉CEO埃隆·马斯克也在官方动态下留言“Impressive(令人印象深刻)”。K3的发布不仅刷新了开源模型的性能天花板,更以“顶级性能+极低价格”的组合拳,对闭源模型市场构成直接冲击。