刚刚,Kimi K3开源,2.8万亿参数砸向全球,硅谷巨头看傻了
2.8万亿参数冲击全球,Hugging Face半小时登顶
7月28日,月之暗面(Moonshot AI)在Hugging Face上正式发布了Kimi K3的模型权重、技术报告,并开源了支撑其训练的关键Infra技术。这个拥有2.8万亿总参数、激活1040亿参数、支持100万token上下文的混合专家(MoE)模型,一经放出便引爆社区。Hugging Face CEO Clem Delangue发文称,Kimi K3在30分钟内以超过4000个赞登顶趋势榜,是“迄今为止最快的发布增长速度”。截至上线前,已有近3700名开发者在等待,上线页面甚至因瞬时流量过大短暂出现404。北美AI基础设施创企OsmanticAI的创始人兼CEO Ahmad将Kimi K3称为“本地版Fable 5”,并强烈建议开发者下载,称“他们永远也夺不走我的Fable 5”。数字员工Devin的开发商Cognition随即宣布接入Kimi K3,并评价其为“首款性能逼近前沿水准的开源模型”。Nebius、Baseten、Fireworks等海外AI基础设施厂商纷纷宣布Day 0适配,华为昇腾CANN、趋境科技也同步完成国内硬件适配并开源成果。
编程与Agent能力逼近闭源巅峰,多模态实测惊艳
在基准测试中,Kimi K3展现出极强的工程与通用推理能力。在超长时序持续开发SWE Marathon、软件逆向Program Bench、终端运维Terminal Bench 2.1等测试中均取得突出成绩,其中SWE Marathon、Program Bench均获第一,Terminal Bench 2.1达到88.3分,接近GPT-5.6 Sol。在高难度软件工程任务FrontierSWE中,Kimi K3以81.2分位列第二,仅次于Claude Fable 5。在Agent和知识工作场景中,Kimi K3在网页深度调研BrowseComp(91.2分)、办公自动化Automation Bench、Excel财务建模SpreadsheetBench 2等测试中取得领先。视觉能力方面,在图表理解CharXiv、文档分析OmniDocBench(91.1分)等任务中表现强劲,但部分视觉推理任务仍弱于Claude Fable 5。智东西实测显示,Kimi K3 Max模式下仅用一次就生成了包含“霸天虎入侵的破败城市地图”、“低多边形风格”、“5种擎天柱阵营角色”等复杂设定的3D横版格斗游戏,无任何错误。海外开发者@He1s_Sammy对比测试Kimi K3、GPT-5.6 Sol、Fable 5三款模型的游戏设计能力,Kimi K3在方案质量、游玩体验和调用成本上均胜出,调用成本仅0.030美元(约0.2元人民币),而Fable 5为0.38美元,GPT-5.6 Sol为0.11美元。在官方展示的芯片设计案例中,K3基于开源EDA工具和Nangate 45nm工艺库,在48小时连续自主运行中独立完成了芯片的构建、优化与验证;在科研领域,一次分析了391个GWTC-5引力波事件,调用20多个并发子智能体,产出7张科学图、2张表格,综合多篇论文文献。
开源Infra三件套:MoonEP、FlashKDA与AgentEnv
Kimi K3此次不仅开源了模型本身,还同步开源了支撑其训练与部署的三项关键基础设施技术:MoonEP、FlashKDA和AgentEnv。FlashKDA是Kimi Delta Attention的高性能算子,在英伟达H20上prefill速度相比flash-linear-attention基线提升1.72-2.22倍,可直接作为替换后端使用。AgentEnv是与KVCache.ai合作开发的沙箱系统,为大规模Agent训练提供高保真、强隔离的运行环境,支持快速快照、恢复和分叉,可应对大规模并行的Agent工作流。MoonEP则负责高效路由与专家并行。在模型架构方面,KDA+AttnRes以3:1比例混合KDA与Gated MLA,通过块级注意力残差增强跨层信息流动,实现高效长上下文建模。Stable LatentMoE使每个token从896个路由专家中激活16个,通过SiTU-GLU与Quantile Balancing在极高稀疏度下保持训练稳定。MoonViT-V2视觉编码器从零开始使用next-token prediction训练,无需对比预训练,获得更稳定的优化过程。后训练阶段,模型在通用推理、通用Agent和编程Agent三大领域进行大规模任务合成,配合百万token上下文的强化学习基建,并完成了近20个内部评测集的完整评估。
制裁阴影下的全球选择:开发者用脚投票,美国企业难舍中国开源模型
Kimi K3的开源引发热潮的同时,也触动了美国政界的敏感神经。美国参议员蒂姆·斯科特和比尔·哈格蒂已提案扩大商务部权限以限制外国对手接触AI技术,白宫曾考虑通过行政令要求使用中国模型的美国企业对安全事件承担责任,OpenAI、Anthropic等美国闭源AI企业也曾提案禁用中国开源模型。然而,现实是近200家美国初创企业敦促政府不要切断对中国开源模型的访问,认为这将削弱美国企业竞争力。正如海外开发者所言,半年前DeepSeek-V3开源时,社区讨论是“又一个中国模型”;到了Kimi K3,话题变成了“它比Claude Opus强”、“开发者正在把Fable换成K3”。当美国企业自己都在用中国的开源模型,并且以百分之一成本实现接近甚至超越的性能时,制裁的合理性自然站不住脚。AI能力正在从少数公司的技术优势,变成全球开发者可以调用的基础工具——这个趋势不会因为一纸制裁令而改变。与此同时,顶尖AI人才回流中国的趋势加速:月之暗面创始人杨植麟在硅谷百万年薪邀约下毅然回国创业,仅3年打造出估值超200亿美元的AI独角兽。前谷歌Fellow吴永辉加入字节跳动,前OpenAI研究员姚顺雨加入腾讯,越来越多中国AI人才选择在本土完成从底层研发到产品落地的全链条,中国正在成为全球AI创新的主场之一。