华为官宣昇腾 0day 支持 Kimi K3 的训练适配及推理部署
全球首个开源3万亿参数级模型:Kimi K3的技术突破
月之暗面于7月28日开源了Kimi K3大模型,这是全球首款开源3万亿参数级多模态模型。其采用Stable LatentMoE架构,内部集成896个专家,单次推理仅激活16个专家,显著降低计算成本。模型搭载KDA混合线性注意力,支持100万token超长上下文,KV Cache压缩75%,长文本解码速度提升6.3倍。原生视觉理解能力使其在长周期编程、深度文献分析、工程设计等复杂智能体任务中表现突出,扩展效率较前代提升2.5倍。在权威评测中,Kimi K3在Artificial Analysis Intelligence Index v4.1上位列第4,Vals行业基准指数排名第2,Arena Human偏好中Web开发能力排名第1。

昇腾0day适配:三大硬骨头被啃下
Kimi K3的落地面临三大技术难点:KDA算子计算密度低、海量专家易导致负载失衡、2.8万亿参数带来巨大显存压力。华为昇腾联合月之暗面,针对这些痛点完成了全套专项优化,实现从训练到推理的0day极速全链路适配。依托Atlas系列算力硬件、MindSpeed MM训练套件、vLLM Ascend与SGLang推理引擎,完整覆盖模型训练复现与线上推理部署,为万亿级稀疏MoE大模型提供国产算力落地方案。
训练端:MindSpeed套件+多维并行破解显存与专家计算难题
在训练端,昇腾基于MindSpeed MM套件,在Atlas 800 A3和Atlas 900 A3 SuperPoD上完成完整训练复现。采用FSDP+EP混合多维并行策略,将专家参数拆分到多卡以解决显存溢出问题;自研GEMM分组矩阵算子,批量处理海量专家计算,提升运算效率。基于Triton Ascend编译框架加速线性注意力,并通过ChunkLoss分块损失计算大幅降低显存峰值。此外,提供一键式环境部署脚本,大幅降低超大模型训练门槛,使开发者能快速复现Kimi K3的训练过程。
推理端:50毫秒内单步生成,无需改动代码即可迁移
推理侧支持昇腾950超节点全系列精度,原生兼容Kimi K3的MXFP4量化权重。基于vLLM Ascend与SGLang两大开源引擎进行落地优化,针对KDA设计Prefill和Decode双融合算子,提升计算效率。MC2流水线打通专家路由、跨卡通信与计算回收全流程;支持逐Token动态MXFP8量化及FlashComm1通信优化。SGLang新增DSpark投机推理技术,将单步生成时延压至50毫秒以内,且完整保留原有引擎调度与接口体系,开发者无需改动业务代码即可迁移。
开源生态协同:趋境科技与华为CANN联手加速
开源消息公布后,趋境科技基于SGLang完成了Kimi K3在昇腾Atlas A3上的Day0推理适配。项目实现了KDA在昇腾CANN上的适配,并针对MoE、混合注意力机制、多卡通信等关键模块进行了优化,确保模型在昇腾平台上的高效稳定运行。Kimi K3的896专家大EP部署场景,充分发挥了昇腾超节点架构优势,已完成64卡/千卡国产超节点的全链路适配。相关适配成果即将开源,为开源大模型在昇腾平台上的快速部署和Agent应用落地提供有力支撑。