蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-Flash
小参数大能量:124B参数如何越级挑战?
7月24日,蚂蚁百灵正式推出新一代原生混合推理模型Ling-3.0-Flash。该模型总参数量仅124B,单次计算激活参数仅5.1B,相比上一代1T级旗舰思考模型Ring-2.6-1T,参数总量减少87.6%,激活参数减少91.9%。然而,在基础推理、指令遵循及长文本处理等核心指标上,Ling-3.0-Flash对标甚至超越了参数规模为其2至3倍的行业领先模型,展现出极高的“智效比”与落地性价比。这一“小体量、高智能”的突破,为AI模型的高效部署提供了新范式。
重新定义计算架构:混合注意力机制与KDA的进化
实现“小体量、高智能”的关键,源于底层计算架构的重新设计。Ling-3.0-Flash放弃了单纯堆砌参数的思路,从预训练阶段即采用原生混合线性注意力架构,以5:1的比例交替堆叠KDA线性注意力层与MLA层,在长上下文效率与模型能力之间实现更优平衡。此外,模型将上一代的Lightning Attention升级为KDA(Kimi Delta Attention),在Delta Rule的状态更新中引入细粒度对角门控,让模型在处理长文档和代码库时能更精准地记住关键信息。同时,Ling-3.0-Flash进一步压缩了单次计算的专家激活比例,每个Token的专家激活比例由前代的1/32压缩至1/64,由此带来了更高的“效率杠杆”。

Agent实战:从代码编写到长程任务自主闭环
Ling-3.0-Flash针对Agent的实际应用场景进行了深度打磨。模型扩展了超10000个真实交互训练环境,并优化了复杂任务的自我纠错与长程规划机制。无论是在代码编写、复杂任务拆解,还是多源信息深度调研等场景中,Ling-3.0-Flash均展现出更强的自主闭环交付能力,解决了传统模型在大任务中容易“跑偏”或断档的难题。升级后的多智能体协同架构允许不同Agent分工协作、相互校验,有效减少了单一模型的误判风险,为高频线上服务与真实业务落地提供了支撑。
快上加快:集群级缓存将首字延迟降低80%
为了让AI Agent运行更快、更稳,百灵还为其匹配了配套的工程与协作架构。在响应速度上,通过引入集群级分级缓存(SGLang HiCache + Mooncake架构,物理双池、集群共享L3),避免了长对话和多轮交互中的重复计算,将长输入下的首字响应延迟降低了60%至80%以上。这意味着,即便面对超长文本或复杂对话场景,用户也能获得近乎即时的响应体验。
限时免费开放,一周后正式开源
目前,Ling-3.0-Flash已上线OpenRouter与百灵官方平台,同步开放限时免费API调用,免费期截至8月3日23:00(北京时间)。模型权重将在免费期结束后正式开源,届时开发者可获取完整模型进行本地部署与二次开发。这一开放策略,将加速原生混合推理模型在Agent、代码生成、长文本处理等真实场景中的落地与创新。