智谱发布 GLM-5.3-FlashX:速度飙至200tokens/s,国产算力再提速

智谱GLM-5.3-FlashX正式上线,最高推理速度达200 tokens/s

9月18日,智谱正式推出GLM-5.3-FlashX模型,其API接口与体验中心同步向企业与开发者全面开放。据官方介绍,该模型的最高推理速度可达200 tokens/s,较前代基础模型GLM-5.3-Flash提升5倍,定价也相应上调至原版本的2.5倍,在智能水平、响应速度、服务定价三个维度形成综合竞争实力。消息发布后,港股“大模型第一股”智谱股价当日大涨5.41%,智谱方面也表示,随着FlashX上线,模型收入规模与盈利能力有望进一步提升。

智谱发布 GLM-5.3-FlashX:速度飙至200tokens/s,国产算力再提速

GLM-5.3-Flash匿名测试创纪录,为FlashX迭代打下基础

GLM-5.3-Flash作为本次迭代的基础模型,早在8月26日就已正式开源,其总参数规模达3200亿,激活参数为180亿,支持100万tokens的上下文长度。此前该模型曾以“Ox Alpha”为代号在全球范围内进行匿名测试,收获海内外开发者广泛认可,在OpenRouter等平台的token调用量高达62T,登顶双平台历史纪录,验证了其市场认可度与需求潜力。

10万张国产芯片搭计算底座,Infra优化助力推理提速

本次GLM-5.3-FlashX的速度跃升,核心依托于10万张国产芯片构建的推理算力集群。据悉该集群上线后即被用户需求占满,智谱后续追加了基础设施与推理优化的投入,通过软硬件协同调优进一步释放算力潜能,最终实现推理速度的大幅提升,也打破了此前国产大模型推理速度的性能瓶颈。

国产大模型竞争逻辑切换:从抢算力到拼效率成行业共识

GLM-5.3-FlashX的提速与定价调整,折射出国产大模型产业竞争逻辑的转变:从过去单纯追求模型能力上限,转向在同等智能水平下比拼推理效率、用户体验与单位成本。这一趋势在2026年下半年已初步显现,例如阿里同期发布的Qwen3.8-Flash训练成本较前代骤降近90%,推理定价低至每百万Tokens输入0.8元、输出2.7元。随着国产算力供给的规模化与国产化推进,模型公司得以将更多精力从“抢算力”转向“提效率”,推理速度、响应体验与成本控制,正在取代单纯的参数规模,成为衡量模型商业竞争力的核心标尺。