智谱 GLM-5.3-FlashX 模型上线,更快、更流畅

2026年9月18日,智谱官方正式宣布推出GLM-5.3-FlashX大模型,同步开放API接口,开发者可通过Model Key GLM-5.3-FlashX 调用该模型,为企业与开发者提供更快、更流畅的模型使用体验。

智谱FlashX正式上线 推理速度跃升五倍

新版本最高推理速度可达200 tokens/s,较现有GLM-5.3-Flash版本提升5倍,定价为原版本的2.5倍,在保持模型智能水平的基础上大幅优化响应速度,降低用户使用等待成本。此前GLM-5.3-Flash以“Ox Alpha”为代号与全球开发者见面时便获得广泛认可,上线后调用量持续攀升,本次FlashX的推出正是为了承接快速增长的市场需求。

前身Ox Alpha全球出圈 调用量连破平台纪录

GLM-5.3-Flash在正式发布前,曾以匿名模型“Ox Alpha”面向全球开发者开展大规模测试,凭借出色的性能表现获得海内外开发者的广泛认可,上线后调用量持续走高,曾登顶OpenRouter平台使用量排行榜首位,同时创下OpenCode、OpenRouter双平台调用量新高,成为当时全球开发者热议的明星模型之一。

10万张国产芯片筑基 Infra优化释放推理效能

为应对激增的用户调用需求,智谱投入10万张国产芯片组成推理集群,上线后集群算力即被完全打满。智谱进一步加大对Infra侧的投入与推理优化,采用生产级EPD分离式架构,核心优化动作包括:

  • 将多模态编码、prompt预填充和逐token解码拆分为独立调度、独立扩缩容的工作池
  • 端到端服务性能较初始基线提升3倍
  • 硬件效率与单token成本已达到与主流英伟达GPU相当的水平
    该优化方案验证了国产芯片在大规模场景下可高效、经济地支撑前沿模型的推理需求,有行业分析师推测,该批国产芯片大概率采用华为昇腾系列产品。

    多维竞争力成型 持续扩容承接超预期市场增长

    GLM-5.3-Flash长期保持同尺寸模型最强智能水平,同时具备极高性价比,本次FlashX版本的推出,在延续模型能力优势的基础上补齐速度短板,进一步形成智能、价格、速度的全面竞争力。由于市场需求持续超预期,智谱在今年7月和9月分别完成40亿美元、50亿美元再融资,持续扩容算力储备,为业务增长提供有力支撑。