智谱 GLM 公开国内大模型首个递归自我改进实践:AI 在十万卡国产集群上自建推理系统
智谱GLM首度公开国内大模型RSI生产级落地实践
今日智谱GLM团队正式披露递归自我改进(Recursive Self-Improvement,RSI)方向的首个工程化实践进展,核心突破在于让AI完成对自身运行系统的反向改进,打破了大模型仅能作为编程辅助工具的局限,实现了推理基础设施全链路的自主工程闭环。这也是国内大模型厂商首次公开将RSI能力落地到真实生产环境的案例。

Infra Agent在十万卡国产芯片集群从零搭建生产级推理服务
本次实践的核心执行主体为GLM-5.3驱动的Infra Agent,其任务范围完全覆盖GLM-5.3-Flash推理基础设施的设计、调试与全流程优化,无需人工主导核心工程环节,即可自主完成整套生产级推理服务的搭建。整个部署环境为超10万张国产芯片组成的算力集群,完全基于国产硬件体系完成系统落地,验证了AI自主工程能力在国产算力场景的适配性。
两周迭代实现推理性能三倍提升达行业主流水平
Infra Agent完成系统初步搭建后,在不到两周的迭代周期内实现了核心性能指标的跃升,优化成果包括:
- 端到端吞吐量提升至初始基线的3倍
- 硬件利用效率达到主流NVIDIA GPU的相当水平
- 单Token成本与主流GPU集群持平
彻底摆脱了此前国产算力集群在推理场景的性能与成本劣势。
优化后GLM-5.3-Flash已上线商用六天调用量破62万亿Token
目前这套由AI自主搭建优化的推理系统已经投入真实商用,GLM-5.3-Flash以匿名模型Ox-Alpha的身份在OpenCode、OpenRouter平台上线,上线仅6天Token调用量就超过62万亿,已验证了系统的生产级可用性与高负载下的稳定性。