刚刚,唐杰发布智谱RSI首个成果
9月17日,清华大学计算机系教授、智谱创始人唐杰公开了智谱在递归自我改进(RSI)领域的首个实际落地成果,这也是他近期分享时提到的“最近一次感到震动的时刻”的核心内容:由GLM-5.3驱动的Infra Agent,成功参与优化了运行在超10万颗国产AI加速器组成的集群上的生产级推理系统,从零搭建到完成全生产流量承载仅用时两周,端到端吞吐能力直接提升至初始基线的3.2倍。唐杰同时明确表示,当前成果距离真正的RSI仍有差距,但“模型优化系统,系统服务模型”的最小规模循环已经出现。

GLM自主完成10万国产芯片集群推理系统部署
此次部署的推理系统运行在超过10万颗国产AI加速器构成的集群上,是行业少有的无成熟经验可参考的大规模落地案例。智谱团队需要同时解决国产芯片显存容量与互联带宽限制、新模型架构适配、100万token长上下文支持、多模态请求处理等多重难题,加之国产AI加速器的软件生态仍处于发展初期,部分计算Kernel支持不足,大量技术资料需要工程团队自行探索。
在极端受限的条件下,GLM-5.3驱动的Infra Agent深度参与了推理系统的全流程优化,而非单纯通过堆算力提升性能,团队需要在算力、内存、通信、调度多个维度之间寻找最优平衡,最终仅用两周就完成了全部生产流量的承载,吞吐量达到初始基线的3.2倍。这套被优化后的推理系统也将继续承载后续GLM模型的推理需求,形成“GLM优化运行自身的系统,优化后的系统再服务新一代GLM”的协同迭代正向循环。
密集反馈机制助Agent精准定位多项性能瓶颈
本次优化过程中,智谱团队为Agent搭建了可验证的密集反馈环境,将系统级性能问题拆解为多个局部、低成本、可客观核验的信号,避免了传统优化中“端到端基准跑数小时、探索效率极低”的稀疏奖励问题,具体落地的优化成果包括三项核心改进:
- KV Transfer并发瓶颈修复:团队为Agent设定了单独Prefill、Prefill+KV Transfer、单独Decode等测试场景,要求Prefill+KV Transfer的性能损失不超过5%,但Agent测试发现部分场景性能差距超过20%。经过调用链追踪,Agent定位到KV Transfer的Python侧执行始终未释放GIL,导致其与DeepEP dispatch/combine的调用区间无法重叠,修复后传输开销从超过30%降至不到1%。
- KDA Decode算子性能提升:Agent通过阅读SGLang、Flash Linear Attention、DeepGEMM等项目的现有Kernel,提炼出适配当前系统的“优化骨架”,对KDA Decode算子的计算逻辑进行重构,最终拿到1.71倍的性能提升。
- 长上下文精度问题修复:在CP切分的状态合并计算中,原实现默认采用TF32计算,导致长上下文下舍入误差不断累积。Agent将两处核心计算显式指定为input_precision="tf32x3",通过三次TF32 Tensor Core运算组合出更高精度结果,在减轻累积误差的同时保留Tensor Core性能优势,相关修复已合并至Flash Linear Attention上游仓库(PR #1180)。
唐杰:模型优化系统的最小循环已跑通
唐杰在分享中表示,虽然当前成果尚未达到真正的递归自我改进(RSI)标准,但“模型优化系统,系统服务模型”的最小循环已经形成。过去类似优化经验高度依赖工程师的个人积累,而本次过程中Agent已经能够从已有代码中学习优化方法,再通过实验验证是否适配新的硬件与模型环境。
他提到,人类工程师的角色正在发生转变:从直接解决每一个具体问题,转向设计反馈环境、设定优化目标、审核高风险修改,Agent则负责执行具体的分析与代码修改工作。智谱此前融资335亿元时已明确,6成资金将投向RSI相关研发,下一代GLM-6模型将采用Full Self-Training(完全自训练)技术路线,逐步接管预训练、中训练、后训练全流程,实现训练数据自产、训练环境自造、基础设施自我优化的完整闭环。
智谱强调,当前GLM-5.3已经参与到下一代模型的训练链条中:其生成的任务环境已被用于后续模型训练,Infra Agent也已参与下一代模型的推理内核、性能诊断与服务栈优化。团队并不认同单纯堆砌模型参数的路线,当前7400亿参数的GLM-5.3通过后训练