华东首个国产 TPU 千卡集群落地杭州,中昊芯英发布二代 AI 芯片“须臾”
千卡集群落地杭州:三方协同打造全栈国产化智算标杆
在2026世界人工智能大会期间,由中昊芯英、中国电信杭州分公司与中兴通讯联合建设的华东地区首个国产TPU千卡智算集群正式宣布落地杭州。该项目一期基于中昊芯英“泰则”智算平台,采用1024片自研“刹那”TPU芯片,算力规模达400PFlops,实现了从AI算力、服务器硬件、集群组网到算力调度平台的全链路国产化。这一集群是中国电信体系内首个大规模国产TPU部署项目,标志着国产TPU正式进入运营商级规模化应用阶段。
三方各司其职:中昊芯英提供核心TPU芯片与软件栈,中兴通讯负责全栈通信方案与集成部署,杭州电信则承担算力运营与综合服务输出。杭州电信副总经理王元昊表示,TPU在低功耗和推理场景上的优势,与运营商打造普惠Token算力服务的方向高度契合。
芯片性能三倍跃升:“须臾”二代TPU正式发布
在WAIC同期,中昊芯英发布了第二代全自研高性能TPU芯片“须臾”。该芯片混合精度浮点算力达896TFLOPS,是上一代“刹那”芯片的3倍,8-bit推理算力达1792TOPS,单芯片额定功耗600W。相较于算力性能持平的传统芯片,其功耗降低50%。在集群部署层面,单个超节点最高可实现2048片“须臾”全光互联,为万卡级扩展奠定硬件基础。

“须臾”的发布意味着中昊芯英在TPU架构上实现了又一次迭代。创始人杨龚轶凡表示,TPU将更多算力资源集中在计算、通信和存储搬运环节,在大语言模型等特定场景下可显著提高算力利用率,降低单位算力成本。
百万词元成本降至十元以内:推理效率提升超十倍
成本与效率是本次集群落地的核心亮点。杭州电信智算及IDC总经理王良介绍,经过数月联合调优,通过Prefill-Decode分离等优化技术,该集群的Token输出效率已提升超过10倍,每百万词元的调用成本由此前的约100元降至10元以内。这一降幅直接降低了AI应用企业的推理门槛,使TPU在推理场景中的性价比优势愈发突出。
为降低用户使用门槛,中昊芯英提出了“Token Factory”模式。应用企业通过API直接调用模型服务,无需处理底层硬件与软件迁移,可更关注百万词元成本、生成速度和服务质量。千卡集群则作为“试验田”,在真实运营中持续优化软件栈与系统能力。
走向万卡时代:二期规划超10000P算力
按照规划,项目二期将搭载中昊芯英第二代TPU“须臾”,总算力规模突破10000PFlops。王良透露,二期测试设备已进入机房验证,计划于9月上线投产。杨龚轶凡表示,公司希望以千卡集群为基础,逐步向万卡规模扩展,在真实商业运营中推动国产TPU从“可用”进一步走向“好用”。
不过,国产AI算力从“可用”到“好用”仍需补齐软件生态、硬件互联和模型适配等短板。杨龚轶凡指出,软件栈既要发挥算力性能,也要让开发者快速上手。中昊芯英目前已能在智谱、DeepSeek等新模型发布首日后快速适配,但适配不等于最优性能,后续仍需结合真实运行数据持续调优。