国内首个国产 GPU + 类脑芯片大模型异构混合推理系统发布,较同类国产 GPU 算力集群性价比提升一倍以上

21世纪经济报道记者从相关渠道获悉,日前国内首个搭载国产通用GPU与类脑芯片的大模型异构混合推理系统正式亮相,该系统针对大模型推理场景深度定制,彻底解决传统训推一体芯片用于推理场景时的能效浪费问题,整体性价比较同类国产GPU算力集群提升1倍以上,标志着国产AI算力在推理领域取得关键性突破。

国内首个国产 GPU + 类脑芯片大模型异构混合推理系统发布,较同类国产 GPU 算力集群性价比提升一倍以上

国产异构混合推理系统发布 破解大模型推理成本痛点

该系统采用异构架构设计,由国产通用GPU负责大模型计算密集型任务,类脑芯片承担低延迟、高并发的推理调度任务,二者协同大幅提升推理场景的算力利用率。此前业界普遍采用训推一体的通用GPU承担推理任务,这类芯片为适配训练场景的高精度计算需求,搭载了成本高昂的HBM高带宽内存与高级封装,但实际推理场景中算力利用率仅为5%-10%,电力与硬件持有成本极高,严重制约了AI应用的规模化落地。
新系统摒弃了为训练场景设计的冗余硬件配置,无需搭载HBM内存,转而采用大容量低成本存储方案,在满足百亿、千亿级大模型参数装载需求的同时,将硬件成本压缩40%以上,叠加架构级能效优化,整体性价比较同类国产GPU算力集群提升一倍以上,可大幅降低AI应用厂商的推理算力持有成本,为AI技术走向千行百业扫清代价障碍。

国产算力生态持续完善 适配多行业大模型落地场景

近年来国产算力与大模型的协同效应持续显现,目前华为昇腾、海光DCU、壁仞科技、天数智芯、摩尔线程、寒武纪、沐曦等国内主流芯片厂商已陆续完成DeepSeek、通义千问、文心一言等国产大模型的适配,国产算力供给能力快速成熟。
在落地应用层面,电信运营商已成为国产GPU规模化应用的重要场景:中国移动智算中心(哈尔滨)等项目已采用华为昇腾、壁仞科技等国产GPU实现规模化部署,其联合打造的“水利大模型一体机”已在洪水预警、水资源智能调度、灾害防控等场景落地;中国电信、中国联通的AI服务器建设中也已批量应用华为昇腾、海光、壁仞、天数智芯等国产芯片。互联网大厂层面,字节跳动已部署寒武纪GPU集群覆盖推荐、广告等核心业务场景,百度、阿里在采用自研芯片的同时也逐步提升国产GPGPU在推理任务中的占比,多家企业基于国产算力构建的AI应用已实现规模化商用。

推理赛道成国产芯片差异化突围核心方向

随着大模型从训练阶段转向规模化应用,推理算力需求正快速爆发,德勤报告显示2026年推理算力在整体AI计算中的占比将超过训练,达到66%。过去国产芯片厂商多沿着“对标英伟达训推一体芯片”的路径发展,但英伟达凭借CUDA生态构筑了深厚的护城河,同质化竞争下国产芯片突围难度极大。如今越来越多厂商转向推理赛道寻求差异化突破:脱胎于商汤科技大芯片部门的曦望发布的专用推理GPU启望S3,彻底放弃训练场景的冗余设计,不采用HBM内存而是选择大容量L