算力缺的不是“卡”,而是Token丨ToB产业观察
在AI大模型与Agent应用加速落地的当下,算力资源的供需错配正成为行业核心痛点。多位产业专家与调研机构的判断显示,当前算力缺的从来不是硬件卡,而是稳定、低成本产出Token的全链路能力。
买卡是加法题,把卡跑成Token才是乘法题
GPUStack创始人秦小康给出了一个直观的行业现状对比:市面上主流显卡型号有几十种,Hugging Face上的公开模型超过3600个,中间还要对接十几种推理后端,每种后端又各有十余种优化方案。几十种硬件对上数千个模型,再乘以多套软件栈,“这是一个多维度组合匹配的问题,复杂度近乎呈阶乘级膨胀”,买卡是一道加法题,把卡用好却是一道乘法题。
这一现状也反映在行业调研数据中,IDC的调研显示:
- 近半数企业的智算资源利用率处于51%~70%区间
- 6.7%的企业智算资源利用率仅为31%~50%
- 不少自建智算项目存在“重硬轻软”的问题,服务器和GPU上架后,缺乏统一算力调度平台、资源池化管理和动态分配机制

中科曙光高速网络互联产品部总工程师万伟进一步指出,决定Token生成效率的,不只是加速卡的算力,更是算力、网络和存储三者之间的数据流转效率。模型规模越来越大,单块GPU已经装不下完整模型,必须通过分布式架构把模型拆到多个节点上,一旦数据要在节点之间来回跑,通信就变成了“并行计算逻辑的一部分”,任何一处时延增加,整个集群的效率都会被拖下水。随着推理需求爆发,这个缺口还在放大:IDC预测到2027年中国智能算力规模中推理占比将提高到72.6%;TrendForce的数据同样显示,北美五大云服务商2026年的推理算力增速(预计122%)将超过训练算力增速(56%)的两倍以上。训练是阶段性的、可以提前排期的,推理却是全天候、贴着用户跑的,未来绝大多数GPU资源都要用来干“推理”这件精细活,而恰恰是这件精细活,最考验软件功夫。
Token工厂成算力服务新核心,破解模型硬件适配鸿沟
痛点的背后,是算力服务定位的彻底转变。秦小康表示,GPUStack过去强调的是GPU管理,如今把“Token工厂”作为核心概念:“过去大家追求的是获取硬件资源,现在用户需要的是把资源之上的模型真正跑好。”如今用户与服务商之间不再只是“你需要卡,我就给你卡”的粗放调度,而是要提供从硬件管理到模型一键部署的一体化方案,最终对外稳定输出Token。
首当其冲需要破解的是模型与硬件之间的“驱动”鸿沟。GPUStack联合创始人、CTO梁胜将整个算力栈比喻为熟悉的PC体系:GPU相当于显卡,模型相当于游戏,推理后端就是显卡驱动,而管理这一切的平台,相当于操作系统。梁胜表示,现在整个行业还处于上世纪90年代Windows的状态——驱动要不停调试、优化,各种不兼容层出不穷。一个新模型发布,想跑在华为昇腾卡上,推理后端必须同时适配上层模型和下层硬件;如果推理后端不做适配,模型和硬件就无法协同工作。这也解释了为什么英伟达的TensorRT-LLM、华为的MindIE等厂商自研工具,如今都把重心转向vLLM、SGLang等开源生态,因为单靠一家厂商,已经很难覆盖层出不穷的模型组合。
算力评价体系重构,单位Token成本成核心定价指标
摩尔线程高级副总裁董龙飞打了个比方:“这好比是一个交响乐队,256张卡就像256个乐手,每一个乐手自己都拉得很好。当整个乐队要合奏一首曲子时,大家就需要协同”。当大模型参数从千亿迈向数万亿,Agent应用要求百万级上下文长度,单张GPU已无法独立承载,超节点架构的出现,正是为了破解“海量GPU如何高效协同”这个核心难题。
这也意味着,算力价值的衡量标准正在发生根本性变化:过去行业关注单卡峰值算力是多少,未来更重要的是单位时间能够稳定产生多少Token、每个Token消耗多少能源、每单位成本能够创造多少AI价值,算力竞争正在从“参数竞争”进入“效率竞争”。当单芯片性能差距难以在短期内完全拉平时,芯片互联效率、软件生态、集群稳定性、运维能力,正在成为决定AI产业化速度的新变量。与此同时,光通信正在成为AI基础设施的重要支撑,光纤、光模块、液冷等基础技术,正在成为AI时代的“高速公路”,支撑数千甚至数万颗芯片协同工作的数据传输效率。未来衡量算力价值的核心指标是“单位Token的产出成本”,谁能把算力的单位成本打下来,谁就能拿到AI时代的“水电定价权”。
算力竞争进入生态团战,Token成产业链核心计价单位
英伟达CEO黄仁勋已经明确将Token定义为资产,“Token就是资产、已经成为获利的营收单位”。英伟达与Anthropic达成的百亿美金级超级绑定,正是“算力+大模型”深度耦合改写AI产业规则的典型样本:英伟达不只是卖硬件的“铲子商”,更通过投资、融资绑定核心客户,成为整个AI行业的“央行”——其季报中浮现的5305亿美元表外承诺,相当于为整个AI产业链创造信用、设定定价基准,今年8月英伟达联合Apollo、贝莱德、黑石等成立的算力融资平台,计划募集超过5000亿美元第三方资金,专门支持AI模型开发商建设基础设施。
产业端的落地逻辑也在同步转向生态协同:本届WAIC上,芯片、算力、模型、终端、场景全链条企业同台竞技,产业链上下游协同成为主旋律,展会的主角不再是某一家明星公司,而是一条条完整的产业链路。具身智能等AI应用的落地也遵循“痛点优先”法则,情感陪伴的容错空间远大于家务执行,从“容错率高”的陪伴场景切入,反而能更快完成市场验证与产品迭代,率先在特定细分场景积累大量操作数据、形成稳定解决方案的企业,将建立起极高的落地壁垒。