大模型价格战下半场:将推理价格打下去
降价潮席卷行业:从“骨折价”到永久免费
2025年5月以来,国内大模型厂商掀起了一场史无前例的降价风暴。DeepSeek率先将V4-Pro模型原2.5折的“折扣优惠”转为永久降价,并推出峰谷动态定价;小米MiMo-V2.5全系列API接口永久下调,部分场景降幅逼近99%,且不再区分上下文窗口长度。腾讯云紧随其后,DeepSeek-V4全系列模型最高降幅达97.5%,第三方模型MiniMax-M3各项降幅均为50%。以DeepSeek为例,调价后专业版百万Tokens价格降至0.025元,仅为Minimax M2.7价格的5.8%。
这一波降价的“始作俑者”字节跳动,早在5月15日就将豆包主力模型定价为0.0008元/千Tokens,比行业便宜99.3%。阿里云通义千问Qwen-Long输入价格直降97%,从0.02元/千Tokens降至0.0005元/千Tokens;百度文心大模型两大主力模型直接免费。降价效果立竿见影:OpenRouter数据显示,DeepSeek-V4-Flash模型登顶全球调用榜,阿里云、百度云等大厂AI相关收入也实现三位数增长。

推理芯片成为成本新“天花板”
随着AI大模型从训练阶段转向大规模商业落地,推理成本正取代训练成本成为主要支出。阿里云在“2026算力倍增计划”中,推理芯片采购预算占AI资本开支的60%;Meta计划在2026年底建成60万张GPU等效算力的推理集群,占其AI总预算的55%。联想集团董事长杨元庆指出,未来70%以上AI算力将用于推理,而非训练。
推理芯片的成本压力是全生命周期的。与一次投入的训练芯片不同,推理芯片需要持续响应海量用户请求,其成本随调用量飙升而线性增长。数据显示,生产环境中推理芯片投入占大模型生命周期计算成本的80%至90%。DeepSeek创始人梁文峰坦言,芯片价格太贵,无法满足低成本需求,即便采购国产昇腾芯片,也仅能缓解部分压力。
自研推理芯片:算法与硬件的跨界难题
面对高昂的推理成本,头部厂商开始自研定制推理芯片。OpenAI与博通联合开发的Jalapeño芯片已发布,声称可降低约50%推理成本;DeepSeek被曝秘密启动自研推理芯片已一年,并与芯片设计、晶圆代工、存储厂商展开接洽。然而,自研芯片的难度远超想象:
- 研发跨界:大模型企业擅长算法架构(软件),AI芯片属于硬件领域,需从零积累人员和技术,而芯片流片周期长、失败风险高。
- 迭代速度劣势:华为昇腾、寒武纪、英伟达等芯片厂商有深厚技术基础,能快速响应行业需求;而大模型厂商仅针对自身模型定制,研发周期长,容易“出厂即落后”。
- 生态缺失:英伟达CUDA生态拥有超过400万开发者,适配框架、采购形成规模效应,分摊成本;而自研芯片没有生态,只能自用,无法通过数量均摊研发成本,导致单芯片成本居高不下。
生态与产能:自研芯片的终极考验
对于智谱AI、DeepSeek等企业而言,自研推理芯片最难的不是芯片设计本身,而是“算法迭代、芯片流片、产能排期、用户生态”四环的协同。没有生态支持,芯片无法获得大规模采购,无法摊薄流片成本;没有产能保障,即使设计出芯片也无法量产。同时,芯片厂商的迭代速度可能让自研芯片在性能上落后于通用芯片。
2026年的AI大模型行业,已从“工程师时代”进入“工业时代”——比拼的不再是模型能力,而是能否将每百万Token推理成本降到极致。能否推出并量产自研推理芯片,将决定一家大模型公司是停留在AI产品公司层面,还是晋升为AI时代的基础设施公司。