把记忆交给CPU,大模型会变快
随着大模型应用从训练侧向推理侧倾斜,推理场景的算力效率问题逐渐成为行业落地的核心瓶颈。近期多位行业人士公开提出“把记忆交给CPU,大模型会变快”的观点,这一技术方向正引发广泛关注。
大模型推理的“记忆负担”已成效率瓶颈
对于采用因果自注意力的Transformer模型来说,前面处理过的Token会在注意力层留下对应的Key和Value,模型生成后续Token时可直接调用这些结果,推理系统将这些中间状态缓存下来,就形成了KV Cache,相当于模型读书时做的笔记,可省去对已有Token的重复计算。但这份“笔记”会实实在在占用存储空间:以Qwen3-8B为例,在KV Cache采用BF16或FP16精度、每个数值占2字节的条件下,每个Token对应的KV数据达147KB,上下文越长、请求规模越大,缓存池的体积就会急剧膨胀,直接挤占GPU显存中模型权重、运行时数据的空间。
在Agent等长上下文场景下,这一问题更加突出:如果显存不足,部分缓存会被清理,等Agent下一轮需要用到这些历史信息时,就不得不重新执行Prefill阶段,对已处理过的Token重复计算,直接拉长用户等待首个Token的TTFT时间,同时浪费GPU的算力资源,降低整体服务效率。
CPU软硬件优化成熟,托管记忆具备落地条件
过去CPU在AI推理领域存在算力不足的刻板印象,但近年来的软硬件优化已经让CPU具备了托管KV Cache的能力。Hugging Face官方已推出多篇“用CPU高效推理大模型”的优化教程,覆盖大语言、图像、音频等多模态模型,PyTorch、TensorFlow等主流框架也持续推出CPU优化版本,部署门槛大幅降低。
硬件层面,英特尔等厂商的CPU已内置AI加速模块,第五代至强可扩展处理器搭载的AMX指令集紧靠系统内存,可大幅降低数据传输延迟、提升带宽,运行不超过200亿参数的模型时,延迟可低至100毫秒以内;京东与英特尔联合优化的方案中,Llama2-13B的Token生成速度提升了51%,可满足问答、客服、文档总结等常见AI场景的需求。同时CPU方案的通用性更强,一套服务器即可同时支持AI推理、数据分析、机器学习等多类应用,降低企业的IT成本。
技术价值已获验证,CPU托管记忆成为行业共识
量子位近期与多位行业人士交流发现,“把记忆交给CPU”的观点已获得广泛认可。英伟达最新财报显示,其180亿美元的数据中心收入中,AI推理已占比四成,推理需求正在快速爆发。将KV Cache交由CPU托管,可避免GPU重复执行Prefill计算,把算力资源集中在新的输入处理和Token生成上,显著提升单位GPU的服务请求量。
同时CPU优化的低门槛也让这一技术更易推广:单点场景验证成功后,可快速复制到同类场景中,让更多中小规模场景能够以更低的成本落地AI应用,加速大模型的普及。
AI需求拉动CPU产能倾斜,消费级供应趋紧涨价
随着AI推理需求的爆发,CPU产能正在向数据中心市场倾斜。英特尔、AMD已通知客户,计划从4月起上调全线处理器价格10%-15%,同时交货周期从原本的数周拉长至数月,消费级CPU的供应被进一步压缩。有游戏PC厂商透露,2026年第二季度消费级CPU供应会更加紧张,部分PC产品的整体售价可能上涨25%-30%,有装机需求的消费者可提前做好准备。