英伟达用 Vera 处理器加速下一代 CPU 和 GPU 设计,EDA 应用提速最高 1.5 倍

16 小时前
1 阅读

Vera全面投产,AI工厂CPU性能飙升

NVIDIA Vera现已进入全面量产阶段。作为一款专为AI时代打造的全新类别处理器,Vera的任务完成速度比传统x86 CPU快1.8倍,能够驱动智能体AI、强化学习及数据处理等多样化工作负载。Vera建立在NVIDIA Grace CPU的成功基础之上,后者出货量已接近250万颗。针对现代数据中心最严苛的AI工作负载,Vera将CPU的性能与能效推向了全新高度,尤其适合需要执行代码、调用工具并评估结果的AI智能体场景。

自研Olympus核心:单核性能为王

Vera搭载了NVIDIA专为AI智能体工作负载量身定制的Olympus CPU核心,完全兼容Armv9.2指令集架构。与以往强调核心数量的x86服务器CPU不同,Vera更注重单核性能、内存带宽和延迟表现。88颗Olympus核心配合空间多线程技术,以及带宽高达1.2TB/s的LPDDR5X内存子系统,能够有效处理海量指令、预判应用行为,并在大量并发的环境、查询和数据处理任务间高效传输数据。英伟达表示,Vera重点优化了单核速度,让AI智能体能够尽快将任务交还GPU,从而最大限度提升GPU这一AI工厂中最昂贵资产的利用率。

英伟达用 Vera 处理器加速下一代 CPU 和 GPU 设计,EDA 应用提速最高 1.5 倍

内存带宽1.2TB/s,挑战x86地位

在Phoronix测试中,Vera搭配LPDDR5X内存展现出相对于现有Intel Xeon与AMD EPYC平台更具优势的存储器性能表现。即使平行工作负载持续增加,Vera仍能维持高带宽与低且稳定的存储器延迟。与上一代Grace CPU相比,Vera的几何平均性能提升达到1.6倍。在Linux内核编译测试中,单插槽Vera仅需约20秒即可完成,成为所有受测平台中最快的处理器。整体而言,Vera相较于最新128核心x86服务器处理器,平均性能领先约50%,甚至比AMD主打高时脉的EPYC 9575F高出约10%的性能表现。这标志着ARM架构处理器首次在高阶服务器领域具备挑战x86的竞争力。

CPU-GPU紧耦合,Vera Rubin平台崛起

Vera不仅是独立的CPU,更是NVIDIA Vera Rubin平台的主机CPU。通过第二代NVIDIA NVLink-C2C互连技术,Vera与GPU之间可实现高达1.8TB/s的相干带宽,将机密计算扩展至整机架规模。这一紧耦合的CPU-GPU数据通路,显著提升了AI工厂的端到端效率。Vera功耗范围约250瓦至450瓦,支持最高1.5TB低功耗内存(LPDDR),产品形态包括单独销售的Vera CPU、由256颗Vera组成的液冷整柜系统、双路风冷服务器配置,以及与GPU组成的Vera Rubin系统。

生态联盟与市场影响

戴尔、惠普、联想等企业将提供Vera独立CPU服务器配置,英伟达称这是x86之外的首个标准CPU选项。在AI工厂中,CPU重新回到关键路径——Agentic AI时代,CPU负责工作流程协调、数据搬移与基础服务运作,其性能直接影响Agent吞吐和Token收入。英伟达正通过垂直整合战略,加速从GPU供应商向系统级解决方案提供商转型,并试图在AI数据中心中提供x86之外的新标准选项。目前首批Vera处理器已开始交付给部分AI企业与云端业者进行验证。