英伟达正在将其CPU产品线从“Grace”向“Vera”推进,新架构明确将目标瞄准了正在爆发的AI推理市场——特别是需要低延迟、高吞吐的智能体工作负载。

一、从Grace到Vera:AI推理成为CPU设计的第一性原理

7月21日,在NVIDIA AI Summit上,英伟达副总裁兼CPU产品负责人Rama Malladi详细阐述了Vera CPU的核心设计逻辑:当AI应用从“训练”转向“推理”,从“单轮对话”转向“多轮智能体协作”,CPU在AI计算体系中的角色正在被重新定义。

Vera CPU的关键规格如下:

核心架构:Olympus CPU核心,共88个定制核心

制造工艺:台积电N3P工艺(3nm增强版)

内存规格:LPDDR5X,带宽1.2 TB/s,容量最高512GB

互联:NVLink-C2C,芯片间互联带宽900 GB/s

配套:与下一代Blackwell Ultra GPU协同

Malladi强调,Vera不是传统意义上的通用服务器CPU,而是“为AI推理工作负载从头设计的计算引擎”。

二、为什么AI推理需要新的CPU架构?

传统CPU的核心任务是“快”——单线程性能足够强,就能应对大多数通用计算场景。但AI推理工作负载的瓶颈正在从“计算”转向“内存”。

在智能体AI场景中,一个任务往往需要多轮模型调用:Agent先理解用户意图,再规划步骤,再调用工具,再综合输出。每一轮调用都需要加载大量上下文信息(系统提示词、对话历史、工具定义),这部分数据在CPU和GPU之间频繁搬运。

如果把CPU比作大脑,内存比作短期记忆,那么Vera的设计逻辑就是:给大脑配一个容量更大、读写更快的短期记忆系统。1.2TB/s的内存带宽意味着数据搬运速度达到了一个新的量级,Agent在多轮对话中的上下文切换延迟有望大幅降低。

三、88核+1.2TB/s内存:数字背后的工程逻辑

88核Olympus架构:Vera的88个核心采用Olympus架构,是英伟达继Grace核心之后的新一代CPU微架构。官方未披露具体IPC提升数据,但从“为AI推理优化”的描述来看,核心设计方向可能倾向于在保持单核性能的同时优化多核并行效率——尤其适合处理大量并发的推理请求。

1.2TB/s LPDDR5X:这是Vera最具辨识度的技术特征之一。相比Grace的900GB/s内存带宽,Vera提升了约33%。LPDDR5X相较于标准服务器内存,功耗更低、带宽更高,尤其适合大规模推理集群中数千颗CPU并发的场景。

NVLink-C2C 900GB/s:Vera通过NVLink-C2C与Blackwell Ultra GPU互联,芯片间互联带宽达到900GB/s。这一带宽意味着CPU与GPU之间的数据搬运几乎不再是瓶颈。

四、Vera的竞争对手和上市时间

Vera的主要竞争对手包括Intel的Xeon系列和AMD的EPYC系列。但Vera的目标不是取代通用服务器CPU,而是在AI推理场景中提供更高效的“专用协处理器”。

英伟达表示,Vera CPU预计将在2027年正式上市,与Blackwell Ultra GPU共同构成下一代AI计算平台。Grace系列(Grace CPU + Hopper GPU)将成为过去,Vera时代即将到来。

当AI推理成为数据中心的主要工作负载,CPU的设计哲学也需要重新思考——不再是追求“什么都能跑”,而是在特定的AI工作负载上实现极致效率。Vera的88核Olympus CPU和1.2TB/s的LPDDR5X内存,正是英伟达对这一变化给出的硬件答案。