芝能智芯出品NVIDIA 最擅长卖 GPU,因此人们很容易把 Vera CPU 理解成 Rubin GPU 旁边的一颗"配套芯片"。但 Vera 的设计透露出另一种判断:未来 AI 系统的瓶颈,不全在矩阵乘法里。

大模型推理尤其是智能体工作负载,不只是连续生成 Token。
它还要运行 Python 和 Java 服务、处理数据库与检索、调度工具调用、解析网络请求、管理内存,并在大量短小任务之间切换。
这些工作依赖强单线程 CPU、低延迟内存和操作系统生态。GPU 再快,也不能高效接管所有控制流。
Vera 集成 88 个 NVIDIA 自研 Olympus 核心,并通过 Spatial Multithreading 提供 176 个线程。
官方强调的不是极端核心数,而是单线程性能。它配备最高约 1.5TB 的 LPDDR5X 内存,带宽可达 1.2TB/s;与 GPU 之间通过一致性 NVLink-C2C 连接,双向总带宽达到 1.8TB/s。
为什么服务器CPU开始使用LPDDR
传统服务器习惯使用可插拔 DDR 内存,容量大、可维护性好。Vera 却选择移动设备常见的 LPDDR5X,并把它紧密集成到计算模块周围。

理由是带宽和能效。智能体系统中,CPU 要频繁处理上下文、队列和元数据。如果 CPU 内存只有普通服务器带宽,GPU 与 CPU 之间的高速互连也无法消除 CPU 侧等待。
LPDDR5X 能用较低功耗提供很高带宽,代价则是可升级性和部署灵活性下降,内存焊死在板上,坏了不能单独换,容量也从出厂就定死了。
这说明 NVIDIA 设计的不是通用服务器主板上的一颗独立 CPU,而是一件围绕 AI 数据流优化的系统部件。
"空间多线程"解决什么问题
传统同步多线程让两个线程共享同一核心的大量执行资源,以提高利用率。
NVIDIA 所称的 Spatial Multithreading 更强调为线程划分和安排核心内部资源,希望在增加吞吐的同时,减少一个线程干扰另一个线程。
这对 AI 服务很重要。控制面任务数量很多、延迟敏感,而且经常出现突发。系统既需要吞吐,也不能让关键请求因为资源争抢而抖动。
Vera 的 88 核、176 线程并不是简单复制 x86 服务器的堆核路线,而是在单线程响应和并发之间寻找平衡。

NVIDIA想控制的是整条数据路径
从 Grace 到 Vera,NVIDIA 自研 CPU 的逻辑越来越清晰:如果 GPU、CPU、内存和互连分别来自不同厂商,它就很难对整台 AI 系统的能效与延迟负责。
把 CPU 纳入设计,NVIDIA 可以共同定义 CPU 内存、GPU 内存、缓存一致性、通信和软件调度。
这件事对 Intel 和 AMD 的影响,比表面看起来更大。过去 AI 服务器里,x86 CPU 是默认选项,NVIDIA 只负责 GPU。现在 Vera 把 CPU 也收进 NVIDIA 的体系,x86 在 AI 服务器里的位置正在从"不可或缺"变成"可以被替代"。
对中国 AI 基础设施行业有两个启示。
◎ AI 芯片竞争不能只比较 TOPS 或 FLOPS。CPU 侧的数据准备、网络、存储和任务调度如果跟不上,昂贵 GPU 一样会空转。
◎ 平台能力比单芯片更难复制。国产加速器不仅要有计算核心,还要补齐主机 CPU、互连、编译器和集群软件之间的协同。
Vera 看起来"不像明星"。在下一代 AI 工厂里,决定系统体验的是所有数据能不能以足够低的代价,及时到达那颗芯片。
