Hot Chips 2026 | GPU巨头为什么要自己做一颗强CPU

芝能智芯 2026-08-28 08:18
Hot Chips 2026 | GPU巨头为什么要自己做一颗强CPU图1芝能智芯出品


NVIDIA 最擅长卖 GPU,因此人们很容易把 Vera CPU 理解成 Rubin GPU 旁边的一颗"配套芯片"。但 Vera 的设计透露出另一种判断:未来 AI 系统的瓶颈,不全在矩阵乘法里。


Hot Chips 2026 | GPU巨头为什么要自己做一颗强CPU图2


大模型推理尤其是智能体工作负载,不只是连续生成 Token。


它还要运行 Python 和 Java 服务、处理数据库与检索、调度工具调用、解析网络请求、管理内存,并在大量短小任务之间切换。


这些工作依赖强单线程 CPU、低延迟内存和操作系统生态。GPU 再快,也不能高效接管所有控制流。


Vera 集成 88 个 NVIDIA 自研 Olympus 核心,并通过 Spatial Multithreading 提供 176 个线程。


官方强调的不是极端核心数,而是单线程性能。它配备最高约 1.5TB 的 LPDDR5X 内存,带宽可达 1.2TB/s;与 GPU 之间通过一致性 NVLink-C2C 连接,双向总带宽达到 1.8TB/s。


为什么服务器CPU开始使用LPDDR


传统服务器习惯使用可插拔 DDR 内存,容量大、可维护性好。Vera 却选择移动设备常见的 LPDDR5X,并把它紧密集成到计算模块周围。


Hot Chips 2026 | GPU巨头为什么要自己做一颗强CPU图3


理由是带宽和能效。智能体系统中,CPU 要频繁处理上下文、队列和元数据。如果 CPU 内存只有普通服务器带宽,GPU 与 CPU 之间的高速互连也无法消除 CPU 侧等待。


LPDDR5X 能用较低功耗提供很高带宽,代价则是可升级性和部署灵活性下降,内存焊死在板上,坏了不能单独换,容量也从出厂就定死了。


这说明 NVIDIA 设计的不是通用服务器主板上的一颗独立 CPU,而是一件围绕 AI 数据流优化的系统部件。


"空间多线程"解决什么问题


Hot Chips 2026 | GPU巨头为什么要自己做一颗强CPU图4


传统同步多线程让两个线程共享同一核心的大量执行资源,以提高利用率。


NVIDIA 所称的 Spatial Multithreading 更强调为线程划分和安排核心内部资源,希望在增加吞吐的同时,减少一个线程干扰另一个线程。


这对 AI 服务很重要。控制面任务数量很多、延迟敏感,而且经常出现突发。系统既需要吞吐,也不能让关键请求因为资源争抢而抖动。


Vera 的 88 核、176 线程并不是简单复制 x86 服务器的堆核路线,而是在单线程响应和并发之间寻找平衡。


Hot Chips 2026 | GPU巨头为什么要自己做一颗强CPU图5


NVIDIA想控制的是整条数据路径


从 Grace 到 Vera,NVIDIA 自研 CPU 的逻辑越来越清晰:如果 GPU、CPU、内存和互连分别来自不同厂商,它就很难对整台 AI 系统的能效与延迟负责。


把 CPU 纳入设计,NVIDIA 可以共同定义 CPU 内存、GPU 内存、缓存一致性、通信和软件调度。


这件事对 Intel 和 AMD 的影响,比表面看起来更大。过去 AI 服务器里,x86 CPU 是默认选项,NVIDIA 只负责 GPU。现在 Vera 把 CPU 也收进 NVIDIA 的体系,x86 在 AI 服务器里的位置正在从"不可或缺"变成"可以被替代"。


对中国 AI 基础设施行业有两个启示。


 AI 芯片竞争不能只比较 TOPS 或 FLOPS。CPU 侧的数据准备、网络、存储和任务调度如果跟不上,昂贵 GPU 一样会空转。


 平台能力比单芯片更难复制。国产加速器不仅要有计算核心,还要补齐主机 CPU、互连、编译器和集群软件之间的协同。


小结


Vera 看起来"不像明星"。在下一代 AI 工厂里,决定系统体验的是所有数据能不能以足够低的代价,及时到达那颗芯片。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
GPU IP
more
灵晟超算破局:纯CPU架构首抗GPU集群,国产AI算力迎新范式
TinyGPU v2.0实机测试通过,微型ASIC图形芯片验证成功
英伟达退场后的算力真空期,腾讯加速自主GPU储备布局
GPU开始金融化!黄仁勋拉上华尔街搞5000亿美元融资,回应“循环投资”
龙芯首款通用GPU流片交付,自主工艺CPU性能追平主流X86
HBM奇缺,英伟达考虑降低GPU规格
GPU为什么总在等最慢的请求?BlockServe 把扩散 LLM 吞吐拉高 10.6 倍
国内首款,GPGPU发布!
美国押注“后GPU时代”
Hot Chips 2026 | GPU巨头为什么要自己做一颗强CPU
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号