英伟达开始按柜出货Vera Rubin,每天出货最高1000机柜

芝能智芯 2026-07-24 08:28
英伟达开始按柜出货Vera Rubin,每天出货最高1000机柜图1芝能智芯出品


2026 年 7 月,英伟达硬件工程高级副总裁 Andrew Bell 透露,通过约十家制造伙伴,最终能做到每天产出最高 1000 个 Vera Rubin 机柜


英伟达副总裁 Ian Buck 告诉大家Grace 独立服务器已经交付「数十万台」,而自 Grace 问世以来,英伟达累计发出的 Grace 芯片超过 250 万颗。随着AI agent越来越火,英伟达从交付GPU 开始按整柜交付算力工厂的系统供应商。


英伟达开始按柜出货Vera Rubin,每天出货最高1000机柜图2


Part 1

  Vera 的机柜


英伟达 Vera Rubin NVL72,是一个机架级系统,塞着 72 颗 Rubin GPU 和 36 颗 Vera CPU,GPU 与 CPU 的比例恰好是 2 比 1,反映的是智能体时代对编排层算力的预期,大量任务要在 CPU 上做编译、运行时、数据管道和工具调用,GPU 专心跑模型,CPU 负责把活儿喂顺。


每一颗 Vera 要照看两颗 Rubin,它的主责是把模型要用的数据、工具调用和编排任务理顺,而不是自己去做重算力。


这种分工让英伟达有底气把 CPU 做成智能体专用件,不必像通用服务器芯片那样面面俱到。买这样一台柜子,买的是一个可以直接写进数据中心规划的算力单元,芯片只是其中的一环。


当前旗舰 Grace Blackwell 300 机架大约 500 万美元,而 Rubin 这一代单柜价格进一步抬到 700 万到 800 万美元。价格往上走,根子是英伟达把 GPU、CPU、网络、散热、电力、软件和机架级互联一起打包,而不只是芯片在涨价。


英伟达开始按柜出货Vera Rubin,每天出货最高1000机柜图3


这一代机箱做了一件很聪明的减法,Vera Rubin NVL72 的机箱内部没有线缆、没有风扇、也没有软管,计算模块的组装时间从过去的数小时压缩到 1 分钟,液冷入口温度设计在 45 摄氏度,可以做到不要冷水机的干式冷却运行。


这一点上而言,英伟达卖的早已超出一块板卡,它是一套可以规模化铺开的工程方案。


无线缆和软管的机箱,省掉的不只是零件。它把现场部署的出错概率和运维复杂度一起压下来,让一个柜子从出厂到通电的链路更短。对要铺几千个柜的云厂商,这种「开箱即算力」的省心,和芯片性能一样值钱。


除了和 Rubin GPU 绑定的 NVL72,英伟达还给了一种纯 CPU 的形态。一台独立 Vera 机架可以集成 256 颗液冷 Vera CPU,支撑超过 22,500 个并发运行的 CPU 环境,每一个都跑在全性能上。这是冲着超大规模 agent 编排去的纯 CPU 玩法,把算力工厂的编排层单独拎出来放大。


Part 2

  Vera 这颗 CPU 的技术细节


Vera 的灵魂在它的 CPU 核心。英伟达给这颗核心起了个名字叫 Olympus,全芯片 88 颗都是英伟达自己设计的。


官方说法里,Olympus 的单线程性能是上一代的 2 倍,核间带宽是 3 倍,在同类小芯片设计里,它是跑关键智能体负载时最高效的单线程 CPU。


英伟达做 CPU 的思路和传统厂商不一样。它不去追求一颗核心什么负载都强的全能路线,而是把核心和内存、互联绑在一起,为少数几类智能体负载做到极致。


这种「为场景造核」的路线,正是 Vera 敢和积累了几十年的 x86 阵营正面碰的底气来源。


英伟达开始按柜出货Vera Rubin,每天出货最高1000机柜图4


Olympus 每一核可以跑两个任务,用的是英伟达自己的空间多线程(Spatial Multithreading)


也就是说,一个核不会空着一个执行槽等活儿,它会把两条任务流错峰填进去,在智能体那种多租户、多任务并行的工厂里,能交出稳定可预测的性能。


这一点,对云上同时跑成千上万个 agent 的场景,比单核尖峰更关键。 


Vera 为什么敢把内存从传统的 DDR 换成 LPDDR5X。英伟达在这里上了第二代低功耗内存子系统,建在 LPDDR5X 之上,带宽做到 1.2 TB/s,是通用 CPU 的两倍,而功耗只有通用 CPU 的一半。


英伟达开始按柜出货Vera Rubin,每天出货最高1000机柜图5


这条路 Grace 已经探过一次。上一代 Grace 同样押注低功耗内存,Vera 是把代际再往前推一步。


对 AI 工厂来说,电费是和芯片成本一样要算进总账的硬支出,每瓦效率的提升,直接变成可部署规模的放大。智能体负载看重的是每核带宽和每瓦效率,而不是单纯堆内存容量。


LPDDR5X 把带宽和功耗这两本账一起算清了,这也解释了为什么英伟达敢把 Vera 定义为「为智能体时代而生」的处理器。


换句话来说,Olympus 配 LPDDR5X,是一条冲着 AI 工厂用电和吞吐去的专门路线,而不是通用服务器的平替。


英伟达开始按柜出货Vera Rubin,每天出货最高1000机柜图6


CPU 与 GPU 的关系,在 Vera 这一代被重新写了。


Vera 通过 NVLink-C2C 和 Rubin GPU 连在一起,提供 1.8 TB/s 的一致性带宽,是 PCIe Gen 6 的 7 倍。这一点上而言,CPU 不再只是 GPU 旁边的陪衬,它开始成为内存层级本身的一部分。


再配上第二代英伟达可扩展一致性 fabric(Scalable Coherency Fabric),Vera 能在智能体那种极端利用率下,交出更快的响应。


英伟达自己的定位很直白,在推理和智能体 AI 推进的当下,规模、性能和成本越来越由支撑模型的系统决定,CPU 不再只是给模型打辅助,它在驱动模型。把这套互联放到整柜里看,意义才完整。


英伟达开始按柜出货Vera Rubin,每天出货最高1000机柜图7


72 颗 Rubin 和 36 颗 Vera 通过第六代 NVLink Switch 连成一片,CPU 与 GPU 共享同一块一致性内存,模型在跑、数据在挪,中间不再有 PCIe 那道又窄又慢的桥。


对推理和智能体这种边想边调工具的负载,省下的每一次跨桥拷贝,都是实打实的延迟和成本。把这套互联和 fabric 理解透,才能看懂 Vera 为什么敢叫「世界第一款为智能体时代打造的 CPU」。


系统伙伴提供双路和单路两种 CPU 服务器配置,适配强化学习、agent 推理、数据处理、编排、存储管理和高性能计算等工作负载。


英伟达还出了新参考设计,让 Vera 充当 HGX Rubin NVL8 系统的宿主 CPU,负责数据搬移和系统控制。


所有配置都集成 ConnectX SuperNIC 和 BlueField-4 DPU,做加速网络、存储和安全,客户能在一套软件栈下按负载调优。


这种把 CPU 做成「系统心脏」的思路,正是 Vera 和过往 Arm 服务器芯片最大的不同。


上个月,英伟达刚刚开启 Vera Rubin 平台的全产能爬坡,摆明了要在今年冲上全球第一 CPU 供应商的位置,单从 CPU 这一项就瞄准 200 亿美元营收。


英伟达公布的 Vera Rubin 平台,供应链跨 30 个国家、350 个制造基地,是有史以来最大规模、最成熟的机架级供应链。


系统制造伙伴涵盖 Dell、HPE、联想、Supermicro,以及华硕、仁宝、富士康、技嘉、纬创、纬颖等;云上合作方包括阿里云、字节跳动、Meta、甲骨文云、CoreWeave、Lambda 等。


按测算,1000 柜满产一个季度理论营收上限约 6300 亿美元,但这笔钱由英伟达和伙伴分,且不等于真实订单。


  小结


英伟达Vera 这颗 CPU 从 GPU 的陪衬,重新定义为内存层级的一环,用 88 颗 Olympus 核心、1.2TB/s 的低功耗内存和 1.8TB/s 的 NVLink-C2C 把这条路走实了。

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
英伟达
more
英伟达开始按柜出货Vera Rubin,每天出货最高1000机柜
英伟达,拿下诺基亚
三星超60%NAND产能,直供英伟达
不靠英伟达网卡,国产GPU直通方案实测出炉:吞吐飙升、延迟砍半
推理芯片又火了,但这个市场不会出现另一个英伟达
英伟达又给NAND大单,三星赚翻了!
英伟达推 CPO、华为推 NPO,中国硅光该跟谁?40 位一线人士闭门激辩四个半小时
英伟达自动驾驶重磅人事调整,吴新宙收拢权力丨36氪独家
英伟达想掌控每一颗芯片
SpaceX、Meta做起算力生意,英伟达高端芯片现货价格翻倍,全球算力有多缺?
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号