公众号记得加星标⭐️,第一时间看推送不会错过。
英伟达的 NVLink Fusion 项目为合作伙伴提供了必要的构建模块,用于将定制芯片与 NVLink 扩展域连接起来,从而将多个独立的处理器整合到一个统一的系统中,例如 Vera Rubin 的 NVL72 机架级加速器。今天,英伟达为该工具包新增了一个构建模块:NVHBM,这是一种高带宽内存的定制实现,几乎所有当今使用的AI 加速器都基于此。
正如英伟达所描述的,NVHBM 是一款定制的 HBM 基础芯片,与传统的 HBM4e相比,它承诺更高的带宽、更低的功耗和更小的芯片面积。英伟达表示,NVHBM 是与“领先的内存供应商”共同设计和验证的,因此它能够帮助定制芯片开发商更快地将产品推向市场,而无需从零开始实现通用 HBM。但值得再次强调的是,这并非 HBM 的替代品。相反,它是一种全新的构建模块,英伟达仅将其提供给定制芯片合作伙伴。
内存带宽对人工智能加速器至关重要,而NVHBM承诺每个堆栈的带宽比标准HBM4e高出30%。对于受内存带宽限制的人工智能工作负载而言,更高的带宽意味着更高的吞吐量,例如更高的AI推理每秒token数。
定制的NVHBM基片还减少了主定制加速器芯片上与存储器相关的电路的占用空间。传统上,HBM存储器控制器集成在封装上的主硅芯片中。而NVHBM则将存储器控制器移至HBM堆叠的基片中,从而提供了一个更小的定制PHY,NVLink Fusion客户可以将其集成到自己的设计中。

英伟达表示,这种方法可以释放宝贵的封装空间,从而用于增加计算芯片面积——主硅芯片上的计算能力最多可提升 30%。此外,NVHBM 还有望简化用于将多个芯片连接在一起的中介层布线,尤其适用于采用先进封装技术的设计。
与现成的 HBM4e 堆栈相比,NVHBM 还能节省功耗。正如英伟达在 Vera Rubin 的发布会上反复强调的那样,每一瓦没有用于代币生产的功率都是浪费。英伟达表示,NVHBM 的功耗比普通 HBM4e 低 15%,节省下来的电量可以用于提升每瓦性能,重新分配给定制加速器设计中功能更强大的单元,或者在相同的功耗预算下转化为更高的持续性能。
对于需要传输海量数据结构(例如模型权重和键值缓存)的人工智能加速器而言,更高的带宽和更低的功耗无疑是一项巨大的优势,尤其是在数千个芯片上实现这种节能效果时。节省下来的数据传输能耗可以用于提升加速器自身的性能,也可以重新分配用于在相同的固定功耗范围内支持更多数量的加速器。
但就目前而言,这些只是英伟达潜在合作伙伴考虑将 NVLink Fusion 和 NVHBM 集成到其定制设计中的原因,而不是 Rubin 机架式系统中已经投入生产的优势。
英伟达宣布,除了NVHBM之外,亚马逊旗下的Annapurna Labs也将成为其首个NVHBM合作伙伴。Annapurna副总裁Nafea Bshara表示:“我们期待此次技术合作能够惠及未来的AWS基础设施设计。” Annapurna的下一代Trainium 4 AI芯片已经支持NVLink Fusion扩展接口,因此后续芯片很可能也会支持NVHBM。
NVIDIA NVLink Fusion 扩展支持 NVHBM 定制高带宽内存
下一波人工智能浪潮对基础设施提出了新的要求。
随着人工智能代理和万亿参数工作负载成为主流,人工智能基础设施的性能不仅取决于计算能力,还取决于计算、内存、存储、网络和软件如何作为一个统一的系统进行设计。
为了帮助超大规模数据中心和人工智能创新者构建下一代半定制人工智能基础设施,NVIDIA 今日宣布将NVIDIA NVHBM 集成到NVIDIA NVLink Fusion中。NVIDIA NVHBM是一种新一代高带宽内存技术,可为 XPU 带来更高的内存性能和效率。领先的内存合作伙伴将验证并提供该技术,从而将这项先进的内存功能扩展到 NVLink Fusion 用户。
传统的HBM架构将内存控制器置于XPU芯片上,占用了原本可用于计算的宝贵硅面积。而NVHBM基于NVIDIA未来GPU将采用的相同技术,将NVIDIA定制的内存控制器集成到HBM基础芯片中。
通过将内存控制器集成到 3D HBM 堆栈而不是 XPU 中,NVHBM 与标准 HBM4E 相比,可提供高达 30% 的更高内存带宽和15%更低的 HBM 功耗,并在 XPU 计算芯片上释放高达 25% 的更多面积。
NVIDIA 正在建立一套标准的 NVHBM 实现方案,该方案可由多家内存供应商提供。这将减少跨多个供应商集成和验证内存所需的工程工作量,从而使 NVLink Fusion 客户能够更快地将定制 AI 芯片推向市场。
亚马逊旗下的 Annapurna Labs将率先开展 NVHBM 的研发工作,这是其与 NVIDIA 在 NVLink Fusion 领域更广泛合作的一部分。
亚马逊旗下的 Annapurna Labs将与 NVIDIA 合作开发 NVHBM 技术和 NVLink 扩展架构,以提高 AI 工作负载的性能和效率。
这是在AWS此前宣布支持NVLink Fusion的基础上进行的。Annapurna Labs将从Trainium4开始,在其下一代Trainium芯片中支持NVLink Fusion,这将使亚马逊芯片和NVIDIA GPU能够在通用的机架级架构下协同工作。
亚马逊Annapurna Labs副总裁Nafea Bshara表示:“NVHBM代表了一种提升高带宽内存性能和效率的全新架构方法。我们期待这项技术合作能够惠及未来的AWS基础设施设计。”
NVLink Fusion 使合作伙伴能够将定制的 XPU 和 CPU 连接到 NVIDIA 的机架级平台。
合作伙伴可以获得 NVIDIA NVLink 芯片、NVLink-C2C、NVLink 交换机和 NVIDIA MGX 系统和机架,以及广泛的 CPU 合作伙伴、ASIC 设计商、系统制造商和技术提供商生态系统。
NVLink Fusion 随每一代 NVIDIA 机架级系统架构提供,使超大规模数据中心和 AI 原生公司能够将工程资源集中于 XPU 创新,同时使用成熟的技术堆栈进行纵向和横向扩展的网络、机架级系统和软件,从而为部署半定制 AI 基础设施创造更快、风险更低的途径。
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
END
今天是《半导体行业观察》为您分享的第4511期内容,欢迎关注。
推荐阅读
★
★
★
★
★
★
★
★

加星标⭐️第一时间看推送~


