芝能智芯出品如果说 MI455X 是 AMD 在单卡层面的反击,Helios 就是它在系统层面的回应。
Helios 把多颗 MI455X GPU、AMD 自研 CPU、Pensando Vulcano AI NIC 与 Scale-Up Pod 架构打包成一座机柜级 AI 系统——高带宽、低延迟,多个计算单元组成一个统一的计算域。

Helios 和 NVIDIA NVL72 设计意图是相似的,当模型大到单卡装不下,多卡之间的通信就成为性能瓶颈。与其让 GPU 通过普通以太网松散连接,不如在机柜内部用高速互连把它们组成一个"超级加速器"。
Helios 采用纵向扩展(Scale-Up)Pod 架构。一个 Pod 内的多颗 GPU 通过高速互连组成统一内存和计算域,模型可以在 Pod 内高效并行,而不需要频繁跨机柜通信。
这和 NVIDIA 的 NVLink Domain 思路类似。关键指标是 Pod 内的互连带宽、延迟和分区灵活性。AMD 在演讲中讨论了虚拟 Pod 技术,可以把物理机柜灵活划分为不同大小的逻辑计算域,适应不同规模的模型和任务。
虚拟 Pod 的价值在于资源利用率。数据中心不可能所有任务都需要满配机柜,如果能按需求动态划分 Pod,就能减少碎片,提高 GPU 利用率。这对云厂商尤其重要,他们交付的是按时计费的计算实例,卡只是载体。

UALoE:用以太网做超低延迟互连
UALoE(Ultra-low Latency over Ethernet,基于以太网的超低延迟互连)。
传统上,AI 集群的高速互连要么用 InfiniBand(NVIDIA 主导),要么用专有协议(如 NVLink)。
AMD 选择在以太网协议上做超低延迟优化,是要用更开放、更通用的网络硬件,去够到接近专有互连的性能。不被网络协议锁定。
如果 AI 集群的高速通信可以跑在标准以太网上,客户就有更多网络设备供应商可选,也能降低整体成本。但以太网原本不为 AI 多卡通信而生,得在拥塞控制、传输协议和可编程性上做大量优化。
AMD 用 Pensando Vulcano 800 AI NIC 来承载这套方案。这颗网卡支持可编程传输和可编程拥塞控制,可以根据 AI 工作负载的流量特征动态调整。
这是 AMD 收购 Pensando 后的关键落地,把智能网卡从普通网络设备变成 AI 集群的通信引擎。

大规模 AI 集群的另一个痛点是故障。几千颗 GPU 同时运行,任何一颗出问题都可能拖慢整个训练任务。Helios 讨论了纵向扩展的故障弹性机制,目标是在 Pod 内某颗 GPU 故障时,任务可以降级或快速恢复,避免整个 Pod 崩溃。
机柜级智能则是把监控、调度和故障管理下沉到机柜层面。这和 NVIDIA 在 NVL72 上做的事情类似:AI 基础设施的管理粒度正在从"单台服务器"变成"整座机柜"。

AMD 已经不满足于做"另一家 GPU 供应商"。
它试图复制 NVIDIA 的打法:从单卡扩展到整机柜,把 GPU、CPU、网卡、互连、软件和管理打包成一个系统方案。多一个系统级供应商,议价空间和技术路线都不会被一家绑死。
但 AMD 要走的路还长——NVIDIA 的 NVLink、InfiniBand、CUDA 和 DGX 已经迭代多代,Helios 还得在真实大规模集群里证明自己的稳定性、性能和易用性。
AI 算力建设不能只看单卡性能。机柜级互连、网络协议、资源调度和故障管理,正在成为决定集群实际产出的关键因素。