公众号记得加星标⭐️,第一时间看推送不会错过。
IBM 在 Hot Chips 2026 大会上详细介绍了其未来的 IBM Z 和 LinuxONE 处理器,以及与之配套的 AI 推理加速芯片组。IBM 杰出工程师 Christian Zoellin 讲解了一款双指令集架构 (ISA) 内核,该内核可原生运行 z/Architecture 和 Arm AArch64 架构,随后介绍了面向大型企业推理工作负载的第二代片上 AI 加速器。此前,我们已经看到了IBM z17 大型机借助 Telum II 和 Spyre 实现 AI 功能,以及全新 IBM z17 Telum II 处理器模块的拆解图。

IBM 首先回顾了 Z 的历史背景,追溯了其发展历程:从乱序执行和 64 位 Linux,到无处不在的加密、后量子安全,直至如今的人工智能。这一发展脉络将 Z 定位为 IBM 构建的可靠基础,IBM 正在此基础上添加更多现代化功能。全球约 70% 的交易量都通过 IBM Z 大型机完成。IBM 表示,通过引入 Arm 生态系统,IBM 将为 Z 大型机带来新一代的应用。

现在到了发布会的核心部分:一款大型机级别的双指令集架构(ISA)处理器。这款芯片采用 2nm 工艺,搭载 11 个主频超过 5.7GHz 的 IBM Z 内核,每个内核都能原生执行 z/Architecture 和 AArch64 两种架构。IBM 将这些内核与 36MB 的私有 L2 缓存(合并为虚拟 L3/L4 缓存)搭配使用,此外还配备了专用的片上 DPU 用于 I/O 加速,以及用于 AI、压缩、加密和排序的专用模块。该处理器采用 SMT=2 设计,并拥有 432MB 的虚拟 L3 缓存和 3.5GB 的虚拟 L4 缓存。这些信息在我们拿到的幻灯片中没有显示,但他们在现场演示中展示了这些规格。

IBM 的一个关键选择是直接在硬件上实现 AArch64,而不是通过转换实现。该设计采用小端序 Arm 实现和大端序 z/Architecture 实现,支持 AArch64 v9.3、SVE 和 SVE2,并实现了 2792 条 AArch64 指令。IBM 还声称该设计符合 Arm SystemReady 标准,这对于该内核能够兼容多少现成的 Arm 软件至关重要。这项技术绝对令人惊叹。Arm 软件直接识别为原生 Arm 处理器。Arm 无需修改即可在标准 Arm 平台上运行。IBM 表示,这 2792 条 AArch64 指令是 Z 指令的两倍多。IBM 还就 RISC 中的“精简”一词开了个玩笑。

分支预测展示了 IBM 能够将多少现有的 Z 内核设计复用于 AArch64。自动化流程会读取 Arm 的 XML 架构描述来进行解码,同时调度和指令会重新分配寄存器重命名以适应 GR16-31 系列。IBM 还展示了 SVE 的新控制、FP16、Bfloat16 和加密的新数据流,甚至还有一些不常见的 CISC 复用,例如内存复制和清除。我仍然对 IBM 的所作所为感到惊叹,这不仅仅是 Z + Arm 内核的简单叠加,而是将 Z 和 Arm 完美融合在一个内核中。

在软件方面,IBM 将 Z 加速器作为平台设备暴露给 Arm 上的 Linux。加密、GZIP 压缩和片上 AI 单元作为 Linux 设备出现,其延迟与原生 Z 指令相当,而 Z ISA 仍然可以将它们作为指令暴露给 s390x 工作负载。

该设计延续了高可靠性,可用性目标高达 99.999999%。IBM 指出,其优势体现在阵列、数据流和控制层面的错误检查、瞬态故障的透明恢复、针对持续性故障的核心备用、并发修复以及 RAIM 内存保护等方面。如果您看过我们关于 Z17 的视频,就会发现 IBM 为提升系统可靠性所做的工程设计与通用云服务器截然不同。实际上,NVIDIA 也一直在进行一些类似的工作,例如用 PCB 取代许多线缆来提高系统的可靠性。

IBM 并没有强制推行单一生态系统,而是通过 Linux KVM 和 OpenShift 虚拟化技术实现内核共存。下图展示了 s390x Linux 和 ARM64 Linux 与 IBM z/OS 的共存状态,逻辑分区共享同一处理器。一个线程可以运行 s390x 或 Arm 软件,切换过程仅需几纳秒。

这种共存模式旨在融合两种软件生态系统的优势,让 Z 系列客户既能保留大型机代码,又能利用 Arm 庞大的软件基础。正因如此,IBM 并没有仅仅集成现有的 Arm 内核。

IBM 第二代 AI 推理加速器面向更大规模的企业工作负载。这款芯片集成了 16 个活跃 AI 核心和一个冗余核心,支持 FP4 和 MXFP4 数据类型,IBM 表示其性能可提升高达 4 倍 TOPS。令人惊叹的是,这才是真正具备冗余能力的 AI。它还配备了 96GB HBM3e 内存,运行速度高达约 4TB/s,约为当前一代产品的 20 倍,并采用 PCIe Gen6 作为低延迟的对等接口。

在安全性和可靠性方面,IBM 将此部件定位为关键任务型人工智能应用,其机密计算功能可保护静态、传输和使用中的数据和模型,包括量子安全加密技术。安全启动和片上加密技术与针对可用性和可维护性优化的固件堆栈相结合,并与 IBM Z 紧密集成。

IBM 在这份路线图中融入了许多内容,从将大型机可靠性与 Arm 生态系统相结合的原生双 ISA 内核,到用于更大工作负载的严肃企业级 AI 推理部件。
结语
我参加过近十年的Hot Chips大会,而这次的演讲让我几乎叹为观止。IBM的双指令集架构(ISA)策略旨在让大型机在Arm软件和AI工作负载重塑数据中心的过程中保持竞争力,而不是将Z系列处理器视为封闭平台。两年前,我根本无法想象他们能想到这个点子,并且如此艰难地将其实现。在参与Z17发布会的内容制作之后,我知道答案很简单:IBM拥有一批勇于挑战极限的工程师。即便如此,这依然令人惊叹。这款采用2nm工艺、原生支持AArch64执行和第二代AI加速器的处理器,同时应对着软件生态系统的广度和AI推理密度的双重压力。未来有多少Arm软件栈能够未经修改地运行在这个核心上,值得我们密切关注。
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
END
今天是《半导体行业观察》为您分享的第4509内容,欢迎关注。
推荐阅读
★
★
★
★
★
★
★
★

加星标⭐️第一时间看推送


