AI数据中心,“抛弃”GPU

半导体芯闻 2026-08-05 18:20
👆如果您希望可以时常见面,欢迎标星🌟收藏哦~

近日,《半导体工程》杂志邀请了Arm全球云和人工智能基础设施芯片负责人Satadal Bhattacharjee、 Axiomise首席执行官Ashish Darbari、Cadence杰出工程师Moshiko Emmer、Expedera首席科学家Sharad Chole、西门子EDA高性能计算开发负责人Cameron Brunner以及Synopsys战略营销总监Sumit Vishwakarma,共同探讨人工智能数据中心架构的变革。


以下是此次讨论的节选:

AI数据中心,“抛弃”GPU图1

LR:Arm 的 Bhattacharjee;Axiomise 的 Darbari;Cadence 的 Emmer;Expedera 的 Chole;Siemens EDA 的 Brunner;Synopsys 的 Vishwakarma。


SE:阿里巴巴表示,他们为数据中心开发了一个拥有1万张显卡的计算集群,这可能是为了弥补没有最新英伟达芯片的不足而采取的变通方案。这现实吗?


布鲁纳:我们看到硬件供应商和大型系统集成商正在根据你的网络架构来开发解决方案。软件可以帮助你合理安排工作负载,从而最大限度地利用这些互连。我们之前没有过多讨论超大规模数据中心,但它们在推广这类概念方面做得非常出色,因此你可以构建符合这种模式的环境。大多数超大规模数据中心都有一个“放置组”的概念,它们会将虚拟机(VM)组合在一起,从而实现高速互连。但这最终会带来一个大问题。当你从一台机器扩展到更多机器时,如果想要实现线性扩展,这将是一个很大的问题。


克洛伊:这很大程度上取决于工作负载。我之前从事NPU和AI方面的工作,随着模型规模的不断扩大,内存成了计算中需要有效利用的关键瓶颈之一。因此,HBM的成本以及HBM的利用率对于GPU来说就显得尤为重要。模型中既有静态参数,也有动态部分,也就是上下文。例如,内存占用量、处理量,这些都与你想要处理的请求数量息息相关。在边缘端,情况比较简单,一次只会收到几个请求。但在数据中心层面,你需要尽可能地提高API的利用率,而这主要取决于你每秒处理的请求数量。所以,当你把所有这些因素综合起来,最终会涉及到不同的并行化范式,例如张量并行、数据并行、上下文并行和流水线并行,每种范式对拓扑结构都有不同的要求。流水线并行更像是从 A 点到 B 点的流程。张量并行则是先进行全归约,然后再广播返回。在定义集群时,牢记这一点至关重要。这就是为什么如果你需要扩展到张量并行拓扑,NVLink 就成了关键组件之一。存储连接也是如此,内存传输方式也需要遵循类似的原则。


回到CPU的利用方式、工具调用以及工具在CPU上的使用方式,这些因素都会影响代理处理工作负载的方式。了解这些工具的执行方式至关重要。例如,如果您在数据中心运行的是一个完全由代理驱动的工作流,则必须对其进行编排。这意味着,在某种程度上,代理工作负载更像是一个云管理问题,需要提供工具应用程序,并且MCP(模型上下文协议)服务器必须响应迅速并已部署。如果您的工作负载需要使用大量的API,那么优化集群将大有裨益,因此我们必须考虑所有可能的并行化策略来实现扩展。如何从单个GPU扩展到八个GPU并仍然保持接近8倍的性能提升始终是一个挑战。


巴塔查吉:没错。我们看到的一个趋势,也是英伟达率先提出的,就是将推理流程拆分。推理过程分为几个阶段。第一个阶段叫做预填充,在这个阶段,你输入一个提示,程序会尝试理解你的问题,以便执行相应的操作。预填充阶段的计算量非常大。最近,英伟达发布了用于预填充集群的 Groq 3 LPU(语言处理单元),这表明完成某些任务需要的不仅仅是 GPU。接下来是解码阶段,在这个阶段,程序会实际执行任务或生成并显示响应。然后是代理介入阶段,也就是工具调用或执行任务的阶段——例如,预订 Uber 或酒店。


我们看到,在推理分离的架构中,有一个集群配备了特定的软硬件组合来执行预填充阶段,另一个集群执行解码阶段,还有一个完整的计算集群负责代理的执行,所有这些集群相互连接。它们彼此通信,目前很可能是通过以太网,但每个集群都拥有不同的软硬件组合,以发挥其最擅长的功能。这将成为未来的常态,因为迄今为止,所有人工智能问题都是通过GPU解决的。业界已经意识到,并非所有问题都能用同一种锤子(GPU)解决。GPU在数学计算等方面效率很高,但推理的工作负载特性完全不同。因此,我们需要更多样化的硬件。这被称为异构集群,软件必须能够理解异构集群。这带来了巨大的软件挑战,因为这些硬件大多来自不同的公司。接下来,软件必须确保能够无缝地利用每块硬件来实现其目标。NeoCloud 公司也参与其中。例如,DigitalOcean 宣布部署一种五层推理架构,该架构专门针对底层异构集群进行了优化,并提到了 AMD 和 Nvidia 的产品。他们还表示,将会集成新的硬件。这是提高效率并降低代币成本的趋势。


SE:如果CPU在人工智能数据中心承担着大量繁重的智能体人工智能和人工智能推理任务——复杂的推理循环、维护上下文、路由分支指令以及其他难以并行化的任务——那么除了矩阵乘法之外,GPU还需要做什么?当CPU承担其工作负载时,GPU是否还有其他任务需要处理?


巴塔查吉:如果你考虑推理过程,其中有一个推理部分,需要根据提示推断出应该执行什么操作。而推理步骤的计算量非常大。这就是加速器发挥作用的地方,我用“加速器”而不是“GPU”,因为它不一定是GPU。它可以是定制的ASIC芯片,负责执行推理功能。所以需要大量的矩阵乘法运算,而这正是加速器的优势所在。但是,当涉及到编排工具的调用时,也就是代理执行操作时,这些都可以在CPU上运行。而且,这一切都是在严格控制下完成的,因此编排操作直接在CPU上运行的工作负载和NPU上运行的工作负载上进行,而软件在这里发挥着至关重要的作用。


布鲁纳:集群内部的异构性只会持续增长。显然,我们已经有了这些用例,我不想过多地偏离主题。但在我们的环境中,我们也在考虑集成量子计算机,这将非常棒。这将为这些计算机提供数据并保持集成带来一种全新的方式。最终会有一个通用的互联平台来解决业务目标,而这正是我们真正要讨论的——满足运营商使用硬件的需求,从而为他们的业务和用户带来最佳结果。业务将驱动最有效的解决方案来解决他们的问题。


SE:NVLink 拥有 Fusion,这是其公共功能。各种以太网协议会成为竞争对手吗?还是集群和机架的不同层级会成为竞争对手?


巴塔查吉:从连接性的角度来看,存在加速器之间的连接,即GPU之间或NPU之间进行通信。此外,还有主机到加速器的连接,即CPU与加速器之间的通信。对于加速器之间的连接,由于单个加速器不足以执行和运行程序,需要多个加速器协同工作,因此我们需要在加速器之间建立高速互连,以避免性能下降。这就是英伟达推出NVLink的原因,它现在已成为行业标准。但它仅适用于英伟达生态系统。因此,超大规模数据中心都在开发自己的加速器。谷歌开发了TPU,并使用光互连技术将TPU连接起来,他们称之为ICI(芯片间互连)。谷歌在创建这种完全不同的连接方式方面做得很好,但这只是谷歌特有的TPU连接方式。现在,看看亚马逊的训练系统、Meta 的 MTIA(Meta 训练和推理加速器)以及微软的 Maia,所有这些公司都需要类似的功能。并非每家公司都愿意去解决互连问题,所以他们都在推动制定标准。英伟达也面临着开放 NVLink 的压力。因此,英伟达推出了 NVLink Fusion,但英伟达必须参与其中。要么使用英伟达的加速器连接到另一个 CPU,要么使用英伟达的 CPU 连接到另一个加速器。在这种情况下,NVLink Fusion 可以正常工作,所以它仍然参与其中。此外,还有一个名为 UA 的联盟,他们正在开发 UALink(Ultra Accelerator Link)来连接加速器。许多公司都在支持它,并且它还包含一个主机到加速器的链路,这基本上就是 CPU 到加速器的互连。所以,如果快进一两年,这项技术将会更加标准化,超大规模数据中心运营商(正是它们推动了这一趋势)以及其他公司(例如AMD)将会采用这项技术,因为AMD拥有Instinct系列产品,这些产品相当于GPU,他们希望超大规模数据中心运营商能够采用。他们的支持至关重要。整个行业正朝着标准化的加速器连接方式以及CPU与加速器的连接方式发展。


原文链接

https://semiengineering.com/ai-data-centers-look-beyond-just-gpus/


(来源:编译自semiengineering)

点这里👆加关注,锁定更多原创内容


*免责声明:文章内容系作者个人观点,半导体芯闻转载仅为了传达一种不同的观点,不代表半导体芯闻对该观点赞同或支持,如果有任何异议,欢迎联系我们。

推荐阅读

AI数据中心,“抛弃”GPU图2

喜欢我们的内容就点“在看分享给小伙伴哦~AI数据中心,“抛弃”GPU图3

AI数据中心,“抛弃”GPU图4

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI GPU
more
国内首款,GPGPU发布!
美国押注“后GPU时代”
从GPU到光互联:AI超节点为何重写光模块的产业位置
NVIDIA 全模态世界模型 Cosmos 3 与 BlackWell GPU 加速物理 AI|公开课
WAIC对话星环科技CEO:把数据库“户口”迁到GPU上,AI Agent推理不再干等
NVIDIA 利用 Vera CPU 加速下一代 CPU 与 GPU 设计
十年坚持自研GPU IP,速显微杀进具身智能GPU赛道
利用英伟达GPU,Cadence颠覆PCB设计
AI数据中心,“抛弃”GPU
听,芯片在“唱歌”:一首由国产GPU“算”出来的WAIC主题曲,惊艳了谁?
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号