AMD为何收购这家芯片公司?

半导体行业观察 2026-08-09 09:31

公众号记得加星标⭐️,第一时间看推送不会错过。


英伟达首席执行官兼联合创始人黄仁勋在 3 月份的 GTC 2026 大会上透露,如果超大规模数据中心运营商、云构建商、人工智能模型构建商和其他企业以及主权国家需要低延迟推理才能使用智能人工智能,或者只是想对聊天机器人推理收取额外费用,那么他们无法在 GPU 架构上实现这一点。


黄的研究表明,为了在更广泛的延迟范围内获得最佳的低延迟性能,公司需要做的是将他们的 AI 推理引擎拆分,并在 GPU 集群上处理上下文窗口的输入标记(GPU 集群非常擅长这项工作,这被称为预填充),然后将解码部分(模型给出响应的部分)卸载到大规模并行、更具确定性、SRAM 密集型的矩阵数学引擎上,例如 Grok、SambaNova Systems、Cerebras Systems 等公司创建的引擎。


原因很简单。GPU 是一款优秀的、高性能、高带宽的通用并行处理引擎,但它在推理解码部分的性能不如理想状态稳定。黄仁勋在 GTC 大会上展示的图表显示,由其“Grace”CG100 CPU 和“Hopper”H100 GPU(据推测是一个八 GPU 节点)组成的系统,通过批量处理用户,每个用户每秒可以处理大约 100 个 token,之后性能就明显下降了。


他称之为中等性能水平。NVL72混合CPU-GPU平台拥有18个CPU和36个GPU,基于相同的Grace CPU和Nvidia的“Blackwell”B300 GPU,在100 TPS交互级别下,其性能(以每秒每兆瓦的令牌数表示)约为现有系统的3.5倍。即将推出的基于“Vera”CV100 CPU和“Rubin”R200 GPU的NVL72机架级系统,其TPS/MW性能约为Grace-Blackwell系统的2倍,这意味着其性能是Grace-Hopper系统的7倍。


Grace-Hopper节点的交互能力已无法超越此水平,但Grace-Blackwell系统可以支持Huang所说的“高层级”应用,即每用户200 TPS,并保持合理的整体吞吐量,而Vera-Rubin NVL72的性能则要好三倍。在高级层级应用(交互能力达到400 TPS)下,Grace-Blackwell机架式系统的TPS/MW接近于零,而Vera-Rubin的性能则要好十倍,并能提供合理的整体TPS/MW。


同样,这些方法都使用 GPU 来进行推理的预填充和解码部分。但是,当 Nvidia 将推理负载拆分,把预填充放在 GPU 上,而把解码放在我们推测是一整套 Grok LP30 加速器机架上时,会发生什么呢?


全新的 Ultra 推理层级正式启用,它很可能成为交互量超过 1000 TPS/用户的智能体工作负载的性能基准。不仅如此,搭载 Grok 加速器的 Vera-Rubin NVL72 的 Premium 层级性能也比未搭载 Grok 加速器的 Grace-Blackwell NVL72 提升了 35 倍(相比之下,未搭载 Grok 加速器的 Grace-Blackwell NVL72 的性能提升仅为 10 倍)。显而易见,仅靠 GPU 加速器很难在合理的系统整体吞吐量下实现超过 400 TPS/用户的性能。


当然,Grok集群在解码方面的扩展能力也有限。你不可能把一百万个这样的设备连接起来以进一步增强交互性。(当然,我们并不知道这些限制是什么。)


这两张图表不仅解释了英伟达为何在去年12月斥资200亿美元收购了Grok团队及其技术,还解释了AMD为何与Cerebras合作开发分解式推理技术,以及为何本周AMD收购了人工智能推理初创公司Taalas——这并非某种可疑的、规避审查的收购,而是实实在在的收购——收购金额未公开。AMD的GPU在推理解码方面与英伟达的GPU存在同样的局限性。


与 Cerebras 的合作对 AMD 和 Cerebras 来说都是一件好事,这将使 AMD 的“Helios”集群(使用“Verano” Epyc CPU 和“Altair” MI455X GPU)能够像 Nvidia 未来 Vera-Rubin-LPU 组合那样进行分解推理,我们推测该集群将于今年晚些时候发布第四代晶圆级计算引擎 (WSE-4)。


唯一的问题是,AMD 无法掌控 Cerebras 的技术,因为后者在今年早些时候上市前筹集了大量资金,使得 AMD 收购该公司的成本非常高昂。AMD 越来越倾向于掌控自己的技术栈,而 Cerebras 目前的市值高达 509 亿美元,这意味着 AMD 可能需要花费 600 亿美元收购一家目前季度营收不足 2 亿美元的公司。在如今的收购市场,支付 300 倍的年营收溢价风险极大,而通常情况下,收购溢价可能只有这个数字的十分之一。


因此,AMD 目前看来只能寻求新的合作方式——由于 Graphcore 被 Arm 的母公司软银收购,Nvidia 收购了 Grok,而 SambaNova 与英特尔合作,Cerebras 成了 AMD 唯一的选择——并寻找未来推理加速的新方法。


今年二月,Taalas公司正式发布新品时,我曾对其进行过深入报道,这里就不赘述了。该公司由一群曾创立或就职于人工智能加速器和RISC-V架构领军企业Tenstorrent的工程师组成。其创新之处在于将人工智能推理模型及其权重硬编码到ROM电路中,并将其连接到巨大的SRAM块,这些SRAM块充当片上键值缓存(KV缓存)。目前Taalas的HC1芯片可以存储包含80亿个参数的模型,而下一代HC2芯片则计划存储200亿个参数。理论上,几十个芯片互连后,就可以存储包含万亿个参数的推理模型及其权重。在初步基准测试中,与Nvidia Blackwell B200 GPU相比,Taalas展现出了极低的延迟和更低的单次推理成本。


Taalas 的诀窍在于,每个模型都需要一个不同版本的 HC1 芯片——SRAM 和周围的组件都相同,但芯片中用于编码模型和权重的两层金属必须改变。不过,Taalas 也表示,训练一个新的 GenAI 模型所需的成本是定制 Taalas HC 芯片并以合理数量(几十万个芯片比较合适)购买的成本的 100 倍。


AMD 对 Taalas 的计划并未透露太多,只表示“AMD 计划将该技术整合到其加速器路线图中,并使用 AMD Instinct GPU 开发系统级解决方案”。


欢迎来到模型特定架构的世界。


(来源:编译自nexeplatform

*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。


END


今天是《半导体行业观察》为您分享的第4493内容,欢迎关注。


推荐阅读


AMD为何收购这家芯片公司?图1


加星标⭐️第一时间看推送


求点赞


AMD为何收购这家芯片公司?图2

求分享


AMD为何收购这家芯片公司?图3

求推荐


AMD为何收购这家芯片公司?图4

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
芯片 AMD
more
腾讯全新QQ宠物上线,AMD将在韩国设立AI研究中心,微信输入法1.0.0鸿蒙版上线,三星升级后输错13次密码永久锁,这就是今天的其他大新闻!
AMD Zen 6内核代码曝光:三级异构核心架构确立,桌面端最高24核
AMD 嵌入式计算峰会:嵌入式创新与技术深度在此交汇(SoC|FPGA|NPU|DSP等)
AMD重磅首购:全新AI推理芯片——模型权重直刻硅片!1.7万token/秒,48倍优势吊打英伟达GPU!
AMD锁定三星HBM4供应,Helios整机系统剑指英伟达
Linux 7.2-rc6发布:修复AMD Zen 5/6识别错误,稳定版将至
欧盟建7座AI超级工厂,英伟达、AMD、高通等助攻
AMD为何收购这家芯片公司?
AMD RDNA5代码现身Linux内核,旗舰显卡或延至2028年
AMD上调2030年服务器CPU市场预期,智能体AI催生新一轮计算需求
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号