推理正在重塑AI芯片

半导体行业观察 2026-10-10 09:20

公众号记得加星标⭐️,第一时间看推送不会错过。

推理正在重塑AI芯片图1

人工智能的构建已跨越了一个临界点。多年来,由于加速器资源匮乏、前沿模型竞争以及需要构建规模日益庞大的集群(通常包含数千甚至数万个图形处理器 (GPU))来训练模型,大量的计算资源被用于训练。到 2030 年,人工智能工作负载预计将转向推理,推理将占人工智能需求的约 60%,而训练则约占 40%(图表 1)。业界正在从构建人工智能转向大规模地提供服务,这在工程方面面临着截然不同的挑战,成本结构也大相径庭(参见侧边栏“延迟、吞吐量和成本限制因推理请求而异”)。


推理正在重塑AI芯片图2


事实上,企业高管们不再纠结于人工智能是否能创造价值,而是关注其服务成本是否在可接受的范围内。企业需要立即为人工智能的使用和基础设施付费。流程重组、数据集成、员工采纳以及可衡量的生产力提升则需要更长时间。人工智能部署在取得成功之前可能看起来非常昂贵,而且随着自主系统承担越来越多的工作,高管们预计成本还会大幅上升;人工智能的普及以及支持其所需的基础设施需求可能仍处于发展初期。但是,除非服务成本显著降低,否则企业可能无法大规模地采用人工智能推理技术。


为了解这一新环境,麦肯锡与全球半导体联盟 (GSA) 合作,采访了来自领先半导体厂商和超大规模数据中心的 AI 架构师。通过这些对话,我们提炼出了定义 AI 推理时代的五大转变:


企业将主要根据每次有效结果的成本而不是组件基准来评判人工智能的性能,这可能会将价值转移到能够改善系统经济性的价值链层。


工作负载变得越来越多样化,从而产生了对专用硅的需求(这可以通过[半]定制硅或芯片设计等手段来实现)。


用于推理的计算将分布在云端、企业、边缘和设备上,具体位置由经济性、延迟和数据控制因素决定。


硬件(逻辑、内存和网络)决定了人工智能计算能力的极限,而软件则决定了能够实现多少这样的能力。


专业化只有在规模化时才能带来收益,因此开放标准势在必行。


下面,我们将详细探讨这些变化,并提出半导体行业应该如何应对企业领导者的担忧,并成功扩展人工智能推理能力。


1. 企业可能会权衡每次结果的成本,而不是通用的基准。


硬件发展路线图已经指向更高的性能、更大的内存、更快的互连速度和更密集的系统。挑战在于,每一次升级的成本都比上一次更高,而且回报并非线性增长。因此,企业在决定人工智能投资方向时,需要比通用基准测试更精准的需求信号。


由于企业需求因行业而异,人工智能需求应源于业务成果。例如,零售推荐系统可能需要处理数百万个成本相对较低的请求,并具备高可用性和可预测的单位经济效益;而自动驾驶汽车则需要近乎实时的推理,并对延迟和可靠性有严格的要求。这些工作负载对基础设施、成本、性能和服务水平的要求截然不同,单一的通用基准测试无法涵盖这些差异。


企业不应再仅仅关注规格表是否有所改进,而应考虑可靠地服务特定工作负载的成本,包括每个已解决的服务工单成本、每行已验收代码成本以及每个已检查单元的成本。鉴于这种转变,硬件制造商和部署客户必须在架构选择尚可形成之时,尽早展开合作。


行业衡量标准的这种变化也可能影响价值的分配。如今,价值获取很大程度上受稀缺性影响;领先的加速器、高带宽内存、先进封装和电源供应都享有溢价,部分原因是供应难以跟上需求。而持久的价值可能更多地体现在那些能够显著提升系统经济性的环节,例如降低成本、提高利用率、减少延迟或提高每瓦有效输出。能够缓解带宽瓶颈的内存供应商、能够保持机架有效连接的互连供应商、能够提高密度的散热或供电供应商——每一家供应商都通过提升整个系统的性能来赢得市场地位。


短期内,收益可能仍将集中在存储器供应商、领先的加速器厂商以及少数定制芯片和网络设备公司身上。但随着限制因素不再局限于计算能力,电源供应、散热管理、连接性和传感技术或许能为众多仍在探索自身差异化的模拟电路、微控制器和其他无晶圆厂厂商带来机遇。专业化的价值在于解决系统级问题,而非仅仅提升产品规格书上的参数。


2. 多样化的工作负载需要专用的硅芯片


由于不同的工作负载对 AI 基础设施提出了截然不同的要求,因此多种推理架构可能会共存(图表 2)。


推理正在重塑AI芯片图3


如今的很多已安装设备最初是为训练而设计的,现在却被用于推理。这造成了一种不匹配,但并非规格表所暗示的那样。训练需要原始计算能力;解码需要内存带宽。生成每个标记意味着将模型的权重和累积的键值缓存从内存中流出,而实际执行的运算量相对较少。因此,关键在于带宽,而不是峰值浮点运算能力。这决定了节点的服务速度,而过去二十年来,峰值计算能力的增长速度大约是内存带宽的两倍。


GPU+HBM目前主导部署的配置仍将继续服务于大部分工作负载,但随着推理需求变得更加具体,它不太可能继续保持唯一的默认设置。更可能出现的结果是配置更加多样化:根据工作负载的不同,节点可能侧重于带宽或容量;HBM 新一代产品可以拓宽接口,同时定制基础芯片以满足特定买家的需求;先进的封装技术可以缩短数据传输距离;更便宜的内存层可以容纳缓存中较冷的部分;以及大量使用 SRAM 的设计可以从另一端解决瓶颈问题。最终哪种平衡会占据主导地位尚不明朗,而且很可能会因工作负载的不同而有所差异,而不是趋于一致。


设想这样两种工具:一种是合规工具,它读取一份 300 页的合同,并返回一份标记条款的简短列表;另一种是语音助手,它逐个文本框地播放语音回复。前者预填充量大,计算资源消耗高;后者解码量大,带宽资源消耗高。如果运行在同一硬件上,两者都会为自己未使用的功能付费。


同样的划分也出现在单个请求内部。预填充(模型处理提示信息)计算量巨大;解码(逐个生成令牌)则更依赖于内存带宽。较长的输入会增加预填充的工作量;较长的输出会增加解码的工作量。因此,执行相同任务的文本代理和语音代理可能需要不同的硬件配置,不同的延迟目标也可能需要聚合或分离式服务。


整个行业正在围绕这一问题进行设计。超大规模数据中心和人工智能实验室正在为其高容量工作负载构建定制加速器。Groq、Cerebras、SambaNova 和 d-Matrix 等基于 SRAM 的厂商则着眼于解决带宽瓶颈问题。此外,一系列合作模式也应运而生,旨在将不同阶段的运算任务分配到专用芯片上:NVIDIA 与 Groq 达成许可协议和人才转移,从而得以吸收 Groq 的专用推理技术;AWS 将 Trainium 预填充与 Cerebras 解码相结合;AMD 与 Cerebras 合作;Intel 和 SambaNova 则推出了一种推理蓝图,将预填充任务路由到 GPU,将解码任务路由到可重构数据流单元 (RDU)。OpenAI 的 Jalapeño 采取了相反的策略:使用单一的平衡加速器,在每个阶段激活适当的计算、内存和网络组合,将模型状态保持在本地,而不是在硬件池之间移动。此外,许多厂商正在探索基于芯片组的架构,以便在标准计算平台上提供定制化解决方案。


专业化存在一个主要风险:芯片周期以年为单位,而模型架构的更新换代仅需数月,因此,专用芯片可能针对早已过时的工作负载进行了优化。缩短芯片周期如今已成为业界的明确目标。强化学习布局规划已在谷歌的几代张量处理单元(Tensor Processor Unit)中得到实际应用,杰夫·迪恩(Jeff Dean)也曾公开表示,人工智能方法可以将设计周期从18到30个月缩短到3到6个月。OpenAI 的 Jalapeño 芯片是迄今为止最清晰的例证:它与博通公司联合开发,从最初的 RTL 代码到最终流片仅用了九个月——相比之下,从零开始设计的典型 ASIC 芯片通常需要 18 到 24 个月。OpenAI 利用其自身的模型来探索各种实现方案、缩短验证循环并优化芯片的运算电路。基于机器学习的布局和优化如今已成为主流电子设计自动化流程中的标准功能,而非实验性的附加功能,而一批资金雄厚的初创公司正致力于完善设计流程的其他环节。如果这些努力能够实现哪怕一部分预期目标,团队就可以根据实际工作负载而非预测工作负载进行设计,而针对特定工作负载的芯片也将变得更加实用。


3. 推理运行的位置取决于经济性、延迟和数据控制,而非技术。


用于推理的计算资源可能会越来越分散在云端、企业级应用层、边缘端和终端设备上。最佳部署位置会因工作负载而异,并受数据位置、经济性、延迟、可靠性和控制等因素的影响。技术可行性很少成为障碍;基本上可以在每个位置运行推理。区别在于谁愿意为此付费(图表 3)。


推理正在重塑AI芯片图4


云计算。对于前沿模型、弹性工作负载、快速模型更新以及数据已集中化的应用而言,云计算可能仍将占据核心地位。但随着经济性和其他需求变得越来越重要,它可能不再是所有工作负载的默认选择。


企业级应用。在治理和主权至关重要的领域,企业级和托管基础设施可能会蓬勃发展。例如,对客户记录进行欺诈检测的银行很可能希望将敏感的客户记录保存在自己的场所。这些工作负载仍然需要数据中心级别的系统;它们只是运行在私有集群中,而不是超大规模集群中。


边缘计算。边缘计算服务于需要在数据生成地点附近进行大量计算的工作负载——例如,工厂对生产线上的每个单元进行目视检查,在这种情况下,传输视频的成本高于本地处理。虽然边缘计算在技术上可行,但谁来承担成本的问题尚未解决。电信行业提供了一个前车之鉴:运营商在 4G 网络建设上投入了数十亿美元,消费者每月支付的订阅费并不高,而大部分价值都流向了构建在其上的应用程序。在成本问题明确之前,电信运营商、公用事业公司和站点运营商都会对转向边缘计算持谨慎态度。


设备端。当模型符合终端的内存、功耗和散热要求,并且即时性、隐私性或离线操作至关重要时,这种部署方案是最佳选择。例如,手机会在本地汇总消息,仅将难度较高的请求上报给上游。


4. 硬件决定了人工智能计算能力,而软件决定了可以捕获多少信息。


加速器在未来仍将扮演核心角色,但它们可能不再能单独决定推理的经济效益。在芯片内部,性能越来越受到三个相互依存的要素的影响:逻辑执行计算,内存为其提供数据,网络连接并扩展数据。展望未来,内存带宽和网络带宽很可能成为日益重要的制约因素——这使得业内一些人士认为,网络正在成为计算机本身的一部分。


这种上限是物理性的。随着上下文窗口的延长和代理工作负载的倍增,键值缓存流量、内存容量和带宽决定了节点能够处理的并发请求数量。网络性能决定了单个请求在机架上能够有效分布的范围,超过这个范围,延迟就会抵消性能提升。电源供应和散热管理(例如液冷和微流控等新兴技术)在计算能力提升之前,就已经提高了门密度。许多最新的半导体创新(例如硅光子学或先进封装)都在解决同一个问题:数据传输而非数据处理所消耗的能量和延迟。


不过,短期成本优势可能体现在软件领域。例如,一个每次请求都重新读取同一存储库的代码助手,可以通过缓存重用来大幅降低预填充成本。一个客户服务团队如果将简单查询路由到小型模型,仅将更复杂的查询升级处理,那么在不改变硬件的情况下,每次解析的成本也会降低。批处理、调度、量化和数据放置等技术也遵循同样的原理:收益会不断累积,最终降低现有硬件的运行成本。


这意味着推理基础设施是一个全栈优化问题(图表 4)。硬件决定了系统能够提供什么,而软件(以及最终的企业数据和工作流集成)决定了系统实际提供什么。


推理正在重塑AI芯片图5


5. 专业化只有在规模化时才能带来收益,因此开放标准势在必行


随着人工智能融入关键工作流程,政府和企业越来越重视数据处理地点、模型选择、基础设施部署位置以及结果访问权限。对于越来越多的工作负载而言,在部署决策中,主权、弹性以及监管要求的重要性已与成本和性能不相上下。


其结果是需求呈现分化而非趋同的趋势。国家医疗服务机构、国防部和区域性银行可能都需要相同的能力,但在数据驻留、认证供应商、模型来源和本地生态系统参与等方面却有着不同的限制。曾经集中在少数几个超大规模区域的需求,现在可能会分散到数十个国内部署项目中,每个项目都有自己的具体要求。对于半导体公司而言,这既是需求的驱动因素,也是复杂性的来源,意味着需要在碎片化的需求基础上逐步构建。


主权并非唯一可能促成这种趋势的力量。普通的竞争也会产生类似的影响:超大规模数据中心围绕自身加速器和软件进行优化,商业供应商捍卫其全栈平台,机器人和汽车厂商根据自身的延迟、安全性和功耗限制进行设计,所有这些都有理由选择差异化而非趋同。在这两种情况下,最终结果很可能是出现多种可行的推理堆栈。主权在竞争已经造成的差异之上又叠加了额外的限制。


在碎片化时代,开放模型和标准的重要性不再仅仅体现在意识形态层面,而是体现在经济层面。开放权重模型允许运营商将相同的功能部署到自主云、私有集群或边缘环境中,并根据本地可用的芯片进行调整。封闭模型在功能和托管集成方面可能更胜一筹,但它们会将更多技术栈集中在单一提供商的生态系统中,当客户需要控制部署、数据或底层基础设施时,这种模式可能难以满足需求。开放模型和封闭模型最终将如何平衡,将决定推理市场的多元化程度。


开放的互连和软件标准在硬件层面发挥着同样的作用。专用架构只有在规模化部署时才能体现其价值;如果要在十五个不同的司法管辖区提供服务意味着需要十五个软件栈,那么集成负担就会迫使买家转向更易于在任何地方复制的通用平台。通用标准允许供应商根据本地需求调整专用架构,而无需为每个司法管辖区构建单独的软件栈,从而保持了使专用架构可行的规模。


推理正在将人工智能的竞争从构建智能的竞赛转变为以经济高效的方式大规模服务智能的竞赛。这里描述的五大转变都指向同一个方向:基础设施正在围绕每个工作负载的价值而非每个组件的能力进行重组。


正因如此,没有任何一家公司——或者说任何单一层面——能够独自解决推理经济问题。服务成本取决于芯片、内存、网络、软件、电源、散热和数据架构如何协同工作,而一旦做出这些决策,大多数都难以逆转。行业联盟和合作伙伴关系可以通过通用标准、可互操作的架构、共享路线图以及将基础设施设计公司与基础设施的资金投入和部署公司协调一致的商业模式,帮助整个生态系统一次性做出正确的决策。


以经济的方式服务于人工智能,可以将人工智能从少数人能够负担得起的能力转变为整个经济体可以赖以发展的基础设施。


(来源:编译自麦肯锡)


*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。


END


今天是《半导体行业观察》为您分享的第4555期内容,欢迎关注。


推荐阅读


★

★

★

★

★

★

★

★

推理正在重塑AI芯片图6


加星标⭐️第一时间看推送~


求点赞


推理正在重塑AI芯片图7

求分享


推理正在重塑AI芯片图8

求推荐


推理正在重塑AI芯片图9

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 芯片
more
英伟达,投资芯片公司?
0.3nm芯片路线图
精粤推出B650芯片组PCIe扩展卡,388元实现接口“大扩容”
SpaceX拟豪掷400亿美元购英伟达芯片,阿波罗牵头融资剑指2027
他们都在抢购AI芯片
博通牵线500亿,OpenAI加码定制AI芯片
上市9个月,壁仞科技再度配售,两轮募资超100亿,新一代芯片已点亮
华为余承东面向海外媒体交流纪要:在芯片、鸿蒙、AI、折叠屏以及海外市场方面的最新进展(附全文)
超越英伟达!芯片巨头单季利润800亿美元,全球第一!
倒计时6天!芯片测试数据分析实战沙龙来了!
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号