
随着AI智能体不断调用工具、生成子智能体并处理更长的Token序列,CPU在AI基础设施中的计算负载持续增加,并逐渐成为影响整体性能的关键瓶颈。

今年早些时候,Amazon Web Services(AWS)的高层向工程师提出了一项新的要求:必须尽可能节省CPU计算资源。据报道,随着AI工作负载不断挤压公司的云基础设施,AWS的CPU服务器容量的等待时间出现了爆发式增长。
这个问题似乎让AWS措手不及,而且原因显而易见。AI的蓬勃发展导致GPU需求激增,随后内存需求也随之飙升。CPU基本没有出现在这轮增长中,因为与GPU相比,CPU的并行能力相对有限,因此并不适合AI模型推理——也就是运行并向用户提供大语言模型(LLM)服务的过程。
但随着Agentic AI(智能体AI)系统兴起,这一叙事正在发生变化。Agentic AI允许AI模型自主运行,并调用其他子智能体来完成任务。
Moor Insights & Strategy副总裁兼首席数据中心分析师Matt Kimball表示,2026年CPU需求出现了明显增长,其中很大一部分来自Agentic AI的发展。Kimball说:“让一个智能体工作,并假设它生成100个智能体是一回事。如果我要把这种模式推广到整个企业,那么这100个智能体很快就会变成数万个、数十万个甚至数百万个智能体。你会看到智能体生成子智能体、发起API(应用程序编程接口)调用,并通过Anthropic的模型上下文协议与更多智能体进行通信。”
AI agents需要使用计算机,而计算机需要CPU
Kimball所说的情况,部分涉及所谓的“工具调用(tool use)”。这是对LLM能力的一种概括,即让大语言模型访问互联网、打开桌面上的文件,以及使用各种软件来完成任务。
经过工具调用训练的LLM能够学会调用其他软件。虽然LLM的推理过程仍然主要在GPU或类似的AI加速器上执行,但LLM发起的工具调用通常会交由CPU处理。
“Agentic AI任务中的许多环节,本质上都是基于CPU的工作。”英特尔高级研究科学家Souvik Kundu解释道,“CPU负责解析输出结果、确定应该调用哪个工具、发起API调用或运行代码、收集结果,并将结果反馈回去。”AMD计算与企业AI副总裁Madhu Rangarajan也表达了类似观点。他表示:“在我们的测试中,实际Agentic AI流程的八个阶段中有七个完全在CPU上运行。”
例如,当一个LLM负责编写软件时,它很可能会调用各种工具,将代码写入文件、移动或替换文件、下载所需的软件包,并在LLM认为代码已经完成后构建软件。
Kundu与佐治亚理工学院的研究人员共同撰写了一篇关于Agentic AI优化的论文。他们发现,当LLM推理在GPU上执行时,CPU往往处于空闲状态;反过来,当工具调用在CPU上执行时,GPU又经常处于空闲状态。为了优化这一现象,Kundu及其同事提出了调度优化方案。在持续负载下,该方案最多可以将端到端延迟,即Agentic AI工作负载从开始到结束所需的时间,降低至原来的约1/1.8,也就是性能提升最高约1.8倍。
这只是一个开始,但这种性能提升面对的是一个不断变化的目标。Agentic AI系统能够以机器的速度产生工作,并在运行过程中不断放大工作量。OpenAI曾无意间“入侵”Hugging Face,其模型在一个小时内发起了多达300次操作,而一个智能体还可以生成自己的子智能体,由后者继续发起工具调用。
此外,还有一个重要因素可能会随着模型变得更加复杂而进一步增加CPU的工作负载,那就是安全护栏(safety guardrails)。
Kundu表示,对agents行为进行安全和策略检查,通常需要依据特定规则检查语法和日志文件。安全护栏也可能使用小型模型(参数量低于10亿)来分析任务复杂度或意图。虽然这些任务也可以在GPU上执行,但实际情况往往并非如此,因为这些模型规模较小,同时又需要尽可能降低延迟,因此相关工作通常会留在CPU上执行。

增加可用 CPU 的数量可以显著降低 Llama-8B 对较长序列长度的响应延迟。来源:Euijun Chung、Yuxiao Jia 等。
Tokenization进一步加剧CPU瓶颈
Euijun Chung佐治亚理工学院博士生Euijun Chung近期与其他研究人员共同撰写了一篇论文,其研究结果与Kundu的研究相辅相成。
Chung及其合作者发现,当服务器的CPU核心数量不足时,系统在向GPU分发工作方面会逐渐跟不上。这会导致GPU因为等待指令而停顿。
除此之外,这篇论文还涉及LLM工作负载中的另一个关键环节:Tokenization(Token化)。
Tokenization是LLM推理关键的第一步,它会将文本转换成模型能够处理的整数Token ID。与大多数LLM推理所需要的矩阵运算不同,Tokenization属于具有大量分支、依赖数据的顺序字符串处理。虽然可以通过将文本分块来实现并行处理,但它并不像LLM推理的大部分计算那样具备大规模并行能力。
对于较短的提示词而言,Tokenization是一项相对简单的任务,即使是入门级CPU也不会承受太大压力。然而,一个会发起工具调用的Agentic AI模型,还必须对工具调用返回的结果进行解析和Tokenization。
Chung表示:“假设你有一个持续进行的序列,其中包含10万个Token,而一次工具调用返回了1000个Token,那么Tokenizer就必须再次对整个序列进行Tokenization。而且,每一次Agentic工具调用都需要进行Tokenization。”这不仅提高了Tokenization发生的频率,也增加了每次需要处理的Token数量。Chung认为,未来的Tokenizer或许能够找到缓解这一问题的方法,但对于当前的LLM推理而言,这仍然是一个问题。
论文发现,首Token生成延迟(time-to-first-token),即模型生成回复中的第一个词所需的时间,会随着序列长度增加而大幅上升。增加CPU核心数量可以缓解这一问题。在更长序列的测试中,增加CPU核心数量可以将首Token生成延迟降低约1.5倍至7倍。
由于测试硬件存在限制,Chung及其同事只能测试规模相对较小的模型,例如阿里巴巴的Qwen 3-30B和Meta的Llama 3.1-70B。他推测,更大型的模型可能因为整体GPU需求更高,而不会出现如此明显的CPU瓶颈,但同时他预计Agentic AI会将Token序列长度推向远超其团队测试范围的水平。
Chung表示:“如果你考虑Anthropic的Claude这样的模型,很容易就会达到50万个甚至100万个Token。在Agentic AI的世界里,平均序列长度会不断增长,所以我预计这个问题在未来的工作负载中会变得更加严重。”
CPU紧缺才刚刚开始吗?
亚马逊开始限制CPU资源使用,只是Kundu和Chung发现其研究具有现实意义的诸多迹象之一。
Intel的服务器CPU至少已经到年底前都已售罄。AMD已经将服务器CPU预测产量翻倍。Arm和Qualcomm都宣布了专门用于加速Agentic AI的新型CPU。就连NVIDIA也将基于Arm架构、面向Agentic AI的Vera CPU优先推出,该处理器也是NVIDIA Vera Rubin平台的一部分。
Kimball表示,这些发展清楚表明,AI行业正在更加重视CPU性能。他认为,CPU需求的激增是一个“绝对明显的信号”,说明CPU如今已经被视为Agentic AI系统的关键组成部分。
遗憾的是,这可能会进一步演变为更广泛的CPU短缺和价格上涨,就像此前GPU和内存市场已经出现的情况一样。
Kimball表示:“我们已经在某种程度上看到CPU紧缺了。从市场限制来看,这种趋势甚至蔓延到了消费领域。”他补充说,尽管英特尔新的18A制程推动了公司客户端业务的销售增长,但英特尔仍然削减了客户端CPU的产量,转而优先生产服务器CPU。在Kimball看来,这表明CPU厂商将会向更具商业价值的市场倾斜。




