看懂智能体AI:核心≠实力,产出才是关键

英特尔中国 2026-08-25 16:06
看懂智能体AI:核心≠实力,产出才是关键图1




对于智能体AI而言,衡量基础设施的终极标准,应是单位成本、单位功耗及单位机架内所能稳定完成的工作量。




本文作者Karin Eibschitz Segal


很多关于智能体AI CPU的讨论太窄了。行业对话大多聚焦于单线程性能、核心密度以及机架吞吐量。这三者固然重要,但无论哪个,都无法回答客户的核心诉求:在有限的延迟、成本和功耗要求下,我的基础设施究竟能稳定完成多少有价值的智能体工作?


核心的数量,可以反映企业在系统中投入了多少算力资源。而面对智能体AI,我们则需要一个方法来衡量,那些算力资源所完成的工作,从整个系统的转化效率来看,到底是高、还是低。




并发改变答案



在单智能体循环中,衡量性能是一件很简单的事情:每一步都能完成得更快,那么整个工作流的速度也会变快。然而,系统往往并非单智能体循环,而是同时运行很多的智能体,共同争抢CPU、内存、I/O以及加速器等资源。在这种高负载的情况下,系统的瓶颈也会随之改变。


近期的一项公开分析,以739个匿名Claude Code会话为样本,包含多轮推理、代码生成和工具调用的代码智能体工作流。该分析显示,单个请求下CPU端的处理和等待时间占总延迟的不到1%,而当32个请求并发时,这一比例最高可提升到15%。新增的延迟大部分源于调度与排队,而非计算。


更快的核心可以提高任务的执行速度,但它无法避免排队的现象。


此类等待,同样会波及系统中最昂贵的组件——GPU。同样在这个分析中,针对代码执行智能体的研究预估,GPU的有效工作时间仅占整体实际运行时长的50%~60%。当智能体等待数据库、检索系统或沙箱返回结果时,GPU也会跟着陷入空转。在这里,阿姆达尔定律依然适用:


“最昂贵的加速器,其实是那些正在等待系统其他组件响应的加速器。”




衡量理论容量,

不如衡量实际交付的智能体工作流



英特尔提出了一个更实用的衡量指标,即每机架实际交付的智能体数量,也就是说,在既定功耗和成本范围内,一个机架能够在规定的吞吐量、质量和延迟要求下,稳定完成的智能体工作流数量。


如何理解实际交付容量呢?


每机架实际交付的智能体数量=每机架理论智能体数×路由效率×资源平衡度×卸载效率


理论容量反映机架可用的计算、内存和带宽资源。路由效率反映任务的部署分配效果。资源平衡度体现因瓶颈和排队造成的损失。卸载效率反映将基础设施任务从通用核心移出后,系统所释放出的容量。随附的白皮书对这些因素及具体方法作了更详细的说明。


真正的容量上限,不是理论吞吐量图表的最高点,而是增加智能体数量后,延迟超过客户目标的那个点。图1给出了一个示例说明。


看懂智能体AI:核心≠实力,产出才是关键图2


图1: 容量指的是延迟曲线与目标阈值的交点。根据系统余量进行路由、任务卸载和状态分层,会将曲线拐点向右移动(示意图)




英特尔打造完整的工作流解决方案



英特尔不是在“更快的核心”和“更多的核心”之间二选一,而是在构建一个系统,让两者都转化为实际的工作产出。


保持状态可用。带宽让智能体持续运行,容量则防止它重新启动。借助英特尔至强6平面内存模式(Flat Memory Mode),CXL附加内存与原生DDR5可以共享同一个地址空间。根据英特尔与SAP的联合评估,该方案的性能能够达到全DDR5配置的96%,与此同时,内存TCO降低约25%。这为企业以更低成本维持更多活跃会话,提供了一条可行之路。


把容量还给系统。英特尔® 数据保护与压缩加速技术(英特尔® QAT)、数据流加速器(英特尔® DSA)和存内分析加速器(英特尔® IAA),可卸载原本会占用通用核心的基础设施任务。公开资料显示,使用英特尔IAA进行快照压缩,快照完成速度可提高约1.2倍。卸载不再只是功能列表上的选项,而是将容量还给客户。


按任务需求匹配算力资源。编排调度、工具执行、数据服务与状态迁移的算力需求各不相同。至强产品系列依托统一架构,既有性能核的高单线程性能,也有能效核的高密度吞吐,这让系统有能力为每一阶段的工作流,匹配最合适的执行配置。


避免加速器陷入闲置。当然,企业既需要CPU,也需要专为智能体优化的GPU,英特尔正在筹备的Crescent Island GPU,正是为满足这一需求而来。然而,如果GPU持续处在等待状态,那它终究就只是一块昂贵的硅片,白白消耗机架电力而已。这就是CPU在当下,依然事关重要的原因。至强承担了智能体系统总调度者的角色,维持会话运行、工具调用、数据流通等,持续为加速器供给任务。




更具价值的评测标准



所有智能体AI的性能声明,也包括英特尔自己所发布的在内,都应标明并发规模、延迟目标,以及理论性能与实际交付之间的损耗。一旦缺少这些,测试数据所代表的,也只是潜在上限,而无法反映实际的生产力。


英特尔将基于真实智能体轨迹,以明确的P99延迟目标为基准,公开单机柜智能体数量、路由效率、固定功能卸载所带来的性能增益、GPU挂载系统的主机侧效率,以及机柜功耗约束下的每瓦智能体数量等。


单线程性能重要,核心密度也重要。但最终胜出的系统,一定能让每个线程都有活干、每个会话都保持活跃、每个加速器都充分运转。


行业花了太多时间盘点机柜的硬件规格。现在,是时候衡量它的实际产出了。




想要了解更多,点击“阅读原文”,获取英特尔白皮书《您的机柜究竟能运行多少智能体?》。白皮书围绕“每机柜实际交付智能体数”一核心概念,系统阐述其背后的技术框架、支撑数据与实践考量,并进一步说明企业如何付诸实践,用于评估真实的系统性能。




©英特尔公司,英特尔、英特尔logo及其它英特尔标识,是英特尔公司或其分支机构的商标。文中涉及的其它名称及品牌属于各自所有者资产。



相关资讯



/转载请注明出处/

看懂智能体AI:核心≠实力,产出才是关键图6

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
藏在他山科技WRC展台里的物理AI的“入场券”
中国AI的半壁江山,走路十分钟就逛完了
「豆包工作」上线!AI巨头狂卷办公场景,独立客户端成标配?
IDAS 2026分论坛预告之半导体AI技术及应用论坛(二)Agentic EDA智能体赋能
纳德拉警示企业勿将“智力主权”外包给单一AI模型
Agentic AI的第三种范式来了,16家机构提出「伴身智能体」
刚刚,新款 Mac mini 发布!价格大涨2500元,苹果第一次为 AI 造电脑
Gamma收购Lica:AI演示文稿赛道的“合纵连横”与视觉沟通的深层重构
给优秀实习生期权!刚刚,一项面向AI顶级人才的「面壁计划」启动了
OpenAI自研芯片Jalapeño首秀:能效碾压英伟达Blackwell,但量产尚需时日
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号