2.4倍吞吐量提升!软件持续优化,让至强跑出更高推理效率

英特尔中国 2026-09-17 19:38
2.4倍吞吐量提升!软件持续优化,让至强跑出更高推理效率图1


MLPerf Inference v6.1结果表明,软件优化可显著提升AI推理性能,实现更广泛的模型覆盖,推动更深入的生态参与。


在MLCommons最新发布的MLPerf Inference v6.1成绩中,英特尔重点展示了如何通过软件优化,大幅提升英特尔® 至强® 6 处理器和英特尔锐炫 Pro B系列GPU的AI推理性能。这些成绩的背后,同样体现了客户和生态伙伴日益深入的参与,越来越多的系统选择在英特尔平台上完成验证,覆盖更多模型、更多工作负载以及更丰富的部署场景。


在与MLPerf v6.0测试相同的芯片和插槽配置下,英特尔® 至强® 6980P处理器在Llama 3.1 8B Server测试中实现了2.4倍的吞吐量提升,Offline测试中实现了56%的吞吐量提升。值得一提的是,这些性能提升全部来源于软件层面的优化。这充分说明了,通过持续的软件创新,客户无需更换已部署的硬件平台,也能获得更高性能。英特尔的生态伙伴也展现出同样强劲的势头。



“MLPerf Inference v6.1结果表明,持续的软件优化,能让客户从已部署的硬件中释放出更为强劲的性能。我们正在不断强化至强和锐炫 Pro的全栈 AI 软件能力,同时扩大平台所支持的模型、工作负载及系统的范围。”


——Bill Pearson

英特尔数据中心事业部

数据中心软件副总裁



随着AI推理进入实际部署阶段,客户需要的计算平台,不仅要能支持更大规模、更多样化的模型,还要能在长期使用中持续提升性能,带来更好的灵活性与价值。英特尔在MLPerf Inference v6.1中的结果证明,软件优化可以进一步释放已部署基础设施的有效性能,帮助客户从现有系统中挖掘更多价值,并在CPU与GPU算力之间实现横向扩展


客户与合作伙伴在英特尔平台上的参与情况也有所提升,从v6.0的29项结果增至v6.1的39项,第三方验证不再局限于英特尔自身提交的结果2。其中,甲骨文(Oracle)首次提交了基于英特尔平台的结果;红帽(Red Hat)首次提交了至强 CPU 的推理结果;广达云科技(Quanta Cloud Technology)与超微(Supermicro)则提交了首批采用英特尔锐炫Pro B70的合作伙伴测试数据。


英特尔至强6测试结果:在MLPerf v6.1中,英特尔进一步扩大了至强处理器的测试范围。参加测试的至强6 SKU从v6.0的2款增至5款,CPU推理测试数量也从24项增加到35项。与此同时,至强依然是MLPerf Inference测试中唯一以独立服务器CPU完成提交的平台。


英特尔锐炫Pro B70测试结果:锐炫的测试结果进一步显示了,软件优化对提升AI模型性能的作用。由四块英特尔锐炫Pro B70 GPU组成的单节点系统,可提供128GB显存,并完成了Llama 3.1 8B、Llama 2 70B、gpt-oss-120B、Whisper以及端到端检索增强生成(E2E-RAG)等多种模型和应用场景的测试提交。在与MLPerf Inference v6.0相同的四卡系统配置下,gpt-oss-120B Server场景性能提升36%,Offline场景性能提升27%,充分体现出英特尔软件栈持续优化带来的性能收益3


全新E2E-RAG基准测试:英特尔参与联合开发了全新的MLPerf Inference v6.1端到端检索增强生成(E2E-RAG)基准测试,并提交了测试成绩。作为本轮测试中最复杂的全新工作负载之一,测试系统在单次运行中配备了一台英特尔至强6787P处理器和四块英特尔锐炫Pro B70 GPU,并将工作负载拆分给CPU和GPU,各自处理AI流水线的不同阶段:至强处理器负责嵌入、重排序、向量搜索和小语言模型;锐炫Pro B70 GPU则负责大语言模型的生成。这一结果清晰展示出,经过优化的CPU与GPU可以在完整的AI工作流中高效协同。


英特尔的优化并未止步于基准测试。至强处理器的各项优化成果,正不断被纳入主流AI框架,让客户无需更改现有的基础设施,就能直接享受到软件改进带来的提升。同时,对英特尔锐炫Pro B70的优化,也将进一步推动未来英特尔GPU在内核、框架及推理服务栈上的演进。


注释

性能因使用、配置和其他因素而异。详情请访问www.Intel.com/PerformanceIndex。

性能测试基于相应配置在所示日期开展,可能未能涵盖最新的公开更新。欲了解详情,请访问 MLCommons。任何产品或组件都无法做到绝对安全。


¹ 基于英特尔提交的MLPerf Inference v6.1(ID:mint-lark-1a28)和MLPerf Inference v6.0(ID:6.0-0057)测试结果。测试配置:1节点,2颗英特尔® 至强® 6980P处理器(128核),24条96GB DDR5 MRDIMM 8800 MT/s(共2304GB),无独立加速卡。Server:1,139.51 vs. 471.54 tokens/s(提升2.4 倍)。Offline:1,916.74 vs. 1,229.56 tokens/s(提升1.56倍)。测试结果可能未能涵盖所有公开更新。MLPerf名称及标识均为MLCommons的商标。欲了解更多信息,请访问mlcommons.org。


² 基于mlcommons.org上发布的MLPerf Inference v6.1和v6.0封闭式测试组结果。“英特尔平台”定义为采用英特尔® 至强® 处理器作为主要计算单元(纯CPU推理)或采用英特尔锐炫™ Pro GPU作为加速卡提交的测试。合作伙伴/客户数量统计不包含英特尔自身提交的测试。MLPerf名称和Logo是MLCommons 的商标。欲了解更多信息,请访问mlcommons.org。


³ 基于英特尔提交的MLPerf Inference v6.1和MLPerf Inference v6.0(ID:6.0-0101)封闭式测试组结果。测试配置:1节点,1颗英特尔® 至强® 698X处理器(86核),4块英特尔锐炫™ Pro B70 GPU(每块 32GB GDDR6,PCIe Gen5 x16),8条16GB DDR5 6400 MT/s(共128GB)。gpt-oss-120B Server 模式:1,296.87 vs. 951.67 tokens/s(提升36%)。gpt-oss-120B Offline 模式:1,956.40 vs. 1,536.90 tokens/s(提升27%)。软件配置:基于 Ubuntu 24.04的PyTorch vLLM。测试结果可能未反映所有公开可用的更新。MLPerf名称和Logo是MLCommons 的商标。欲了解更多信息,请访问mlcommons.org。


MLPerf Inference v6.0与v6.1之间的性能对比,建立在硬件类型(处理器或GPU)以及规格数量(插槽数或GPU数量)均一致的可比配置基础之上。欲获取完整系统配置及测试细节,请参阅MLCommons官方结果与英特尔性能文档。

实际成本与结果可能不同。

使用英特尔技术可能需要特定的硬件、软件或服务激活。


©英特尔公司,英特尔、英特尔logo及其它英特尔标识,是英特尔公司或其分支机构的商标。文中涉及的其它名称及品牌属于各自所有者资产。



相关资讯



/转载请注明出处/

2.4倍吞吐量提升!软件持续优化,让至强跑出更高推理效率图3

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
软件
more
资料汇总|FPGA软件安装包、书籍、源码、技术文档…(2026.09.16更新)
行业财报 | 微软、甲骨文、思爱普、戴尔、IBM、慧与等37家计算机软件信息服务企业2026年第二季度和上半年业绩汇总
Anthropic CEO驳斥“SaaS末日论”:AI与软件巨头是共生而非零和博弈
GPT-6 Astra突袭上线:从“生成内容”到“操控软件”,AI代理的临界点已至?
5分钟搞懂HFSS/CST/ADS到底怎么选,附国产仿真软件最新突破
AMD的Rust赌局:一支精英小队,能否改写GPU软件的未来?
宝马启动大规模召回:超15万辆车因起动机缺陷及软件隐患分批整改
爱德万 Advantest FY2026 Q1:营收 3675 亿日元创纪录、营业利润率 51.7%,AI 推理把测试变成了准软件生意
MCU可扩展软件框架:BSP、HAL、Middleware与RTOS解析
Warp推出“软件工厂”基础设施,试图为AI时代的工程组织重塑铺路
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号