Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”

半导体芯闻 2026-09-09 18:27
Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图1
👆如果您希望可以时常见面,欢迎标星🌟收藏哦~

过去几年,智能手机围绕AI的竞争,几乎总会落到一个数字上:TOPS。尤其是在NPU成为旗舰SoC标配之后,几十TOPS、上百TOPS的AI算力不断刷新,似乎只要AI加速器足够强,就能代表一颗芯片乃至一部手机的AI能力。但当AI从拍照增强、语音识别、智能回复这样的单点功能,进一步走向生成式AI和Agentic AI,移动计算面对的问题正在发生变化。


9月8日,Arm发布新一代移动计算平台CSS for Mobile 2。与过去单纯强调CPU、GPU性能升级相比,这一次Arm把重点放在了两个此前并不属于传统手机SoC核心叙事的方向上:一个是Agentic AI(智能体AI),一个是AI-native graphics(AI原生图形)。


Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图2


CSS for Mobile 2由C2 CPU集群、Mali G2-Ultra NX GPU、新一代SI L2系统互连,以及软件、模型和开发工具共同构成。Arm给这套平台的定位是——面向AI智能体和桌面级移动图形的计算平台。


这背后反映的,其实是Arm对下一阶段移动计算的一次重新判断:未来AI手机的竞争,可能不会再只是比较某一个计算单元有多少TOPS,而是比较CPU、GPU、专用加速器、内存和软件能不能真正协同起来。


AI变成手机的“运行层”,CPU是“编排者”


在Arm看来,“AI is becoming the mobile operating layer”,就是说,AI正在成为移动设备的运行层。


过去的AI更像一组独立功能。相机增强、智能回复、人脸识别、实时翻译……需要某项能力时调用一次模型,任务结束后AI也随之退出。


生成式AI改变了一部分体验,但仍然主要停留在“问—答”的模式。但Agentic AI则完全不同。前者是“Answer-focused”,后者则是“Goal-focused”。


例如,当用户询问:“附近有什么餐厅?”生成式AI负责给出答案。但如果用户提出:“帮我规划并预订周年纪念日晚餐。”就需要Agent来负责。一个智能体就需要连续完成感知、记忆、推理、行动四个阶段:理解用户意图,检索日历和历史偏好,推理合适的餐厅,再调用应用和服务完成预订。


这意味着AI工作负载本身发生了变化。它不再是一个大型模型从头跑到尾,而是由语音识别、个人记忆检索、小模型推理、应用调用、系统权限判断乃至云端模型共同组成的一条复杂链路。


Arm将这类工作负载概括为四个特点:对延迟敏感、具有突发性、内存密集,而且高度异构。


所以,真正影响智能体体验的并不只是某一颗NPU有多高的峰值算力。智能体更像一个系统工程。也正因此,Arm CSS for Mobile 2中最值得注意的变化之一,不是NPU,而是CPU。


Arm表示,“CPUs are the heart of agentic AI.”Arm对CPU的定位是:CPU是AI智能体的Orchestrator——编排者。


在一套完整的智能体工作流中,搭载SME2的CPU负责轻量级AI、工具调用和系统编排;GPU适合并行AI计算;专用AI加速器负责高度优化的端侧AI;规模更大的模型或者外部服务则可以继续交给云端。


Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图3


这种分工非常重要。因为智能体并不像传统AI Benchmark那样,把一组矩阵连续计算几分钟。它会不断在不同类型任务之间切换:先进行语音转文字;然后检索用户个人信息;随后运行一个小语言模型生成Prompt;接着判断调用哪个应用;最后可能再把任务交给更大的本地模型或者云端模型。对于这种工作负载而言,启动速度和延迟有时比峰值TOPS更加重要。


Arm边缘AI CPU产品管理总监Daniel Lu在媒体交流中也专门强调,CPU面对AI工作负载时关注的重点并不是峰值吞吐,而是低延迟。他给出了一组很直观的对比:目前高规格移动NPU可以达到大约100至200 TOPS,而搭载SME引擎的CPU集群等效算力大约只有5至6 TOPS。


如果是一项长期、计算密度极高的任务,CPU显然不会比NPU或者GPU更加合适。CPU真正适合的,是那些小而碎、对响应速度敏感,同时又需要高度通用性的AI任务。


C2-Ultra,不只是15%的CPU升级


于是再来看这次发布的C2 CPU集群,很多看似传统的CPU升级,就有了不同的意义。


Arm给出的参考配置中,C2 CPU集群相较上一代:GeekBench 6.3单线程性能提升15%;多线程提升12%;Web浏览性能提升15%;应用启动速度提升12%。


如果只是看这些数据,C2似乎仍然是一代常规CPU升级。


真正拉开差距的是AI。搭载两个SME2核心的C2平台,在Arm测试的最新AI模型中,最高可以实现1.7倍性能提升。


Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图4


Arm还按照“感知—记忆—推理—行动”的智能体流程进行了更细粒度测试。在语音转文字阶段,C2-Ultra相较C1-Ultra快约40%;在多语言个人记忆检索中快约41%;在利用小语言模型生成结构化Prompt时,平均快约25%。


这几个数字其实比单纯的1.7倍更为直观。因为一个智能体最终的用户体验,是由几十甚至数百个这样的小步骤叠加出来的。每个步骤少等待几十毫秒,最终才会变成用户能够感知的“AI反应更快”。


这一代CPU另一个明显变化,是SME2进一步进入端侧AI计算。Arm认为,它尤其适合组成智能体的轻量级端侧模型。在采访中,Daniel Lu给出了一个大致范围:Arm并没有严格定义什么叫“小模型”,但目前通常将20亿至30亿参数左右的模型视为比较典型的轻量级模型。这类模型并不一定值得把整个任务都卸载到专用NPU。与此同时,低比特量化也正在进一步降低模型体量。


Arm此次特别介绍了SME2和LUTi两项能力。SME2主要提高Prompt Encoding阶段单位数据可以完成的MAC运算数量;而LUTi,也就是查找表指令,则针对Decode阶段大量查表类工作,通过减少内存访问降低内存带宽需求。


这是一个容易被忽略的变化。移动AI今天遇到的问题已经不仅仅是“算不算得动”。很多时候真正拖慢AI的是:数据能不能及时送到计算单元。也就是说,端侧AI正在越来越明显地撞上Memory Wall。


Arm这次专门做了一层SI L2


Arm此次同时发布了新的SI L2系统互连。这也是CSS for Mobile 2为什么必须被看作一个“平台”,而不能只看CPU和GPU。


Arm的分析指出,Agentic AI系统级挑战包括高带宽、低延迟、QoS、功耗、安全以及可扩展性。SI L2针对这些问题增加了硬件一致性机制、QoS、高带宽统一内存访问、安全机制,并原生支持LPDDR6。


最值得注意的一项数字,是CPU到DRAM的访问延迟。按照Arm给出的测试,相较SI L1,SI L2可以把CPU访问DRAM的延迟降低大约45%。在采访中James McNiven进一步补充,SI L2同时兼容LPDDR5和LPDDR5X。


Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图5


这意味着CSS for Mobile 2想解决的不是“如何再增加一些TOPS”,而是在优化一条完整路径:Orchestration → Compute → Memory Movement → Software → Tools。


GPU的下一步,不是渲染更多,而是计算更少


CSS for Mobile 2的另一半,则是更激进的GPU升级。


Arm把新一代Mali G2-Ultra NX称为第一颗“AI-native Mali GPU”。之所以叫AI-native,并不只是因为GPU增加了矩阵运算能力。Arm真正改变的是移动图形的一条基本规则:过去GPU需要渲染每一个像素、每一帧。而AI-native graphics的思路则变成:有选择的渲染,然后利用AI重建细节、帧和光照。


Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图6


这背后的现实原因在于,手游正在越来越接近PC和主机游戏。分辨率越来越高、帧率越来越高,几何复杂度越来越高,实时光线追踪和全局光照也开始进入手机。但有一个东西并没有同步增长:手机的散热和电池预算。继续按照传统方式暴力增加GPU算力,很快就会撞墙。于是Arm选择另一条路:少算一点。


Mali G2-Ultra NX加入了一套专门的神经网络加速器NX,并围绕它提供三项主要神经图形技术。


Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图7


第一项是神经超级采样(NSS,Neural Super Sampling)。GPU先以较低分辨率渲染画面,再根据低分辨率颜色、运动矢量、深度和历史帧信息,通过神经网络重建高分辨率画面,同时完成抗锯齿。在Arm测试中,NSS可以将540p画面重建至1080p,部分场景下持续帧率接近2倍,同时外部内存流量降低约50%。


Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图8


第二项是神经帧率提升(NFRU,Neural Frame Rate Upscaling)。两帧真实渲染帧之间,通过硬件加速的光流信息以及神经网络生成中间帧。在Arm演示中,NFRU可以将持续60 FPS提高至120 FPS,同时将DRAM流量降低33%。


Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图9


第三项是神经超级采样与降噪(NSSD,Neural Super Sampling & Denoising)。它进一步把超分与光追降噪结合起来,让GPU用更少的光线追踪样本生成最终画面。


Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图10


而当这些技术同时工作时,会出现一个相当激进的结果:最终画面中最多7/8的像素都可以由AI重建,真正原生渲染的像素只剩1/8。这可能是Mali G2-Ultra NX最值得关注的一项变化。


Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图11


在Arm展示的《光影新生(Neural Dawn)》案例中,Mali G2-Ultra NX借助AI原生图形能力,将原本仅约15 FPS、基本停留在“不可玩演示”阶段的画面,提升到了可持续运行的60 FPS移动端体验。与上一代Arm CSS G1-Ultra参考平台相比,G2-Ultra NX最高可实现4倍帧率提升、4倍能效提升,同时将DRAM数据流量降低最高70%。这意味着在不显著突破手机功耗与散热预算的前提下,AI重建与神经图形技术正在把过去只能作为技术演示的复杂画面,推进到真正可持续运行的移动游戏体验。


Deyan Lazarov在采访中对此做了专门澄清。Arm目前使用的是CNN,而非Transformer网络。它不是凭空创造一张画面,而是以GPU真正渲染得到的Ground Truth为基础,通过神经网络完成超分、细节重建或者插帧。


开发者甚至可以使用自己的游戏内容重新训练模型,让模型适应某一款游戏特定的美术风格。因此更准确的说法并不是:AI替代GPU画图。而是GPU负责计算最关键的信息,AI负责重建剩下的信息。这也是“Render less, deliver more”的真正含义。


如果只看到神经网络,很容易低估这代GPU传统架构本身的变化。G2-Ultra NX同时加入了新的Execution Engine和第三代Ray Tracing Unit。Arm称新的执行引擎是Mali GPU七代以来最大的一次ISA重构,主要面向UE5的Nanite、Lumen等越来越复杂的桌面级工作负载。


新的执行引擎允许每个Warp拥有最多2倍寄存器,并支持动态的16 Warp寄存器分配,从而降低大型Shader发生Register Spill的概率。


第三代光追单元则采用了更加紧凑的三角形数据结构,减少重复几何数据,使更多内容能够留在缓存中。


仅这一项优化,在Arm测试中就可以把领先光追Benchmark的DRAM流量降低最高13%。结合硬件Opacity Micromaps之后,特定场景中的光追GPU工作负载最高可减少70%,帧率提升最高30%。


因此,AI并没有让传统GPU设计失去意义。恰恰相反,Arm的思路是:传统Rasterization、Ray Tracing与Neural Graphics同时升级。


更重要的是,AI加速器已经直接进入Shader Core。从架构层面看,另一个值得关注的变化,是NX并不是GPU旁边外挂的一颗独立AI模块。Arm直接把神经网络加速器集成进了Shader Core。


NX目前支持INT8和INT16运算,可以运行Whole Tensor Operations和压缩权重,并配套Motion Engine完成光流加速。更重要的是,它能够复用GPU原有的Memory System、Control Structure和一致性缓存,并在神经网络、图形和通用计算任务之间进行细粒度调度。


这意味着GPU内部“图形计算”和“神经网络计算”的界限正在变模糊。采访中Deyan Lazarov也提到,从GPU角度来看,运行NX任务和运行Compute Shader已经没有那么大的差别。Arm还加入了Power Gating,AI加速器不用时可以直接关闭。


因此,至少短期内,Arm并不是要让AI单元取代Shader。更可能发生的事情是:神经网络计算逐渐成为GPU和Shader体系中的一种标准计算能力。


Arm为什么反而没有把手机NPU放到平台中心?


这就带来了一个很有意思的问题。CPU有SME2,GPU有NX,那么NPU呢?


在此次PPT中,Arm几乎没有把自研NPU作为CSS for Mobile 2的重点。而在媒体问答中,James McNiven给出了比较明确的解释。Arm认为,不同计算引擎适合不同类型的工作负载。对于大型、高计算密度模型,如果追求最高效率,NPU仍然是更合适的选择。


但在智能手机市场,Arm更愿意把NPU领域的差异化创新交给SoC合作伙伴,而自己把更多工程资源放在CPU、GPU和整个计算平台上。


其中还有一个重要原因:生态。第一方应用很容易针对厂商自己的NPU做深度优化。但是对于大量第三方开发者而言,不同芯片、不同NPU之间的适配成本会迅速增加。CPU和GPU反而拥有一个非常现实的优势:通用性。这并不意味着未来NPU的重要性下降,而是端侧AI的算力分工正在进一步细化:NPU追求极致的专用AI效率,GPU承担大规模并行和越来越多AI计算,而CPU负责低延迟AI、控制、工具调用以及系统编排。


谁都不会消失。真正重要的是谁负责什么。


最后一块拼图,是软件


在此次发布中另一个明显变化,是软件的比重大幅增加。


过去芯片厂商讲CPU、GPU,往往把主要精力放在微架构和性能数据上。但AI时代不同。模型数量越来越多,量化方式越来越多,CPU、GPU、NPU乃至云端都有不同的部署路径,开发者面对的已经不是“有没有算力”,而是:到底应该把哪个模型放在哪里跑。


Arm的一句话非常适合解释今天移动AI发生的变化:“Models provide intelligence. Systems deliver value.”模型提供智能,系统才真正交付价值。


Arm因此推出了新的AI Portal。它提供已经针对Arm优化的模型、可以直接部署的示例应用,以及模型优化工具,希望让开发者完成从模型发现、优化、评估到最终部署的一整套流程。对于面向 CSS for Mobile 2 平台进行开发的开发者而言,Arm AI Portal 提供了一条直接利用 Arm 平台能力的路径,帮助开发者充分调动 CPU 端 SME2、GPU 端神经网络加速器等能力,将经过优化的 AI 模型与高端移动设备所提供的性能优势紧密结合。


Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图12


与此同时,KleidiAI也正在快速扩大。按照Arm此次披露的数据,目前KleidiAI已经拥有超过100个第三方应用集成、12个以上AI框架集成以及200多个优化Microkernel,代码量超过14万行。


在神经图形领域,Arm则选择了比较开放的模式。NSS、NFRU模型可以公开获取和调整,并提供SDK以及游戏引擎插件。根据Arm已有开发者项目经验,将神经图形加入一款现有游戏大约需要3至6个月,新游戏从开发到出货则可以控制在18个月以内。


而在采访中,James McNiven还提到了一个更加有意思的变化:过去选择模型的是开发者。未来选择模型的人,可能本身就是Agent。所以未来模型和工具不能只放在网页上等待人类开发者下载,还需要通过类似MCP Server这样的接口,让智能体能够自主发现和调用。


这意味着AI正在改变的不只是芯片。甚至连芯片厂商服务“开发者”的方式,都可能发生变化。


写在最后


总体来看,CSS for Mobile 2真正想传递的,并不只是C2相比C1提升了多少性能,或者G2-Ultra NX又增加了多少FPS。更值得关注的是,Arm正在重新组织移动端的计算资源:由CPU承担Agentic AI的编排与低延迟任务,将神经网络加速能力进一步融入GPU,再通过SI L2降低数据移动和访问延迟,最终借助软件、模型与开发工具,把这些原本分散的计算单元整合成一个完整的平台。


CSS for Mobile 2,正是Arm对下一代移动AI计算平台给出的“AI原生SoC”答案。


点这里👆加关注,锁定更多原创内容


*免责声明:文章内容系作者个人观点,半导体芯闻转载仅为了传达一种不同的观点,不代表半导体芯闻对该观点赞同或支持,如果有任何异议,欢迎联系我们。

推荐阅读

Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图13

喜欢我们的内容就点“在看分享给小伙伴哦~Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图14

Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”图15

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI GPU Arm
more
采购规模可达600亿美元,高通携手亚马逊布局AI推理芯片
AI Agent重塑SaaS估值逻辑:从“卖席位”到“卖结果”的阵痛与重构
别只盯着 EDA!AI 时代的半导体提效新思路
Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”
TechCrunch Disrupt 2026:在AI重塑产业的十字路口,投资人如何穿透噪音捕获下一个独角兽?
联想来酷发布纯闪存AI NAS,起售价6999元
赛博男友“变心”背后:AI思考链的拟人化幻觉与效率博弈
OpenAI刚曝光循环架构,这家公司更早将其用于世界模型
狐讯 | 唐家三少痛批 AI 洗稿乱象;DeepSeek Flash 系列将降价
2026年Q1, 通信B2B AI变现指数
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号