
过去几年,智能手机围绕AI的竞争,几乎总会落到一个数字上:TOPS。尤其是在NPU成为旗舰SoC标配之后,几十TOPS、上百TOPS的AI算力不断刷新,似乎只要AI加速器足够强,就能代表一颗芯片乃至一部手机的AI能力。但当AI从拍照增强、语音识别、智能回复这样的单点功能,进一步走向生成式AI和Agentic AI,移动计算面对的问题正在发生变化。
9月8日,Arm发布新一代移动计算平台CSS for Mobile 2。与过去单纯强调CPU、GPU性能升级相比,这一次Arm把重点放在了两个此前并不属于传统手机SoC核心叙事的方向上:一个是Agentic AI(智能体AI),一个是AI-native graphics(AI原生图形)。

CSS for Mobile 2由C2 CPU集群、Mali G2-Ultra NX GPU、新一代SI L2系统互连,以及软件、模型和开发工具共同构成。Arm给这套平台的定位是——面向AI智能体和桌面级移动图形的计算平台。
这背后反映的,其实是Arm对下一阶段移动计算的一次重新判断:未来AI手机的竞争,可能不会再只是比较某一个计算单元有多少TOPS,而是比较CPU、GPU、专用加速器、内存和软件能不能真正协同起来。
AI变成手机的“运行层”,CPU是“编排者”
在Arm看来,“AI is becoming the mobile operating layer”,就是说,AI正在成为移动设备的运行层。
过去的AI更像一组独立功能。相机增强、智能回复、人脸识别、实时翻译……需要某项能力时调用一次模型,任务结束后AI也随之退出。
生成式AI改变了一部分体验,但仍然主要停留在“问—答”的模式。但Agentic AI则完全不同。前者是“Answer-focused”,后者则是“Goal-focused”。
例如,当用户询问:“附近有什么餐厅?”生成式AI负责给出答案。但如果用户提出:“帮我规划并预订周年纪念日晚餐。”就需要Agent来负责。一个智能体就需要连续完成感知、记忆、推理、行动四个阶段:理解用户意图,检索日历和历史偏好,推理合适的餐厅,再调用应用和服务完成预订。
这意味着AI工作负载本身发生了变化。它不再是一个大型模型从头跑到尾,而是由语音识别、个人记忆检索、小模型推理、应用调用、系统权限判断乃至云端模型共同组成的一条复杂链路。
Arm将这类工作负载概括为四个特点:对延迟敏感、具有突发性、内存密集,而且高度异构。
所以,真正影响智能体体验的并不只是某一颗NPU有多高的峰值算力。智能体更像一个系统工程。也正因此,Arm CSS for Mobile 2中最值得注意的变化之一,不是NPU,而是CPU。
Arm表示,“CPUs are the heart of agentic AI.”Arm对CPU的定位是:CPU是AI智能体的Orchestrator——编排者。
在一套完整的智能体工作流中,搭载SME2的CPU负责轻量级AI、工具调用和系统编排;GPU适合并行AI计算;专用AI加速器负责高度优化的端侧AI;规模更大的模型或者外部服务则可以继续交给云端。

这种分工非常重要。因为智能体并不像传统AI Benchmark那样,把一组矩阵连续计算几分钟。它会不断在不同类型任务之间切换:先进行语音转文字;然后检索用户个人信息;随后运行一个小语言模型生成Prompt;接着判断调用哪个应用;最后可能再把任务交给更大的本地模型或者云端模型。对于这种工作负载而言,启动速度和延迟有时比峰值TOPS更加重要。
Arm边缘AI CPU产品管理总监Daniel Lu在媒体交流中也专门强调,CPU面对AI工作负载时关注的重点并不是峰值吞吐,而是低延迟。他给出了一组很直观的对比:目前高规格移动NPU可以达到大约100至200 TOPS,而搭载SME引擎的CPU集群等效算力大约只有5至6 TOPS。
如果是一项长期、计算密度极高的任务,CPU显然不会比NPU或者GPU更加合适。CPU真正适合的,是那些小而碎、对响应速度敏感,同时又需要高度通用性的AI任务。
C2-Ultra,不只是15%的CPU升级
于是再来看这次发布的C2 CPU集群,很多看似传统的CPU升级,就有了不同的意义。
Arm给出的参考配置中,C2 CPU集群相较上一代:GeekBench 6.3单线程性能提升15%;多线程提升12%;Web浏览性能提升15%;应用启动速度提升12%。
如果只是看这些数据,C2似乎仍然是一代常规CPU升级。
真正拉开差距的是AI。搭载两个SME2核心的C2平台,在Arm测试的最新AI模型中,最高可以实现1.7倍性能提升。

Arm还按照“感知—记忆—推理—行动”的智能体流程进行了更细粒度测试。在语音转文字阶段,C2-Ultra相较C1-Ultra快约40%;在多语言个人记忆检索中快约41%;在利用小语言模型生成结构化Prompt时,平均快约25%。
这几个数字其实比单纯的1.7倍更为直观。因为一个智能体最终的用户体验,是由几十甚至数百个这样的小步骤叠加出来的。每个步骤少等待几十毫秒,最终才会变成用户能够感知的“AI反应更快”。
这一代CPU另一个明显变化,是SME2进一步进入端侧AI计算。Arm认为,它尤其适合组成智能体的轻量级端侧模型。在采访中,Daniel Lu给出了一个大致范围:Arm并没有严格定义什么叫“小模型”,但目前通常将20亿至30亿参数左右的模型视为比较典型的轻量级模型。这类模型并不一定值得把整个任务都卸载到专用NPU。与此同时,低比特量化也正在进一步降低模型体量。
Arm此次特别介绍了SME2和LUTi两项能力。SME2主要提高Prompt Encoding阶段单位数据可以完成的MAC运算数量;而LUTi,也就是查找表指令,则针对Decode阶段大量查表类工作,通过减少内存访问降低内存带宽需求。
这是一个容易被忽略的变化。移动AI今天遇到的问题已经不仅仅是“算不算得动”。很多时候真正拖慢AI的是:数据能不能及时送到计算单元。也就是说,端侧AI正在越来越明显地撞上Memory Wall。
Arm这次专门做了一层SI L2
Arm此次同时发布了新的SI L2系统互连。这也是CSS for Mobile 2为什么必须被看作一个“平台”,而不能只看CPU和GPU。
Arm的分析指出,Agentic AI系统级挑战包括高带宽、低延迟、QoS、功耗、安全以及可扩展性。SI L2针对这些问题增加了硬件一致性机制、QoS、高带宽统一内存访问、安全机制,并原生支持LPDDR6。
最值得注意的一项数字,是CPU到DRAM的访问延迟。按照Arm给出的测试,相较SI L1,SI L2可以把CPU访问DRAM的延迟降低大约45%。在采访中James McNiven进一步补充,SI L2同时兼容LPDDR5和LPDDR5X。

这意味着CSS for Mobile 2想解决的不是“如何再增加一些TOPS”,而是在优化一条完整路径:Orchestration → Compute → Memory Movement → Software → Tools。
GPU的下一步,不是渲染更多,而是计算更少
CSS for Mobile 2的另一半,则是更激进的GPU升级。
Arm把新一代Mali G2-Ultra NX称为第一颗“AI-native Mali GPU”。之所以叫AI-native,并不只是因为GPU增加了矩阵运算能力。Arm真正改变的是移动图形的一条基本规则:过去GPU需要渲染每一个像素、每一帧。而AI-native graphics的思路则变成:有选择的渲染,然后利用AI重建细节、帧和光照。

这背后的现实原因在于,手游正在越来越接近PC和主机游戏。分辨率越来越高、帧率越来越高,几何复杂度越来越高,实时光线追踪和全局光照也开始进入手机。但有一个东西并没有同步增长:手机的散热和电池预算。继续按照传统方式暴力增加GPU算力,很快就会撞墙。于是Arm选择另一条路:少算一点。
Mali G2-Ultra NX加入了一套专门的神经网络加速器NX,并围绕它提供三项主要神经图形技术。

第一项是神经超级采样(NSS,Neural Super Sampling)。GPU先以较低分辨率渲染画面,再根据低分辨率颜色、运动矢量、深度和历史帧信息,通过神经网络重建高分辨率画面,同时完成抗锯齿。在Arm测试中,NSS可以将540p画面重建至1080p,部分场景下持续帧率接近2倍,同时外部内存流量降低约50%。

第二项是神经帧率提升(NFRU,Neural Frame Rate Upscaling)。两帧真实渲染帧之间,通过硬件加速的光流信息以及神经网络生成中间帧。在Arm演示中,NFRU可以将持续60 FPS提高至120 FPS,同时将DRAM流量降低33%。

第三项是神经超级采样与降噪(NSSD,Neural Super Sampling & Denoising)。它进一步把超分与光追降噪结合起来,让GPU用更少的光线追踪样本生成最终画面。

而当这些技术同时工作时,会出现一个相当激进的结果:最终画面中最多7/8的像素都可以由AI重建,真正原生渲染的像素只剩1/8。这可能是Mali G2-Ultra NX最值得关注的一项变化。

在Arm展示的《光影新生(Neural Dawn)》案例中,Mali G2-Ultra NX借助AI原生图形能力,将原本仅约15 FPS、基本停留在“不可玩演示”阶段的画面,提升到了可持续运行的60 FPS移动端体验。与上一代Arm CSS G1-Ultra参考平台相比,G2-Ultra NX最高可实现4倍帧率提升、4倍能效提升,同时将DRAM数据流量降低最高70%。这意味着在不显著突破手机功耗与散热预算的前提下,AI重建与神经图形技术正在把过去只能作为技术演示的复杂画面,推进到真正可持续运行的移动游戏体验。
Deyan Lazarov在采访中对此做了专门澄清。Arm目前使用的是CNN,而非Transformer网络。它不是凭空创造一张画面,而是以GPU真正渲染得到的Ground Truth为基础,通过神经网络完成超分、细节重建或者插帧。
开发者甚至可以使用自己的游戏内容重新训练模型,让模型适应某一款游戏特定的美术风格。因此更准确的说法并不是:AI替代GPU画图。而是GPU负责计算最关键的信息,AI负责重建剩下的信息。这也是“Render less, deliver more”的真正含义。
如果只看到神经网络,很容易低估这代GPU传统架构本身的变化。G2-Ultra NX同时加入了新的Execution Engine和第三代Ray Tracing Unit。Arm称新的执行引擎是Mali GPU七代以来最大的一次ISA重构,主要面向UE5的Nanite、Lumen等越来越复杂的桌面级工作负载。
新的执行引擎允许每个Warp拥有最多2倍寄存器,并支持动态的16 Warp寄存器分配,从而降低大型Shader发生Register Spill的概率。
第三代光追单元则采用了更加紧凑的三角形数据结构,减少重复几何数据,使更多内容能够留在缓存中。
仅这一项优化,在Arm测试中就可以把领先光追Benchmark的DRAM流量降低最高13%。结合硬件Opacity Micromaps之后,特定场景中的光追GPU工作负载最高可减少70%,帧率提升最高30%。
因此,AI并没有让传统GPU设计失去意义。恰恰相反,Arm的思路是:传统Rasterization、Ray Tracing与Neural Graphics同时升级。
更重要的是,AI加速器已经直接进入Shader Core。从架构层面看,另一个值得关注的变化,是NX并不是GPU旁边外挂的一颗独立AI模块。Arm直接把神经网络加速器集成进了Shader Core。
NX目前支持INT8和INT16运算,可以运行Whole Tensor Operations和压缩权重,并配套Motion Engine完成光流加速。更重要的是,它能够复用GPU原有的Memory System、Control Structure和一致性缓存,并在神经网络、图形和通用计算任务之间进行细粒度调度。
这意味着GPU内部“图形计算”和“神经网络计算”的界限正在变模糊。采访中Deyan Lazarov也提到,从GPU角度来看,运行NX任务和运行Compute Shader已经没有那么大的差别。Arm还加入了Power Gating,AI加速器不用时可以直接关闭。
因此,至少短期内,Arm并不是要让AI单元取代Shader。更可能发生的事情是:神经网络计算逐渐成为GPU和Shader体系中的一种标准计算能力。
Arm为什么反而没有把手机NPU放到平台中心?
这就带来了一个很有意思的问题。CPU有SME2,GPU有NX,那么NPU呢?
在此次PPT中,Arm几乎没有把自研NPU作为CSS for Mobile 2的重点。而在媒体问答中,James McNiven给出了比较明确的解释。Arm认为,不同计算引擎适合不同类型的工作负载。对于大型、高计算密度模型,如果追求最高效率,NPU仍然是更合适的选择。
但在智能手机市场,Arm更愿意把NPU领域的差异化创新交给SoC合作伙伴,而自己把更多工程资源放在CPU、GPU和整个计算平台上。
其中还有一个重要原因:生态。第一方应用很容易针对厂商自己的NPU做深度优化。但是对于大量第三方开发者而言,不同芯片、不同NPU之间的适配成本会迅速增加。CPU和GPU反而拥有一个非常现实的优势:通用性。这并不意味着未来NPU的重要性下降,而是端侧AI的算力分工正在进一步细化:NPU追求极致的专用AI效率,GPU承担大规模并行和越来越多AI计算,而CPU负责低延迟AI、控制、工具调用以及系统编排。
谁都不会消失。真正重要的是谁负责什么。
最后一块拼图,是软件
在此次发布中另一个明显变化,是软件的比重大幅增加。
过去芯片厂商讲CPU、GPU,往往把主要精力放在微架构和性能数据上。但AI时代不同。模型数量越来越多,量化方式越来越多,CPU、GPU、NPU乃至云端都有不同的部署路径,开发者面对的已经不是“有没有算力”,而是:到底应该把哪个模型放在哪里跑。
Arm的一句话非常适合解释今天移动AI发生的变化:“Models provide intelligence. Systems deliver value.”模型提供智能,系统才真正交付价值。
Arm因此推出了新的AI Portal。它提供已经针对Arm优化的模型、可以直接部署的示例应用,以及模型优化工具,希望让开发者完成从模型发现、优化、评估到最终部署的一整套流程。对于面向 CSS for Mobile 2 平台进行开发的开发者而言,Arm AI Portal 提供了一条直接利用 Arm 平台能力的路径,帮助开发者充分调动 CPU 端 SME2、GPU 端神经网络加速器等能力,将经过优化的 AI 模型与高端移动设备所提供的性能优势紧密结合。

与此同时,KleidiAI也正在快速扩大。按照Arm此次披露的数据,目前KleidiAI已经拥有超过100个第三方应用集成、12个以上AI框架集成以及200多个优化Microkernel,代码量超过14万行。
在神经图形领域,Arm则选择了比较开放的模式。NSS、NFRU模型可以公开获取和调整,并提供SDK以及游戏引擎插件。根据Arm已有开发者项目经验,将神经图形加入一款现有游戏大约需要3至6个月,新游戏从开发到出货则可以控制在18个月以内。
而在采访中,James McNiven还提到了一个更加有意思的变化:过去选择模型的是开发者。未来选择模型的人,可能本身就是Agent。所以未来模型和工具不能只放在网页上等待人类开发者下载,还需要通过类似MCP Server这样的接口,让智能体能够自主发现和调用。
这意味着AI正在改变的不只是芯片。甚至连芯片厂商服务“开发者”的方式,都可能发生变化。
写在最后
总体来看,CSS for Mobile 2真正想传递的,并不只是C2相比C1提升了多少性能,或者G2-Ultra NX又增加了多少FPS。更值得关注的是,Arm正在重新组织移动端的计算资源:由CPU承担Agentic AI的编排与低延迟任务,将神经网络加速能力进一步融入GPU,再通过SI L2降低数据移动和访问延迟,最终借助软件、模型与开发工具,把这些原本分散的计算单元整合成一个完整的平台。
CSS for Mobile 2,正是Arm对下一代移动AI计算平台给出的“AI原生SoC”答案。
点这里👆加关注,锁定更多原创内容
*免责声明:文章内容系作者个人观点,半导体芯闻转载仅为了传达一种不同的观点,不代表半导体芯闻对该观点赞同或支持,如果有任何异议,欢迎联系我们。
推荐阅读

喜欢我们的内容就点“在看”分享给小伙伴哦~![]()
