9月8日,在Arm Everywhere China 的年度大会上,Arm正式发布第二代移动端计算子系统CSS for Mobile 2,专为端侧智能体AI与AI原生神经图形时代量身打造。

Arm边缘AI执行副总裁Chris Bergey表示,CSS for Mobile 2实现了全栈技术整合,集成了全新Arm Mali G2-Ultra NX GPU、搭载SME2的Arm C2 CPU集群、增强型系统IP、物理实现方案以及开发者就绪的软件生态系统,在单一计算平台中可实现对智能体 AI 和 AI 原生图形技术的全面支持。
区别于Arm传统单一CPU、GPU IP独立交付模式,CSS for Mobile 2采用全栈一体化子系统交付逻辑,将 C2 CPU 集群、Mali G2-Ultra NX GPU、SI-L2 系统互联 IP、参考物理实现基线与全套软件开发者工具做一体化深度整合,把优化视角从单 IP 性能跑分,拉升到完整异构工作流的性能、能效、数据传输效率的端到端系统统筹。
一、Arm 移动端计算平台的迭代演进历程
Arm 移动端计算平台的迭代升级,深度契合终端算力形态、AI 负载范式与先进制程工艺的变革趋势,整体历经Total Compute 集成方案→CSS for Client 初代子系统→Lumex CSS 品牌化初代平台→CSS for Mobile 2 AI 原生架构四个核心阶段,完成了从单一 IP 售卖、简单组合打包,到全栈系统集成、再到物理级子系统优化的战略跃迁,彻底重构了移动端高端 SoC 的设计范式。
Arm 移动端计算平台的雏形,源自早期 TCS(Total Compute Solution)全域计算方案,也是 Arm 系统级 IP 交付的初代形态。该方案核心是将 Cortex 系列 CPU、Mali/Immortalis 系列 GPU、CoreLink 互连 IP 标准化组合打包交付,仅完成逻辑层级的 IP 适配与功能集成,不涉及完整计算子系统的物理收敛、布局规划与时序功耗优化。
2024 年,生成式大模型技术快速落地,端侧轻量化 AI 模型开始在旗舰移动端设备规模化试点,传统单一 IP 交付模式的弊端持续凸显。在此产业背景下,Arm 正式推出CSS for Client 客户端计算子系统,首次确立 CSS(Compute Subsystem)计算子系统产品体系,彻底告别传统简单 IP 打包模式。相较于 TCS 方案,该版本实现关键升级,完成 CPU、GPU 内核级的硬化物理实现,夯实单 IP 功耗与性能基础,但仍未将 CPU、GPU、互连网络作为整体子系统开展一体化物理收敛,系统协同优化仍停留在逻辑层面。
2025 年,端侧生成式 AI 从行业试点全面迈入旗舰终端标配阶段,轻量化大模型本地推理、多模态 AI 交互成为高端移动设备的核心差异化能力。为适配全新端侧 AI 负载需求,Arm 正式推出品牌化移动端初代计算子系统Lumex CSS(Lumex-1),完成移动端 CSS 平台的首次品牌升级与架构重构。该平台全面迭代核心硬件体系,搭载全新 C1 CPU 集群、第二代可伸缩矩阵扩展 SME2、Mali G1 系列 GPU 与新一代 SI-L1 互连架构,实现完整子系统层级的逻辑集成与全场景逻辑仿真验证,同时配套交付全套子系统 RTL 源码、系统集成规范与 KleidiAI 全栈软件适配体系,从硬件架构、逻辑验证、软件生态三层完善端侧 AI 推理基础能力。从技术交付边界来看,Lumex CSS 仍延续前代迭代逻辑,仅聚焦逻辑系统优化,未开展完整子系统的一体化物理收敛,相应的均由终端 SoC 设计企业自主完成。

2026 年,移动端智能体(Agentic AI)迎来商用落地窗口期,终端算力负载范式发生根本性、颠覆性变革。新一代端侧智能体具备 7×24 小时后台常驻、多模型串联并发、持续感知记忆、自主规划决策、跨应用工具调用的特性,形成高频迭代、持续运行、异构协同的全新算力需求。CSS for Mobile 2 第二代移动端计算子系统的推出,正是基于产业变革需求,精准适配智能体时代的异构算力负载。
二、系统优化提前延伸至物理实现阶段
CSS for Mobile 2 最具标志性的架构演进,是将系统级优化向前延伸至物理实现阶段,完成从 “逻辑子系统” 到 “逻辑 + 物理全闭环子系统” 的架构升级。在保留全套前端逻辑架构优化的基础上,新增完整物理层级优化能力,覆盖子系统级布局规划、电源网格设计、全局布线优化、时序收敛、IR 压降抑制、信号串扰优化、PPA 精细化调优,并提供经过原型硅验证的标准化参考硬宏、参考 Floorplan、时序约束脚本、电源规划方案。
在智能体高频并发、内存密集的全新业务场景下,移动 SoC 设计的痛点已不再是单一模块峰值算力不足,更多来自多计算引擎协同调度、跨模块数据搬移开销、架构与后端 PPA 难以提前协同评估等系统级工程难题。随着 AI 从单一功能逐步演进为持续运行的智能体 AI 体验,AI 正驱动移动设备工作负载发生深刻变化:智能体不仅需要执行推理任务,还需保持上下文状态、运行应用程序、协调不同模型与服务,并在用户授权下自主完成任务,而这一切都必须在智能手机的功耗和散热约束下实现。与此同时,AI 原生图形技术也为移动体验带来巨大创新空间,有望突破用户对移动设备图形能力的既有认知。
CSS for Mobile 2 以异构计算为底层基石,CPU 不再只承担通用业务,升级为整套智能体工作流的编排中枢,负责跨算力资源的任务调度、上下文维护与权限管理,在手机严苛功耗、散热约束下保障高频并发 AI 交互的响应灵敏度。
随着端侧 AI 与沉浸式图形体验成为核心竞争力,移动设备的体验上限不再由单一算力模块定义,而是取决于整套异构子系统的协同优化能力。CSS for Mobile 2 通过逻辑 + 物理全层级系统优化,构建 AI 原生的标准化计算底盘,让厂商无需耗费大量资源攻坚基础算力子系统,可集中研发资源聚焦自研 NPU、影像、通信、终端 AI 生态等差异化技术创新,推动移动端智能体、神经图形等下一代体验的规模化普及。
该升级并非 Arm 替代厂商完成全部 SoC 后端设计,而是由 Arm 提前完成 CPU、DSU、互连、GPU、神经加速单元整套核心计算子系统的物理收敛与硅片验证。CSS for Mobile 2 将系统优化延伸至物理实现阶段,是 Arm 适配智能体 AI、神经图形新一代负载的核心战略升级,彻底解决先进工艺下移动端高端 SoC 研发的系统性痛点,对产品研发、技术落地、体验迭代具备多层次核心价值。
三、Arm CSS for Mobile 2 核心技术
手机作为算力中枢,早已从单纯通讯娱乐工具,升级为端侧 Agent 智能体的本地算力底座,可常驻运行多模型,持续完成感知、记忆、规划、工具调用。未来移动设备,不再是单一芯片疯狂堆峰值算力,而是一套完整的AI 原生计算子系统,在严格功耗约束下,同时支撑传统渲染、硬件光追、神经图形、端侧 Agent 多模型并发。硬件层面的核心差异,不再是单一 NPU 算力数值,而是 CPU-GPU-NPU 整套异构子系统的协同效率、持续负载稳定性与功耗控制水平。
Arm CSS for Mobile 2 第二代移动端计算子系统,构建了面向端侧智能体与神经图形时代的 AI 原生异构计算平台。平台搭载全新 C2 系列 CPU 集群与 Mali G2-Ultra NX AI 原生 GPU,并标配第二代可伸缩矩阵扩展 SME2 硬件单元,形成 CPU、GPU、异构加速器协同优化的完整子系统能力。
其中,搭载双 SME2 硬件单元的 C2-Ultra/C2-Pro CPU 集群,显著提升端侧 AI 推理的响应速度与能效表现,让 CPU 从传统控制调度单元升级为轻量大模型、向量检索、语音预处理、智能体规划的核心算力载体。全新 Mali G2-Ultra NX GPU 则通过内置专用片上神经加速器(NX),实现神经图形算法原生嵌入渲染管线,彻底解决传统 GPU 依赖外部 NPU 做 AI 后处理的带宽与延迟瓶颈。
在平台架构层面,CSS for Mobile 2 保持高度开放与可定制特性。终端芯片厂商既可整体采用完整预集成计算子系统,也可按需拆分选用独立 IP 模块,结合自研 NPU、第三方加速器及定制化系统设计,实现差异化 SoC 落地,兼顾标准化底层能力与产品顶层创新空间,结合自身产品定位完成差异化 SoC 实现。
全新 C2 系列 CPU 集群
C2-Ultra、C2-Pro 是 CSS for Mobile 2(第二代 Lumex CSS)新一代 CPU 核,集群内置双 SME2 硬件单元,算力相对 C1 集群翻倍;三者并非孤立 IP,而是微架构 - 指令集 - 缓存 - 互连整套协同,面向端侧智能体 Agent AI,解决轻量大模型、语音、检索、推理的低延迟推理与异构编排问题。
过去 CPU 只做调度,AI 靠外部 NPU;C2+SME2 让 CPU 成为端侧 Agent AI 的实际运行载体 + 异构系统编排中枢,CPU 不再只是控制单元,本身具备高效 AI 推理能力,同时与 GPU、独立 NPU 协同,完成下一代移动端 AI 原生体验。关键区分:
C2-Ultra:单线程峰值性能核心,面向突发、低延迟、智能体编排;
C2-Pro:长时高负载持续性能核心,兼顾性能 / 功耗;
SME2(第二代可伸缩矩阵扩展):CPU 内核内置的矩阵运算硬件 + ISA 指令集扩展,支持 Transformer/LLM 卷积矩阵乘法硬件加速;C2 集群实现双 SME2 硬件单元,算力相较 C1 时代翻倍,可达 5-7TOPS(INT8)。
CPU 作为可编程计算与系统调度中心,负责协调整个系统中的计算活动。在 Arm CSS for Mobile 2 平台中,C2 CPU 集群提供了支撑智能体 AI 从 “意图” 到 “行动” 所需的可编程算力与编排能力。通过融合 C2-Ultra CPU、C2-Pro CPU 以及第二代 Arm 可伸缩矩阵扩展(SME2)技术,该集群不仅提升了移动应用中的日常计算性能,还进一步增强端侧 AI 能力,为语音处理、信息检索和模型执行等工作负载提供更强支持。依托持续稳定的性能输出与能效表现,即使面对高频并发的 AI 交互,整套系统也能在移动设备功耗、散热约束条件下,维持灵敏响应。

Arm C2 CPU 集群性能亮点:
最新 AI 模型性能最高提升达 1.7 倍
单线程性能最高提升 15%
网页浏览速度提升 15%
应用启动速度提升 12%
集群级多线程性能提升 12%,支持知识检索、模型准备和应用执行等任务并行处理
这些性能提升贯穿智能体 AI 工作流的各个环节。更强的单线程性能可降低单次决策和系统响应的延迟,而更高的多线程性能则让信息检索、模型处理和应用执行等任务并行推进。与此同时,更快的网页浏览和应用启动速度进一步缩短服务访问和任务执行所需时间。
该工作流的核心为编排层(Orchestration Layer)。它负责维护任务状态、整合相关上下文信息,并决定工作流中每个阶段应由哪个计算资源执行。根据具体工作负载不同,执行过程可能涉及本地应用、端侧模型、其他计算资源或云端服务,而 CPU 则负责统一协调权限管理、任务决策以及整个任务的执行进程。
相较于上一代配置,新一代 Arm C2 CPU 集群集成双 SME2 引擎,实现 SME2 能力翻倍,为各类对延迟敏感的端侧 AI 工作负载提供更充足的 AI 算力空间。双 SME2 引擎可有效提升多 AI 任务并发能力:在智能体时代,设备同时运行 “大模型推理、语音转写、记忆向量检索、本地视觉分析” 等任务,双引擎可让多路 AI 任务真正并行执行,而非排队串行,保障后台 Agent 常驻运行不阻塞前台交互。
在任务解耦方面,双 SME2 引擎表现亮眼:CPU 通用负载与 AI 负载隔离,一套 SME2 处理前台交互 AI 任务,另一套 SME2 承接后台 AI 任务。CPU 核心(C2-Ultra/C2-Pro)可专心处理标量控制逻辑、Agent 规划调度,不会被矩阵 AI 任务抢占 CPU 流水线。
SME2 引擎的数据能力表现:
运行最新的 Moonshine 和 Parakeet 语音转文本模型时,搭载 SME2 的 Arm C2-Ultra 相比 C1-Ultra 可降低 40% 延迟。
记忆阶段,搭载 SME2 的 C2-Ultra 内存信息检索与搜索性能较上一代提升 41%;推理阶段,在测试的各类模型中,C2-Ultra 完成这一过程的平均速度较上一代提升 25%。
端到端智能体 AI 工作流测试中,搭载 SME2 的 C2-Ultra 配置相比上一代配置实现 24% 整体性能提升。
Mali G2-Ultra NX GPU 架构三大核心革新
Mali G2-Ultra NX 是 Arm 首款真正意义的AI 原生商用 GPU,也是 CSS for Mobile 2 平台的图形与神经图形核心载体。Arm 数十年来深耕 GPU 架构创新,持续为移动计算发展提供关键支撑。迄今为止,Arm Mali GPU 出货量已超 140 亿颗,这一庞大规模使 Arm 具备独特优势,能够将神经网络技术带入全球移动生态系统。
相较上代 G1-Ultra 仅能通过着色器模拟或外部 NPU 迂回实现图形 AI 能力,G2-Ultra NX 完成架构级质变:整体性能提升 85%、功耗降低 64%,原生支持神经超分、神经帧生成、光追神经降噪。

1.神经网络加速器直接嵌入 GPU 着色器(真正 AI 原生管线)
作为首款 AI 原生 Mali GPU,Mali G2-Ultra NX 将神经网络加速器直接嵌入 GPU 着色器核心,与 GPU L0/L1 缓存、执行引擎、流水线完全共享片上资源,渲染中间特征与帧数据可在片上直接完成神经网络推理,无需搬运至外部 DDR,彻底消除跨 IP 数据搬移开销。
这种紧密集成的架构能够复用 GPU 的内存系统、一致性缓存和控制结构,减少数据在不同计算单元之间的传输,提升整个管线的执行效率,助力开发者在移动设备功耗限制内,更高效提升画面质量,推动先进神经网络技术更快落地到实际游戏产品中。

核心技术能力:
神经超级采样(Neural Super Sampling,NSS):通过低分辨率渲染结果重建更高分辨率图像,减少生成高质量最终图像所需的传统渲染工作量。
神经帧率提升(Neural Frame Rate Upscaling,NFRU):通过生成中间帧提高帧率,实现更流畅的游戏体验。
神经超级采样与降噪(Neural Super Sampling and Denoising,NSSD):结合基于神经网络的超分辨率重建与降噪技术,在复杂光照和阴影的高负载光线追踪场景中提升图像质量。

NX 拥有独立时钟域,最高可超频至 GPU 主频 2 倍,原生支持 INT8/INT16 张量运算、权重压缩与硬件光流加速。Arm《光影新生》演示项目展示了开发者如何将 NFRU 和 NSSD 技术集成至游戏开发流程中。与传统渲染相比,该方案可实现最高 4 倍性能效率提升,并将外部内存流量降低多达 70%。这些提升使虚幻引擎 MegaLights 等先进技术能够切实应用于移动设备。同时,Mali G2-Ultra NX 专为持续高帧率移动游戏体验设计,可支持最高 120 帧 / 秒稳定运行,帮助玩家在更长游戏过程中获得更流畅、响应更灵敏的体验。
2. 全新 EE 执行引擎:七代最大规模指令集升级
全新执行引擎完成 Arm Mali 多年来最大一次 ISA 重构,核心解决移动端运行 UE5 Nanite、Lumen 等高复杂度着色器的寄存器溢出、性能断崖下跌问题。通过线程束寄存器容量翻倍、16-Warp 细粒度动态寄存器池分配,大幅提升复杂着色器的执行效率与稳定性,减少内存溢出访问损耗,让移动端可稳定承载 PC 级现代游戏引擎内容:传统游戏性能提升 14%、跑分性能提升 24%。同时新增着色器与 NX 单元的硬件高速通路,实现图形任务与张量推理任务的高效调度切换。
全新 EE 执行引擎可支持每个线程束的寄存器数量比上一代多 2 倍,并采用动态寄存器分配机制,有助于在着色程序规模扩大、复杂度增加的情况下减少寄存器溢出。如此一来,GPU 能更高效运行规模更大的着色器程序,为呈现更丰富场景、更高视觉保真度以及更稳定帧率预留充足算力余量。对于开发者和玩家而言,这意味着在整个游戏过程中都能获得更多可用图形性能,而非仅在峰值负载时。
3. 第三代 RTU-v3 光线追踪硬件单元
Mali G2-Ultra NX 搭载 Arm 第三代硬件光线追踪技术,可在移动端实现复杂度更高的光照、阴影、反射与几何效果。全新光追架构在主流光追基准测试中,DRAM 流量最高可降低 13%,缓解场景复杂度提升带来的内存压力。
新架构采用更小巧、更高效的光线 - 三角形数据结构,同时提供硬件级不透明度微贴图(Opacity Micromaps,OMM)支持,高效处理复杂透明几何体,能够实现更丰富的植被、精细织物、多层材质等复杂场景元素。Arm 演示数据显示:启用 OMM 最高可实现 30% 帧率提升,光追工作负载最高下降 70%,大幅提升复杂几何场景在移动端落地可行性。
神经图形与光追硬件能力形成互补:复杂光照会推高计算与数据搬运开销,神经网络技术可实现成本可控的画质增强。将新一代光追硬件与 NSSD 等神经图形技术结合,能够在移动端渲染约束下高效输出更高水准视觉细节,在既定功耗散热预算下取得超越传统渲染的画质表现,支持低分辨率输入重建高质量画面、光追场景降噪、插帧提流畅度等能力。
4.全系统协同优化:破解移动端高负载带宽瓶颈
针对高复杂度游戏场景海量数据处理带来的内存带宽与缓存压力,Mali G2-Ultra NX 的带宽与缓存优势并非单一技术优化,而是依托 AI 神经图形能力、可调节超分策略、新一代光追架构、全新执行引擎构成的整套协同优化体系,从算力调度、数据结构、内存访问多维度降低海量场景的数据吞吐压力,高效适配移动端高负载游戏渲染需求。
整体图形效能的提升,源于 GPU 全模块协同升级,而非仅依赖神经网络加速器。Mali G2-Ultra NX 搭载全新执行引擎与第三代光线追踪引擎,搭配升级的着色器内核,大幅提升传统图形负载执行效率,可实现接近桌面级的渲染画质;同时通过优化 DRAM 访问机制、原生支持不透明度微贴图(OMM),显著改善光追场景的执行效率,夯实复杂场景的底层渲染能力。

结束语
智能体 AI 和神经图形技术正在重塑移动设备的能力需求,而 AI 原生的 CSS for Mobile 2 正是 Arm 针对这一趋势打造的新一代计算平台。在边缘侧,AI 正朝着持续运行、上下文感知和沉浸式交互的方向演进。下一代移动 AI 体验将不再由单一加速器定义,而是通过在统一优化的系统中融合各类 AI 能力,共同打造全新的移动体验。
Arm CSS for Mobile 2 从整个系统层面应对这一挑战。它整合了 Arm C2 CPU 集群、GPU、系统技术、物理实现、软件及开发工具,对整体计算资源调度、数据在系统中的传输,以及日益复杂的 AI 和图形工作负载进行协同优化,使其能够在移动设备功耗限制内高效运行。通过对计算、图形、数据传输、软件以及物理实现的协同优化,CSS for Mobile 2 帮助芯片合作伙伴在移动设备固定的限制条件下,更好应对日益增长的工作负载复杂度。对于开发者而言,这意味着能够为图形渲染、光线追踪和神经图形处理释放更多性能空间。