在历经过去几年的厚积薄发之后,智能体AI已经走到了爆发的临界点。特别是随着最近这些年的Agent和端侧推理的火热之后,AI距离走向千行百业,似乎仅有一步之遥。
但要让AI赋能每一台终端,除了需要先在云端搭建强大的算力,以支持更大参数的模型运行以外,还需要面向不同的终端打造相应的算力底座。尤其是在面向一些由电池供电的设备,如何打造在性能、功耗和成本上达到平衡,且在AI加速和通用算力方面都能兼顾的芯片,是在当代智能体AI新趋势之下给供应商提出的严苛考验。
作为一家深耕移动与计算领域超过四十年的厂商,高通显然已经为此做好了准备。
智能体时代,重塑算力底座
过去一年,智能体成为AI产业最热的关键词,芯片的竞争也开始从“比算力”转向“比系统”。
复盘近几年的AI芯片演进,一个趋势愈发明确:真正决定终端体验的,不只是更高的TOPS,而是CPU、GPU、NPU、ISP等异构计算单元如何高效协同,以及如何减少数据搬运、提升存储带宽,让模型始终运行在离计算最近的位置。

高通将这一思路贯彻到了新一代骁龙平台中。在智能体场景下,各模块分工明确:传感器中枢负责环境感知,Oryon CPU承担任务规划、推理与云端调度,Hexagon NPU与Adreno GPU则协同完成终端侧多模型推理,共同构成智能体的底层计算框架。
首先,在CPU方面,高通认为,当前的智能体AI时代不但需要主频更高的CPU,还需要有更出色的IPC。因为前者能决定任务“跑多快”,后者可以决定“每一步干多少活”。有见及此,高通在先进制程的基础上,对其Oryon CPU的微架构和CPU子系统进行创新,并推动整体落地方案的全栈定制化设计,以通过对各组件的协同调校,突破了移动芯片的5GHz主频天花板。
面向AI智能体时代,系统不仅需要更强的推理能力,更需要支持持续运行、多模态与低时延的整体架构。正是在这个需求推动下,高通推出了全新的Hexagon NPU。
据介绍,在这一代NPU中,高通引入了向量计算单元和标量计算单元、Element Accelerator,以加速Transformer工作负载,处理控制逻辑复杂的任务,帮助智能体更快地响应、更高效地推理。与此同时,通过引入更大的共享内存与之协同,高通能将更多上下文数据保留在靠近计算单元的位置,在保证移动端能效的前提下,提供更丰富的体验。
作为决定游戏体验的关键因素,GPU在移动SoC中的重要性不言而喻。在将AI、专用加速硬件和先进的显存架构结合后,高通打造了采用三切片架构的新一代Adreno GPU,带来性能与能效的进一步提升。
高通表示,作为AI赋能的GPU专用核心,Adreno Matrix Cores能够在图形管线内直接运行先进的AI模型。真实受惠于这种设计,神经网络计算不再需要离开图形渲染管线即可完成,开发者也能够以更低时延和更低功耗运行日益复杂的渲染模型。
而通过引入一项由AI驱动的渲染技术——高通Adreno Neural Fusion,高通全新一代GPU能将神经网络处理、AI超级分辨率和AI帧生成整合到统一的图形管线中,改变了场景的渲染和优化方式,使游戏在呈现更高画质的同时,降低渲染开销和功耗。据了解,Adreno Neural Fusion还是行业首个且已商用的支持主流游戏引擎的移动端AI超级分辨率技术。
在ISP方面,高通的升级同样围绕AI展开。据了解,高通在新一代ISP的影像管线中引入了Intelligent Pixel Control(智能像素控制)等多项AI影像技术,使图像传感器采集的每个像素不仅承载传统亮度与色彩信息,还可同时保留16位高位宽AI元数据,为后续的实时识别、场景理解和计算摄影提供更丰富的数据基础。
至此,高通为NPU、CPU、GPU或ISP的每个核心引擎都带来AI加持,为打造面向智能体的算力芯片打下了坚实基础。通过对这些新核心的拆解,我们发现,除了架构以外,他们的优化都指向了同一个目标——存储。
存储,是一个值得重视的问题
计算以外,存储已经成为决定AI系统性能与效率的关键另一极,这是一个不争的事实。在大模型发展早期,以GPU为代表的加速器计算能力曾以惊人的速度提升,但在粗放发展几年后,大家逐渐发现,现在真正限制训练与推理规模的,往往不是FLOPS,而是数据能否被快速、稳定地送达计算单元。
于是,从HBM到DDR,再到企业级SSD与分布式存储,存储正从过去的“容量配角”演变为与算力并列的核心基础设施,直接影响模型训练效率、推理时延、系统功耗以及整体拥有成本(TCO)。也正因如此,围绕AI的存储架构正在迎来新一轮重构。如何在带宽、容量、延迟与能效之间取得最佳平衡,成为产业链共同关注的焦点。
针对这些需求,高通也从缓存、显存,甚至近存等方面入手,为AI带来更强的存力保障。
高通表示,无论是智能体规划任务、调用各类工具,大型开放世界游戏持续加载场景,还是多任务处理时同时维持十多个进程活跃,其共同特点都是需要频繁访问海量数据。一旦CPU无法快速获取所需数据,计算单元就不得不等待访存,整体性能和响应速度都会受到明显限制。
有见及此,高通为CPU的每个核心配备大容量L1指令缓存,以有效减少处理器等待时间,提升指令执行效率。与此同时,高通还将L2缓存直接集成在CPU内,使大型缓存池与核心相邻,以增强处理器的访问体验。
而为针对不同终端实现CPU定制化的体验,高通还引入了全新的缓存架构——Qualcomm Oryon FlexCache。据介绍,该架构的关键价值并不只是扩大缓存,而是让超级内核与性能内核共享同一个异构缓存池。
高通表示,智能体AI的多步任务往往不会固定运行在单一核心上,而是会随着调度在不同CPU核心之间不断切换。传统架构下,数据迁移容易带来额外访存开销;而共享缓存意味着任务即使换了核心,所需数据仍然保留在同一缓存池中,无需反复搬运,从而降低访问延迟,让推理、响应和多任务体验更加流畅。
针对GPU AI计算对高速数据访问能力的需求,高通在新一代的Adreno GPU平台中引入专门优化的18MB Adreno独立高速显存(HPM),为GPU提供大容量、低时延的存储,使基于图块的渲染、帧缓冲和计算负载能够留在图形子系统内部进行。高通强调,三切片和近内存设计可将中间计算结果保留在GPU片上,无需反复访问系统内存,进而带来更低时延、更高能效和续航更持久的游戏体验。

在高通最近披露的存储技术中,尤为值得一提的是HBC(High Bandwidth Compute)。在高通看来,这是破除内存墙问题的一个有效方法,而通过3D堆叠将内存和计算单元紧密排列在一起,就是高通这个方案的核心。
据介绍,通过这种方式,能减少数据在计算单元与内存之间的移动,将计算尽量放到数据附近完成,而不是让数据频繁流向计算单元,绕过了传统SoC中“外部存储器和总线瓶颈”的问题,进而在同一架构下兼顾更高的有效内存带宽、更低的单Token能耗以及更大的内存容量,并最终以更低的总体拥有成本(TCO)支撑AI推理负载。
在美国当地时间22日开幕的骁龙峰会上,高通总裁兼CEO安蒙透露,公司会在未来几年将这项技术带到手机领域。
从手机到音频,多款“芯品”齐发
在上述多种技术的支持下,高通于今年的骁龙峰会上面向移动平台、音频平台推出了多款领先“芯”品。其中,面向智能手机推出的两款骁龙新旗舰,更是高通这些新品中的重中之重。

据介绍,高通的第六代骁龙8系列包含两款旗舰平台:第六代骁龙8至尊版面向主流旗舰终端,第六代骁龙8超级至尊版则采用更先进的封装技术,重点强化持续性能、整体算力及高负载场景表现,覆盖AI、游戏、影像等旗舰体验。
架构层面,新平台全面围绕智能体AI设计。升级后的CPU、GPU、NPU、ISP与缓存架构,使终端可支持超过300亿参数的MoE混合专家模型;Adreno GPU将AI超级分辨率、AI帧生成融入实时渲染,在提升画质的同时降低时延与功耗;新一代AI ISP则支持8K 60fps视频、4K 240fps超慢动作及VVC编码,兼顾影像质量与能效。
连接方面,平台搭载X105 5G调制解调器及射频系统,成为全球首批面向3GPP Release 19就绪的移动方案,并配备支持Wi-Fi 8、4×4 Wi-Fi、UWB和Thread的FastConnect 8800,进一步增强高速连接与智能终端的互联能力。
得益于上述配置,高通新一代的骁龙旗舰芯片实现了全面的提升。

面向个人AI时代,高通还基于领先技术推出了第二代骁龙音频平台至尊版。
据介绍,该平台集先进的骁龙畅听技术、终端侧AI、以安全为核心的云连接智能,以及集成式超低功耗Wi-Fi 6E于一体。值得一提的是,新一代音频旗舰是高通首款集成超低功耗Wi-Fi的旗舰音频平台,结合XPAN与先进蓝牙技术,可在更远距离、更大带宽下持续连接云端,兼顾无损音频与实时AI服务。
具体而言,相比上一代,新平台的AI性能提升至2倍、功耗降低40%、芯片占板面积缩小30%,通过专用AI加速器与多核架构,可同时支持AI助手、语音交互、健康管理、环境感知和高品质音频,并实现端侧与云端智能体协同。从高通的介绍我们得知,该芯片还支持配备摄像头的终端形态。“此类摄像头主要用于理解用户所处的周围环境并获取相关上下文信息,而非用于拍摄照片”,高通强调。
此外,平台还将AI深度融入音频体验:自适应ANC可根据佩戴状态、运动和环境噪声动态自动调节,AI增强的cVc语音技术则进一步提升通话、翻译及AI助手交互的语音清晰度。配合骁龙畅听智能体生态,耳戴式设备还可通过语音完成查询、预约、导航等任务,逐步演进为个人AI入口。

来到人工智能重点落地的PC方面,高通也拥有了专为智能体AI PC打造的旗舰领先平台——骁龙X2 Elite。据高通介绍,该平台的核心目标并非单纯提升传统PC性能,而是让更多复杂的AI工作负载能够在终端本地完成。平台集成高达85 TOPS的NPU,并搭配极速内存,为轻薄笔记本提供业界领先的端侧AI算力,同时支持运行300亿参数级大模型。
相比上一代产品,骁龙 X2 Elite 更大的提升体现在智能体推理效率。高通表示,新平台的词元生成速度最高提升2倍,能够以更低时延、更低成本完成本地推理,在提升响应速度的同时,也更好地保障用户数据隐私。
为了适应智能体日益复杂的工作流程,骁龙 X2 Elite还将上下文长度扩展至20万词元。这意味着设备能够保留更多历史信息,支持更长链路的任务规划、多轮对话和复杂推理,让端侧AI从简单问答进一步迈向真正的智能体应用。
与此同时,高通也在持续完善端侧AI生态。目前骁龙X系列已支持超过450个AI模型,覆盖Gemma、Qwen等主流大模型,并兼容Claude、Perplexity、Codex等智能体应用,为AI PC 提供更加丰富的软件与开发生态。高通在峰会上透露,骁龙X2系列正在进一步扩大操作系统生态,从Windows、ChromeOS延伸至Linux。
据介绍,高通不仅将提供平台级Linux支持,还计划将NPU、GPU等核心驱动贡献至上游社区,并联合Debian、Ubuntu以及惠普、华硕等合作伙伴推动终端落地,其核心目的在于进一步扩大骁龙AI PC的开发者和应用生态。
重构的不仅仅是芯片,还有AI计算范式
过去十年,移动计算看的是CPU+GPU的表现;但在智能体时代,终端芯片的玩法完全变了。
现在决定体验好坏的,是供应商能不能围着同一个AI工作流高效运转,把数据和模型在本地盘活。看看高通这一系列更新就明白了:FlexCache、HBC、AI ISP、Neural Fusion……林林总总的动作,其实是在强调一件事:系统级AI。
有意思的是,高通并没有把智能体局限在手机里。手机当大脑、耳机做入口、PC干重活,再叠加最近几年大举发力的汽车和数据中心,高通的统一底座有能力让不同设备实现模型互通、上下文共享。一张以骁龙为内核的个人AI网络,其实已经在水面下成形了。
可以肯定的是,接下来AI的竞争,不再只是单纯比谁的模型体量大,而是看谁能把智能体真正塞进生活的每个缝隙里。高通重构骁龙的底气,押的正是这个局。
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
END
今天是《半导体行业观察》为您分享的第4540期内容,欢迎关注。
推荐阅读
★
★
★
★
★
★
★
★

加星标⭐️第一时间看推送~


