过去一年,AI成了硬件发布会的固定节目。
手机有了AI助手,家电接了大模型,眼镜学会了回答问题。
厂商们排着队上台,演示一个比一个炫。行业热闹得像2010年的移动互联网元年,人人都在抢一张名叫Agent的船票。
但装上Agent之后,设备究竟替用户省了多少事?
在今年云栖大会AI原生硬件论坛上,Qwen Intelligence产品负责人范黎举了一个例子:用户说自己有一班九点的飞机,请手机设个闹钟。Agent照做了,把闹钟设在九点。它执行了指令,却没弄明白用户是想赶上飞机。
“Agent”这个词,每家讲的意思都不一样——有人把它当语音助手的升级,有人做成跨应用的自动化工具,还有人干脆动起了操作系统的手术。但判断AI硬件的进展,需要一把更实在的标尺:能不能感知环境,能不能理解意图,以及最关键的,能不能把事办完。
9月23日,云栖大会「智启万物:AI原生硬件论坛」在杭州开场。比起介绍的产品,台下坐着的人更值得玩味:手机、家电、眼镜头部厂商和头部的芯片厂商坐进同一个会场,模型这一层,则由主办方阿里云自己补上。
这几方平时各管一段,如今坐在一张桌上,只因为一件事——Agent把它们的命运绑进了同一个闭环。
阿里巴巴CEO吴泳铭前一天在主论坛用机器智能(Machine Intelligence)这个词来概括当下的技术变革:“机器正在成为思考的主力,智能正在变成规模化的商品,未来机器思考的总量会达到人类的1000倍以上。”而这些变化落到终端上,要回答的是一个更具体的问题:模型和算力的提升,能否让设备从被动响应走向主动办事?
顺着这把标尺看,眼下三条硬件赛道各有各的难:手机最主力,要横跨应用跑通长任务;家电最分散,要调动一屋子设备;可穿戴最轻量,要随时随地办事。三道题的难度不同,解题的思路也不同。
手机:Agent时代最难的考场
三道题里,手机是公认最难的。通讯录、支付、日程、位置、习惯,全在这一块屏幕上。
阿里巴巴ATH事业群副总裁、Token Foundry Qwen手机智能负责人许主洪给过一组数字:手机占据用户90%的使用时长,承载90%的用户上下文。这也是手机厂商的机会——Agent需要的数据,很多已经留在手机上。
头部厂商的切入点各不相同,回答的却是同一个问题:先让Agent把事办稳。一个细节值得留意,这是OPPO、vivo、荣耀三家头部手机厂商第一次同台,能让三家同时坐到一张桌上的议题不多,Agent手机算一个。
“终端正从‘应用入口’变成‘意图入口’。”OPPO研究院AI负责人王俊认为Agent原生手机定了三个条件:真正理解用户;把意图转成高效、稳定、安全的执行;在交互中持续成长、自我迭代。
这三个条件不是口号,OPPO已经把它们落进了系统。在AI核心能力上,OPPO坚持自研路线,小布助手的底层记忆与系统级交互均由其自研体系提供。底座是一套记忆引擎:统一管理用户记忆,不仅能记录,还能动态更新、遗忘和反思; 同时, 智能体具备隐私保护的个性化感知能力,学习用户用机习惯, 快速响应用户的服务需求。提前把应用资源备好。往外走,OPPO接入的头部服务商超过40家,比如小布“一句话直达”与支付宝打通了约200项服务。
在AI能力的构建上,OPPO AI坚持生态开放策略,与阿里云展开了深度的生态能力共建,在模型层和端侧能力上引入最新一代Qwen-3.8模型、Qwen-Omni全模态模型等,为用户提供更丰富的AI能力服务。
vivo AI副总裁张飞强调的是另一个词:持续理解。他认为最根本的变化,是手机第一次有机会规模化地服务好每一个人。一个典型场景是长任务多轮对话:用户说一句"订明天去北京的高铁,再打个车"——一句话里藏着订票、打车两个关联意图,系统得先把票订好,再衔接上打车,把组合式的服务串起来。
支撑这种串联的,是支付宝400万小程序、600大类服务的执行能力:长任务能打磨到什么程度,很大程度上取决于接入的服务规模。据双方透露,接下来还会继续整合资源和技术方案,覆盖更多的长任务需求。
这套“持续理解"也落进了最新的旗舰。X500系列的小V圈搜由千问多模态模型助力:通过屏幕感知自动识别画面中的重要主体,结合意图理解做精准推荐;图片问答中,还能精准提取文字——“所见即搜、圈选即得”。
如果说上面这些还是在入口和记忆上做文章,还有一种更重的做法:直接改写操作系统。
荣耀AI首席科学家黄非把Agentic OS的重点放在了任务上。9月15日,荣耀在全球开发者大会上发布MagicOS 11——行业首个实现系统级Agent Harness商用落地的手机操作系统,将模型能力与终端的感知、规划、工具调用和执行结合起来,由系统统一调度。
在圆桌上,他谈到的是一连串具体问题:系统得知道每个Agent做到了哪一步?成功了还是失败了?接下来需要什么资源?端侧受到功耗和发热限制时,一些复杂任务可以交给云端,结果再回到手机。用户关心的是最后有没有办成,系统则要把中间这些事安排好。
9月22日,阿里巴巴在云栖大会发布AI手机全栈解决方案Qwen Intelligence时披露:9月28日发布的荣耀Magic9系列,将成为首批搭载该方案的正式机型,荣耀Robot Phone同步支持。
双方以Qwen Intelligence和荣耀MagicOS为基础,共同打造了面向下一代AI手机的垂域模型和解决方案。基于这套方案,综合任务准确率达到91.8%,GUI操作耗时3.6秒,复杂长程任务可实现100步以上的连续操作,端到端服务闭环率超过90%。
系统搭起来了,但这只是地基。考验系统成色的,不是单条指令,而是那些会跨应用、会被打断、还可能临时改变要求的长任务。
100步以上的长程任务,数字好看,做到极难。阿里的MobileWorld等开源评测给出了另一组数据:平均27.8步的长程任务里,超过60%需要跨App协作,受测领先模型的成功率只有51.7%,端到端模型最高20.9%,换到全新挑战任务上,主流Agent的准确率几乎归零。
这些评测与具体产品方案的测试口径不同,数字不能直接比较。圆桌讨论更关心的是实际执行时会发生什么:任务中断后是重试、回退,还是重新规划?这些都得有安排。
这也解释了Qwen Intelligence的设计:用许主洪自己的比喻,模型是发动机,Harness是驾驶决策系统,OS是交通规则和基础设施——三者协同,通用智能才能变成手机上“可执行的智能"。
Qwen Intelligence把工作拆成了规划、执行和影像创作三个部分。
Mobile Planner Agent定位“大脑”,负责理解模糊目标、拆解成可执行的步骤、编排工具并动态调整。
计划做好之后,Mobile-Use Agent负责实际操作:有API接口就优先调用,没有接口时,再通过GUI操作应用界面。前者能提高执行效率,后者让一些尚未开放接口的应用也能被调用。
Mobile Creative Agent则管的是影像创作。针对手机场景深度优化的轻量模型,把口语化表达翻译成清晰指令,覆盖拍照修图这类高频任务。
模型层以千问为底座,针对手机场景深度优化和后训练;平台层支持厂商定制模型和Harness,按需接入、可定制运营。手机厂商则负责系统整合、场景定义和差异化体验。
任务每往前多跑一步,对底层硬件能力的要求也会不断提升。高通曾测算:对话式AI单次任务约1万词元,推理式约10万,智能体可达百万级;2026到2030年,全球Token需求将增长约40倍。面对如此大规模的AI计算需求,需要充分发挥终端侧计算的作用,通过云端与终端协同来承载不断增长的AI工作负载。
高通公司全球副总裁、中国区研发负责人徐晧谈到了两个要求:Agent要实时在线,需要极低功耗的传感器中枢24小时待命;要处理长任务,还需要建立更加高效的长期记忆机制,能够有选择地保留和压缩关键信息,并为私密信息保留端侧存储的选择。
当操作系统调度的是持续执行的Agent,芯片平台也需要知道任务处在哪个阶段、需要多快响应。操作系统与芯片之间的协同,将成为下一步的关键。
家电与可穿戴:同一个Agent,不同的答案
手机之外,Agent要走向万物,绕不开家电和可穿戴。同一个“把事办完”的要求,到了这两个场景里,要解决的问题又不一样。
先看家电。智慧家庭喊了十年,大多数家庭还停留在开灯、关窗帘。家电的痛点不是单个设备不够智能,而是设备之间不互通,用户要挨个操作。现在,厂商需要把问题从“怎么控制这台电器”,转向“怎么完成这个家庭目标”。
论坛上,海尔智慧家庭 家庭智能实验室主任牛博提到,洗衣机已经替代了不少体力家务,但家里还有大量隐性的脑力劳作:谁记得明天买什么菜,谁记得滤芯该换了。
要接过这些事,设备先得理解人的状态。用户说“我累了”,得分清是环境累、身体累还是精神累。在牛博看来,模型是否最聪明,并不是唯一的选择标准;能否适合家庭任务,以及Harness如何组织执行,同样重要。据悉,海尔智慧家庭已经和阿里云在智能体基础设施(Agent Infra)层面展开了多层级的合作。
这些设备卖出去之后,智能体验还要能持续改进。阿里云智能集团云原生产品解决方案架构师宋明强介绍的AgentCore,能让多个Agent像真实企业一样组队、分工,并跟踪任务过程、评估结果、针对问题调优。
家电难在要调动一屋子设备,可穿戴的难题正相反:设备轻量、交互受限,用户要的是“更省心”。眼镜的优势在于第一视角:靠近人的视觉和听觉,才有机会及时理解用户正在经历什么、需要什么。
当然,前提是硬件先够格。雷鸟创新生态业务负责人李凌霄在论坛上介绍,现场展示的眼镜整机34克,日常续航可达48小时;如果一直开启显示,则约为6小时。在他看来,智能眼镜已经开始具备日常佩戴的条件。
复杂任务则要靠云端分担。从2024年起,雷鸟与阿里云展开全面战略合作——底层用阿里云的基础设施,语音助手接入千问,多模态能力用阿里云的套件。
在李凌霄介绍的使用场景中,AI问答不再需要掏出手机;“全天记忆”通过录音持续积累用户的上下文,生成日记和会议纪要,甚至在会议中被突然提问时给出提示。
更有意思的是眼镜和办公场景的结合。雷鸟与千问办公把交互压缩成三个动作:派活——想到任务随口说出;跟踪——任务看板实时呈现在眼前;验收——结果以卡片呈现,一句话确认。
千问办公技术专家涂发亮把这类终端Agent的要求概括为三个词:听得懂、做得完、信得过。他把办公Agent的演进画成三个阶段:从被动执行的助手,到主动建议的参谋,再到可以被长期托付的“合伙人”。
眼镜之外,魅族 AI 小方块,AI 时代全新形态终端。搭载原生 FLYME AIOS,内置智能体 Super Aicy 与 千问办公 深度协同。通过 Super Aicy 将复杂任务交由云端 千问办公 运算处理,结果同步回传设备。
TCL、安克、影石、韶音等品牌此前也已与阿里云展开合作。越来越多的硬件开始尝试借助模型与云能力,扩展原有产品的用途。
阿里云的答案:把能力做成共用底座
把手机、家电、可穿戴三条线合在一起看,阿里云的角色很清晰:把模型、平台、方案、基础设施做成共用的底座,让厂商在此基础上开发自己的产品。这套底座主要承担三件事。
首先是在硬件侧的操作系统里加入Agentic OS,把软件打通。云栖大会上发布的Qwen Intelligence,做的就是这件事,它覆盖任务规划、跨应用执行、影像创作三大场景。与之相配套的,还有对应复杂任务规划、跨应用执行、真实手机任务和安全行动能力四个维度的测试集。方案好不好,需要放到这些具体任务里检验。
第二件事是持续提升模型能力——长程任务、工具调用、多模态感知到执行,都对模型提出了更高要求。千问旗舰大模型Qwen3.8-Max在人类“零参与”的情况下,自主搭建训练流程、构造训练数据、设计实验、定位缺陷,持续迭代超过一个月,完成了33轮有效迭代。阿里还公布了下一步计划:训练5-10万亿参数规模的全新模型。这些能力,正是端侧Agent从“能对话”走向”能办事”的基础。
第三件事是让Agent稳定地跑起来。阿里云将整条技术栈按Agent的需求重新拆解装配,12条产品线、56款产品完成Skill化,Agent可以像调函数一样调用OSS、数据库等云能力。对Agentic Cloud来说,分配计算资源之外,还得为持续运行的任务提供隔离环境,管理多个Agent的分工、身份权限和记忆。
这些能力合在一起,就是阿里云为Agentic时代准备的全栈基础设施:模型+模型服务+Agentic应用+Agentic Cloud。手机厂商可以减少从零搭建模型和云侧能力的投入,聚焦系统级整合和场景定义;家电厂商可以借助现有Agent框架,聚焦设备协同和用户体验;可穿戴厂商则可以借助云侧任务规划能力,聚焦随身场景和主动交互。
结语
2024年的云栖大会上,吴泳铭说AI不会只是手机上多几个新App,而是会真正接管数字世界、改变物理世界。
今年的主论坛上,吴泳铭给出的三大基石,是AI模型、AI芯片、AI云——三者最终都要在终端汇合,变成设备能感知、能理解、能执行的能力。
两年过去,方向正在变成方案,方案正在变成产品。
对用户来说,这种变化值不值得,最终还得看它能不能少让人盯着手机、来回操作。
行业已经展示了不少“能办事”的可能性,下一步,要在每天的使用中证明它们靠得住。
五年后的手机什么样?许主洪在圆桌上的回答可以作结:「未来,整个手机都会进入Agent时代——硬件、软件、架构,都会发生非常大的变化。」
当我们再次回看历次终端换代,赢的从来不是演示最惊艳的公司,而是把新能力铺得最平、成本压得最低的生态——PC如此,智能手机如此,Agent时代大概率还是如此。
“能办事”,而且要“能把事办完”,才是Agent接下来的胜负手。
至少,九点起飞的航班,不能等到九点才叫醒用户。
