很多年后,当人们不再需要亲手打开任何 App,他们或许会回想起,手机第一次替自己作出选择的那个夏天。那时,用户仍习惯在几十个图标之间来回跳转,搜索餐厅、比较车价、筛选酒店,再逐项填写地址和付款。AI Agent 出现以后,一句话开始取代所有步骤。它理解目的,调用服务,安排顺序,只在支付等关键环节把决定权交还用户。人们当时只觉得少点了几下屏幕,还没有意识到,站在所有 App 之前的 Agent,已经开始掌握需求的解释权、服务的选择权,以及订单的分配权。图片来自 YouTube 博主 Kingmi Mobile包括在今年 7 月举行的 WAIC 2026 上,努比亚 NaviX Ultra、阶跃星辰 STEPX Neo 和荣耀 Robot Phone 集中亮相,也让 AI Agent 手机的竞争进一步升温。产品形态看似各不相同,背后对应的合作模式,大致可以分为三条路线。第一类是苹果、华为、小米等传统厂商的垂直整合路线,掌握硬件、系统、账号与生态,可自研或接入模型,AI Agent 只是既有体系的延伸。第二类是模型公司联合 ODM 从零做 Agent 手机,如 STEPX Neo。模型公司负责智能与交互,ODM 负责硬件与供应链,优势是迭代快,但需重建品牌与渠道。第三类是模型公司与手机品牌合作,将 Agent 嵌入系统。多数仍停留在基础 AI 功能层面,而豆包与努比亚更深入系统权限与交互,开始参与任务执行,甚至成为最差异化的灵魂。更详细的梳理可以回看爱范儿的文章:三条路线分别对应系统内生、从零定义与深度嵌入三种路径,但竞争的核心点依旧牢牢围绕谁能成为用户的统一入口。在此基础上,我们还可以延伸出几个关键判断。1. 手机行业第一次希望用户「少玩手机」过去十多年,移动互联网追求更多页面、更长停留和更多广告曝光。短视频依赖连续滑动,电商依赖浏览比较,搜索引擎依赖结果页点击。Agent 手机的目标正好相反。用户让 STEPX Neo 规划行程,系统可以查询日程、选择常用交通工具,再调用携程完成机酒规划。上一代豆包手机助手也曾支持在多个电商平台之间查询同一商品,再把结果交给用户确认。Agent 越好用,用户亲自点击的次数越少。未来衡量 AI 手机能力的指标,可能从每天看了多久手机,转向每天委托手机完成多少项任务。屏幕使用时间可能下降,手机在生活中的参与程度却会提高。App 也不会消失。商品、司机、酒店、支付、物流和办公能力仍然需要 App 提供。App 会逐渐从用户直接操作的软件,变成 Agent 背后的能力供应商。Agent 还可能成为新一代搜索引擎和广告位。用户要求预订餐厅时,系统往往只会给出一个结果。哪家平台先被调用,哪项服务成为默认选项,都会影响最终订单。广告可能从横幅和推荐流,转移到 Agent 的选择过程。未来的生态冲突,主要围绕两个问题展开:谁有资格调用 App 的能力。Agent 完成订单之后,平台、手机厂商和模型公司如何分配收益。但新的争议也随之出现,当 Agent 推荐某项服务时,它依据的是用户利益、历史习惯、平台合作关系,还是厂商自营业务?选择过程越不可见,平台中立性问题就越关键。2. AI 手机争夺的核心资产是权限,终点是「代表你」的资格最近发布或官宣的三套 AI 手机方案,都在强调同一件事:记忆。豆包手机助手在授权后可读取录音、联系人、相册、短信、便签和日历,也支持用户主动保存长期信息。STEPX Neo 为用户与智能体分别建立记忆域。华为将记忆融入系统级感知,小艺接入 200 余项系统感知数据并支持全天候智能感知、记忆与上下文理解,通过「小艺时光机」在用户授权下整合运动、拍照、听歌、位置与通话记录生成日常与旅行回忆。包括最近,OPPO 也加入这场竞争,启动「小布 Next 计划」,开放端侧 Multi-Agent 系统内测。经用户授权后,它可持续理解个人习惯与多场景信息,让手机从执行指令的工具,升级为理解需求的智能代理。厂商集体做记忆,并不是为了做一个更高级的备忘录。没有记忆的 AI 只能提供通用服务,而个人 Agent 至少需要三类信息:我是谁:地址、联系人、饮食偏好、作息与预算等。发生过什么:照片、录音、订单、行程、浏览记录与历史任务等。如何替我做事:不坐早班机的原因、酒店偏好、金额阈值等。前两类让 AI 认识和理解用户,第三类让 AI 学会代表用户。STEPX Neo 的智能体域,本质就是在做这件事:记住过去,与长期代办事务,是两种能力。模型可以在云端运行,Agent 可以存在于电脑、汽车或眼镜中,但手机的优势在于,它本身就是最核心的数字身份载体。手机集成账号、手机号、联系人、位置、支付、生物识别、文件与各类登录状态。豆包手机助手将 AI 键与系统鉴权结合,本质是在区分「请求」与「授权」:按键发起意图,系统确认身份。读取隐私信息、发送消息、完成交易,都必须证明 Agent 已获得机主授权。一条完整链路通常是:身份确认 → 偏好调用 → 环境感知 → 任务规划 → 服务执行 → 关键步骤确认 → 结果回写记忆。与之相伴的则是手机的角色正在变化,从单纯的工具变成个人 Agent 的身份载体、记忆容器与行动终端。但依赖也随之加深,目前更换手机品牌,主要迁移照片、通讯录、文件、聊天记录和应用。但静态数据可以复制,长期训练出的个人 Agent 难以完整迁移。AI 手机最敏感的资产,也将从用户数据本身,延伸到由数据塑造的「另一个我」。与此同时,Agent 越懂用户,也未必是好事。传统推荐系统形成的是信息茧房,但执行型 Agent 的目标是完成任务,还可能形成行动茧房。未来记忆系统需要保留一定的探索机制,也要允许用户查看和修改 Agent 对自己的判断。3. 第一批高频场景会很琐碎,但操作步骤越少,错误的影响范围越大尽管厂商发布会喜欢展示旅行规划、复杂办公和多平台购物,以及各种所谓的杀手级场景,但实际普及最快的任务,大概率是查快递、叫车、点外卖、寻找照片、设置日程、整理录音和填写重复信息。相关产品演示已经体现了这种倾向。努比亚 M153 展示点外卖、购物和修图;STEPX Neo 展示差旅规划和支付宝调用;荣耀展示从收藏的餐厅信息中找到目标,再调用滴滴前往,付款和最终决策仍然留给用户。此外,Agent 的普及速度取决于任务失败的代价。普通 App 发生错误,通常只影响当前页面。但系统级 Agent 可以读取屏幕、调用多个应用、访问个人信息并连续执行任务。一次判断错误,可能同时影响聊天、支付、文件和其他账户。尤其是国际机票、大额转账、医疗预约和工作邮件一旦出错,后果更难处理。GUI Agent 还面临一种新的攻击点。今年 7 月的一项移动 Agent 安全研究指出两类风险:屏幕感知攻击和通道滥用攻击。攻击者可在肉眼难以察觉的文字或像素中嵌入指令,诱导视觉模型执行错误操作;对五种移动 Agent 框架的测试显示,即使低权限恶意 App 也可能劫持 Agent 行为。🔗 https://arxiv.org/abs/2607.00333另一项针对移动 GUI Agent 的研究在 10 款应用、1111 个样本中测试五种视觉模型 Agent,攻击成功率达 23%–30%。恶意指令可伪装为正常内容,仅靠视觉识别难以拦截。也就是说端侧运行虽能减少数据外传,但无法解决屏幕欺骗、提示注入与权限滥用问题。因此,任务记录是否可追溯,关键步骤是否强制确认,权限能否按任务细分,是否支持即时中止与撤销,以及出现损失时的责任归属,都是厂商们亟待解决的棘手难题。4. 最先被真正改变的,可能是不会用智能手机的人现阶段,AI Agent 还很难成为消费者换机的首要理由。相比之下,价格、影像、续航和品牌依然更能左右购买决定。对熟悉智能手机的用户而言,许多 Agent 功能只是把原本的操作流程缩短几步,便利有限,惊喜也有限。但同一项能力放到老年人、视障人士和不熟悉数字产品的用户手中,价值却截然不同。「把孩子发来的地址直接设为导航终点。」「看看这个月的电费交过没有。」「找出我下周三的医院预约。」AI Agent 可以用自然语言接收需求,再代替用户识别信息、调用服务和完成流程,相当于在复杂的 App 与用户之间增加了一层「翻译」和「操作」服务。尤其考虑到过去的智能手机适老化,通常依靠大字体、简化桌面和减少功能,现在保留数字服务完整能力、具有执行能力的 AI Agent,得以发挥更大的作用。举例而言,苹果在 2026 年公布的新无障碍功能中,已经把 Apple Intelligence 接入 VoiceOver、放大器、语音控制和辅助阅读器,能够提供更详细的环境描述和自然语言导航。换言之,AI Agent 手机最有价值的用户,未必是科技爱好者。它更可能先帮助那些一直被 App 规则挡在数字生活之外的人。5. 端侧 AI 的上限,既由算力决定,也由内存决定讨论端侧 AI 时,行业最关注的指标通常是 NPU 算力。但进入 Agent 阶段后,核心问题便成了如何在有限功耗、内存和闪存下,让模型持续理解屏幕、检索个人数据并调用系统能力。 一个典型案例是,苹果在第三代 Apple Foundation Models 中保留约 30 亿参数的小模型,同时引入 200 亿参数的 AFM 3 Core Advanced,但采用稀疏架构,每次仅激活 10 亿至 40 亿参数。 模型权重放在 NAND 中,按任务加载专家模块到 DRAM;复杂推理与工具调用则交由 Private Cloud Compute 处理。🔗 https://machinelearning.apple.com/research/introducing-third-generation-of-apple-foundation-models这说明端侧模型不会无限堆参数,而是走「小模型 + 稀疏化 + 云端兜底」的路线,在性能、功耗和占用之间做平衡。整体来看,端侧模型本地负责语音、屏幕理解、检索与基础工具调用,云端负责复杂推理与长文本生成,系统逐渐演化为多模型协同架构。 而随着模型规模上升,存储压力难免同步增加,这也是内存厂商分走一大块蛋糕的重要原因之一。麦克卢汉说,媒介是人的延伸。智能手机沿着这一逻辑,逐渐成为人类感官、记忆与行动能力的外延:人负责判断,手机负责执行。AI Agent 手机则试图成为具备一定自主判断能力的「外置器官」,既能保存信息,也能理解信息;既能响应指令,也能结合用户的身份、经历与偏好,主动规划并完成行动。别看在后智能手机时代,AI 眼镜、AI 吊坠、AI 项链等硬件层出不穷,但归根结底,它们争夺的无非是,谁能成为你在数字世界中的合法代理人。对此,天然距离用户更近的 AI Agent 手机,大概仍有资格说一句:本宫不死,尔等终究是妃。我们正在招募伙伴📮 简历投递邮箱hr@ifanr.com✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)