关于 AI 手机的一些思考

APPSO 2026-07-29 17:43
关于 AI 手机的一些思考图1
很多年后,当人们不再需要亲手打开任何 App,他们或许会回想起,手机第一次替自己作出选择的那个夏天。
那时,用户仍习惯在几十个图标之间来回跳转,搜索餐厅、比较车价、筛选酒店,再逐项填写地址和付款。
关于 AI 手机的一些思考图2
AI Agent 出现以后,一句话开始取代所有步骤。它理解目的,调用服务,安排顺序,只在支付等关键环节把决定权交还用户。
人们当时只觉得少点了几下屏幕,还没有意识到,站在所有 App 之前的 Agent,已经开始掌握需求的解释权、服务的选择权,以及订单的分配权。
关于 AI 手机的一些思考图3
图片来自 YouTube 博主 Kingmi Mobile
包括在今年 7 月举行的 WAIC 2026 上,努比亚 NaviX Ultra、阶跃星辰 STEPX Neo 和荣耀 Robot Phone 集中亮相,也让 AI Agent 手机的竞争进一步升温。
产品形态看似各不相同,背后对应的合作模式,大致可以分为三条路线。

第一类是苹果、华为、小米等传统厂商的垂直整合路线,掌握硬件、系统、账号与生态,可自研或接入模型,AI Agent 只是既有体系的延伸。

第二类是模型公司联合 ODM 从零做 Agent 手机,如 STEPX Neo。模型公司负责智能与交互,ODM 负责硬件与供应链,优势是迭代快,但需重建品牌与渠道。

第三类是模型公司与手机品牌合作,将 Agent 嵌入系统。多数仍停留在基础 AI 功能层面,而豆包与努比亚更深入系统权限与交互,开始参与任务执行,甚至成为最差异化的灵魂。
更详细的梳理可以回看爱范儿的文章:
三条路线分别对应系统内生、从零定义与深度嵌入三种路径,但竞争的核心点依旧牢牢围绕谁能成为用户的统一入口。在此基础上,我们还可以延伸出几个关键判断。
1. 手机行业第一次希望用户「少玩手机」
过去十多年,移动互联网追求更多页面、更长停留和更多广告曝光。短视频依赖连续滑动,电商依赖浏览比较,搜索引擎依赖结果页点击。
Agent 手机的目标正好相反。
用户让 STEPX Neo 规划行程,系统可以查询日程、选择常用交通工具,再调用携程完成机酒规划。上一代豆包手机助手也曾支持在多个电商平台之间查询同一商品,再把结果交给用户确认。
关于 AI 手机的一些思考图4
Agent 越好用,用户亲自点击的次数越少。未来衡量 AI 手机能力的指标,可能从每天看了多久手机,转向每天委托手机完成多少项任务。屏幕使用时间可能下降,手机在生活中的参与程度却会提高。
App 也不会消失。商品、司机、酒店、支付、物流和办公能力仍然需要 App 提供。App 会逐渐从用户直接操作的软件,变成 Agent 背后的能力供应商。
Agent 还可能成为新一代搜索引擎和广告位。
用户要求预订餐厅时,系统往往只会给出一个结果。哪家平台先被调用,哪项服务成为默认选项,都会影响最终订单。广告可能从横幅和推荐流,转移到 Agent 的选择过程。
未来的生态冲突,主要围绕两个问题展开:谁有资格调用 App 的能力。Agent 完成订单之后,平台、手机厂商和模型公司如何分配收益。
但新的争议也随之出现,当 Agent 推荐某项服务时,它依据的是用户利益、历史习惯、平台合作关系,还是厂商自营业务?选择过程越不可见,平台中立性问题就越关键。
2. AI 手机争夺的核心资产是权限,终点是「代表你」的资格
最近发布或官宣的三套 AI 手机方案,都在强调同一件事:记忆。
豆包手机助手在授权后可读取录音、联系人、相册、短信、便签和日历,也支持用户主动保存长期信息。STEPX Neo 为用户与智能体分别建立记忆域。
华为将记忆融入系统级感知,小艺接入 200 余项系统感知数据并支持全天候智能感知、记忆与上下文理解,通过「小艺时光机」在用户授权下整合运动、拍照、听歌、位置与通话记录生成日常与旅行回忆。
包括最近,OPPO 也加入这场竞争,启动「小布 Next 计划」,开放端侧 Multi-Agent 系统内测。经用户授权后,它可持续理解个人习惯与多场景信息,让手机从执行指令的工具,升级为理解需求的智能代理。
关于 AI 手机的一些思考图5
厂商集体做记忆,并不是为了做一个更高级的备忘录。没有记忆的 AI 只能提供通用服务,而个人 Agent 至少需要三类信息:

我是谁:地址、联系人、饮食偏好、作息与预算等。

发生过什么:照片、录音、订单、行程、浏览记录与历史任务等。

如何替我做事:不坐早班机的原因、酒店偏好、金额阈值等。
前两类让 AI 认识和理解用户,第三类让 AI 学会代表用户。
STEPX Neo 的智能体域,本质就是在做这件事:记住过去,与长期代办事务,是两种能力。模型可以在云端运行,Agent 可以存在于电脑、汽车或眼镜中,但手机的优势在于,它本身就是最核心的数字身份载体。
关于 AI 手机的一些思考图6
手机集成账号、手机号、联系人、位置、支付、生物识别、文件与各类登录状态。豆包手机助手将 AI 键与系统鉴权结合,本质是在区分「请求」与「授权」:
按键发起意图,系统确认身份。读取隐私信息、发送消息、完成交易,都必须证明 Agent 已获得机主授权。
一条完整链路通常是:身份确认 → 偏好调用 → 环境感知 → 任务规划 → 服务执行 → 关键步骤确认 → 结果回写记忆。
与之相伴的则是手机的角色正在变化,从单纯的工具变成个人 Agent 的身份载体、记忆容器与行动终端。
关于 AI 手机的一些思考图7
但依赖也随之加深,目前更换手机品牌,主要迁移照片、通讯录、文件、聊天记录和应用。但静态数据可以复制,长期训练出的个人 Agent 难以完整迁移。
AI 手机最敏感的资产,也将从用户数据本身,延伸到由数据塑造的「另一个我」。
与此同时,Agent 越懂用户,也未必是好事。
传统推荐系统形成的是信息茧房,但执行型 Agent 的目标是完成任务,还可能形成行动茧房。未来记忆系统需要保留一定的探索机制,也要允许用户查看和修改 Agent 对自己的判断。
3. 第一批高频场景会很琐碎,但操作步骤越少,错误的影响范围越大
尽管厂商发布会喜欢展示旅行规划、复杂办公和多平台购物,以及各种所谓的杀手级场景,但实际普及最快的任务,大概率是查快递、叫车、点外卖、寻找照片、设置日程、整理录音和填写重复信息。
相关产品演示已经体现了这种倾向。
努比亚 M153 展示点外卖、购物和修图;STEPX Neo 展示差旅规划和支付宝调用;荣耀展示从收藏的餐厅信息中找到目标,再调用滴滴前往,付款和最终决策仍然留给用户。
关于 AI 手机的一些思考图8
此外,Agent 的普及速度取决于任务失败的代价。普通 App 发生错误,通常只影响当前页面。但系统级 Agent 可以读取屏幕、调用多个应用、访问个人信息并连续执行任务。
一次判断错误,可能同时影响聊天、支付、文件和其他账户。尤其是国际机票、大额转账、医疗预约和工作邮件一旦出错,后果更难处理。
GUI Agent 还面临一种新的攻击点。
今年 7 月的一项移动 Agent 安全研究指出两类风险:屏幕感知攻击和通道滥用攻击。攻击者可在肉眼难以察觉的文字或像素中嵌入指令,诱导视觉模型执行错误操作;对五种移动 Agent 框架的测试显示,即使低权限恶意 App 也可能劫持 Agent 行为。
关于 AI 手机的一些思考图9
🔗 https://arxiv.org/abs/2607.00333
另一项针对移动 GUI Agent 的研究在 10 款应用、1111 个样本中测试五种视觉模型 Agent,攻击成功率达 23%–30%。恶意指令可伪装为正常内容,仅靠视觉识别难以拦截。
也就是说端侧运行虽能减少数据外传,但无法解决屏幕欺骗、提示注入与权限滥用问题。
因此,任务记录是否可追溯,关键步骤是否强制确认,权限能否按任务细分,是否支持即时中止与撤销,以及出现损失时的责任归属,都是厂商们亟待解决的棘手难题。
4. 最先被真正改变的,可能是不会用智能手机的人
现阶段,AI Agent 还很难成为消费者换机的首要理由。相比之下,价格、影像、续航和品牌依然更能左右购买决定。
对熟悉智能手机的用户而言,许多 Agent 功能只是把原本的操作流程缩短几步,便利有限,惊喜也有限。但同一项能力放到老年人、视障人士和不熟悉数字产品的用户手中,价值却截然不同。
「把孩子发来的地址直接设为导航终点。」
「看看这个月的电费交过没有。」
「找出我下周三的医院预约。」
AI Agent 可以用自然语言接收需求,再代替用户识别信息、调用服务和完成流程,相当于在复杂的 App 与用户之间增加了一层「翻译」和「操作」服务。
尤其考虑到过去的智能手机适老化,通常依靠大字体、简化桌面和减少功能,现在保留数字服务完整能力、具有执行能力的 AI Agent,得以发挥更大的作用。
关于 AI 手机的一些思考图10
举例而言,苹果在 2026 年公布的新无障碍功能中,已经把 Apple Intelligence 接入 VoiceOver、放大器、语音控制和辅助阅读器,能够提供更详细的环境描述和自然语言导航。
换言之,AI Agent 手机最有价值的用户,未必是科技爱好者。它更可能先帮助那些一直被 App 规则挡在数字生活之外的人。
5. 端侧 AI 的上限,既由算力决定,也由内存决定
讨论端侧 AI 时,行业最关注的指标通常是 NPU 算力。
但进入 Agent 阶段后,核心问题便成了如何在有限功耗、内存和闪存下,让模型持续理解屏幕、检索个人数据并调用系统能力。 
一个典型案例是,苹果在第三代 Apple Foundation Models 中保留约 30 亿参数的小模型,同时引入 200 亿参数的 AFM 3 Core Advanced,但采用稀疏架构,每次仅激活 10 亿至 40 亿参数。 
模型权重放在 NAND 中,按任务加载专家模块到 DRAM;复杂推理与工具调用则交由 Private Cloud Compute 处理。
关于 AI 手机的一些思考图11
🔗 https://machinelearning.apple.com/research/introducing-third-generation-of-apple-foundation-models
这说明端侧模型不会无限堆参数,而是走「小模型 + 稀疏化 + 云端兜底」的路线,在性能、功耗和占用之间做平衡。
整体来看,端侧模型本地负责语音、屏幕理解、检索与基础工具调用,云端负责复杂推理与长文本生成,系统逐渐演化为多模型协同架构。 
而随着模型规模上升,存储压力难免同步增加,这也是内存厂商分走一大块蛋糕的重要原因之一。
关于 AI 手机的一些思考图12
麦克卢汉说,媒介是人的延伸。智能手机沿着这一逻辑,逐渐成为人类感官、记忆与行动能力的外延:人负责判断,手机负责执行。
AI Agent 手机则试图成为具备一定自主判断能力的「外置器官」,既能保存信息,也能理解信息;既能响应指令,也能结合用户的身份、经历与偏好,主动规划并完成行动。
别看在后智能手机时代,AI 眼镜、AI 吊坠、AI 项链等硬件层出不穷,但归根结底,它们争夺的无非是,谁能成为你在数字世界中的合法代理人。
对此,天然距离用户更近的 AI Agent 手机,大概仍有资格说一句:
本宫不死,尔等终究是妃。
我们正在招募伙伴
📮 简历投递邮箱hr@ifanr.com
✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
关于 AI 手机的一些思考图13

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
刚刚,贾扬清官宣AI新公司!
三步训练法+强化学习,vivo新框架把AI修图从“概率生成”训练成了“有审美的修图师”
集成DDR4控制器+PCIe Gen3硬核,智多晶SA5T-420加速视频与AI处理
吓到奥特曼,暂停训练GPT-6?Hugging Face公开首个AI攻击全过程
AI智能体时代来了,哪种存储器机会最大?
AIDA64 v8.35上线:提前锁定AMD Zen 6与Intel Panther Lake-R支持
刚刚,Agnes国内API节点来了!这头撸代码的AI怪兽彻底解禁
Xspark AI一篇长达37页的具身系统综述和分级,全面盘点可信赖的具身智能
Momenta上市首周破发:物理AI叙事下的估值虚火与基本面真相
AI自主入侵Hugging Face引爆硅谷焦虑,Altman罕见呼吁“踩刹车”
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号