对话 vivo 周围:手机 AI 竞赛的下半场,是个人化智能

雷峰网 2026-09-17 15:29
对话 vivo 周围:手机 AI 竞赛的下半场,是个人化智能图1
对话 vivo 周围:手机 AI 竞赛的下半场,是个人化智能图2
截至 2028 年底,vivo 将实现端侧 MOE 模型的成熟商用 ”  

作者丨马广宇

编辑丨李雨晨
对话 vivo 周围:手机 AI 竞赛的下半场,是个人化智能图3

“当大模型能力越来越强,AI 竞赛的下半场,拼的是什么?”
9 月 16 日,2026 vivo 开发者大会开场不久,vivo 副总裁、OS 领域副总裁、vivo AI 全球研究院院长周围就抛出了一个新问题。
而对于行业来说,这个问题并非空穴来风。
过去两个月,行业关于 AI 的分歧逐渐公开化。一边是 OpenAI 等公司集体呼吁,大模型能力已经过剩,不要再内卷式开发;另一边,市场开始质疑大厂的资本开支还能不能持续。
手机行业则在另一个战场上厮杀。从去年底的豆包手机开始,“AI 智能体手机”成了每家发布会的标配话术,今年更是有不止一家厂商自称“全球首个”,关于功能趋同的质疑,也随之而来。
过去一年 vivo 海外出货规模持续突破,几个重点市场实现倍数增长,全球用户已接近 6 亿。在庞大的用户基数下,vivo是为数不多能够回答这一问题的手机厂商。
在主会场,vivo 一口气发布了原系统 7、全新蓝心小V、蓝心 30B MoE 端侧大模型、小 V Cowork,以及蓝河智能体操作系统的技术预览版,并给出了 vivo 自己的答案:个人化智能。
在 vivo 高级副总裁、首席技术官施玉坚的表述里,当手机能够感知情境、理解意图并主动行动,Smart Phone 将进化为 Agent Phone。这是 vivo 第一次在开发者大会上,把手机直接定义为 Agent。
这套组合拳的核心逻辑,是“大模型 + Harness + 智能体安全架构”。大模型是“大脑”,负责听懂、记住、办事。语音大模型升级为 BlueLM-RealTime,端侧的 BlueLM-Nano 负责实时感知和沉淀个人记忆,云端大模型负责更复杂的任务。
而 Harness 是“神经系统”,把感知、记忆、规划、执行串成一条流水线,深入原系统内核,把手机的 6000 多项原子能力变成 AI 的手和脚。
9 年时间里,这家公司在 AI 上很少有激进的态度,而如今方向的转变,也让外界有了更多期待。在发布会结束后,周围带着 vivo AI 产品总经理关岩冰、vivo AIOS 产品总监黄梓勋组织了一场小规模的沟通会。话题从 30B 模型的内存压力,一路聊到 GUI 与 MCP 的路线之争、AI 是否过剩、手机是不是端侧 AI 最好的载体,以及 Agent 手机的收费模式。
以下为周围、关岩冰、黄梓勋与雷峰网等媒体的对话内容,内容经不改变原意的编辑:

问:今年你们提出预研 30B 端侧大模型让我们非常意外,去年你们的观点还是不一定要追求端侧模型参数量的大小,是什么契机让你们转变?有没有考虑内存压力?

周围:去年我们觉得,手机上跑 3B、7B 模型对内存来说很吃力。但今年年初行业发生了变化,大模型不一定要一次加载完,每次只加载一个或几个专家模型就行了。
现在旗舰机型内存标配已经 12G,拿 3G 内存加载 MoE 模型变成了现实。我们今年对行业、技术的判断做了修正,然后快速做出了自己的 MoE 模型。

问:PC 本地部署满血版 30B 大概要 18-19G 内存,但 vivo 认为最小只需要 2G,长时间使用会不会影响体验?中端机型能不能享受到 30B 的个性化端侧?

周围:这也是我们过去大半年一直在问自己的问题。在笔记本上部署端侧模型,动辄 64G 起步,手机上不可能。
但随着 MoE 类稀疏模型出来,根据任务难度按需加载部分专家执行,激活 1-3B 参数量,动态来看可能只需要 2-4G 内存。理论上已经能做到了,所以我们自己训练了 30B MoE 模型。
今天为什么没有直接带到产品上?因为它对手机硬件有全新的挑战。
举个类似的例子,为什么今年才提液态玻璃,2024 年不提?因为 2024 年才刚好规划硬件芯片,一颗芯片 24 个月才到,今年做刚刚好。今年提 MoE,同样要 24 个月之后,对应的芯片规划才会出来。
加上我们还需要一两年把模型调校好,到 2028 年底,MoE 实现今天所谓的大模型能力在端侧上,一定会变成现实。

问:端侧模型从几年前的 1B 到今天的 30B,参数越来越大,对手机硬件提出了什么新要求?

周围:我要澄清一下。手机最珍贵的资源,一个是算力,一个是内存。
到 2028 年底,旗舰机就是 12-16G 的配置,真正留给端侧模型加载的,我认为 4G 以下是比较合理的状态。
端侧模型不会变得有多大。今天 30B 给大家的错觉是很大,其实只是把它切成了 30 块或者 100 块,调用的时候并不是全部加载。

问:在 vivo 开发者大会上讲到的 6000 个原子能力具体指什么?MCP 还是多 Agent 都算?

黄梓勋:目前绝大多数来自系统应用本身。原子化能力可以理解为应用本身提供多少功能,每个功能直接原子化出来,比如笔记的写入、笔记的格式化转换。
我们为什么坚定做原子化能力?因为未来用户复杂任务完全由 AI 进行意图理解和任务编排,编排的过程,包含对本地功能子集的重新组合。
三方的部分会更灵活。有的头部办公应用倾向用 MCP,有的头部办公类 Agent 倾向用 COI 或者 A2A,我们对格式没有强限制,怎么对 Agent 的工作更友好就怎么来。

问:有没有考虑开放 GUI 的操作能力?去年周总还在聊隐私方面的限制,今年很多厂商同时支持 MCP 和 GUI 两种路线。

黄梓勋:我们内部认为,长远来看是弱界面化、弱交互化的,目前的 GUI 技术非常短期。如果不采用 GUI,我们仍然有其他更高效的技术手段,这也是安全性的一部分。
过去探索的过程中,我们也在跟头部互联网厂商沟通,听他们对 GUI 方式的接纳程度。所以今天我们在选择上,弱化了很多 GUI 的部分。
周围:大家用 PC 上的 Harness 会发现,即使在 PC 上,除了浏览器之外,很多私有应用对 GUI 的支持也非常弱。回到手机上差不多,不需要那么执着于给三方应用做 GUI 支持。
我们打开标准的 PC Harness 依赖,接近 3 万个技能和接口的支持,这是蓝河上已经做到的规模。未来想在端侧完美运行各种 Harness,基本上就要支持到这个数量级。
但做到之后,也不意味着手机就要把 GUI 支持得很好。去年 12 月之前,我们要让日历支持 GUI,得加一个“加日历”的功能,再加一个“删日历”的功能。
今年不一样了。日历模块本身会感知事件信息,这里有个需求,它自己就生成了一个日历待办。2026 年之后,对 GUI 的支持是应用自己的事,愿意支持就支持,这已经不是一个话题了。

问:三年前蓝心大模型发布时,提到云端最多做到 1750 亿参数,今年云端的重点变成了 Harness 和引擎,参数量也没怎么提。是不是手机厂商认为,云端的价值已经不在模型本身,而在调度和执行上?

周围:确实,2025 年和 2024 年对大模型的认知完全不一样,整个生态的语言体系都不一样。
2024 年,70B 就是云端的主流模型,175B 是顶层模型,那就是行业天花板。但到了今年 5 月到 8 月这三个月,大家对模型的判断来来回回反复了好几遍。
我们为什么要做本机模型的 MoE 版本?因为随着蒸馏技术的演进,可能 3B 的模型都已经能做很多事情了。一年前的 3B、今年的 3B、三年后的 3B,不是同一个东西。
以发展的眼光看,三年后的 3B 在很多方面能赶上今天的 70B。今天的 30B 到两年后,可能每一个专家模型都相当于去年 70B 的能力。这是行业发展的状态。

问:上午展示了相册随手清、即问即答这些很痛点的功能。系统级 AI 创新,怎么和 vivo 的四条技术长赛道结合?AI 怎么做得和其他厂商不一样?

黄梓勋:我们内部已经开始划分,哪些应用要在未来长期发展里深度融合 AI。
未来的趋势是,界面元素越来越少,交互方式越来越简单,能力越来越强,甚至越来越弱化对界面的需要。随着系统的 Agent 越来越强,有些应用会慢慢淡化出视野。
今天展示的,是那些未来长期仍然存在、但存在大量痛点的场景,我们尝试用 AI 融合的方式解决。比如清理相册。用户触发功能之前,本地端侧模型已经对内容做了理解,AI 会基于场景做出判断,把最后一步留给用户确认。

问:具体差异在哪?

黄梓勋:我们在行业里算是比较坚定用端侧模型做这块处理的。
过去是用户触发功能,数据上云,AI 处理完再返回结果。现在是 AI 走在人前面,用户见到这个场景的时候,AI 已经把该做的做完了,剩下的只是确认。
如果这件事用云模型做,意味着用户还没启动功能,所有数据就上云了,隐私问题更多,效果也不一定好。
周围:在 AI 的层面上,vivo 是行业第一家把端侧模型用在手机上的,去年就已经用了 18 个模块,其中包含相册。
现在大家的相册都是 100G 起,放在服务器上跑都要跑半天,为什么手机可以瞬间完成“找一张国庆节带小孩在海边的照片”?
因为端侧模型已经在后台默默帮你把这些照片感知了一遍,把特征记住了。我们在后台给每个人做了个人化的存储空间,等你在相册里调用的时候,支撑早就在那里了。
以前做不到,因为要把照片丢到云端识别。现在端侧模型在后面默默做,隐私安全也有保障。

问:个人化智能强调主动理解和主动执行,但主动和打扰的界限很模糊,也很主观。vivo 怎么定义系统级 AI 的主动边界?有没有衡量标准?

关岩冰:这是行业级的难题。
第一,每个用户的需求场景和对好服务的尺度不同,这就是我们提个人化智能的原因。只有不同用户的主动服务内容、服务策略不一样,才能真正解决这件事。
第二,在当前阶段,我们会更克制地做过于主动的服务。
比如每天给你一份日程或待办建议,前期会更克制地发。当用户的阅读、保存、导入日历这些正向行为逐步增多,我们会基于个人行为习惯,增加主动服务的深度和广度。背后有一套评价用户行为正向或负向的体验标准。这个问题,我们还在探索。

问:最近关于 AI 有两个分歧。一是 OpenAI 等公司呼吁大模型能力已经过剩,不要内卷开发;二是大家质疑大厂资本开支能否持续。在你们看来,现在的大模型到底够不够用,过不过剩?

周围:AI 分三层。
第一层是往上的通用人工智能,目前是巨头在竞赛。而且我认为还有一项工作还没有开始,就是自我进化、自我迭代、自我训练,这部分大家才刚刚开始。所谓大模型训练已经结束,是不成立的,新的征程才刚刚开始。
第二,今天的大模型可以供我们做生产力使用。从今年 7 月份之后,绝大多数的生产力场景已经够用了。真正限制你的是想象力,Harness 跟不上梦想的翅膀,所以中间这一段,整个行业都在努力。
第三,移动端是数字世界很重要的组成部分。在很长一段时间里,大家还是用 PC 做生产力变现,特别是 2B 场景。
但手机是贴身跟随我们的设备。脱离了 PC,你还是要看 Agent 的任务和生产是否正常,这就是我们为什么做 Cowork。

问:小V Cowork 这个方向,互联网厂商也在发力,vivo 作为手机厂商切入,怎么和它们配合?

关岩冰:AI 在过去两年最火、应用最广泛、完成商业化变现场景最深入的,就是生产力和办公场景。
但我们的定位不同。如果你的生产力在 PC 上,人离开工位、出差旅行,总要带手机。我们的产品定位,是在手机上遥控你工位上或家里 PC 的 Agent,是一个遥控面板。
基于这个定位,未来会往更随身的方向发展。大家用各种 Agent 的时候都有一个痛点,要反复输入自己的背景信息和个人介绍。
而个人上下文最全的地方在手机上。未来 Cowork 会基于手机本地的 Harness,提供更丰富的个人上下文,让你更好地使用 PC 上的 Agent。这是我们的差异化。

问:端侧 AI 真正要爆发,缺什么?缺大模型、通信算力,还是应用爆发?手机是不是端侧 AI 最好的载体?

周围:我们本质上是在讨论,PC 的端侧化和服务器的云侧化之后,能力要不要下到手机。今天看到的行业趋势是一定会下来,至于能覆盖多少场景,要看行业发展,这个行业发展实在太快了。
今天我能看到的是,MoE 是很好的解决方案。定制芯片现在成本很高,但算力没有问题,有一部分人愿意花高价做随身的纯端侧算力中心和生产力中心,没有问题,但这个人群和市场相对较小。这是暂时的观点。

问:AI 功能对算力和成本的要求越来越高,有的厂商已经开始用订阅制。vivo 对 Agent 手机的收费模式有没有思考?

关岩冰:当下的思考是,我们发布的产品还是会面向用户提供免费的功能。
但一部分用户如果想非常深度、非常大流量地使用,我们会提供额外付费扩大流量包的机制,保持探索。相信未来几个月,整个行业都会有类似机制出来。
但面对普通大众用户,还是会提供比较可用的免费空间。

问:2024 年你们提出手机智能体,2025 年这个东西为什么没有大规模走向 C 端?

周围:手机智能体不是没有走向 C 端,而是内化到了很多场景里。比如大家点咖啡点了 3 年了,手机智能体还是立了功的。
一两年前,这个能力看起来是一个方向,做着做着发现,一是比以前成熟了,二是行业对这件事有争论。我们的态度是搁置争议,让生态自然生长和成熟。
黄梓勋:这两年可能没再讲这个词,但思路没有变。
过去是应用级的单点智能,靠用户语音触发。现在是系统级的个人化智能,把能力直接内化到底层,由底层实时理解,提前做本地内容理解和意图预判,在可控的场景、获得授权的情况下代替用户执行。
我们也做了取舍,区分哪些任务由 AI 做,哪些必须留给用户。但几年前提出的手机智能体理念,没有变。

问:今天 vivo 发了自研蓝心 30B 端侧大模型,业界也有很多优秀的开源模型,vivo 怎么看待自研和开源之间的选择?

周围:今天哪怕是万亿级模型,随着预训练门槛降低,只要有算力就可以把模型做到位。对我们帮助最大的是蒸馏,蒸馏只是一个方法。
真正让我们有信心、觉得值得投入的,是在这个方向上看到了用户的痛点。
以后用大模型,一定会说“帮我调亮度”“晕车的时候怎么办”,它帮你把防晕车功能打开。这种能力,一定是手机厂商基于大量自我了解和数据积累训练出来的。
我们选择端侧,除了数据,还有一个很大的优势,我们是指令集级别做 GPU 优化的。现在做模型训练的厂商做不了端侧,要么功耗大,要么内存要求高。只有终端厂商和芯片厂商合作,才能把端侧做好。
我相信三五年之内,只有终端厂商在这个方向上做自己的模型端侧化,体验才是最好的。这是我们坚持投入的原因。

问:今年厂商都在提 Harness,昨天也有厂商说自己的系统首个真正实现 Agent Harness。vivo 的特色和差异是什么?

周围:这个问题,和我们为什么做无障碍、为什么只有 vivo 把影像做到今天这个位置,其实是同一个问题。
在我们的哲学里,这就是用户导向和场景导向的问题。如果这件事对用户最重要,哪怕所有人都去做,我们不是要做得比别人好,是一定要让用户在场景里最满意。
产品的竞争力不在于和友商比,而在于是不是真正理解了用户的痛点和场景。
为什么那么多视障用户用 vivo 的手机,独立出行、独立生活、化妆、挑衣服、参加演唱会?核心就是我们的团队认为,为这样的人群做事,一定要做出让用户偏爱的、不一样的、好很多的产品。
如果大家都做 Harness,为什么 vivo 还要做?大家可以看一下 vivo 的影像和行业的区别,大概也能猜到,两三年后,同样是 AI 智能手机,我们的领先在哪。
很难用几句话说出我们在哪里做得很好。但一定时间之后,大家会觉得,这是让我满意的手机。

问:你想象中个人化智能的终局是什么?

周围:我们都说,做一个产品,最后一定是为某个人、某个场景做的。就像我们为无障碍人群持续做,盲人、聋人都会以我们的手机为主出行和生活。同样,我们为办公人群、出行人群做事,场景一定要做得让人满意。
一个专业做攻略的助手,做不出让你真正满意的出行攻略,因为它不了解你,不了解你的家庭关系、社会关系和行为偏好。而我们可以很懂你,比你更懂你。
等蓝心小 V 给你做出一份超过所有家庭成员预期的攻略,从那一刻开始,你就会意识到,你不只是用它做攻略,你也会让它帮忙做生活和工作里力所能及的各种各样的事。
我们的画面感是,未来有个人智能的手机,是你专属的个人助理。这是我们的愿景。
本文作者长期关注智能硬件及终端,对终端渠道、业内动态感兴趣的行业人士,欢迎添加作者微信(ByArsT)交流。对话 vivo 周围:手机 AI 竞赛的下半场,是个人化智能图4
对话 vivo 周围:手机 AI 竞赛的下半场,是个人化智能图5


推荐阅读

2026-09-10

2026-07-22

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI vivo
more
vivo发布OriginOS 7:主打六年持久流畅与AI深度整合,10月9日开启首批升级
vivo OPPO搭载!2nm天玑9600 Pro正式登场
vivo X500 Pro Max影像揭秘:防抖与动态范围的双重突破
天玑9600 Pro跑分曝光,vivo X500 Pro Max预计搭载
vivo X500 Pro系列官宣:首发天玑9600Pro 2nm旗舰芯片
vivo X500系列定档9月21日,剑指“动态影像唯一解”
vivo OriginOS 7正式发布,全新蓝心小V Pro 模式
vivo OriginOS 7再剧透,9月16日见
vivo X500标准版影像规格曝光:双Pro级配置下放,本月正式亮相
九月手机圈“神仙打架”,vivo X500系列押注视频唯一性
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号