端侧30B临界点:vivo的赌注与手机AI的下一个战场

iMobile爱科技 2026-09-18 19:54

端侧30B临界点:vivo的赌注与手机AI的下一个战场图1

当手机能跑30B参数大模型的那一刻,端侧AI的游戏规则就变了。

从"不可能"到"预研中":vivo修正了一个关键判断

2025年的VDC上,vivo副总裁、OS产品副总裁、vivo AI全球研究院院长周围的观点还是:手机端侧不一定要追求参数量的大小,3B、7B模型已经让内存很吃力了。

端侧30B临界点:vivo的赌注与手机AI的下一个战场图2

仅仅一年后,在2026年VDC的专访现场,周围给出了完全不同的答案——vivo正在预研30B端侧MoE大模型

转变的契机来自行业技术路线的分叉:大模型不一定要一次加载完,可以每次只加载一个或几个专家模型。MoE(Mixture of Experts,混合专家)稀疏架构的成熟,让"用2‑4GB内存激活1‑3B参数,却能调用30B总参数的知识容量"从理论变成了工程现实。

"去年我们觉得手机上跑3B、7B模型对于内存来说很吃力,但是在今年年初的时候,行业发生了变化。"周围说,"现在内存标配旗舰机型已经12G‑16G了,拿2‑4G内存加载MoE的模型变成了现实,基于我们去年对于这个技术的判断,今年做了修正,然后快速做出了我们自己的MoE模型。"

这不是vivo一家的判断。开源社区的进展同样惊人:BigMoeOnEdge项目已经验证了在12GB RAM手机上运行Qwen3‑30B‑A3B的可行性——模型文件比内存还大,但通过"按token从闪存按需读取专家"的流式加载方式,依然能跑出5 tok/s左右的推理速度。16GB机型的表现更好,IQ3_M量化档位下预估可达7‑10 tok/s。

技术上,30B端侧已经不是"能不能"的问题,而是"什么时候产品化"的问题。

30B塞进手机:MoE的魔法与工程的真相

原理:不是全加载,而是"按需叫专家"

要理解30B模型为什么能在手机上跑,必须先理解MoE架构的本质。

传统稠密模型(Dense Model)的每一次推理,所有参数都要参与计算。所以7B模型就需要7B参数的内存空间,30B就需要30B的空间——这是线性关系。

MoE模型不同。它把知识拆成了几十个甚至上百个"专家",每个专家负责不同的领域。每次推理一个token时,路由器(Gate)会从所有专家中选出最相关的少数几个(比如8个),其余的全部跳过。

以Qwen3‑30B‑A3B为例:总参数30B,但每次推理只激活约3B参数。 这意味着你不需要把30B全部放进内存——只要把当前需要的那几个专家读进来就行。

BigMoeOnEdge这类引擎的核心贡献在于:它们构建了一层专家流式加载系统,让模型权重主要存储在闪存(UFS)里,RAM中只保留共享权重(注意力层、嵌入层等)和一个LRU专家缓存。每次推理时,通过路由钩子实时知道当前token需要哪些专家,然后用O_DIRECT方式直接从闪存读取这些专家的张量切片。

这和传统mmap方式的区别是本质性的:mmap依赖操作系统的page cache管理,内存紧张时会剧烈抖动(thrashing),在手机上30B模型只能跑出0.089 tok/s的龟速;而显式的专家流式加载+LRU缓存直接绕过了这个问题,同样的硬件能跑到5.2 tok/s——提升了约58倍。

内存账本:16GB手机到底够不够用?

我们来算一笔账。在16GB旗舰机上,内存分配大致是这样的:

端侧30B临界点:vivo的赌注与手机AI的下一个战场图3

这就是vivo说的"2‑4GB内存就能跑30B"的由来——但要注意,这里的"2‑4GB"指的是真正参与当前计算的活跃专家+共享权重的增量部分,而不是整个模型的全部内存开销。完整运行30B MoE仍然需要大约10‑14GB的总内存空间(含系统、共享权重、缓存等),只是不需要一次性把30B全装进去。

IQ3M量化(约13‑14GB文件)的版本在16GB手机上基本可驻留,流式加载退化为缓存加速,速度最快(7‑10 tok/s)。Q4K_M量化(约18.5GB)则超出了RAM上限,必须依赖流式加载,速度约5‑7 tok/s,但"模型比内存还大却能跑"本身就是最强的技术叙事。

三座大山:能跑≠好用,工程落地的真实挑战

30B端侧在技术上可行,但距离消费者日常可用,还有相当长的路要走。vivo选择用"预研"而非"发布"来描述这个项目,正是因为清楚知道中间的工程鸿沟。

第一座冷启动太慢

当前开源方案的冷启动时间3‑4分钟以上——shared weights要从闪存读入RAM,LRU缓存要初始化,路由表要构建。如果算上prompt prefill(输入处理),一个2000 token的输入可能还要再加7‑8分钟。

 "提问→等5分钟→出答案",这样的体验显然无法作为常规功能交付给普通用户。

vivo的应对思路是系统级优化:将常用的专家模型常驻内存,利用手机空闲时间(比如夜间充电)预加载;结合Main‑Loop的感知记忆系统,预判用户可能需要的能力,提前唤醒对应专家。周围在专访中提到"专家模型常驻,内存的常驻电流不高,不消耗电,真正耗电是搬运的过程"——这说明vivo已经在考虑专家常驻的功耗模型。

更深层的优化空间在芯片级协同:2024年不提液态玻璃,2026年才提,是因为芯片规划周期是24个月。同理,MoE端侧的硬件加速——比如在NPU中增加专家路由的专用电路、优化UFS的随机读取性能——需要提前2年进入芯片规划。周围给出的时间节点是2028年底,这正好对应一代旗舰芯片的规划周期。

第二座:热降频

手机CPU持续高负载10‑15分钟后,温度撞墙,频率骤降——这是所有移动端计算都绕不开的物理规律。

骁龙8 Gen5的3DMark压力测试稳定性仅66%‑73%,意味着持续推理10分钟后CPU性能可能下降27%‑34%。对应到30B MoE推理,初始5‑7 tok/s的速度可能在热降频后掉到3‑4 tok/s。

这不是单纯靠软件能解决的问题,但手机厂商有自己的解法空间:

第三座山:Android内存回收

这可能是最"坑"的一个问题。BigMoeOnEdge项目的作者曾直言:"最难的部分不是流式加载,而是Android在生成过程中回收驻留权重。大部分工作都花在了阻止这件事上。"

MIUI等定制ROM在RAM使用率达到80%时会激进地杀掉后台进程。跑30B模型意味着内存长期处于高压状态,随时可能被系统"杀"掉。

vivo作为手机厂商,在这一点上有天然优势:

这些都是第三方开发者想做但做不到的事情——这也是为什么vivo坚持自研端侧模型,而不是直接用开源模型的根本原因之一。

为什么是手机厂商?vivo的底气与差异化

在专访中,周围反复强调一个观点:端侧模型的体验优化,只有终端厂商能做好。

端侧30B临界点:vivo的赌注与手机AI的下一个战场图4

"也许在之后就跟PC一样,大家都能把手机运行得很好,我相信在三五年之内,终端厂商有意在这个方向上做自己模型的端侧化,它的体验才会是最好的,这是我们坚持在这个方向上投入的原因。"

这句话不是自大,而是事实判断。端侧AI的竞争,到最后比拼的不是谁的模型参数大,而是谁能把模型和硬件、系统、场景拧成一根绳。

端侧的核心优势:个人上下文

vivo对端侧AI的判断,核心锚点是个人化智能。

vivo AI产品总经理关岩冰在专访中说,vivo AI的两大差异化:一是端侧Harness与OS深度融合,二是基于用户个体数据的个人专属上下文

"你用手机,你的手机本地存了相关信息或者对你自己的理解,这部分就是你使用AI的时候最宝贵的上下文,使用端侧的时候可以更加安全、可控地管理。"

周围又举了一个很具象的例子:做旅游攻略。携程的AI助手也能做,但你得告诉它"我爸70多岁了、有个小孩、老婆怀孕了"这些信息。而手机上的小V不需要——它知道你爸爸的年纪(从通讯录、照片、通话记录推断),知道你老婆怀孕了(从产检提醒、搜索记录、聊天内容感知),知道你最近在看巴音布鲁克的电影(从观影记录、讨论记录提取)。

"你可以提醒别的智能助手5条、8条、10条,但总会漏几条。"周围说,"真正能做好让你满意,超过你预期,很贴心的攻略,真的需要懂你身边的家庭关系、社会关系和个人习惯、时空。只有这样信息背景的Harness,再去调用大模型小V的时候,它才真正能作出让你满意的个人化产品。"

这就是端侧30B的真正价值——不是为了在手机上跟云端比推理更快,而是为了在保护隐私的前提下,让AI真正"懂"你。

30B参数量带来的知识厚度,是7B、3B模型无法比拟的。当你的个人记忆、偏好、关系网都存储在本地,再配上一个知识足够渊博的本地大模型,才能做出真正"比你更懂你"的个人助理。

云端 vs 端侧:不是替代,是分工

专访中有一个尖锐的问题:30B部署到手机之后,云端是完全不会介入吗?

周围的回答很干脆:"完全不会介入。"

但这指的是30B端侧模型本身的推理过程不依赖云端,而不是说手机AI从此跟云端没关系。实际上,vivo的AI战略是典型的"云‑端协同"架构:

30B端侧的意义在于,它把"云端才能做的事情"的边界又往端侧推了一大步。以前只有简单问答、图片识别能在端侧做;现在,复杂推理、深度摘要、代码生成、长文档分析这些曾经必须上云的任务,端侧也能搞定了——只是慢一点。

而"慢一点"在很多场景下根本不是问题。比如相册整理、日程规划、信息摘要,这些都是后台可以默默做的事情,用户不需要实时等待结果。端侧的价值在于"能做"和"隐私安全",而不是"秒出"。

行业拐点:30B端侧将改变什么

对云端大模型的冲击

"大模型能力过剩论"最近甚嚣尘上。OpenAI等公司呼吁不要内卷开发了,资本市场开始质疑大厂的资本开支能否持续。

周围的判断分了三层:

第一层,通用人工智能的竞赛还远没结束。 "我认为还有一项工作没有开始,就是自我进化、自我迭代、自我训练,这部分大家刚刚开始,所以所谓的AI大模型训练还没有结束,新的征程才刚刚开始。"

第二层,生产力场景的模型能力已经够用了。 "从今年7月份之后绝大多数的生产力场景已经够用了,真正限制你的是想象力,Harness跟不上梦想的翅膀。"

第三层,端侧模型的能力会快速逼近云端。 "我们认为接下来两年之后,随着蒸馏技术的演进,可能3B的模型都已经能够做很多事情了……今天的30B和两年后的专家模型,可能每一个专家模型都相当于去年70B的能力。"

如果这个判断成立,那么云端大模型的价值重心将从"模型本身"转向"调度和执行"——也就是Harness层、Agent编排层、工具调用层。这也解释了为什么今年VDC上vivo重点讲的是Harness和引擎,而不再拼参数量。

对芯片行业的倒逼

30B端侧给手机芯片提出了全新的要求,但不是"更多CPU核心"或者"更高主频"那种简单粗暴的要求。真正需要的是:

周围给出的2028年时间节点,本质上是在等下一代芯片。"今年提MoE,同样是24个月之后,对应的这些芯片规划也会出来,加上我们还有一两年的时间把这个模型调校好,所以到2028年底,MoE实现今天所谓的大模型能力在端侧上一定会变成现实。"

    
对手机厂商的重新洗牌

端侧AI正在成为手机厂商的新分水岭。

不是所有厂商都有能力自研30B MoE模型,更不是所有厂商都有能力把模型从芯片指令集层面一路优化到用户体验。这需要AI团队、OS团队、芯片合作团队的深度协同,需要持续多年的投入。

vivo的策略很清晰:端侧优先 + 个人化智能 + OS深度融合

这条路不好走,但走通了就是护城河。就像vivo的影像能力——同样的传感器,同样的ISP,出来的照片味道就是不一样。端侧AI也会是一样的道理:参数大家都能追,但体验的厚度,只能靠日复一日的场景打磨。

结语:口袋里的算力革命

2026年的今天,手机端侧30B大模型还处在"能跑但不好用"的工程验证阶段。它更像是一个临界点的信号——告诉我们端侧AI的天花板远比想象中高。

端侧30B临界点:vivo的赌注与手机AI的下一个战场图5

但真正重要的不是"30B"这个数字,而是它背后的范式转移:

从"AI是一个你去调用的功能",变成"AI是一个始终在你身边、懂你、替你思考的存在"。

这需要足够强大的端侧模型(否则不够聪明),需要绝对的隐私安全(否则不敢把个人数据交出去),需要深度的系统整合(否则AI只能站在系统外面看,而不是融入系统内部运转)。

vivo在做的,就是把这三件事揉到一起。30B端侧MoE是技术底座,个人化智能是产品理念,OS级融合是工程路径——三者结合,才有可能做出真正"不一样、好很多"的AI手机体验。

2028年底,我们再回头看。



END




往期精选推荐

端侧30B临界点:vivo的赌注与手机AI的下一个战场图6

端侧30B临界点:vivo的赌注与手机AI的下一个战场图7

端侧30B临界点:vivo的赌注与手机AI的下一个战场图8


端侧30B临界点:vivo的赌注与手机AI的下一个战场图9



关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI vivo
more
当AI开始“自己办事”,vivo蓝河操作系统走向AgentOS
荣耀Magic9ProMax绿色真机打几分?|vivoX500ProMax外观公布
vivo发布蓝心大模型矩阵,四款新品重构端云协同智能体验
vivo X500系列定档,新机外观正式公布
华为MateXT2配置曝光 | vivoX500ProMax官宣6.85英寸2K大屏
参加完 vivo 创作者盛典,我发现他们要对专业影像动手了。
vivo“橘子7”,液态了~
vivo X500 Pro Max定档9月21日,首发京东方Q11屏与蓝图光御主摄
10999起 小米18Fold发布 | vivoX500系列定档9.21发
端侧30B临界点:vivo的赌注与手机AI的下一个战场
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号