MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果

智东西 2026-09-24 10:11

MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图1

KV Cache占用大降78%。
作者 |  江宇
编辑 |  李水青
智东西9月24日报道,昨晚,小米MiMo大模型负责人罗福莉发文,提前披露了MiMo-V3的新架构,其核心组件HySparse2率先登场,相关技术论文同步公布。
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图2

▲罗福莉发文

简单来说,这套新架构主要解决Agent越做越多轮之后出现的三个问题:长输入算得太多、缓存占得太大,以及如何从越来越长的上下文里准确找到需要的信息。
罗福莉直接给出了一组数据:与MiMo-V2.6采用的Hybrid SWA架构相比,在100万Token上下文下,HySparse2处理长输入时所需的预填充(Prefill)计算量降至约1/5,KV Cache占用降至约1/4.5;与此同时,其长上下文检索表现进一步提升,AgentPPL和LongPPL也有所下降。
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图3

▲HySparse2在长上下文表现、Prefill计算量和KV Cache占用上的对比

HySparse2论文由小米LLM-Core团队完成,共有15位作者,罗福莉为通讯作者并标注为Team Lead。论文参考文献里还出现了不少业内熟悉的成果。
其中,DeepSeek相关成果共有4项,包括DeepSeek-V2、DeepSeek-V3.2、DeepSeek-V4和DeepSeek-V4.1-Flash;此外,OpenAI的gpt-oss模型卡以及GPT-4.1相关评测工作也在引用之列。
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图4

▲HySparse2论文引用的4项DeepSeek相关成果

值得注意的是,距离小米上一轮模型更新,才过去两天。
9月22日,小米大模型团队刚刚发布并开源新一代Xiaomi MiMo-V2.6系列,并预告后续将逐步开放MiMo-V2.6-Pro-UltraSpeed。相比MiMo-V2.6-Pro,后者在同等智力水平下输出速度提高20倍。
小米还同步开源了用于新模型训练的RL环境、框架以及模型技术报告。罗福莉当时称,MiMo-V2.6押注大规模RL扩展,进行了开源模型迄今最大规模的单次RL训练,团队将其视为探索RSI(递归自我改进)、通往AGI的新一步。
MiMo-V2.6刚刚把大规模RL摆到台前,这一次,小米把刀落到了模型底层架构上。

01.
Agent多轮任务
带来更高的长输入成本


HySparse2解决的问题,与Agent越来越典型的一种工作模式有关:模型生成的动作很短,工具返回的内容却可能很长。
例如,Agent可能只生成一句搜索指令或一次工具调用,随后搜索引擎返回一篇长文档,代码工具返回大量运行日志。模型进行下一轮推理之前,需要先把这些新增内容处理一遍。
这个过程就是Prefill,也就是预填充。
当Agent连续调用搜索、代码执行、文件读取等工具,文档、网页和运行记录会不断进入上下文。模型既要反复处理这些新增输入,还要保存越来越大的KV Cache,并在几十万甚至上百万Token的历史信息中找出当前真正需要的内容。
论文因此把长周期Agent推理面临的问题归纳为三个方面:降低Prefill计算量、减少KV Cache占用,以及提高长上下文检索准确率。
上一代HySparse已经做过一轮优化。它把全注意力层和稀疏注意力层交替排列,后面的稀疏层可以复用前一个全注意力层生成的KV Cache和选择索引,从而减少注意力计算和缓存占用。不过,在Prefill阶段,HySparse仍需要依次执行全部网络层。
到了HySparse2,小米进一步把Prefill的执行路径缩短:处理长输入时,模型跑完前半部分,就可以完成后续推理所需KV Cache的构建。

02.
两级KV共享
让模型少跑一半


实现这一点的核心,是HySparse2采用的两级KV共享。
第一层叫KV Bridging。
HySparse2把模型主体分成Self-Decoder和Cross-Decoder两部分。前者由全注意力和滑动窗口注意力组成,后者则由全注意力和稀疏注意力组成。
在Cross-Decoder中,全注意力层生成K和V时,可以直接使用Self-Decoder对应全注意力层产生的隐藏状态。这样,后半部分无需再完整处理一次此前输入的全部Token。
第二层是KV Reuse。
进入Cross-Decoder后,一个全注意力层生成的KV Cache和Token选择结果,还会继续提供给后续多个稀疏注意力层复用。两级共享叠加后,Cross-Decoder所需的KV Cache都可以根据Self-Decoder的隐藏状态构建。
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图5

▲HySparse2的两级KV共享架构

Prefill执行完Self-Decoder即可退出,无需再让后半部分完整跑过一次长输入。
HySparse2还调整了寻找长上下文信息的方式。
上一代HySparse采用Block级选择,即一次选取一整块连续Token。HySparse2则改成了Token级选择,可以直接从上下文不同位置寻找相关Token。
这种变化更适合多轮Agent任务。比如一条真正有用的信息可能藏在很早之前的一次工具返回中,Block级方案为了取出其中一个Token,还需要一并处理周围的一整块内容;Token级方案则可以直接选择需要的位置。
论文消融实验显示,在相同注意力预算下,Token级方案在RULER-v2、MRCR-v2和GraphWalks等长上下文检索与图推理测试上均取得了更高得分。
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图6

▲Token级与Block级稀疏选择效果对比

HySparse2同时取消了Cross-Decoder中单独的SWA分支,改为强制保留最近一段上下文。
论文实验中,每次固定保留最近128个Token,再从更早的上下文中选择1024个Token。近期信息和远距离信息因此能够共用同一份KV Cache,也减少了额外缓存。
以论文展示的49层模型为例,在Prefill与Decode分离部署时,Prefill节点只需要部署前25层,所需模型权重接近减半;这一阶段只需要执行一个全注意力层。

03.
长上下文和Agent任务
效果提升更明显


为了验证HySparse2,小米团队训练了一组80B-A3B MoE模型,并与上一代HySparse以及MiMo-V2系列采用的Hybrid SWA进行比较。
三组模型采用相同的数据和训练计划,仅注意力架构不同。模型首先使用约5000亿Token进行预训练,上下文长度为32K;随后又使用约1000亿Token进行轻量后训练,并将上下文长度扩展至256K。
测试结果显示,HySparse2较明显的提升集中在长上下文检索和Agent任务。
经过后训练后,相比HySparse,HySparse2在MRCR-v2和RULER-v2上的平均得分分别提高11.30和19.81个百分点;相比Hybrid SWA,则分别提高6.44和18.65个百分点。
在256K上下文下,HySparse2的RULER-v2得分达到58.45,HySparse为32.61,Hybrid SWA为35.74。
与此同时,HySparse2在论文测试的各个上下文长度下,AgentPPL和LongPPL均低于另外两种架构。
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图7

▲HySparse2在长上下文及Agent任务上的表现

计算和缓存方面的差距更加直接。
在100万Token上下文下,HySparse2的Prefill FLOPs相比HySparse降至约34%,相比MiMo-V2系列采用的Hybrid SWA降至约20%。
同一条件下,HySparse2的KV Cache占用为2.69GB,HySparse为6.72GB,Hybrid SWA达到12.09GB。换算下来,相比Hybrid SWA,HySparse2的缓存占用降至约1/4.5。
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图8

▲不同架构在长上下文下的Prefill计算量和KV Cache占用对比

在通用能力部分,小米团队给出的结论相对克制:三种架构在知识、推理和代码等能力上的整体表现大致相当,不同测试项目各有高低。
例如,HySparse2在BBH和MMLU-Pro上的成绩更高,HySparse则在DROP等项目上表现更好。
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图9

▲HySparse2与HySparse、Hybrid SWA在知识、推理、代码及长上下文任务上的表现对比

相比这些常规测试,HySparse2在RULER、NoLiMa等长上下文任务上的提升更加突出。
论文还通过消融实验验证了不同设计带来的影响。
例如,取消独立SWA分支、采用强制局部窗口后,部分数学推理和MRCR-v2成绩有所变化,但这一设计省去了额外投影参数和局部KV Cache,同时让Prefill可以在模型中途直接退出。小米团队将其视为效率和模型能力之间的一项架构取舍。

04.
结语:MiMo-V3箭在弦上
罗福莉抢先亮剑


MiMo-V2.6刚刚发布两天,罗福莉已经提前透露了MiMo-V3的一项关键架构变化。
按照论文中的设计,HySparse2通过两级KV共享,让Prefill阶段只需运行大约一半模型,同时进一步减少长上下文计算量和KV Cache占用,并在多项长上下文、Agent任务上取得更高得分。
这也让MiMo-V3的一个技术方向提前变得清晰:面对越来越长、越来越多轮的Agent任务,小米正在继续压缩模型处理长输入的计算与存储成本。
从MiMo-V2.6押注大规模RL,到MiMo-V3提前亮出新的底层架构,小米MiMo团队的模型迭代节奏还在继续加快。
接下来,HySparse2会如何落到完整的MiMo-V3上,以及这套架构最终能带来怎样的实际表现,也值得继续关注。
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图10
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图11
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图12
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图13
MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果图14

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
小米
more
小米澎程变身移动美甲店,灵活空间设计催生新商业模式
一加16三款配色亮相|小米18Pro系列官宣搭载防窥屏
小米18 Pro系列发布:纯平背屏与骁龙8至尊版首发
六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1
小米18Pro发布!全球首发第六代骁龙8至尊版
小米18 Pro定档9月23日,徕卡双2亿像素系统成最大看点
小米18 Pro系列今晚首发,标准版确认延后发布
10999 元!小米「透明探索版」,杀回来了...
早报|苹果出手限制“摇一摇”广告;小米18 Pro发布5999元起;马三三乳业回应“纯牛奶倒出来是清水”;梁文锋署名DeepSeek新论文
小米18 Pro硬件级防窥屏引热议,隐私与护眼双重升级
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号