六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1

搜狐科技 2026-09-23 18:03
六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1图1
六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1图2
图片AI处理

出品

作者|常博硕

9月22日,小米正式发布MiMo-V2.6系列,包括旗舰推理模型MiMo-V2.6-Pro和更强调效率的MiMo-V2.6-Flash,同时推出MiMo-V2.6-Pro-UltraSpeed,官方表示其在保持模型质量的前提下,输出速度最高可达到Pro版本的 20 倍。

其中,MiMo-V2.6-Pro是一款万亿参数级模型,支持文本、图像、视频和音频输入,上下文长度达到100万Token,最大输出长度为12.8万Token。它可以进行深度思考、调用工具、联网搜索,也可以处理结构化输出。Flash则是更轻量的版本,总参数约3090亿,激活参数约150亿,同样支持100万Token上下文。

六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1图3

每小时烧20万,小米要上桌

9月17日,罗福莉就在社交媒体上披露了小米MiMo-V2.6的训练细节,并随帖发布了MiMo-V2.6-Pro和MiMo-V2.6-Flash的实时训练数据看板。训练步数、Token消耗量、任务通过率、累计花费,甚至哪个节点的显卡出了故障,全都实时可查,把两款模型的训练过程做成了一场面向全网的直播。

按页面设定的费用速率计算,两轮训练合计每小时约3.08万美元,约合人民币20万。

根据小米最终公布的数据,MiMo-V2.6-Pro和MiMo-V2.6-Flash分别完成30个强化学习Step,累计约75万条轨迹,两轮训练成本分别约为262万美元和85万美元,合计347万美元,折合人民币约2328万元。

模型发布当天,罗福莉在社交媒体上发文表示,MiMo-V2.6很可能是迄今为止任何开源模型团队根据计算量进行的最大的单一RL运行。在推文中她还公开表示:“今天,它(MiMo-V2.6)是排名第一的开源模型。我强烈推荐阅读技术报告。我相信它将成为AgentRL从业者反复打开并每次都发现新内容的论文之一。在我看来,它背后的研究创新和工程挑战超过了DeepSeekR1,后者我曾部分参与。”

从模型结构本身看,小米这次并没有把全部赌注押在“更大的模型”上。

MiMo-V2.6技术报告题为《Scaling Reinforcement Learning Towards Self-Improvement》,小米团队把这项工作的核心概括为:继续扩大强化学习规模,并把它作为模型走向自我改进的一条路径。

从外部结果看,MiMo-V2.6确实完成了一次明显跃升。MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3 中获得 46.32 分,超过 Kimi K3 和 Qwen3.8 Max,与马斯克新发的Grok4.7持平,目前是全球开源模型首位。

六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1图4图片源自Artificial Analysis官网

具体到各项基准测试成绩,Pro在DeepSWE v1.1中获得71.9分,接近DeepSeek V4.1 Flash的74.2、Claude Opus 5与 GPT 6 Astra 的74.0;在Toolathlon-verified中获得76.9 分,高于GPT 5.6 Sol的 74.9。

看模型本身,Pro是一个1.02万亿参数的稀疏MoE模型,但每个Token实际激活的参数约为420亿,Flash是3090亿参数、150亿激活参数。

在底层架构上,Pro的语言骨干共有70层,其中60层采用128 Token窗口的滑动窗口注意力,10层采用全局注意力。

Pro和Flash两者都是稀疏MoE结构,通过局部注意力和少量全局注意力结合,在长上下文场景下降低计算和显存压力。

多模态部分也不是简单外挂几个模型,文字、图像、视频和音频最终进入的是同一套模型体系,而不是多个彼此独立的模型拼在一起。

在推理速度上,MiMo-V2.6继续采用多Token预测机制。官方数据来看,它加入了5层SWA结构的MTP推测解码器,每次前向过程可以提出后续多个Token,再进行并行验证。

当然,小米自己也承认,MiMo-V2.6和目前顶尖的闭源模型依然有差距。不过如果按照性价比来看,MiMo-V2.6非常能打。

搜狐科技整理了目前主流的一些大模型的API价格。

六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1图5搜狐科技制图,数据源自网络

六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1图6

“You Only RL Once”

DeepSeek R1已经证明,模型在经过足够的强化学习后,可以出现明显的推理能力跃升。但如果把问题继续往前推一步,就会遇到新的瓶颈。如果题目越来越复杂,模型需要执行越来越长的任务,训练就需要更多尝试;任务变得开放之后,过去简单的答对还是答错又开始不够用了。

MiMo-V2.6解决的就是这几个问题。小米在这次训练中同时扩大了三件事。

第一是训练本身的规模。每个RL Step使用1568个样本,每个样本可以进行16次尝试,单Step处理约27亿到37亿Token,最长上下文达到100万Token。因为不同任务的执行时间差异非常大,系统还需要让代码、通用Agent、视觉、网络安全等任务在同一轮训练中并行运行。

这看上去只是一个算力问题,但真正落地以后,很快会变成一个工程问题。

一个简单的数学任务几秒钟就能结束,一个Coding Agent可能要读完一个代码仓库、修改代码、运行测试,再根据报错重新修改,如果是一些游戏或者3D任务则可能需要更长时间。如果所有任务都按同一种节奏进入训练,快任务会不断等待慢任务,训练资源也很难被充分利用。

因此,小米在报告里花了相当大篇幅讲训练基础设施,包括异步训练、统一轨迹表示、高并发多框架Rollout,以及控制面和数据面的解耦。

第二是训练环境。MiMo-V2.6没有把强化学习限定在数学题或者代码题里,而是把代码、通用Agent、视觉和网络安全等任务混在一起训练。小米希望不同任务之间形成能力迁移,而不是让模型在一个孤立的Benchmark上取得局部提升。

第三件事是怎么给模型打分,这是这份技术报告最精华的地方。

传统强化学习最简单的一套反馈机制是二元的,通过测试就是正奖励,没通过就是负奖励。但Agent任务很容易出现另一种情况。两个程序都通过了测试,一个只改了十几行代码,解决了真正的问题;另一个虽然也通过,却十分冗长,甚至修改了任务范围之外的代码。从“通过”这个指标看,两者没有区别,但从实际工作质量看,完全不是一回事。

MiMo-V2.6因此加入了Groupwise Agentic Grading。它不再孤立评价一个答案,而是把同一道题的一组Rollout放在一起比较,让一个Agent式的评分器去判断解决方案的质量。

其中一部分工作叫Groupwise Reward Synthesis,简称GRS。它先离线从不同轨迹中提炼任务本身的评价标准,再结合测试结果给不同方案提供更细的奖励。

另一部分是Groupwise Advantage Redistribution,也就是GAR。GAR处理的是“大家都做对了以后怎么办”。

小米的做法,是把同一道题产生的多条通过轨迹放到一起比较,然后继续区分解决方案的质量,把更多正向训练信号给那些更精准、更简洁、更符合任务要求的方案。

如果奖励机制只要求“完成任务”,模型很容易找到一条看似有效、实际上并不理想的路线。技术报告中的消融实验显示,在没有GAR的情况下,模型的平均交互轮数和Token长度会快速上升,模型越来越倾向于用更长、更保守的方式完成代码任务,最终通过率的提升也会趋于停滞;加入组内质量评分以后,模型的提升可以继续维持更长时间。

也就是说,MiMo-V2.6真正扩大的一部分,并不是模型参数,而是“反馈系统”,模型可以继续生成更多答案,但只有更好的评分器,才能告诉它哪些答案值得继续学习。

按照技术报告的披露,仅评分器一项就约占MiMo-V2.6-Pro整轮RL成本的12.7%。这意味着,当强化学习进一步规模化以后,需要增加的并不仅仅是训练模型的GPU,还包括给模型做“裁判”的GPU。

报告中还分享了一些小米团队的探索,比如MiMo-V2.6在RL过程中如果继续更新Router,会出现越来越严重的专家负载倾斜:少数专家收到大量Token,大量专家逐渐“闲置”。技术报告给出的实验数据显示,20个Step之后,专家负载的变异系数从0.78上升到2.0,峰值负载从平均值的6倍上升到16倍,冷专家比例从0.5%增加到22%。研究团队随后恢复Router原始权重,负载很快恢复,模型性能并没有因此受到明显影响。于是,小米最终选择在RL阶段冻结MoE Router。

还有一个问题,是哪些任务可以一起训练。

小米这次并没有试图把所有东西塞进一轮RL。对于代码、通用Agent这类可以比较清晰地验证结果的任务,MiMo-V2.6采用MixRL,让多个任务共同进入主RL过程。但对于游戏、3D以及一些非常长、非常主观、很难自动判断对错的任务,小米选择单独训练,再用MOPD2把这些能力整合回主模型。

因此,MOPD2承担了一个“能力合并”的角色。它使用Multi-Prefix Multi-Teacher On-Policy Distillation,把不同来源的教师轨迹、SFT示范和模型自主Rollout重新组织,在关键决策位置训练模型,而不需要把整个前置过程重新生成一遍。

这也是小米首次比较明确地把MiMo-V2.6和RSI,也就是“递归自我改进”联系在一起。

另外,MiMo-V2.6公开的不只有两个模型。小米还同步开源了训练所使用的RL环境和框架,并释放了超过7000个训练环境,同时提供了一个更小的MiMo-V2.6-Distill-Qwen-9B模型,帮助研究者在更低成本下复现这套训练思路。

正如罗福莉所说,MiMo-V2.6只是开始。“在智能易于复制的时代,我们仍然选择通往自我改进和AGI的这条艰难之路。未来的大部分仍未知。但我们愿意继续投入所需的时间、计算资源和热情,一个接一个地面对棘手问题,并将它们彻底解决,直到智能跨越进入一个新范式。”

六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1图7

六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1图8

运营编辑 曹倩  审核莎莎

六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1图9
六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1图10

六天烧掉雷军2300万,小米发布新模型,罗福莉:创新和工程难度超过DeepSeek R1图14

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
小米
more
小米澎程变身移动美甲店,灵活空间设计催生新商业模式
一加16三款配色亮相|小米18Pro系列官宣搭载防窥屏
小米18Pro系列定档9.23|小米18Fold首周销量曝光
2026民营企业500强发布:华为第4、小米14
小米18 Pro系列今晚首发,标准版确认延后发布
小米SU7遭“移花接木”式造谣,官方辟谣:图是假的
开源王座易主?小米罗福莉发新模型:工程难度超DeepSeek-R1
曝iPhone Duo原计划配专属手写笔/卢伟冰:小米18 Pro会涨价/黄仁勋:AI在2030年毁灭世界概率为0%
6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官
小米智能门锁5 Max开售:AI大模型加持,UWB无感解锁成亮点
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号