沉默将近半年,小米 MiMo 带头人公开说话了:他们在问一个问题——强化学习还能扩多远。MiMo-V2.6 还在训,不是发榜。
发帖人是罗福莉 / Fuli Luo(@_LuoFuli)。现在 building 小米大模型 @XiaomiMiMo;此前在 DeepSeek。X 粉丝约 6.9 万。推文时间约 2026-09-16 18:52 UTC,北京时间 9 月 17 日凌晨。

罗福莉 / Fuli Luo 原帖(中文译意)
三块在放大
她说,半年沉默主要花在一件事上:看强化学习还能扩到多远。眼下 MiMo-V2.6 正处在 RL 训练中。放大的是这三块——
• 算力:约每步 20 亿 token;1568 条提示 × 16 条 rollout;全异步。
• 环境和 harness:多任务智能体强化学习;一次训练里混跑多套 harness。
• 评分算力:智能体组内信用分配;奖励来自测试用例 + 量规(rubric)。
没有宣布发布日、参数量或榜单成绩。推文只确认:V2.6 正在跑 RL,细节会在接下来几周分批开源。
训练过程直接摊开看
直播页在实时流式展示这次 run:mimo.xiaomi.com/rl/。页面写着在跟踪 mimo-v2.6 系列的强化学习训练日志;about 里也写了:我们在直播大规模 RL,系列即将到来。

直播页概览:mimo.xiaomi.com/rl/
一句收获
这不是发榜,是把强化学习规模化的过程摊开给行业看——算力怎么堆、环境怎么混、评分怎么算,先让外面看见。
链接
罗福莉原帖
https://x.com/_LuoFuli/status/2100296686719610932
RL 训练直播页
https://mimo.xiaomi.com/rl/
依据 @_LuoFuli 2026-09-16 推文与 mimo.xiaomi.com/rl/ 公开页。底部「阅读原文」指向直播页。