【科技纵览】就在数小时前,小米MiMo团队负责人罗福莉通过X平台披露了该团队近半年的核心研究进展。她指出,团队始终致力于探究强化学习(RL)的扩展边界。目前,MiMo-V2.6模型正处于关键的RL训练阶段,团队正从计算资源、训练环境与任务体系、以及奖励评估机制三个维度同步扩大规模。未来几周内,更多技术细节将陆续对外公布。与此同时,罗福莉还分享了一个实时训练监控页面,这是外界首次得以窥见该代模型在强化学习阶段的真实状态。
从公开的监控面板来看,MiMo-V2.6正在进行一场大规模的Agent强化学习实验。页面直观展示了训练进度、Token消耗量、累计成本、样本数量及多项内部指标的变化轨迹。当前参与训练的有两个版本:MiMo-V2.6-Pro与MiMo-V2.6-Flash。数据显示,Pro版本处于第12步训练阶段,累计处理约30.1万个样本,耗费约80.6万美元,消耗Token达251亿;Flash版本则推进至第17步,累计样本约42.6万个,成本约35.4万美元,Token消耗量为405亿。两个版本的总训练投入已突破116万美元,平均每小时算力成本高达3.09万美元(约合人民币20.72万元)。尽管成本高昂,但此次公开的核心意图并非展示开销,而是揭示模型如何通过海量任务交互实现能力跃迁。
罗福莉强调,本轮训练的首要突破在于计算规模的扩张。团队将单个训练步骤的规模提升至约20亿Tokens,并采用“1568个提示词×16次 rollout”的配置,结合完全异步(fully async)训练模式。据此推算,单步训练理论上可产生约2.5万次模型尝试。这种机制允许AI在面对单一任务时,不再局限于生成唯一答案,而是并行探索多种解决路径,再依据奖励反馈筛选最优策略。对于需承担编程、办公辅助等复杂任务的Agent模型而言,这种大规模探索能力至关重要。传统大模型依赖预训练知识储备与监督微调,而强化学习则让模型在反复试错中形成更高效的任务执行逻辑。
其次,训练环境的多样性得到显著增强。团队引入了多任务智能体强化学习(multi-task agentic RL),将视觉、代码、通用任务及聊天等多种环境混合纳入同一训练流程。监控页面显示,数据集涵盖visual/dataset-jz3d、visual/dataset-gtaV等视觉领域,code/dataset-4qn等代码任务,以及general和chat类数据。这表明MiMo-V2.6旨在同时适应多元化的Agent应用场景,而非仅优化单一能力。
第三个关键方向是评判系统的精细化。团队引入了智能体组内贡献归因(agentic in-group credit assignment),并结合测试用例与评分细则提供奖励。面对包含搜索、规划、工具调用等多步骤的复杂任务,评判系统需提供具有区分度的反馈,帮助模型识别有效执行路径。从指标曲线观察,Pro版本的平均奖励已从早期的0.55升至0.582,Flash版本也从0.52提升至0.570,整体呈现波动上升趋势。
此外,训练页面还透露了模型能力的实质性变化。截至发稿,MiMo-V2.6-Pro在DeepSWE v1.1基准测试中得分63.72,Flash版本得分为60.77,显示出较强的软件工程处理能力。同时,上下文长度指标持续增长,Pro版本平均上下文长度已接近10万Token,Flash版本亦超越此规模。长上下文能力使模型能持续记忆操作步骤与工具反馈,为完成复杂工作奠定基础。值得注意的是,此次小米选择公开训练过程而非最终成绩,打破了以往大模型发布时的“黑盒”惯例。随着训练继续,计算投入与能力提升、执行长度与任务效果、环境多样性与适应能力这三组关系,将为回答“强化学习能扩展多远”提供实证依据。
小米MiMo-V2.6强化学习训练实时公开,单步探索规模达2.5万次尝试
科技区角
2026-09-17 15:32
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。