小米|罗福莉公开MiMo-V2.6强化学习训练直播,沿三维度扩展RL

PromptTree|阅读 0
2026/09/18 07:19
小米MiMo强化学习Agentic RL
9月17日小米MiMo负责人罗福莉发文并公开MiMo-V2.6强化学习训练直播页;沿计算、环境与Harness、评分算力三维度扩展RL,每步约20亿Token、1568×16 Rollout;细节称将分周开源。

大模型竞赛里,大家习惯晒榜单终点,很少有人愿意把「正在烧钱的中间过程」摊开给外人看。9月17日,小米MiMo大模型负责人罗福莉发文称,自约4月开源MiMo-v2.5后,团队近半年主要研究一件事:强化学习(RL)究竟能扩展到多远;并直接给出训练直播入口,让外界实时看到进度、Token、成本与内部指标。

小米MiMo是小米面向大模型与智能体能力的自研品牌;罗福莉此前公开加入小米并负责相关方向。此轮公开的不是最终模型下载链接,而是仍处中间阶段的RL run本身——等于把通常锁在机房里的实验仪表盘,临时变成对外窗口。

扩展与公开要点(团队公开口径):

  1. 阶段:MiMo-V2.6处于强化学习中间阶段
  2. 计算:每步约20亿Token;1568个Prompt × 16条Rollout;完全异步
  3. 环境:多任务Agentic RL,一次运行混合多种Harness(代码、通用、视觉、Chat等可同训)
  4. 评分:提升Grader算力;提出Agentic In-group Credit Assignment(组内信用分配),含测试用例与量规奖励
  5. 透明:直播页展示Pro/Flash等版本进度、消耗与故障节点;入口指向 mimo.xiaomi.com/rl
  6. 开源:称随后数周逐步开源细节
  7. 成本转述:截至17日下午,两版本累计训练成本转述超过约135万美元量级,综合约每小时3万美元上下(以直播页实时数字为准)

所谓Agentic RL,白话是让模型在可调用工具、可多步行动的环境里靠奖励学策略,而不只是刷静态题库。所谓组内信用分配,白话是同一题生成多条轨迹后,不只看最终成败,还要更细致地给中间步骤打分。所谓完全异步,白话是大量采样与打分流水线尽量并行,减少「等一台机器算完再开下一批」的空转。

放在全球「继续Scaling RL」竞赛上下文里,各家都在堆更多Rollout与更难环境;真正稀缺的是可观测的过程证据。小米选择直播,等于用透明度换信任,也换外部对照压力。竞品若只有最终Arena分数、给不出训练中段曲线与故障暴露,对照会更吃力;若只有烧钱段子、缺少三维度扩展定义,也会沦为短时热搜。

产业影响上,若细节如期开源且第三方能复现关键训练配置,会强化「过程透明」作为实验室沟通新标准;若长期停在直播页、模型迟迟不发,热度会随下一则新闻切换。需要把边界读清楚:中间阶段数字会跳动;成本页不等于配方与数据全公开;直播不等于商用SLA已就绪。下一观察点是开源节奏、最终模型发布,以及非官方复现报告。