大模型竞赛里,大家习惯晒榜单终点,很少有人愿意把「正在烧钱的中间过程」摊开给外人看。9月17日,小米MiMo大模型负责人罗福莉发文称,自约4月开源MiMo-v2.5后,团队近半年主要研究一件事:强化学习(RL)究竟能扩展到多远;并直接给出训练直播入口,让外界实时看到进度、Token、成本与内部指标。
小米MiMo是小米面向大模型与智能体能力的自研品牌;罗福莉此前公开加入小米并负责相关方向。此轮公开的不是最终模型下载链接,而是仍处中间阶段的RL run本身——等于把通常锁在机房里的实验仪表盘,临时变成对外窗口。
扩展与公开要点(团队公开口径):
所谓Agentic RL,白话是让模型在可调用工具、可多步行动的环境里靠奖励学策略,而不只是刷静态题库。所谓组内信用分配,白话是同一题生成多条轨迹后,不只看最终成败,还要更细致地给中间步骤打分。所谓完全异步,白话是大量采样与打分流水线尽量并行,减少「等一台机器算完再开下一批」的空转。
放在全球「继续Scaling RL」竞赛上下文里,各家都在堆更多Rollout与更难环境;真正稀缺的是可观测的过程证据。小米选择直播,等于用透明度换信任,也换外部对照压力。竞品若只有最终Arena分数、给不出训练中段曲线与故障暴露,对照会更吃力;若只有烧钱段子、缺少三维度扩展定义,也会沦为短时热搜。
产业影响上,若细节如期开源且第三方能复现关键训练配置,会强化「过程透明」作为实验室沟通新标准;若长期停在直播页、模型迟迟不发,热度会随下一则新闻切换。需要把边界读清楚:中间阶段数字会跳动;成本页不等于配方与数据全公开;直播不等于商用SLA已就绪。下一观察点是开源节奏、最终模型发布,以及非官方复现报告。