
小米 MiMo 大模型负责人罗福莉。图片由 AI 生成
文丨晓静
编辑丨徐青阳
" 沉寂近半年后,我们一直在死磕一个问题:到底强化学习可以扩展到什么程度。"
9 月 17 日凌晨,罗福莉在社交媒体 X 上公布小米 MiMo-V2.6 的训练细节,并随帖发布了两款模型的训练数据实时看板,向用户 " 直播 "MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 的训练步数、Token 消耗、任务通过率、评测成绩和累计费用。
官方说明,数据直接来自训练日志,且模型仍在训练,新系列即将推出。
按页面设定的费用速率计算,两轮训练合计每小时约 3.08 万美元。用户既能看到成绩上涨,也能看到分数回落、训练重启,以及 GPU 显存问题。

Jina AI 创始人 Han Xiao 称赞公开训练流程的大胆与开放。" 应该把这张动图发给 CFO。"
2025 年 12 月 17 日,MiMo-V2-Flash 上线后,罗福莉专门写了一篇技术说明,讨论混合滑动窗口注意力、多 Token 预测以及多教师在线策略蒸馏。
她解释,团队选择混合滑动窗口注意力,一方面考虑长上下文推理表现,另一方面考虑缓存与现有基础设施的适配。
谈到多 Token 预测时,她特别强调这项技术对高效强化学习的潜力:加快生成,有助于减少小批量训练中长尾样本带来的 GPU 等待。
当时,罗福莉就表示,受时间限制尚未把这项优化放进那轮强化学习训练。
关于后训练,MiMo-V2-Flash 当时采用多教师在线策略蒸馏,将不同领域模型的能力整合到一个模型中。官方技术材料还介绍了大规模代码 Agent 训练环境,以及针对 MoE 训练、推理一致性的优化。
到今年 4 月,罗福莉把讨论推进到了 Agent 的运行方式与商业成本。
4 月 6 日,在一篇长帖中,罗福莉分析了第三方 Harness 的资源消耗。她认为,低价值工具调用和反复携带长上下文,会推高成本;单纯压低 Token 售价,无法解决用户花了钱却仍然完不成任务的问题,因而主张让更节省 Token 的 Harness 与更强、更高效的模型共同演进。
这也解释了小米随后对代码工具的投入。
6 月 11 日,罗福莉宣布开源 MiMo Code,并表示,模型演进需要可靠的 Harness,Harness 也需要模型能力支撑。她同时披露,最初的开发由 5 个人用 14 天完成。
从 2025 年 12 月到今年 9 月,按照时间线来看,能够一定程度的反映罗福莉的思路:先提高推理和后训练效率,再改进模型执行任务的框架,随后扩大多任务强化学习。
罗福莉披露,本轮 MiMo-V2.6 训练扩展了三个方向:计算规模、任务环境与 Harness,以及评分器的计算投入。
具体包括:每步训练约涉及 20 亿 Token,配置为 1568 个提示、每个提示 16 次尝试,采用全异步方式。按这个配置,一批包含 25088 条尝试轨迹。模型要在不同任务环境和执行框架中完成操作,再根据测试用例、评分标准等反馈进行学习。

MiMo-v2.6 系列强化学习训练看板
这些设置把训练难点从答案生成,扩展到了完整的任务过程。
例如,模型修改一段代码后,需要运行测试、读取报错、继续修改。训练系统既要支持这些操作,也要判断修改是否有效。如果环境启动失败,算力消耗可能无法换回有用的样本;如果评分方式有漏洞,模型获得的高分也可能偏离真实需求。
因此,训练成本包含大量生成、工具执行和结果验证,模型参数更新只是整个过程中的一部分。
罗福莉公开的看板中,能看到各种各样的工程问题。
页面展示环境运行数量、基础设施故障造成的样本损失,以及样本生成到进入训练之间相隔的模型版本数。在异步系统中,任务执行和模型更新并行推进,团队需要监测样本是否已经落后于当前模型。
小米还公开过一条故障通知:Pro 训练因一个节点的显存问题而重启。这真实的反映了训练效率取决于模型算法,也取决于系统运行的稳定性。
X 用户 elie(@eliebakouch)特别关注看板公开的每批数据与 Harness 构成,以及大量内部训练指标。他认为这些信息能帮助研究者观察模型究竟在什么任务上学习、训练资源怎样分配。

截至北京时间 9 月 17 日早间核查时,官方公布的 DeepSWE v1.1 代码评测结果中,Flash 从第 1 步的 48.67 升至第 12 步的 60.77;Pro 从第 1 步的 58.41 升至第 10 步的 63.72。页面标明,评测采用 mini-swe-agent,口径为 avg@3。
中间有明显波动。Flash 第 10 步达到 60.18,第 11 步降至 54.13,第 12 步又回升。Pro 前几步也多次下降。公开数据还不足以解释每次变化,但已经能看出,投入与成绩之间并非每一步都同步增长。
网友 Zain 看到看板后,兴奋地提到训练开始约一天,DeepSWE 就到了 60% 左右。这样的评论反映了开发者对提升速度的关注;后续能否维持增幅,仍要继续观察。

看板首页的训练平均通过率,需要与 DeepSWE 评测分开看。官方对 avg@n 的定义,是计算每道采样任务在多次尝试中的成功比例,再对任务取平均。任务构成、难度和基础设施故障,都可能影响这个数字。
文章和社交平台上若只截取一条上涨曲线,很容易忽略这些条件。更有价值的判断,需要比较相同评测设置下的多个检查点,并等待最终模型在真实任务中的表现。
Pro 和 Flash 同时公开训练,也让产品分工变得可观察。两轮运行采用相同的提示数量与尝试次数配置,页面设定的费用速率相差一倍。Flash 的代码成绩已有提升,Pro 在已展示的后续检查点上仍有更高分数。由于训练步数不同,现阶段不能直接得出严格的性价比排名。
但这组数据值得持续跟踪:更低成本的模型能覆盖多少复杂任务,更高成本的模型又能在哪些任务上拉开差距?答案会影响用户怎样选择模型,也会影响小米怎样定价。
罗福莉此前解释过 MiMo API 降价的逻辑,包括缓存优化、模型架构和推理系统效率。
据透露,滑动窗口注意力的分层 KV 缓存优化提高了缓存容量;混合注意力架构也降低了部分推理计算开销。
当时,罗福莉曾透露,降价后的生产推理服务接近满负荷运行,仍能基本实现收支平衡。
如果说之前的降价逻辑与技术和系统效率有关,那么这一次直播所反映的问题则是训练投入的回报。
按照小米 MiMo 官方接口设定的费用速率,每小时 30834 美元,两轮训练累计展示的费用约 115 万美元。不过,页面未完整说明硬件折旧、能源、人力等成本。这个数字可以用来观察本轮训练的投入尺度,无法代表完整的研发支出。
实际上,普通用户最终承担的成本,还包括推理调用、工具执行、失败重试和人工检查。这意味着训练阶段增加投入,只有在模型交付后提高成功率、缩短任务流程或减少人工接管,才可能转化为商业价值。
不同的产品和入口,不同的场景和用户需求都有所差异。开发者关注调用成本与稳定性,直接使用 Agent 的人更关心任务能否完成。
罗福莉历次发言反复涉及的推理效率、上下文管理、后训练和 Harness,都与这些要求有关。
某种程度上可以把小米的技术站位概括为:面向 Agent 任务建设基础模型,并同时优化模型架构、训练系统和运行框架,让能力提升具备可承担的成本。
只不过,这条路线对团队提出了双重要求。
模型要在困难任务上继续提高成功率,系统也要减少无效生成、重复调用和资源等待。更强的模型若需要过长时间或过多重试,使用价值会受到限制;便宜的服务若无法可靠完成任务,同样难以留住用户。
公开训练看板增加了小米研发过程的透明度,也让这些要求更容易被检验。
接下来值得关注的,是相同评测条件下的持续进步、Pro 与 Flash 的能力差距,以及最终 API 和 Agent 产品能否把训练收益交付给用户。
每小时 3 万美元最终换来什么,需要由模型上线后的任务完成质量和成本回答。


登录后才可以发布评论哦
打开小程序可以发布评论哦