小米MiMo团队负责人罗福莉在社交平台宣布,团队正在对MiMo-V2.6模型进行大规模强化学习训练,并首次公开了实时训练监控页面。这一举动打破了行业对模型训练过程的保密传统,让外界得以观察强化学习技术在实际应用中的动态发展。
根据公开的训练面板数据,MiMo-V2.6同时推进两个版本的开发:Pro版已进入第12训练阶段,累计消耗251亿Token,训练成本达80.6万美元;Flash版则处于第17阶段,消耗405亿Token,成本约35.4万美元。两个版本的总训练支出已超过116万美元,平均每小时计算成本达3.09万美元。
训练系统采用三项创新技术:在计算规模上,单个训练步骤处理约20亿Token,通过1568个提示词与16次并行推演的异步训练架构,理论上可产生2.5万次模型尝试。这种设计使AI能同时探索多种解决方案,再根据奖励反馈筛选最优路径。训练环境方面,团队构建了包含视觉、代码、通用任务和对话的多领域混合训练场,涵盖GTA视觉数据集、代码生成任务等12类场景,推动模型适应不同Agent应用需求。
评判系统引入智能体组内贡献归因机制,结合测试用例与评分细则进行奖励分配。面对复杂任务的多步骤执行轨迹,该系统能精准识别各环节的贡献值,帮助模型优化任务策略。训练数据显示,Pro版的平均奖励值从0.55提升至0.582,Flash版从0.52升至0.570,呈现持续优化趋势。
实时监控面板还展示了模型能力的发展轨迹。在软件工程能力测试中,Pro版在DeepSWE v1.1基准测试中取得63.72分,Flash版获60.77分。更引人注目的是上下文处理能力的突破:Pro版平均上下文长度接近10万Token,Flash版也达到同等规模。这种长上下文记忆能力使模型能持续追踪操作步骤、工具反馈和任务状态,为完成复杂工作奠定基础。
与传统大模型发布模式不同,小米选择公开训练过程而非最终成果。这种透明化策略使外界能持续观察计算投入与能力提升的关联性、执行长度对任务效果的影响,以及环境多样性如何塑造模型适应力。随着训练推进,强化学习技术的扩展边界、复杂任务执行效率等关键问题,将通过实时数据得到更直观的验证。









