就在刚刚,小米正式发布并开源 MiMo-V2.6 系列模型。
此次发布包含两款原生全模态模型。MiMo-V2.6-Pro 面向复杂编程、Agent 和专业任务,MiMo-V2.6-Flash 更强调性能、效率与成本之间的平衡。
小米还同步推出 MiMo-V2.6-Pro-UltraSpeed,官方称其在保持模型质量的前提下,输出速度最高可达到 Pro 版本的 20 倍。
而除了版本更新,APPSO 之前也报道过,小米把一场持续近六天、合计花费约 347 万美元的强化学习训练公开到了网上。
从训练进度、成本变化到任务通过率,外界可以近乎实时地观察两个模型如何在 30 个 RL step 中逐渐提升能力。小米将它视为探索 RSI,也就是递归自我改进路线的一次重要尝试。
MiMo V2.6 登场,国产开源模型迎来新标杆
官方公布的结果显示,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3 中获得 46.32 分,超过 Kimi K3 和 Qwen3.8 Max。
小米据此称其为当前该榜单得分最高的开源模型,同时表示 V2.6 沿用了 V2.5 的 API 价格,希望用相同成本提供更高的智能水平。
具体到各项基准测试成绩,Pro 在 DeepSWE v1.1 中获得 71.9 分,接近 DeepSeek V4.1 Flash 的 74.2、Claude Opus 5 与 GPT 6 Astra 的 74.0;在 Toolathlon-verified 中获得 76.9 分,高于 GPT 5.6 Sol 的 74.9;
在 Automation Bench v1.0.6 中获得 53.1 分,略低于 DeepSeek V4.1 Flash 的 54.8,高于 GPT 6 Astra 的 52.0;面向真实职业任务的 JobBench 得分为 62.0,仅次于 Claude Opus 5 的 65.7。
网页与可视化界面生成,也是此次更新的重点。
在小米自建的 MiMo Visual Coding 评测中,Pro 和 Flash 分别获得 72.3 分和 71.5 分,高于 DeepSeek V4.1 Flash 和 Claude Opus 5,但与 GPT 6 Astra 的 82.2 分仍有差距。
当然,整体来看,MiMo-V2.6 尚未在所有能力上追平闭源前沿模型。
Pro 在 Terminal Bench 4.0 中获得 34.9 分,与 GPT 6 Astra 的 59.6、Claude Fable 5.1 的 55.1 仍有明显差距,在多项网络安全评测中也整体落后于头部闭源模型。
不过,对开源模型而言,46.32 分的综合成绩与便宜大碗的 API 价格放在一起,可能比个别榜单上的名次更有现实意义。
六天烧掉 347 万美元,小米豪赌 RL
MiMo-V2.6 背后的训练过程,可能比最终分数更能说明小米想做什么。
APPSO 也第一时间查阅了 MiMo-V2.6 的技术报告:MiMo-V2.6-Flash 和 Pro 分别完成 30 个强化学习 step,各自产生约 75 万条训练轨迹,成本分别约为 85 万美元和 262 万美元。
两个模型的平均任务通过率相对提升约 25% 和 12%,在没有参与训练的长程软件工程评测 DeepSWE v1.1 上,Flash 从 48.8 分提高到 65.68 分,Pro 从 58.4 分提高到 72.57 分。
多个项目在训练后半程仍保持增长。小米据此判断,大规模 RL 仍有较高的样本效率,而且收益能够扩展到训练分布之外,模型学到了一定的通用长程执行能力。
训练规模也远超常见的后训练实验。
每个 step 包含 1568 个 prompt,每个 prompt 同时生成 16 条候选轨迹,相当于一次处理约 2.5 万条长序列和 27 亿至 37 亿训练 token,最长上下文达到 100 万 token。
任务覆盖编程、通用 Agent、视觉和网络安全,并混合多个运行环境;评分系统则对同一问题下的多条轨迹进行比较,为长链路任务提供更细致的奖励信号,引导模型减少无效步骤和 token 消耗。
大规模 RL 也容易出现训练漂移和奖励投机。
模型可能寻找评分规则的漏洞,表面拿到高分,实际没有完成任务。小米在训练期间固定 MoE 路由器,并通过奖励设计、对抗评测、异常检测和多个验证器交叉核验提高稳定性,同时统一不同 Agent 框架产生的轨迹格式,让多类任务进入同一套训练系统。
技术报告





