9月22日,小米发布并开源MiMo-V2.6系列,旗舰Pro版在Artificial Analysis综合智能指数中拿下46分,超过GLM-5.3、Qwen3.8 Max,登顶全球开源模型榜首,较上一代MiMo-V2.5-Pro的26分提升20分。
按小米测算,同等智能水平下其调用价格仅为海外同类模型的1/20到1/60,第三方统计显示Pro加权平均每任务成本约0.13美元,而GPT-5.6 Sol约1.99美元、Claude Opus 5.5约1.34美元,执行一万次任务小米约1300美元、Claude约13400美元、GPT约19900美元,被媒体称为新一代大模型“斩杀线”。
小米进步的关键在于强化学习:训练时一次更新包含1568个任务提示,每个提示生成16条执行轨迹,覆盖代码、工具调用、视觉与网络安全等场景,评判系统横向比较多份方案并加入对抗评估与交叉检查,把更多奖励分给更高效的方案。
代价同样惊人,这轮不到6天的强化学习合计训练成本约347万美元,平均每天超58万美元,效果外溢到未参与训练的评测(DeepSWE v1.1中Pro从58.4分提升到72.57分),小米还一并开放了技术报告、训练环境和强化学习代码。
