9月22日,小米发布并开源MiMo-V2.6系列,包括旗舰模型MiMo-V2.6-Pro和高效推理模型MiMo-V2.6-Flash,同步上线桌面客户端正式版;第三方测评显示Pro综合智能指数46分,在开源权重模型中排名第一,超过Kimi K3和GLM-5.3,但距榜首GPT-6 Astra的53分仍差7分。
小米提前公开训练过程,负责人罗福莉披露本轮强化学习后训练耗时不到六天,Pro训练成本约262万美元、Flash约85万美元,合计347万美元,采用大Batch与全异步架构,支持百万级上下文,Flash在DeepSWE基准由48.8升至65.68,Pro由58.4升至72.57。
成本优势显著,Pro单任务成本0.13美元,小米称同等智能水平下价格仅为海外模型的二十分之一至六十分之一;高盛估计两版本分别基于约4000个和8000个H200等效GPU集群训练,认为强化学习瓶颈已转向工程优化。
小米同步开放蒸馏版本及配套强化学习代码,包括7000余个高质量任务环境与端到端训练框架,高盛维持“买入”评级,预计V2.6系列将巩固其在代理编码与多模态整合上的定位。
