小米MiMo大模型负责人罗福莉宣布,MiMo-V3即将采用全新架构,其核心组件HySparse 2于今日正式发布。该技术主打更少的预填充、更小的KV缓存和更出色的长上下文检索能力。
据官方数据,在100万Token长度下,HySparse 2可将预填充计算量降低5.02倍,KV缓存缩小4.5倍,同时MRCRv2和RULER-v2评分更高,AgentPPL与LongPPL更低,长文本处理效率显著提升。
罗福莉指出,智能体推理是截然不同的工作负载:每轮交互中,简短动作可能返回需预填充的长文本观察结果,上下文持续增长,使预填充成本、KV缓存大小与检索准确率同时处于关键路径上。为此,HySparse 2引入KV桥接与KV重用两项机制,前者让交叉解码器的全注意力层利用自解码器隐藏状态构建K/V,后者使稀疏层复用前层全注意力层的KV缓存和选择索引。
此外,新架构采用Token级选择替代块级选择,并以近期Token强制窗口替代独立SWA分支,让本地与全局Token共享同一KV缓存。由于交叉解码器KV缓存均来自自解码器,预填充在自解码器完成时即可停止。
值得关注的是,小米昨日刚发布并开源Xiaomi MiMo-V2.6系列,含Pro与Flash两个原生全模态模型,被视为其探索RSI路径的关键一步。
