【太平洋科技快讯】据 Xiaomi Mimo 官方消息,小米 MiMo-V3 全新核心架构 HySparse2 在 HySparse 的基础上,进一步升级了 KV 共享与稀疏选择机制,让模型更高效更精准地处理长上下文。HySparse2 面向长程多轮 AGENT,更少的 Prefill 计算,更小的 KV Cache,更精准的长上下文检索。
据了解,MiMo-V2 系列采用的 Hybrid SWA 混合注意力架构,将全注意力 ( Full Attention ) 与滑动窗口注意力 ( Sliding Window Attention ) 结合,在保持模型效果的同时,让训练和推理更加高效。在持续推进 V2 系列的同时,面向 MiMo-V3 的新一代架构研究也一直在进行。
小米 MiMo 大模型负责人罗福莉日前发文表示,MiMo-V3 全新架构可降低预填充开销、缩减 KV 缓存占用、优化长上下文检索能力。
数据显示,在 100 万 Token 上下文条件下,模型预填充计算量 ( FLOPs ) 降低 5.02 倍,KV 缓存占用缩小 4.5 倍。具有更高的 MRCRv2 和 RULER-v2 分数,以及更低的 AgentPPL 和 LongPPL 。
罗福莉提到,智能体推理属于特殊的工作负载。每一轮交互过程中,简短动作指令会返回大段需要预填充处理的文本内容,上下文持续膨胀,预填充成本、KV 缓存规模以及检索准确率都会成为影响性能的关键因素。
HySparse 2 引入 KV 桥接 ( KV Bridging ) 机制,参考 YOCO 设计思路,交叉解码器的全注意力层复用自解码器的隐藏状态来构建 K/V 值。同时实现 KV 重用,在混合计算块内部,稀疏层可以复用上一层全注意力层的 KV 缓存与选择索引。
除此之外,技术层面还有两处优化:使用 Token 粒度选择替代原有块级选择;采用近期 Token 强制窗口替换独立 SWA 分支,实现本地与全局 Token 共用同一套 KV 缓存。得益于交叉解码器全部 KV 缓存均取自自解码器,预填充流程在自解码器计算完成后就可以终止。
另外,小米近期发布并开源了 Xiaomi MiMo-V2.6 系列模型,系列包含 Pro、Flash 两款原生全模态模型 ( 详情可查看此前太平洋科技的报道内容:《登顶全球开源大模型第一!小米发布并开源 MiMo-V2.6 系列》 )。官方表示该版本是探索 RSI 递归自我改进路线的重要实践,通过扩大强化学习算力规模,借助持续探索与反馈迭代模型能力边界。


粤公网安备 44010602000162号
网友评论