• 李明
  • 2026年8月2
  • 125万次浏览
  • 08条评论

MiMo-V2.6才刚亮相,罗福莉就提前透露了MiMo-V3的消息。

MiMo-V3将换用全新架构,核心是HySparse2,这项设计主要应对Agent在长任务执行过程中日益沉重的输入处理负担。

Agent每次调用工具可能只生成几十个token,但搜索结果、网页内容、代码以及执行日志却可能一次性返回数万字。

模型读完这些内容后继续操作,每一轮的结果都会被纳入上下文;

随着轮次增加,模型既要消化新输入,又要保留足够的历史信息供后续查找。

因此,团队希望模型能减少处理输入的精力、降低历史数据的存储占用,同时还能从长长的记录中精准定位线索。

在总参数80B、每个token约激活3B参数的MoE模型配置下,上下文长度达到100万token时,HySparse2的预填充计算量大约是Hybrid SWA的1/5.02;

KV Cache从12.09GB减少到2.69GB,缩水约4.5倍。

节省的不仅是资源,在多轮检索测试中,它查找历史信息的表现也更出色。

预填充只需完成前半段

先来解释Agent为何会被“读材料”拖慢速度。

例如,让模型修复一个代码问题,它会先查阅文件,然后运行程序;程序返回报错后,它会继续查看相关代码,修改后再进行测试。

Agent每一步生成的指令可能很短,但工具返回的文件和日志却很长。

这些内容进入上下文后,模型必须先处理输入,建立后续生成所需的KV Cache,才能决定下一步行动。

这个处理阶段被称为预填充(Prefill)。

在多轮Agent任务中,工具返回的内容通常远长于Agent发出的指令,因此预填充成本会随着任务推进不断累积。

小米之前的HySparse已经采用了稀疏注意力,让少量全注意力层查看更完整的历史,再由后续的稀疏层复用其选中的内容和缓存。

相比让每一层都从头审视长上下文,这能节省不少注意力计算。

但长输入在预填充阶段仍需经过所有模型层。

HySparse2进一步调整了模型的层间依赖关系,使预填充可以在中途终止。

具体来说,模型被分为前后两段,前段是self-decoder,后段是cross-decoder。

前半段结合了全注意力与滑动窗口注意力,后半段结合了全注意力与稀疏注意力。

两段之间的KV Bridging只连接全注意力层:

后半段的全注意力层从前半段对应层的隐藏状态生成K和V,同时保留各自独立的投影参数。

后半段内部的KV Reuse则让稀疏层复用同一混合模块中全注意力层的KV Cache和token选择结果。

有了这座“桥”,当一批新材料进入时,预填充只需完成前段即可停止,不必让整段输入逐层跑完后段。

当模型继续生成内容时,后段仍正常参与计算。

论文标题中所说的两级KV共享,指的就是这两处设计。

仅有跨层共享还不够。

上一代设计中,稀疏层还设有一条独立的滑动窗口注意力分支;这条分支的缓存依赖于后半段逐层计算得到的隐藏状态。

如果保留它,长输入仍需进入后半段构建缓存,预填充就无法完全提前退出。

因此,HySparse2去掉了这条独立分支,改为强制将最近的token纳入稀疏选择。

局部信息仍被保留,但与远处选中的token使用同一套共享KV Cache。

这样一来,后半段所需的缓存都可以从前半段的状态构建,长输入的预填充走完self-decoder即可结束;模型随后生成token时,cross-decoder仍正常参与计算。

论文展示的模型共有49层,采用预填充与生成分开部署的方案时,预填充节点只需放置前25层和相关投影模块,所需模型内存接近减半;

在这种配置下,预填充阶段执行全注意力的也只有一层。

检索精确到单个token

减少输入计算之后,长历史中的信息能否被准确找回,取决于稀疏层如何选择内容。

上一代HySparse按“块”选择内容。

一个64-token的块中即使只有少量内容相关,整块也会占用选择预算。

论文指出,这种方式在早期预训练评估中没有表现出明显劣势,但面对跨越多轮工具调用的Agent任务,检索精度不足的问题变得突出。

因此,HySparse2将选择粒度改为单个token。

论文中的配置是挑选1024个全局token,并强制保留最近128个token。

这样既能从较早的历史中寻找分散的线索,也不会遗漏刚收到的工具结果。后续稀疏层继续复用这些选中位置及其缓存。

对于需要跨越多轮工具调用查找证据的Agent来说,有限的注意力名额究竟分配给谁,会直接影响它能否将前面的线索连接到当前任务上。

在消融实验中,保持骨干结构和注意力预算一致,仅比较按块选择与按token选择的情况下,在32k及以下的长上下文测试中,按token选择使RULER-v2提升了6.57个百分点,双线索MRCR-v2提升了8.14个百分点,GraphWalks提升了5.55个百分点。

当然,HySparse2也没有完全放弃全注意力。

团队认为,少量全注意力层既有助于维持模型能力,也能利用完整的注意力分数,帮助后面的稀疏层选出值得关注的token,这样就无需单独训练一个检索模块。

架构做了这么多改动,最终还是要看模型能否把事情做对。

小米团队使用相同的数据和训练安排,对比了HySparse2、HySparse以及Hybrid SWA三种注意力设计。

预训练后的普通知识、推理和代码项目中,HySparse2的成绩有升有降,整体与对照模型大致相当;优势主要出现在长上下文能力上。

加入Agent数据、再经过后续训练后,差距变得更加明显。

HySparse2在论文评估的各个上下文长度上,MRCR-v2和RULER-v2检索成绩均领先两个对照架构,Agent轨迹与长距离依赖相关的困惑度也更低。

在256k上下文时,HySparse2在RULER-v2上取得58.45分,上一代HySparse为32.61分,Hybrid SWA为35.74分。

按测试长度取平均,它的MRCR-v2和RULER-v2成绩比HySparse分别高出11.30和19.81个百分点。

成本方面,在100万token处,论文分析得出的预填充计算量,HySparse2比HySparse降低约2.92倍,比Hybrid SWA降低约5.02倍。

采用FP8缓存时,三者的KV Cache占用分别为2.69GB、6.72GB和12.09GB。

但5.02倍比较的是预填充计算量,而非实际响应速度;论文的长上下文能力测试评估到256k,100万token对应的是计算量与缓存分析。

MiMo-V3尚未发布,实际产品中的延迟与任务表现,还需等待模型落地后再观察。

不过,HySparse2的方向已经十分明确——

Agent执行任务时,工具会不断送回大量新内容,历史中的关键线索又不能丢失。

MiMo-V3能将论文中的改进带入多少实际任务,将是接下来更值得关注的结果。

参考链接:https://x.com/_LuoFuli/status/2102766365190901957?s=20

论文地址:https://arxiv.org/pdf/2609.26368

本文来自微信公众号“量子位”,作者:闻乐,36氪经授权发布。

开云登录入口以提供道具使用的系统化参考,帮助玩家快速解决常见问题。为核心,带来高效便捷的体验。

想了解更多以理解顺序串联休闲玩法内容,适合碎片化学习。相关内容,尽在开云登录入口。

开云登录入口围绕开云官方登录不断创新,回应用户的真实需求。