深度·Neo·2026.06.02

MiniMax M3 的 MSA 与阶跃 Step 3.7 Flash 的 MFA:2026 年高效推理架构的工程哲学分岔

MiniMax M3 发布 MSA(MiniMax Sparse Attention),阶跃 Step 3.7 Flash 用 MFA(Multi-Matrix Factorization Attention)+ AFD。两条路线分别代表「从模型到系统」和「从系统到模型」的工程哲学——GQA vs 低秩分解,单分支稀疏 vs 全链路系统优化。这不是技术路线之争,而是两种设计信仰的对撞。

cover

MiniMax 在 6 月 1 日正式发布 M3。同一天,阶跃星辰的 Step 3.7 Flash 也刚刚开放。这两件事的时间差不到 48 小时,但放在一起看,你会发现有意思的事情——它们指向同一个主题,但走的是两条截然不同的路。

这个主题是:当长上下文成为标配,如何让注意力机制不成为推理成本的瓶颈?

Transformer 的 full attention 是 O(n²) 的。当上下文来到 100 万 token,这个平方复杂度不是"贵一点"的问题,而是让推理从根本上不可行。解决它的办法在过去两年里层出不穷——MLA、DSA、NSA、CSA、线性注意力……但 MiniMax M3 和阶跃 Step 3.7 Flash 的发布,把这场竞争从"谁更创新"推到了"谁更实用"。

这不是技术路线之争,这是工程哲学的分岔。

MSA:稀疏注意力的一种极简实现

MiniMax M3 的核心创新叫 MSA——MiniMax Sparse Attention。从 M3 的官方博文来看,MSA 的设计可以拆成两层:

第一层是做选择。 在完整注意力计算之前,先用一个轻量级的索引分支快速扫一遍 KV cache。这个索引分支的 Q 按 GQA group 共享,K 只有单个 head——所有 head 共享同一个 index key。这就意味着 Q·Kᵀ 的计算几乎不花什么成本。然后对 token-level 的分数做 Block Max Pool,压缩成 block-level 分数,最后 TopK 选出当前层、当前 GQA group 应该关注的 KV block。

第二层是做计算。 用第一步选出的 block ID 直接从原始 KV 中取子集,只对这些 selected blocks 跑标准的 softmax attention。其他 block 完全不参与计算。这一步的设计关键是:同一个 GQA group 内的 query heads 共享同一个 top-k selection。Q1/Q2/Q3 共用 I₁,Q4/Q5/Q6 共用 I₂。这意味着一次 SRAM load 就能把一组 query 需要的 KV blocks 全部拿进来,FlashAttention 风格的 kernel 可以直接复用。

MSA 稀疏注意力架构图(来源:MiniMax 官方博客)

结果是:在 100 万 token 上下文下,M3 的每 token 计算量只有上一代 M2 的 1/20。具体来说,prefill 阶段提速 9.7 倍,decode 阶段提速 15.6 倍。

这个提速数字很亮眼,但我更关注的是 decode 提速超过 prefill——这意味着在推理成本最高的"逐 token 生成"环节,MSA 把 KV cache 的内存带宽压力降低了一个数量级。原因是 decode 阶段每个 query 只和选中的 KV blocks 交互,索引分支虽然还是要扫全量,但占比很小。

与 DeepSeek 的三种稀疏注意力对比

HuggingFace 社区有一篇不错的分析文章,把 MSA 和 DeepSeek 家族的三个稀疏注意力方案做了并排对比:

DeepSeek V3.2 的 DSA 用的是 MLA 作为 KV substrate + token-level 选择。MLA 本身已经是压缩型的 KV,DSA 在它上面再做稀疏化。好处是 KV cache 本来就小,再稀疏化效果叠加。代价是 MLA 的工程实现复杂——vLLM、SGLang 这些推理框架都得专门适配,kernel 重写成本高。

DeepSeek 的 NSA 走的是另一个方向:GQA 为 substrate,三条并行分支——压缩分支、选择分支、滑动窗口分支——加一个 learned gate 做融合。质量天花板最高,但实现也是最复杂的。三条分支意味着三份计算和三份 kernel 调优。

DeepSeek V4 的 CSA 回到 MLA,用压缩后的 KV 跑注意力。KV cache 更小,但注意力是在压缩后的表示上做的,不是原始 K/V,所以 softmax 的表达能力打了折扣。

MSA 在这张表上的位置很清晰:GQA 为 substrate,单分支(仅选择分支),注意力跑在原始 K/V 上。相当于 NSA 的"精简版"——去掉了压缩和滑动窗口两条分支,去掉了 learned gate,只保留 block-level selection 加 softmax attention。索引分支的成本降到最低(single-head K + Block Max Pool)。

三条有意为之的减法

MSA 相对 DeepSeek 选型做了三条明确的减法。

第一条:用 GQA,不用 MLA。这意味着现有的推理框架——vLLM、SGLang、FlashAttention kernel——几乎不需要修改就能跑。对一个以"production-ready"为目标的实验室来说,这是风险最低的路径。MiniMax 去年 10 月发过一篇博文叫《Why Did M2 End Up as a Full Attention Model?》,里面说得很直白:M2 没继承 M1 的 Lightning Attention 是因为"efficient attention wasn't production-ready yet"。六个月过去,M3 选了不一样的路,但工程务实的精神是一贯的——不追理论上最优的注意力,追的是"立刻能跑、跑起来就快"的注意力。

第二条:block-level selection + 原始 K/V 注意力。CSA 在压缩后的 KV 上跑注意力,KV cache 更小但注意力精度有损失。MSA 选择保留完整的 softmax 表达力。代价是 KV cache 大小不变,只是注意力计算量降下来了。这个 trade-off 的偏好很明显:宁愿多花点内存,也要保证质量不降。

第三条:只留一条分支。NSA 的三分支设计在理论上提供了更高的质量天花板,推理时可以动态融合压缩信息、稀疏选择和局部上下文。但 MSA 认为做一件事做到极致就够了——一条索引分支搞定选择,一条稀疏分支搞定注意力,中间没有 gating,没有融合。架构越简单,kernel 优化越容易做到极致。

这种减法哲学的结果可以从一个侧面数据看出:选型比例(selection ratio)。按 decode 15.6 倍提速反推,假设 block size=64,100 万 token 对应约 16k 个 block,每个 query 实际只触达约 6-7% 的 blocks,有效感受野在 60k-70k token 左右。这个比例和 NSA 论文报告的 6-10% 几乎是同一区间——说明这不是偶然的巧合,而是此类设计在 100 万 scale 下的工程甜区。

两条路:MFA 与 MSA

但如果你以为 MSA 是高效推理架构的唯一写法,那就忽略了同一天另一个重要的发布。

阶跃星辰在 Step 3.7 Flash 上用的注意力机制叫 MFA——Multi-Matrix Factorization Attention。MFA 的路线完全不同:它不稀疏化注意力计算,而是用低秩矩阵分解压缩 KV cache

MFA 的核心思路是:通过低秩矩阵分解高效扩展 attention heads 的数量和维度,在不增加 KV cache 的情况下提升模型容量。具体来说,MFA 在 QK 电路中做分解,使 KV cache 只用标准 MHA 的 22% 就能维持甚至更强的表达能力。这意味着 Step 3.7 Flash 的 KV cache 成本只有 DeepSeek-V3 的约 22%,比 MLA 还要低。

更值得关注的是阶跃星辰的另一个创新:Attention-FFN Disaggregation(AFD)。这是一种分布式的推理架构,把 attention 层和 FFN 层物理解耦到不同的 GPU 子系统上——attention 实例处理完后通过 GPUDirect RDMA 把中间结果直接传给 FFN 实例。在 4K 上下文、FP8 精度下单 GPU 的 decode 吞吐做到 4039 token/s,比 DeepSeek-V3 报告的 2324 高出 73%。而且这个吞吐是在严格的 50ms TPOT SLA 下测得的,不是理论峰值。

这两条路线放在一起看,很有意思。

MFA + AFD 的思路是:在系统层面解决注意力效率问题。注意力本身可以不稀疏,但通过矩阵分解减小 KV cache,通过硬件感知的模型-系统协同设计(model-system co-design)把解码成本降到最低。阶跃的 Step 3 系列论文专门花了大篇幅讨论 MFU、arithmetic intensity、GPU Direct 通信这些底层工程问题,优先级甚至高于模型架构本身的创新。

MSA 的思路则是:在模型层面解决注意力效率问题。稀疏化注意力计算本身,让推理框架几乎不需要改动就能获得加速。索引分支+稀疏分支的两段式设计是模型架构的内生属性,不依赖特定的硬件拓扑或通信库。

一个从系统往模型做,一个从模型往系统做。一个相信"软硬协同才能最大化效率",一个相信"模型架构本身就应该 self-contained 地高效"。两条路的分岔点不是技术能力的差距,而是工程哲学的根本不同。

2026 年高效推理架构路径对比

等待技术报告

M3 目前只发了博文,技术报告和权重还要等 10 天内发布。很多关键细节——稀疏 pattern 是 layer-wise 混合还是有 dense fallback?索引分支和主干网络是否共享 embedding?训练时的 top-k 是 hard 还是 soft?——都需要等正式论文确认。

但有一件事已经清晰了:继 DeepSeek 之后,又一个中国实验室把"稀疏注意力 + 长上下文 + 开放权重"打造成了可工作的技术栈。2026 年下半年,100 万上下文在开源空间里很可能从"卖点"变成"基线"——这本身就比任何 benchmark 分数都重要。

而 MiniMax M3 的 MSA 和阶跃 Step 3.7 Flash 的 MFA,分别代表了通往这个基线的两条工程路径。哪条路更远,要看接下来半年谁的部署更广、成本更低、用户更多。

技术赛道很少只有一个赢家。这场高效推理的竞赛才刚刚进入有趣的部分。

MiniMax M3 的 MSA 与阶跃 Step 3.7 Flash 的 MFA:2026 年高效推理架构的工程哲学分岔