Day 19 · K3 架构两大支柱之一
线性注意力与 KDA:Kimi K3 的核心架构灵魂
无论是 MHA、GQA 还是 MLA,只要带 Softmax,计算和显存依然会随着序列长度 N 增长。有没有一种革命性的架构,无论文章有多长(甚至 100 万 token),每一步的显存和计算量都严格固定为常数 O(1)?答案就是线性注意力(Linear Attention)与 Kimi 团队自研的王牌——KDA(Kimi Delta Attention)。
学完你能回答
线性注意力是如何做到显存和计算 O(1) 的?
学完你能回答
KDA 的「Delta 规则」与「逐通道遗忘门」解决了什么?
学完你能回答
K3 为什么采用 3:1 的 KDA 与 MLA 混合双轨?
1起点:这些你早就会了
线性注意力与 KDA 的思想,就像随身携带的一本固定厚度的笔记本:
| 你已经会的 | AI 世界里对应的东西 |
| 乘法结合律:(A × B) × C = A × (B × C) | 线性注意力核心数学基础:脱掉 Softmax 紧箍咒,调换矩阵相乘顺序 |
| 固定大小的黑板:写满了就用板擦擦掉旧内容、写上新内容 | 固定状态矩阵 S_t:显存大小恒定为 d × d,序列再长显存也不涨 |
| 听长讲座只记一页摘要:细节会丢,要点还在 | 固定状态是有损压缩:历史 token 被压进 S_t,不能逐个还原 |
| 错题修正:先看旧记忆错在哪里,按差值(Δ)精准覆盖 | Delta 规则(Delta Rule):根据预测误差定向更新隐状态,防记忆饱和 |
| 背单词按熟悉程度以不同速度淡忘 | 逐通道遗忘门:每个特征通道有独立的衰减率,重要的慢忘、临时的快忘 |
| 高铁 + 飞机:平原段高铁极速飞驰(KDA),跨海段飞机直达(MLA) | 3:1 混合双轨:3 层 KDA 高速低开销 + 1 层 Gated MLA 全局精准召回 |
2脱掉 Softmax:矩阵结合律的奇迹
传统注意力的瓶颈在于公式里的 softmax(QKᵀ)V:因为 Softmax 把 Q 和 Kᵀ 死死绑定在一起,必须先算出一个 N × N 的巨大方阵,训练和预填充的计算量随序列长度呈平方 O(N²) 膨胀;即便解码时用 KV Cache 免去了重复计算,缓存本身的显存也随长度线性 O(N) 增长(Day 17 讲过)。
线性注意力的神操作
如果我们把 Softmax 拿掉(或用核函数 φ 代替):
Attention(Q, K, V) = (Q·Kᵀ)·V = Q·(Kᵀ·V)
利用乘法结合律把括号改到后面:
1. 先算
S = Kᵀ·V:这是一个大小为
d_k × d_v 的固定尺寸矩阵(举例可想象成 128 × 128,示意),它把所有历史前缀的信息全部压缩融合成了一个
固定状态(Hidden State)!
2. 新来的 q_t 只需要去乘这个固定矩阵:
o_t = q_t·S_t。
质的飞跃:显存不再随文本长度增长,单步计算复杂度降为
严格的常数 O(1)!
严格来说(类比的边界):把状态矩阵比作「固定厚度的笔记本 / 固定大小的黑板」,有两个出入:一是这本笔记是有损压缩——历史 token 被叠加压进同一个矩阵,不能逐个还原,这正是一般线性注意力容易「记混」的根源(§3 的 KDA 就是来补救它的);二是「擦掉再写」其实是每次读取后整体更新,不存在一块写着原文的板子。
图 19.1:传统 KV Cache 与线性注意力循环状态对比。线性注意力将序列建模变回了固定大小的恒常态。
3KDA(Kimi Delta Attention)的两大杀手锏
传统线性注意力虽然快,但长期面临一个致命弱点:容易记混、长程精准召回能力弱、状态容量容易饱和。Kimi 团队在技术报告 §2.1.1 中提出了两项关键创新:
KDA 核心演进机制
与报告式 (1) 对齐的更新步骤:先按通道衰减,再对衰减后的状态做 delta 修正——
S̃ = α_t ⊙ S_(t−1)(逐通道衰减,α_t 是每个通道独立的保留因子)
S_t = S̃ + β_t·(v_t − S̃·k_t)·k_tᵀ(只把预测误差写回去,β_t 控制写入强度)
1. Delta 规则(Delta Rule):更新状态时,先用已有记忆预测当前值(S̃·k_t),算出的差值 v_t − S̃·k_t 才是真正的新信息(Δ)!只用残差去定向覆写旧记忆,彻底避免了盲目累加导致的状态饱和;
2. 逐通道数据依赖遗忘门(α_t):不同特征通道拥有独立的自适应衰减率,重要的长期知识(如全局实体)慢衰减,临时的局部修饰词快遗忘。
严格来说(类比的边界):「错题修正」只是直觉——S_t 并不逐条存放记忆,而是一块 d_k × d_v 的压缩矩阵,写入时新信息会与旧内容叠加、互相干扰;Delta 规则减小的是写入时的冗余,并不能像改错题本那样保证单条信息被完整找回。
4K3 的 3:1 黄金混合双轨架构
在 2.8T 规模的 Kimi K3 中,架构师们没有盲目走向纯线性注意力,而是设计了「3 层 KDA + 1 层 Gated MLA」的周期交替混合双轨(3:1 Hybrid Ratio):
- 75% 的层(KDA 轨道):以 O(1) 恒定开销承担绝大部分局部时序推演与特征流动,是长序列高吞吐的主力;
- 25% 的层(Gated MLA 轨道):定点保留全量高精度全局 Softmax 注意力,保持全局 token 间的精准交互,支撑复杂逻辑推理与超长跨度的信息检索。
严格来说(类比的边界):「高铁 + 飞机」说的是分工而不是接力换乘——KDA 层与 MLA 层在同一个网络里交替堆叠、逐层处理同一条序列,信息在两层之间反复传递,并不是「先坐一段高铁、到站再换飞机」。另外提醒一句口径:报告里那个著名的「2.5×」指的是 K3 整体规模扩展效率相较 K2 的提升(架构 + 数据 + 训练配方共同带来,摘要 / §3.2),并不是「3:1 架构让吞吐提速 2.5 倍」。
5面试视角
面试视角 · 高频考点
面试官可能会问:「什么是线性注意力?Kimi K3 的 KDA(Kimi Delta Attention)解决了传统线性注意力的什么痛点?为什么要采用 3:1 混合双轨?」
八股答「线性注意力去掉 Softmax 用结合律把计算复杂度从 O(N²) 降到 O(N),显存变成 O(1)。KDA 加入了 Delta 规则和遗忘门提高召回率。3:1 混合双轨是为了兼顾速度和精度。」——回答很到位,若能写出 Delta 状态更新公式则直接达到专家级。
本课答「核心是在理论极限吞吐与联想召回容量之间建立协同分工:① 机制原理:通过核函数或去 Softmax 展开,利用结合律将 Q·(Kᵀ·V) 转化为固定尺寸状态矩阵 S_t(大小为 d × d)的自回归递推,使长文本解码显存与算力复杂度恒为 O(1);② KDA 的攻坚点:传统线性注意力采用简单累加更新导致隐状态极易容量饱和,KDA 引入了 Delta 规则(以残差差值 v_t − S̃·k_t 进行联想记忆更新)与逐通道输入自适应衰减门 α_t,解决了长文本长程遗忘与精准检索退化;③ 3:1 双轨协同:用 75% 的 KDA 层剥离大部分时序吞吐开销,再以 25% 的 Gated MLA 层保持全局 token 间的精准注意力,兼顾了前沿推理能力与长序列吞吐。」
6映射到原文:K3 报告 §2.1.1
K3 原文(§2.1.1 Kimi Delta Attention)
「KDA 在 delta 规则递归的基础上扩展了逐通道遗忘门。」「Kimi K3 采用线性注意力与全局注意力的逐层混合,将 KDA 与 Gated MLA 结合。每个块包含 3 个 KDA 层,其后接 1 个 Gated MLA 层,混合比例为 3:1。该模式在整个骨干网络中重复出现。」(第二段出自 §2.1 引言)
逐词翻译:
- 「delta 规则递归」:就是 §3 讲的那个更新方式——状态 S_t 一步步递归推进,每一步只用「预测误差(Δ)」去覆写旧记忆,而不是把新内容无脑累加进去。这是 KDA 防「记混、记爆」的第一件武器。
- 「逐通道遗忘门」:KDA 在 delta 规则之上新加的东西——状态矩阵的每个特征通道都有一个独立的衰减率 α_t(取值在 0 到 1 之间),由当前输入动态决定。重要的长期知识通道衰减慢,临时信息通道衰减快。这是第二件武器。
- 「每个块包含 3 个 KDA 层,其后接 1 个 Gated MLA 层」:就是 §4 的 3:1 混合双轨的原文出处——75% 的层用恒定开销的 KDA 跑长序列,25% 的层用带门控的 MLA 保持全局 token 间的精准注意力,「该模式在整个骨干网络中重复出现」即这种 4 层一组的积木从头搭到尾。
3 : 1
K3 中 KDA 与 Gated MLA 的交替比例(§2.1)
2.5×
整体规模扩展效率相较 K2 的提升(架构+数据+配方共同带来,摘要/§3.2)
7自测题(先自己答,再点开看解析)
Q1 为什么去掉 Softmax 就能把注意力计算量从 O(N²) 降为 O(N)?
解析:因为没有 Softmax 后,可以根据矩阵乘法结合律优先计算后两项 Kᵀ·V(维度为 d × d 的固定小矩阵),而不是先算 N × N 的巨大内积矩阵。
Q2 什么是线性注意力的「状态矩阵 S_t」?它的大小会随着输入变长而变大吗?
解析:S_t = Σ k_i·v_iᵀ 是一个维度为 d_k × d_v 的固定尺寸矩阵。它的尺寸严格恒定,无论输入 1 万 token 还是 100 万 token,显存占用保持不变。
Q3 传统线性注意力为什么容易出现「状态饱和」?KDA 的 Delta 规则怎么解?
解析:传统方法单纯将 k_t·v_tᵀ 线性累加进状态,随着序列加长数值无限膨胀,旧记忆无法被有效抹除。KDA 的 Delta 规则先计算已有记忆的预测误差,仅用新差值更新状态。
Q4 KDA 的逐通道衰减门 α_t 起到什么作用?
解析:α_t 对隐状态的不同通道赋予不同的动态遗忘率,使模型能够区分长期不变的全局概念和短期瞬态的局部修饰,自适应调节遗忘速度。
Q5 为什么 K3 不做 100% 纯 KDA,而要保留 25% 的 Gated MLA?
解析:虽然 KDA 速度极快,但在极端长跨度精准联想与超长上下文精准检索任务上,Softmax 注意力依然具备不可替代的绝对精确性。3:1 混合实现了速度与精度的双赢。
明天 · Day 20
MoE 与负载均衡:1991 年思想的辉煌复兴
总参数 2.8 万亿,为什么激活参数只有 104B?896 个专家里为什么有 98.2% 在“带薪休假”?
进入 Day 20 →