Attention→K3 三十天课 · Day 21 / 30 课程首页 面试速查 周测验
Day 21 · 第 3 周里程碑复盘

K3 混合架构总装,完成设计存活表 v2

在过去的第 3 周里,我们见证了一场近十年的大模型进化风暴:RMSNorm 干掉了传统 LayerNorm、NoPE 淘汰了正弦编码、MLA 与 KDA 彻底重构了注意力机制、896 选 16 的 Stable LatentMoE 颠覆了密集 FFN。今天我们把这些部件拼成当今开源最前沿的模型——Kimi K3 的完整架构总装!

学完你能回答
徒手讲清 Kimi K3 混合架构的完整数据流动
学完你能回答
设计存活表 v2:每个部件被什么取代、为什么?
学完你能回答
本周 6 道高难度架构面试题核心速查

1本周串讲:Kimi K3 架构大总装

把近十年的所有顶尖改进装在一起,就得到了 Kimi K3 的核心架构骨架:

Kimi K3 现代前沿混合架构全景总装图 输入经由 NoPE 和 RMSNorm,进入 3:1 交错的 KDA 线性注意力与 Gated MLA 注意力,经过 AttnRes 块级残差与 Stable LatentMoE 896 选 16 专家输出 Kimi K3 现代混合架构总装(《Kimi K3 技术报告》§2.1–§2.3) 输入嵌入 (Token Embedding) + NoPE(外推到 100 万 token 不必改位置编码) 【3:1 双轨注意力】KDA 线性注意力(状态显存 O(1))+ Gated MLA(全局高精召回) 全链路 Pre-RMSNorm 预归一化 + AttnRes 块级注意力残差(改善深度信息流动) 【Stable LatentMoE】896 个细粒度路由专家选 16(激活 104B / 总量 2.8T) Quantile Balancing(QB,分位数平衡)无辅助损失偏置校准,消除 Straggler 慢卡 RMSNorm + 最终线性投影头 → 100 万 token 原生多模态统一 Next-Token 预测
图 21.1:Kimi K3 终极架构总装图。沿序列长度(KDA)与模型深度(AttnRes)双向优化,达成了极高吞吐与前沿智能的完美结合。

2独家记忆点:设计存活表 v2(近十年改进全景)

现在,我们正式点亮「近十年大模型设计存活表」的前三列全部内容:

模块部件 2017 原版(W2所学) 近十年接力改进(本周所学) 2026 K3 的终极选择
注意力机制 全量缩放点积 (MHA) MQA → GQA → MLA KDA + Gated MLA (3:1双轨)
位置信息 正弦绝对位置编码 相对位置 → RoPE 旋转 NoPE(衰减隐式编码)
归一化 Post-LayerNorm Pre-LN 拓扑 RMSNorm(去均值加速)
前馈网络 单路密集 FFN 稀疏 MoE 概念复兴 Stable LatentMoE (896选16)
层间连接 标准残差(x + f(x)) (长期无人触碰) AttnRes 块级注意力残差
架构形态 Encoder-Decoder Decoder-only (GPT统一) Decoder-only 原生多模态

3映射到 K3 原文:总装那一句话

图 21.1 不是我们的想象画——报告 §2 开篇就把这套总装写成了几句话说尽。现在每个词你都能看懂了:

K3 原文(§2 模型架构)
「Kimi K3 的架构设计旨在沿三个互补的维度扩展信息流动:序列长度、网络深度与模型宽度。在序列维度上,混合注意力(Hybrid Attention)将每个块中的三个 Kimi Delta Attention(KDA,Kimi Delta 注意力)层与一个 Gated MLA 层组合……在宽度维度上,每个注意力层之后接一个 Stable LatentMoE 层进行稀疏通道混合,每个 token 实际激活 896 个路由专家中的 16 个(§2.3)。」

逐词翻译:

  • 「序列长度、网络深度与模型宽度」:正是图 21.1 的三条优化轴——KDA 沿序列长度把状态显存压成常数(D19),AttnRes 沿网络深度改善信息流动,LatentMoE 沿模型宽度扩充专家容量(D20)。
  • 「三个 KDA 层与一个 Gated MLA 层组合」:就是本周反复出现的 3:1 双轨——75% 的层用 KDA 做高效长序列混合,25% 的层用 Gated MLA 保持全局注意力(D18–D19)。
  • 「896 个路由专家中的 16 个」:Stable LatentMoE 的稀疏激活(D20)——每个 token 只叫醒 16 个专家干活,其余 98.2% 休眠。

顺带记住同一段的收尾口径:「结合改进的训练与数据配方,它们使整体规模扩展效率相较 Kimi K2 提升约 2.5×。」——2.5× 是架构、数据与训练配方共同带来的整体规模效率提升,不是某一个部件单干的提速。

2.8T
总参数量
(摘要 / §1)
104B
每 token 激活参数
(摘要 / §1)
896→16
路由专家数与
每 token 激活数(§1 / §2.3)
98.2%
休眠专家占比
(由 896 选 16 换算)

4第 3 周面试题速查(D15–D20 核心 6 题)

本周 6 道大厂技术面高频考点速查:

D15 · 为什么大模型几乎全用 Pre-RMSNorm 代替 Post-LN?
八股背诵:Pre-LN 保证残差纯加法直通、训练不震荡;RMSNorm 删掉均值运算,更省访存、更快。
深刻回答:① 拓扑直通:Pre-LN 将归一化置于分支,使主干残差保持 x_L = x_0 + Σ f_l,消除了 Post-LN 浅层梯度被反复削减的顽疾;② 显存访存提速:归一化的本质是约束模长尺度,RMSNorm 舍弃原点中心化均值 μ,降低了 GPU 内存带宽读写开销。
D16 · RoPE 为什么统治了主流开源模型?K3 为什么敢用 NoPE?
八股背诵:RoPE 通过复数旋转让内积只取决于相对距离。K3 靠因果掩码和 KDA 衰减隐式感知顺序。
深刻回答:RoPE 在注意力内积中相乘消除绝对位置,具备相对距离感知与远程衰减;但扩展上下文长度时,RoPE 需要重新调整频率基值或应用 YaRN 之类的修补;K3 依托 Decoder-only 下三角掩码的不对称性配合 KDA 逐通道遗忘衰减,实现无显式编码的位置感知,长文本外推免去了频率修改。
D17 · 为什么大模型 Decode 阶段是 Memory-bound(访存受限)?
八股背诵:因为单步只算一个 token,计算量很小,时间全花在从显存读取历史 KV Cache 上。
深刻回答:Decode 是 GEMV 向量乘矩阵计算,计算访存比(Arithmetic Intensity)极低。由于 HBM 显存读写带宽(~2TB/s,示意)远落后于 Tensor Core 算力,GPU 算力核心长时间饥饿等待 KV 数据搬运,显存带宽成为绝对瓶颈。
D18 · MLA(多头潜在注意力)相比 GQA 赢在哪里?
八股背诵:GQA 靠剪裁头数省显存,MLA 靠低秩投影压缩 KV,大幅降低缓存占用且表达能力不降。
深刻回答:GQA 牺牲了多头子空间自由度;MLA 将 Key/Value 联合低秩投影为潜在向量 c_t^KV 保存在 Cache 中,并在计算时利用矩阵结合律将解压矩阵预先吸收到 Query 投影中,全程无需显存解压展开,以极小显存保留了全量多头的表征容量。
D19 · 什么是 KDA?为什么 K3 采用 3:1 混合双轨?
八股背诵:KDA 是带 Delta 规则和遗忘门的线性注意力,显存常数级。3:1 混合兼顾了速度与精准召回。
深刻回答:线性注意力利用矩阵结合律维护固定尺寸的状态矩阵 S_t(d×d);KDA 引入 Delta 规则残差更新与逐通道衰减门解决了状态饱和与长程遗忘;3:1 混合让 75% 的 KDA 承担高速流动(状态显存 O(1)),25% 的 Gated MLA 锚定高精 Softmax 全局召回。
D20 · MoE 是怎么做到「大参数、低算力」的?如何解决负载失衡?
八股背诵:MoE 每次只挑几个专家计算。负载失衡用辅助 Loss 或偏置校准让专家分配均匀。
深刻回答:MoE 将知识存储容量与计算 FLOPs 解绑,K3 激活 104B / 总量 2.8T(896 选 16);针对专家马太效应,K3 采用 Quantile Balancing(QB,分位数平衡)按目标负载动态调整专家偏置,不碰主任务梯度,观测不到可度量的残余负载不均衡。

5第 3 周测验:10 题综合验收

Q1 为什么 Pre-LN 结构训练时不需要设置很长的 Warmup 学习率预热?
解析:因为 Pre-LN 保证了主干道残差纯加法流动,求导时存在天然的恒等直通项 +1,浅层梯度不会随深度增加而发生指数级衰减,训练初期数值极为平稳。
Q2 RMSNorm 计算公式中,相比标准 LayerNorm 缺少了哪两个统计量?
解析:缺少了特征均值 μ 的计算以及分子上的减均值中心化平移操作,仅保留均方根 RMS(x)。
Q3 RoPE 是如何实现「相对位置」表达的?写出内积核心原理。
解析:将 Q_m 旋转 mθ,K_n 旋转 nθ。在复数内积运算时,绝对角度相减转化为相对夹角 (m−n)θ(内积 ∝ e^(i(m−n)θ))。
Q4 为什么 Kimi K3 敢于在 100 万 token 上下文下采用 NoPE(无显式位置编码)?
解析:因为因果掩码的下三角结构天然破除了位置对称性,配合 KDA 逐通道遗忘门提供的物理时序衰减偏置,模型能自发感知语序,彻底免去了长文本位置外推的频率调整。
Q5 大模型在 Prefill 和 Decode 阶段,分别属于哪种瓶颈?
解析:Prefill 属于 Compute-bound(计算密集型,大矩阵乘法打满算力);Decode 属于 Memory-bound(访存密集型,瓶颈在于从显存搬运 KV Cache 的带宽)。
Q6 GQA 和 MQA 的主要区别是什么?
解析:MQA 让所有 Query 头共享单一组 Key/Value;GQA 将 Query 头分组(如 8 组),每组共享一组 Key/Value,在压缩比与模型精度间取得平衡。
Q7 MLA 为什么不需要在 GPU 显存中展开多头 Key 和 Value?
解析:MLA 利用矩阵乘法结合律,将解压上投影矩阵预先吸收合并进 Query 投影矩阵中,直接使用变换后的 Query 与低维潜在向量 c_t^KV 做点积。
Q8 线性注意力如何实现常数级 O(1) 的推理显存?
解析:通过去掉 Softmax 并利用结合律优先计算 K^T·V,将历史前缀压缩进一个固定尺寸(d×d)的状态矩阵 S_t 中,显存占用与序列长度解耦。
Q9 KDA 的 Delta 规则是如何避免状态记忆饱和的?
解析:更新状态前先用旧记忆预测当前值,计算出残差差值 v_t − S_(t−1)·k_t,仅用这一差值(Δ)定向覆盖修正旧状态,避免盲目累加导致的状态溢出。
Q10 K3 的 2.8T MoE 架构中,单 token 计算激活的参数量是多少?休眠专家占比是多少?
解析:单 token 激活 104B 参数(从 896 个专家中激活 16 个),休眠专家比例为 (896−16)/896 ≈ 98.2%。

6下周预告:把模型炼出来(K3 训练、基础设施与评测全景)

完成了架构演进考古之后,第 4 周我们将站在整座工厂的高度,看这台 2.8 万亿参数的超级巨兽是如何被真正训练并部署出来的:

《从 Attention 到 K3 · 大模型近十年设计演进》30 天课 · Day 21 / 30 · 返回课程首页