在过去的第 3 周里,我们见证了一场近十年的大模型进化风暴:RMSNorm 干掉了传统 LayerNorm、NoPE 淘汰了正弦编码、MLA 与 KDA 彻底重构了注意力机制、896 选 16 的 Stable LatentMoE 颠覆了密集 FFN。今天我们把这些部件拼成当今开源最前沿的模型——Kimi K3 的完整架构总装!
把近十年的所有顶尖改进装在一起,就得到了 Kimi K3 的核心架构骨架:
现在,我们正式点亮「近十年大模型设计存活表」的前三列全部内容:
| 模块部件 | 2017 原版(W2所学) | 近十年接力改进(本周所学) | 2026 K3 的终极选择 |
|---|---|---|---|
| 注意力机制 | 全量缩放点积 (MHA) | MQA → GQA → MLA | KDA + Gated MLA (3:1双轨) |
| 位置信息 | 正弦绝对位置编码 | 相对位置 → RoPE 旋转 | NoPE(衰减隐式编码) |
| 归一化 | Post-LayerNorm | Pre-LN 拓扑 | RMSNorm(去均值加速) |
| 前馈网络 | 单路密集 FFN | 稀疏 MoE 概念复兴 | Stable LatentMoE (896选16) |
| 层间连接 | 标准残差(x + f(x)) |
(长期无人触碰) | AttnRes 块级注意力残差 |
| 架构形态 | Encoder-Decoder | Decoder-only (GPT统一) | Decoder-only 原生多模态 |
图 21.1 不是我们的想象画——报告 §2 开篇就把这套总装写成了几句话说尽。现在每个词你都能看懂了:
逐词翻译:
顺带记住同一段的收尾口径:「结合改进的训练与数据配方,它们使整体规模扩展效率相较 Kimi K2 提升约 2.5×。」——2.5× 是架构、数据与训练配方共同带来的整体规模效率提升,不是某一个部件单干的提速。
本周 6 道大厂技术面高频考点速查:
x_L = x_0 + Σ f_l,消除了 Post-LN 浅层梯度被反复削减的顽疾;② 显存访存提速:归一化的本质是约束模长尺度,RMSNorm 舍弃原点中心化均值 μ,降低了 GPU 内存带宽读写开销。c_t^KV 保存在 Cache 中,并在计算时利用矩阵结合律将解压矩阵预先吸收到 Query 投影中,全程无需显存解压展开,以极小显存保留了全量多头的表征容量。S_t(d×d);KDA 引入 Delta 规则残差更新与逐通道衰减门解决了状态饱和与长程遗忘;3:1 混合让 75% 的 KDA 承担高速流动(状态显存 O(1)),25% 的 Gated MLA 锚定高精 Softmax 全局召回。+1,浅层梯度不会随深度增加而发生指数级衰减,训练初期数值极为平稳。RMS(x)。Q_m 旋转 mθ,K_n 旋转 nθ。在复数内积运算时,绝对角度相减转化为相对夹角 (m−n)θ(内积 ∝ e^(i(m−n)θ))。c_t^KV 做点积。O(1) 的推理显存?K^T·V,将历史前缀压缩进一个固定尺寸(d×d)的状态矩阵 S_t 中,显存占用与序列长度解耦。v_t − S_(t−1)·k_t,仅用这一差值(Δ)定向覆盖修正旧状态,避免盲目累加导致的状态溢出。完成了架构演进考古之后,第 4 周我们将站在整座工厂的高度,看这台 2.8 万亿参数的超级巨兽是如何被真正训练并部署出来的: