在这四周漫长而充实的旅程中,我们完成了从 2017 年的《Attention Is All You Need》到 2026 年的《Kimi K3 技术报告》的壮丽穿越!今天,我们把四大板块全部打通,点亮「近十年大模型设计存活表」的全部 7 大核心部件,实现通读全篇 K3 技术报告!
把第 4 周学过的预训练、SFT、RL、多模态与基础设施融会贯通:
整门课程最核心的独家交付——「近十年大模型设计存活表」终极完成版!这 7 行表格凝聚了从 2017 年《Attention Is All You Need》到 2026 年《Kimi K3 技术报告》的全部精华:
| 部件 | 2017 原版 | 近十年接力改进 | 2026 K3 的终极选择 | 被取代/保留的核心原因 |
|---|---|---|---|---|
| 注意力 | 全量缩放点积 (MHA) | MQA → GQA → MLA | KDA + Gated MLA (3:1) | Softmax 注意力 KV 显存 O(N)、算力 O(N²);KDA 以固定大小循环状态取代增长的 KV 缓存,MLA 大幅压缩 KV 缓存占用(DeepSeek-V2 提出) |
| 位置信息 | 正弦绝对位置编码 | 相对位置 → RoPE 旋转 | NoPE(衰减隐式编码) | 绝对加法外推性差;NoPE 依托因果掩码与 KDA 遗忘门,百万 token 外推无需改编码 |
| 归一化 | Post-LayerNorm | Pre-LN 拓扑直通 | RMSNorm(含 LatentMoE 插入) | Post-LN 阻断残差导致深层难以收敛;RMSNorm 删去均值计算,更省访存、更快 |
| 前馈网络 | 单路密集 FFN | 稀疏 MoE 概念复兴 | Stable LatentMoE (896选16) | 密集参数算力爆炸;MoE 解绑知识容量与算力,QB(分位数平衡)把残余负载不均衡压到观测不到可度量的水平,训练侧完美均衡另由 MoonEP 保障(Day 26 讲) |
| 层间连接 | 标准残差 (x + f(x)) |
(长期无人改动) | AttnRes 块级注意力残差 | 标准残差沿深度单向累加;AttnRes 改善模型深度方向的动态信息路由 |
| 架构形态 | Encoder-Decoder | Decoder-only (GPT统一) | Decoder-only 原生多模态 | Decoder-only 统一无监督预训练,极度利于分布式并行通信与 KV Cache 显存管理 |
| 优化器 | Adam + Warmup | AdamW 权重衰减 | Per-Head Muon 矩阵正交 | 传统 Adam 逐参数标量缩放;Muon 针对大矩阵施加谱正交约束,深层更新极其稳健 |
本周 6 道工业系统与全生命周期面试高频考点速查:
主体四周课程已全部毕业!最后两天(D29–D30)是整门课的两大终极交付日: