Attention→K3 三十天课 · Day 29 / 30 课程首页 七大主线 自测题
Day 29 · 收官全局回顾 (1/2)

全局回顾:近十年大模型设计演进终极大地图

在这 29 天的探索中,我们从 2017 年 Attention 论文那张著名的架构图出发,穿过九年波澜壮阔的工程风暴,最终登上 2026 年 Kimi K3 那座 2.8 万亿参数的现代技术灯塔。今天,我们站在万米高空,将 7 大主线、4 周知识融合成一张清晰的终极心智地图。

学完你能做到
全局串讲 2017–2026 大模型 7 大主线的演进全貌
学完你能做到
掌握大模型底层「架构 + 训练 + 系统」三大层次
学完你能做到
随时调取任何模块的「为什么改、怎么改」底层原理

1起点:这些你早就会了

「回头看一件东西是怎么一步步变成今天这样的」,你早就做过。先把这些经验和今天要用的工具对上桌:

你已经会的AI 世界里对应的东西
看一栋老宅的历年翻新记录,读懂每次改动的原因设计考古:从 K3 反推每一代设计解决了什么瓶颈
家谱:一眼看清谁是谁的后代七大演进主线:每个 2026 年的设计都能追溯到 2017 年的祖先
上一代产品的短板,往往就是下一代的卖点瓶颈驱动演进:新设计几乎都长在旧瓶颈上
搬家时的断舍离清单:留什么、扔什么、为什么设计存活表:哪些 2017 原版设计活到了 K3、哪些被取代
旅游前先看城市大地图,再钻小巷先建全景心智地图,再回看每个模块的细节
考完试对照考纲,自查哪些点是真的会了按报告章节自查:现在的你能独立读懂哪几章

今天的主线只有一条:不再学新零件,而是把过去 28 天的零件摊在桌上,拼成一张十年演进的大地图。

2十年一剑:大模型演进终极全景知识地图

一张图看懂过去十年大模型工业界的进化主线:

2017-2026 近十年大模型设计演进全景知识地图 全景展示 Attention 原版到 Kimi K3 的七大演进主线:注意力、位置编码、归一化、前馈专家、残差拓扑、优化器与系统工程 2017–2026 近十年大模型架构演进终极大地图 2017 基石时代 《Attention Is All You Need》 • Encoder-Decoder • MHA (全量多头) • Post-LayerNorm • 正弦绝对位置编码 • 单路密集 FFN • 简单残差连接 • Adam + Warmup 【初代开山,但处处有瓶颈】 2018–2024 接力演进 开源与专有大爆发 → GPT Decoder-only 统领 → MQA / GQA 分组共享 → Pre-LN 拓扑直通 → RoPE 旋转位置编码 → 经典 MoE 稀疏路由 → RMSNorm 访存加速 → SFT 表面对齐 + RL 【消除深层震荡,开启超大模型】 2026 现代前沿总成 《Kimi K3 技术报告》 ★ 原生多模态统一骨架 ★ 3:1 KDA + Gated MLA ★ RMSNorm 插入 MoE 通路 ★ NoPE 无显式位置编码 ★ LatentMoE (896选16, QB) ★ AttnRes 块级残差 ★ Per-Head Muon + RLVR 【2.8T 开源,百万窗口】
图 29.1:近十年大模型设计演进终极大地图。见证工业界如何通过数学与系统工程的极致追求,一步步攻克显存、计算与收敛瓶颈。

3七大主线全局串讲

回顾过去四周,我们攻克的大模型七大核心进化轨道:

主线 1 · 注意力机制(Attention Track)
MHA (2017) → MQA (2019) → GQA (2023) → MLA (2024) → KDA + Gated MLA (2026, 3:1 双轨)
演进核心:从全量多头的高额显存开销,到低秩投影压缩(MLA 大幅压缩 KV 缓存),再到结合固定大小循环状态的线性注意力(KDA),兼顾长序列推理效率与全局精准召回。
主线 2 · 位置编码(Positional Encoding Track)
正弦绝对编码 (2017) → 相对位置偏置 (T5) → RoPE 复数旋转 (2021) → NoPE (2026)
演进核心:从加法污染语义,到旋转内积相对感知,最终在因果掩码与 KDA 遗忘门物理时序偏置下抛弃显式编码,百万 token 天然外推无需改动。
主线 3 · 归一化与稳定性(Normalization Track)
Post-LayerNorm (2017) → Pre-LN 拓扑直通 (2020) → RMSNorm 极简访存加速 (2024)
演进核心:打通残差恒等映射直通道,消除深层梯度衰减;砍掉均值运算削减 GPU 显存带宽搬运开销。
主线 4 · 前馈网络与容量(FFN & MoE Track)
密集 FFN (2017) → Top-2 粗粒度 MoE (Switch) → 细粒度 LatentMoE (896选16) + QB 分位数平衡
演进核心:将知识容量(总参数 2.8T)与单步计算算力(激活 104B)彻底解绑;用 QB 分位数平衡把专家间的负载不均衡压到观测不到可度量的残余水平,大幅缓解跨卡同步等待。
主线 5 · 残差拓扑与深度(Residual Track)
标准残差连接 (2017) → AttnRes 块级注意力残差 (2026)
演进核心:突破传统残差仅做简单标量加法的局限,引入跨层动态注意力残差,极大改善了百层大模型深度方向的特征流动。
主线 6 · 训练与智能跃迁(Training & RL Track)
无监督预训练 (Scaling Law) → SFT 表面对齐 (LIMA) → RLVR / 长周期沙箱强化学习 (CoT 慢思考)
演进核心:预训练提供世界知识,SFT 赋予对话格式,强化学习在代码沙箱中通过试错激发 System 2 深度推演与自我纠错,实现测试时算力换准确率。
主线 7 · 基础设施与部署(Infrastructure Track)
单机单卡 → 3D 混合并行 → 4D 专家并行 (EP All-to-All) + 计算通信完全重叠 (Overlap)
演进核心:通过双缓冲流水线将跨节点通信时延隐藏在矩阵乘法阴影中,支撑 2.8T 规模的训练与推理高效平稳运转。
核心类比
七大主线合起来,像读一栋老宅几十年的翻新记录:承重墙始终没动(注意力 + 残差的主干从 2017 保留到了 K3);水电管线逐代重铺(归一化从 Post-LN 到 RMSNorm,位置编码从正弦到 NoPE);隔间越打越细(单路 FFN 到 896 选 16 的 LatentMoE);最后还加建了以前没有的楼层(RL 后训练、原生多模态)。读翻新记录的乐趣不在于记住每块砖,而在于看懂「当年为什么要这么改」。
严格来说(类比的边界):软件没有物理遗产包袱——每一代「翻新」其实都是按新图纸从头训练一栋新楼,只是图纸沿用了旧楼的承重结构;而且老宅是住进去之后慢慢改,模型的每代设计在训练开始前就定死了。
小结:把七条线收进三个抽屉。回头整理时,七大主线其实只落在三个层次上——架构层(主线 1–5:模型的结构怎么长)、训练层(主线 6:智能怎么被一步步激发)、系统层(主线 7:怎么让它在超大集群上跑得起、交付得出)。今后看到任何一个新设计,先问两句:它落在哪一层?它拆的是哪个瓶颈?

4面试视角:讲一个你认为最漂亮的架构改进

全局回顾类的问题,面试官考察的不是你背了多少名词,而是你能不能讲清「瓶颈 → 方案 → 代价」这条链:

面试视角
面试官可能会问:「近十年大模型的架构改进里,你认为哪一个最漂亮?说说理由。」
八股答「我觉得是注意力机制,因为它能让所有词互相关注,效果很好,所以后来所有模型都用它。」——只复述了概念,没有说出任何一次「改进」解决的具体瓶颈,也没有权衡意识。
本课答「我选 MLA。它瞄准的瓶颈非常具体:KV 缓存随序列变长撑爆显存。做法是把逐头的键与值压成一个低维潜向量,只缓存这个向量,注意力计算时再用升投影重构——用少量计算换显存。更漂亮的是它没有牺牲注意力的全局性,所以 K3 把它保留为周期性的全局层,再用 3:1 的 KDA 承担长序列混合,两套机制各管一段。我理解的『漂亮』不是堆性能,而是一个机制精确拆掉一个瓶颈、代价还可控。」

注意本课答的结构:先点名瓶颈,再讲机制怎么拆,最后说代价和组合方式——七大主线里任何一条都能套这个句式。

5大厂技术面试核心英文术语速查表(Cheat Sheet)

大厂架构面与顶会论文中最常出现的专业术语中英精准对照:

英文专业术语 中文概念 核心技术含义 / 典型场景
GEMM vs GEMV 通用矩阵乘 vs 向量矩阵乘 Prefill 阶段为 GEMM(计算密集);Decode 阶段为 GEMV(访存密集)
Arithmetic Intensity 计算访存比 每从显存读取 1 字节数据所执行的浮点运算次数(FLOPs/Byte)
MFU (Model FLOPs Util) 模型算力利用率 衡量真实训练/推理吞吐占 GPU 硬件理论峰值 TFLOPs 算力的百分比
Memory-bound 显存访存受限 GPU 算力核心饥饿等待 HBM 显存搬运数据,Decode 阶段的主要瓶颈
Straggler Effect 分布式慢卡木桶效应 MoE 负载失衡时,少数过载卡拖慢整个分布式集群同步步调的现象
Loss Masking 损失掩码机制 SFT 时将用户 Prompt 处的 Label 设为 -100,仅对 Assistant 回复求导
Test-time Compute 测试时算力扩展 推理阶段动态分配更多思考 token 和沙箱试错步数以换取解题高成功率
RLVR 基于可验证奖励的强化学习 利用代码编译器、自动化单测或数学确定性答案提供客观 Reward 的强化学习
Decoupled RoPE 解耦旋转位置编码 MLA 中将位置键与内容隐向量拆开,保留 RoPE 相对感知的同时实现矩阵吸收

6设计存活表 Markdown 一键导出

点击下方按钮可一键复制完整设计存活表 Markdown,方便存入个人知识库(Obsidian / Notion / 语雀):

| 模块部件 | 2017 原版 | 近十年接力改进 | 2026 K3 终极选择 | 被取代/保留的核心原因 |
| :--- | :--- | :--- | :--- | :--- |
| **注意力机制** | 全量缩放点积 (MHA) | MQA → GQA → MLA | KDA + Gated MLA (3:1双轨) | Softmax 显存 O(N) 爆炸;KDA 固定大小循环状态 + MLA 大幅压缩 KV 缓存 |
| **位置信息** | 正弦绝对位置编码 | 相对位置 → RoPE 旋转 | NoPE(衰减隐式编码) | 绝对加法外推性差;NoPE 依托因果掩码与 KDA 遗忘门,百万 token 外推无需改编码 |
| **归一化** | Post-LayerNorm | Pre-LN 拓扑直通 | RMSNorm(含 LatentMoE 插入) | Post-LN 阻断残差导致深层难以收敛;RMSNorm 删去均值计算,更省访存、更快 |
| **前馈网络** | 单路密集 FFN | 稀疏 MoE 概念复兴 | Stable LatentMoE (896选16) | 密集参数算力爆炸;MoE 解绑知识容量与算力,QB 分位数平衡把负载不均衡压到观测不到的水平 |
| **层间连接** | 标准残差 (x + f(x)) | (长期无人改动) | AttnRes 块级注意力残差 | 标准残差沿深度单向累加;AttnRes 改善模型深度方向的动态信息路由 |
| **架构形态** | Encoder-Decoder | Decoder-only (GPT统一) | Decoder-only 原生多模态 | Decoder-only 统一无监督预训练,极度利于分布式并行通信与 KV Cache 显存管理 |
| **优化器** | Adam + Warmup | AdamW 权重衰减 | Per-Head Muon 矩阵正交 | 传统 Adam 逐参数标量缩放;Muon 针对大矩阵施加谱正交约束,深层更新极其稳健 |

7映射到 K3:摘要里的每个词,现在你都认识了

29 天前,K3 报告摘要的第一句话像一串密码;今天再读,每个名词都是一位老朋友。这就是这张大地图的价值:

K3 原文(摘要)
「我们推出 Kimi K3:一个总参数量 2.8T 的混合专家(MoE)模型,激活参数 104B,具备原生视觉能力,上下文窗口达 100 万 token。Kimi K3 构建于 Kimi Delta Attention(KDA,Kimi Delta 注意力)与 Attention Residuals(AttnRes,注意力残差)之上,二者分别改善了沿序列长度与模型深度方向的信息流动。」

逐词翻译:

  • 「总参数量 2.8T,激活参数 104B」:主线 4 的核心——知识容量与单步算力解绑。2.8T 是整座图书馆的藏书量,104B 是每回答一个 token 实际请出来的 16 位专家(Day 20)。
  • 「KDA……改善沿序列长度方向的信息流动」:主线 1 的终点——3:1 混合架构里,KDA 用固定大小的循环状态承担长序列混合(Day 19),周期性的 Gated MLA 层保住全局注意力(Day 18)。
  • 「AttnRes……改善沿模型深度方向的信息流动」:主线 5 的终点——残差从简单加法升级为跨层注意力检索(Day 21 复盘)。一纵一横,正好是大地图的两条坐标轴。
  • 「100 万 token」:不是拧出来的参数,是分四个阶段练出来的能力(Day 22,§3.4)。
2.8T
总参数量
(摘要 / §1)
104B
每 token 激活参数
(摘要 / §1)
896 选 16
LatentMoE 路由专家
(§1 / §2.3)
1M
上下文窗口 token
(摘要 / §3.4)

8毕业礼物:独立通读 K3 报告指南

课程结束了,但报告还在那里等你。现在的你,已经有能力独立通读《Kimi K3 技术报告》全文——按章节给你一张「读懂度」自查清单:

§1 引言 + 摘要
现在的你:可以零障碍通读。摘要里每个术语(MoE、KDA、AttnRes、LatentMoE、QB)都在课程里讲过;「两条扩展轴」的论述正好呼应主线 6。
§2 模型架构
现在的你:配合 Day 15–21 能读懂主线——§2.1 混合注意力(D18/D19)、§2.2 AttnRes(D21)、§2.3 LatentMoE 与归一化(D15/D20)、§2.4 原生多模态(D25);§2.5 Per-Head Muon 可当新内容泛读。公式可以跳过,文字论述全能跟上。
§3 预训练
现在的你:Day 22 讲过规模定律与四阶段长上下文扩展(§3.2/§3.4),数据配方(§3.1)与训练配方(§3.3)读个框架即可。
§4 后训练
现在的你:Day 23 讲过 SFT(§4.1.1),Day 24 讲过 RL(§4.1.2)与 MOPD 多教师蒸馏合体(§4.1.3);§4.2 智能体能力的读法是「RL 在什么环境里练」。推理力度控制等细节可当新内容泛读。
§5 基础设施
现在的你:Day 26 讲过主线——KDA 的算法-系统协同设计(§5.1)、MoonEP 完美均衡专家并行(§5.2)、百万 token 智能体 RL 基础设施(§5.3)、推理交付(§5.4)。这是全文工程浓度最高的一章,慢慢读。
§6 评测 + §7 案例研究
现在的你:Day 27 教过怎么读基准表——先看基准测什么,再看数字,最后看性价比(§6.4)。短板章节(研究级推理)报告写得很坦诚,值得一读。
附录 C / D(QB 推导与直方图估计)
现在的你:想挑战数学时的加餐。Day 20 讲过 QB 的直觉(分位数平衡),附录是把它写严的过程——读不懂不影响主线。
通读建议:第一遍只读每节开头的总起段和加粗小标题,把骨架串起来;第二遍带着「这个设计拆的是哪个瓶颈」的问题精读 §2;§5 留到最后,它是把前五周所有「为什么」落到机器上的地方。

9收官自测:串通十年核心脉络

Q1 如果让你用一句话概括大模型近十年的演进主旋律,你会怎么说?
解析:在保持或提升表征与推理智能上限的同时,通过算法与系统的协同创新,将显存访存瓶颈、序列计算复杂度与硬件通信开销压缩至理论极致。
Q2 为什么说「设计存活表」是理解大模型技术史的最佳工具?
解析:因为它清晰展示了 2017 年初代 Transformer 的每一个原始设计在工业落地中遇到了什么物理瓶颈,又是被哪项后续创新所替代或升级,帮助我们建立知其然、更知其所以然的架构心智模型。
Q3 报告是怎么给 K3 的开源定位的?
解析:报告(§8 结论)的原话口径:Kimi K3 是「全球首个开源的 3T 级模型」,在长周期编程、智能体、知识、推理和视觉任务上交付了前沿级性能;尽管与最强闭源模型仍有差距,但它「建立了一个所有人触手可及的开源新前沿」,供研究、部署与创新使用。
Q4 把七大主线收进「架构 + 训练 + 系统」三个抽屉,每个抽屉各举一个代表改进。
解析:架构层(主线 1–5):如 KDA + Gated MLA 的 3:1 混合注意力,拆的是长序列显存与算力瓶颈;训练层(主线 6):如 RLVR 与长周期沙箱强化学习,用测试时算力换推理深度;系统层(主线 7):如 MoonEP 专家并行与计算通信重叠,让 2.8T 规模在集群上跑得动、交付得出。能这样分层归类,说明地图已经装进脑子里了。
Q5 结课后想独立通读 K3 技术报告,按什么顺序、带着什么问题读?
解析:建议三遍法:第一遍只读各节总起段与小标题,串起 §1–§6 的骨架;第二遍带着「这个设计拆的是哪个瓶颈」精读 §2 架构(对应 Day 15–21);§5 基础设施(Day 26)留到最后细读,§6 评测(Day 27)用「先看基准测什么、再看数字、最后看性价比」的方法读。附录 C/D 的 QB 推导当数学加餐,读不懂不影响主线。
《从 Attention 到 K3 · 大模型近十年设计演进》30 天课 · Day 29 / 30 · 返回课程首页