恭喜你完成了整门课程最硬核的一周!在过去 6 天里,你把 Transformer 的每一个核心零件——点积注意力、QKV、因果掩码、多头切分、正弦波位置编码、残差连接与 LayerNorm 逐一拆解到了螺丝钉级别。今天我们做两件大事:徒手搭出一台完整的 2017 原版机器,并首次开启我们的镇课之宝——「设计存活表」。
现在,我们把前 13 天的所有模块组装在一起。一段文字进入 Transformer 到最终吐出一个 token,走完如下全程:
现在,我们正式填下整门课程最重要的一张总表——「近十年大模型设计存活表」的第 1 列。请盯紧这张表里的每一个名字,因为在接下来的第 3 周(Day 15–21),这里的几乎每一个设计都将被革命性地推翻或重构:
| 模块部件 | 2017 原版(本周所学) | 近十年接力改进(下周剧透) | 2026 K3 的终极选择 |
|---|---|---|---|
| 注意力机制 | 全量缩放点积 (MHA) | MQA → GQA → 线性化 | KDA + Gated MLA (3:1双轨) |
| 位置信息 | 正弦绝对位置编码 | 相对位置 → RoPE | NoPE(衰减隐式编码) |
| 归一化 | Post-LayerNorm | Pre-LN → RMSNorm | RMSNorm(含 LatentMoE 插入) |
| 前馈网络 | 单路密集 FFN | MoE(1991思想复兴) | Stable LatentMoE (896选16) |
| 层间连接 | 标准残差 (x + f(x)) | (长期无人改动) | AttnRes 块级注意力残差 |
| 架构形态 | Encoder-Decoder | Decoder-only(GPT 系列统一) | Decoder-only 原生多模态 |
图 14.1 不是我们编的示意图——它就是《Attention Is All You Need》图 1 的中文重画版。论文 §3.1(编码器与解码器堆栈)里这句话,说的正是今天的总装:
逐词翻译:
本周 6 天的核心面试题浓缩卡,随身查阅:
第 2 周我们掌握了 2017 年的原版 Transformer。但在过去的近十年里,这个架构经历了一场波澜壮阔的「全面升级改造」: