在这 29 天的探索中,我们从 2017 年 Attention 论文那张著名的架构图出发,穿过九年波澜壮阔的工程风暴,最终登上 2026 年 Kimi K3 那座 2.8 万亿参数的现代技术灯塔。今天,我们站在万米高空,将 7 大主线、4 周知识融合成一张清晰的终极心智地图。
「回头看一件东西是怎么一步步变成今天这样的」,你早就做过。先把这些经验和今天要用的工具对上桌:
| 你已经会的 | AI 世界里对应的东西 |
|---|---|
| 看一栋老宅的历年翻新记录,读懂每次改动的原因 | 设计考古:从 K3 反推每一代设计解决了什么瓶颈 |
| 家谱:一眼看清谁是谁的后代 | 七大演进主线:每个 2026 年的设计都能追溯到 2017 年的祖先 |
| 上一代产品的短板,往往就是下一代的卖点 | 瓶颈驱动演进:新设计几乎都长在旧瓶颈上 |
| 搬家时的断舍离清单:留什么、扔什么、为什么 | 设计存活表:哪些 2017 原版设计活到了 K3、哪些被取代 |
| 旅游前先看城市大地图,再钻小巷 | 先建全景心智地图,再回看每个模块的细节 |
| 考完试对照考纲,自查哪些点是真的会了 | 按报告章节自查:现在的你能独立读懂哪几章 |
今天的主线只有一条:不再学新零件,而是把过去 28 天的零件摊在桌上,拼成一张十年演进的大地图。
一张图看懂过去十年大模型工业界的进化主线:
回顾过去四周,我们攻克的大模型七大核心进化轨道:
全局回顾类的问题,面试官考察的不是你背了多少名词,而是你能不能讲清「瓶颈 → 方案 → 代价」这条链:
注意本课答的结构:先点名瓶颈,再讲机制怎么拆,最后说代价和组合方式——七大主线里任何一条都能套这个句式。
大厂架构面与顶会论文中最常出现的专业术语中英精准对照:
| 英文专业术语 | 中文概念 | 核心技术含义 / 典型场景 |
|---|---|---|
GEMM vs GEMV |
通用矩阵乘 vs 向量矩阵乘 | Prefill 阶段为 GEMM(计算密集);Decode 阶段为 GEMV(访存密集) |
Arithmetic Intensity |
计算访存比 | 每从显存读取 1 字节数据所执行的浮点运算次数(FLOPs/Byte) |
MFU (Model FLOPs Util) |
模型算力利用率 | 衡量真实训练/推理吞吐占 GPU 硬件理论峰值 TFLOPs 算力的百分比 |
Memory-bound |
显存访存受限 | GPU 算力核心饥饿等待 HBM 显存搬运数据,Decode 阶段的主要瓶颈 |
Straggler Effect |
分布式慢卡木桶效应 | MoE 负载失衡时,少数过载卡拖慢整个分布式集群同步步调的现象 |
Loss Masking |
损失掩码机制 | SFT 时将用户 Prompt 处的 Label 设为 -100,仅对 Assistant 回复求导 |
Test-time Compute |
测试时算力扩展 | 推理阶段动态分配更多思考 token 和沙箱试错步数以换取解题高成功率 |
RLVR |
基于可验证奖励的强化学习 | 利用代码编译器、自动化单测或数学确定性答案提供客观 Reward 的强化学习 |
Decoupled RoPE |
解耦旋转位置编码 | MLA 中将位置键与内容隐向量拆开,保留 RoPE 相对感知的同时实现矩阵吸收 |
点击下方按钮可一键复制完整设计存活表 Markdown,方便存入个人知识库(Obsidian / Notion / 语雀):
| 模块部件 | 2017 原版 | 近十年接力改进 | 2026 K3 终极选择 | 被取代/保留的核心原因 | | :--- | :--- | :--- | :--- | :--- | | **注意力机制** | 全量缩放点积 (MHA) | MQA → GQA → MLA | KDA + Gated MLA (3:1双轨) | Softmax 显存 O(N) 爆炸;KDA 固定大小循环状态 + MLA 大幅压缩 KV 缓存 | | **位置信息** | 正弦绝对位置编码 | 相对位置 → RoPE 旋转 | NoPE(衰减隐式编码) | 绝对加法外推性差;NoPE 依托因果掩码与 KDA 遗忘门,百万 token 外推无需改编码 | | **归一化** | Post-LayerNorm | Pre-LN 拓扑直通 | RMSNorm(含 LatentMoE 插入) | Post-LN 阻断残差导致深层难以收敛;RMSNorm 删去均值计算,更省访存、更快 | | **前馈网络** | 单路密集 FFN | 稀疏 MoE 概念复兴 | Stable LatentMoE (896选16) | 密集参数算力爆炸;MoE 解绑知识容量与算力,QB 分位数平衡把负载不均衡压到观测不到的水平 | | **层间连接** | 标准残差 (x + f(x)) | (长期无人改动) | AttnRes 块级注意力残差 | 标准残差沿深度单向累加;AttnRes 改善模型深度方向的动态信息路由 | | **架构形态** | Encoder-Decoder | Decoder-only (GPT统一) | Decoder-only 原生多模态 | Decoder-only 统一无监督预训练,极度利于分布式并行通信与 KV Cache 显存管理 | | **优化器** | Adam + Warmup | AdamW 权重衰减 | Per-Head Muon 矩阵正交 | 传统 Adam 逐参数标量缩放;Muon 针对大矩阵施加谱正交约束,深层更新极其稳健 |
29 天前,K3 报告摘要的第一句话像一串密码;今天再读,每个名词都是一位老朋友。这就是这张大地图的价值:
逐词翻译:
课程结束了,但报告还在那里等你。现在的你,已经有能力独立通读《Kimi K3 技术报告》全文——按章节给你一张「读懂度」自查清单: