Attention→K3 三十天课 · Day 28 / 30 课程首页 面试速查 周测验
Day 28 · 第 4 周里程碑复盘

K3 全景拆解与设计存活表终极完成版

在这四周漫长而充实的旅程中,我们完成了从 2017 年的《Attention Is All You Need》到 2026 年的《Kimi K3 技术报告》的壮丽穿越!今天,我们把四大板块全部打通,点亮「近十年大模型设计存活表」的全部 7 大核心部件,实现通读全篇 K3 技术报告!

学完你能回答
完整讲清大模型从预训练到强化学习的工业全流程
学完你能回答
设计存活表 v3 终极完成版:7 大部件的演进逻辑
学完你能回答
本周 6 道工业级系统与训练面试题速查

1本周串讲:大模型全生命周期工业流向图

把第 4 周学过的预训练、SFT、RL、多模态与基础设施融会贯通:

现代大模型端到端全生命周期工业流水线 海量图文数据经过清洗进入预训练,产生基础 Base 模型,经 SFT 获得对话格式,再经沙箱强化学习产生 System 2 推理智能体,最终经专家并行基础设施高效部署 现代前沿大模型工业全流水线(《Kimi K3 技术报告》全景) 1. 预训练 海量图文语料 Scaling Law 4阶段扩窗 产物: Base 2. SFT 监督微调 少而精数据 表面对齐假说 Loss Masking 产物: Instruct 3. 强化学习 RL 持久代码沙箱 RLVR 自发纠错 长链条慢思考 产物: 推理智能体 4. 基础设施与开源部署 专家并行 EP (All-to-All) 计算通信重叠 Overlap 规模效率较 K2 提升 2.5× ★ 2.8T 权重全开源 ★
图 28.1:现代前沿大模型完整工业生命周期。从千亿 Token 预训练到持久沙箱强化学习,构成了现代前沿智能的完整拼图。

2独家记忆点:设计存活表完成版 v3(十年演进全景)

整门课程最核心的独家交付——「近十年大模型设计存活表」终极完成版!这 7 行表格凝聚了从 2017 年《Attention Is All You Need》到 2026 年《Kimi K3 技术报告》的全部精华:

部件 2017 原版 近十年接力改进 2026 K3 的终极选择 被取代/保留的核心原因
注意力 全量缩放点积 (MHA) MQA → GQA → MLA KDA + Gated MLA (3:1) Softmax 注意力 KV 显存 O(N)、算力 O(N²);KDA 以固定大小循环状态取代增长的 KV 缓存,MLA 大幅压缩 KV 缓存占用(DeepSeek-V2 提出)
位置信息 正弦绝对位置编码 相对位置 → RoPE 旋转 NoPE(衰减隐式编码) 绝对加法外推性差;NoPE 依托因果掩码与 KDA 遗忘门,百万 token 外推无需改编码
归一化 Post-LayerNorm Pre-LN 拓扑直通 RMSNorm(含 LatentMoE 插入) Post-LN 阻断残差导致深层难以收敛;RMSNorm 删去均值计算,更省访存、更快
前馈网络 单路密集 FFN 稀疏 MoE 概念复兴 Stable LatentMoE (896选16) 密集参数算力爆炸;MoE 解绑知识容量与算力,QB(分位数平衡)把残余负载不均衡压到观测不到可度量的水平,训练侧完美均衡另由 MoonEP 保障(Day 26 讲)
层间连接 标准残差 (x + f(x)) (长期无人改动) AttnRes 块级注意力残差 标准残差沿深度单向累加;AttnRes 改善模型深度方向的动态信息路由
架构形态 Encoder-Decoder Decoder-only (GPT统一) Decoder-only 原生多模态 Decoder-only 统一无监督预训练,极度利于分布式并行通信与 KV Cache 显存管理
优化器 Adam + Warmup AdamW 权重衰减 Per-Head Muon 矩阵正交 传统 Adam 逐参数标量缩放;Muon 针对大矩阵施加谱正交约束,深层更新极其稳健

3第 4 周面试题速查(D22–D27 核心 6 题)

本周 6 道工业系统与全生命周期面试高频考点速查:

D22 · 什么是 Scaling Law?长上下文预训练为什么必须分阶段渐进?
八股背诵:算力、参数和数据成幂律关系。一开始就训 1M 算力浪费且难以收敛,分阶段能以最低成本扩窗。
深刻回答:Scaling Law 确定了计算预算与参数/数据量的最优配比;长序列早期信噪比低,分阶段(如 K3 的 8K → 64K → 256K → 1M)在短序列阶段以最高吞吐沉淀稠密世界知识,后期冷却退火注入长依赖数据,把代价高昂的长序列计算集中在整体训练预算的一小部分内,平稳解锁百万上下文。
D23 · 表面对齐假说(LIMA)的核心观点是什么?SFT 为什么要做 Loss Masking?
八股背诵:知识在预训练就定型了,SFT 只是调教问答风格,数据少而精。Prompt 不算 Loss 避免模型背诵问题。
深刻回答:SFT 并未引入新的先验知识,而是调校多轮行为分布与角色扮演;低质数据会污染预训练概率流导致严重幻觉;Loss Masking 将 Prompt 标签置为 -100,使梯度更新完全聚焦在生成高质量 Response 上。
D24 · 强化学习 RL 为什么能激发大模型的 System 2 慢思考与自我纠错?
八股背诵:RL 靠结果奖励而不是局部模仿,模型能在代码沙箱里反复试错,涌现出思维链(CoT)和纠错能力。
深刻回答:SFT 强制拟合标注导致探索受限;RLVR(可验证强化学习)依托代码编译器或客观判题器,仅对最终结果给予标量 Reward;在采样式多轨迹探索中,长链条推导、假设验证与主动回溯的轨迹展现出显著更高的成功率,从而被策略梯度强化,实现了测试时算力(Test-time Compute)的智能跃迁。
D25 · 原生多模态(Native Multimodal)相比外挂 Adapter 有何本质优势?
八股背诵:外挂方案模态割裂,原生方案图文 token 在统一主干里自回归预训练,融合更深。
深刻回答:外挂方案多以 SigLIP 等对比预训练模型初始化视觉编码器,其表示偏重全局语义、牺牲细粒度文本与结构线索,且联合优化容易不稳定;原生多模态(如 K3 从零训练的 MoonViT-V2)由视觉编码器将图像转化为统一 token 序列,在单一 Next-Token 目标下与文本共同经历几十层深度注意力交互,表征空间彻底统一。
D26 · 2.8T MoE 模型训练中的专家并行(EP)通信瓶颈如何化解?
八股背诵:用 4D 混合并行切分模型,通过计算通信重叠(Overlap)隐藏 All-to-All 延迟。
深刻回答:节点内走高速互联运行 TP,节点间跨网络运行 EP;利用双缓冲流水线与独立 CUDA Stream,在 GPU 核心执行 Dense 计算与 GEMM 时异步发起下一层 MoE 的 All-to-All 数据分发,将通信开销掩盖在计算耗时内,再配合 QB(路由侧)与 MoonEP(训练执行侧)两条独立的负载均衡防线,避免慢卡拖累整体吞吐。
D27 · 为什么前沿基准全面转向长周期编程智能体(如 FrontierSWE)与研究生级科学问答(GPQA)?K3 的开源地位如何?
八股背诵:防数据污染,考察长周期真实软件工程任务和深度科学推演。K3 开源了完整 2.8T 权重,是全球首个开源的 3T 级模型。
深刻回答:传统单步选择题(MMLU)区分度低且易被污染;FrontierSWE 这类长周期基准要求模型在真实沙箱中完成复杂因果推演与数十步多轮工具调用,GPQA 则考察研究生级科学推理,二者真实检验长上下文与智能体能力;K3 在评测套件中稳定领先除最强闭源模型外的所有开源与专有模型,并开源万亿级完整权重,建立了所有人触手可及的开源新前沿。

4第 4 周测验:10 题综合验收

Q1 为什么说预训练在大模型全生命周期中占据了绝大部分算力?
解析:因为预训练需要在数万亿 token 的海量无监督语料上,将全人类的世界知识、语法和逻辑压缩进万亿参数中;而后续的 SFT 和 RL 仅使用数万到数十万条样本进行格式对齐和策略强化。
Q2 为什么 SFT 阶段追求「少而精」而不是盲目扩充数据量?
解析:根据表面对齐假说,SFT 主要是激发已有的知识表达格式。低质量的噪声数据会破坏预训练形成的平稳概率分布,引入幻觉;极少数高质量示范即可教会模型优质的交互风格。
Q3 简述强化学习中 RLVR(可验证奖励强化学习)的核心机制。
解析:利用代码编译器、自动化单元测试或数学答案比对等客观验证器,自动给模型的输出判定 Reward(+1/-1),无需依赖人工打分,实现高强度的自主探索与自我纠错。
Q4 什么是原生多模态(Native Multimodal)的「统一自回归」?
解析:视觉图片被切分成 Patch 转化为视觉 token,与文本 token 混排在同一序列中,在同一个 Decoder-only 主干网络里通过单一的 Next-Token 预测目标进行联合预训练。
Q5 专家并行(EP)中,GPU 之间主要依赖什么通信原语交换 token?
解析:依赖 All-to-All 全交换通信原语,所有 GPU 同时把各自批次中的 token 发送给目标专家所在的 GPU,并同时接收其他 GPU 派发给本卡专家的 token。
Q6 什么是「计算与通信重叠(Overlap)」?
解析:在 GPU 核心计算当前层矩阵乘法的同时,异步网卡利用后台通信流并行传输下一层的数据,将网络通信时延完全隐藏在计算耗时阴影中。
Q7 FrontierSWE 这类长周期编程基准主要考察大模型的什么能力?
解析:考察模型在长周期软件工程任务中自主分解问题、多轮调用工具、编写并验证代码的智能体解决能力,而非单步选择题式的知识回忆。
Q8 为什么 Kimi K3 采用了 3:1 的 KDA 与 Gated MLA 混合双轨?
解析:3 个 KDA 层以固定大小的循环状态做高效长序列混合(状态占用不随上下文长度增长),1 个 Gated MLA 层保持全局 token 间注意力,兼顾长上下文效率与全局交互能力。
Q9 K3 的 2.8T MoE 架构中,单 token 激活参数是多少?专家数量是多少?
解析:激活参数量为 104B,路由专家总数为 896 个(单 token 激活 16 个,休眠 98.2%)。
Q10 在设计存活表上,位置编码从 2017 到 2026 的演进路线是什么?
解析:2017 正弦绝对位置编码 → 相对位置编码 → RoPE 旋转位置编码 → 2026 K3 NoPE(无显式编码,靠因果掩码与 KDA 遗忘门隐式感知)。

5收官预告:最后 2 天|从全局地图到 50+ 题模拟面试

主体四周课程已全部毕业!最后两天(D29–D30)是整门课的两大终极交付日:

《从 Attention 到 K3 · 大模型近十年设计演进》30 天课 · Day 28 / 30 · 返回课程首页