Attention→K3 三十天课 · Day 30 / 30 终极收官 课程首页 初代表 压缩表 RL训练
Day 30 · 模拟面试日

模拟面试终极实战:56 道高频考点模拟题自测

恭喜你走完了整整 30 天的严密学习!今天我们将四大板块的所有硬核考点,汇编成 56 道高频考点模拟题。所有题目均配备独家「三段式答题法」(八股直觉 → 深刻机理 → 架构权衡),助你在任何技术答辩与面试中游刃有余!

毕业目标
掌握「三段式答题框架」,告别死记硬背
毕业目标
通关 6 大专题 56 道高频硬核面试自测
毕业目标
完成《Attention 到 K3》30 天课程,领取结业纪念

1大厂技术面试「三段式答题方法论」

怎样回答才能让大厂面试官眼前一亮?
• 第一段(八股直觉):用 1–2 句话直接命中定义和结论,展示基础扎实;
• 第二段(深刻机理):给出公式推导、矩阵维度或物理硬件逻辑(如显存带宽、梯度流动),展示专家级深度;
• 第三段(架构权衡 Trade-off):结合业界前沿(如从 2017 原版到 K3 的改进),讲清为什么选它、代价是什么、如何解决。
🛠 模拟考场控制台:

2专题一:初代 Attention 与 Transformer 基础(10 题)

01 相比 RNN 和 LSTM,2017 Transformer 的核心颠覆在哪里?
八股直觉RNN 存在 O(n) 时序串行依赖,GPU 无法并行;Transformer 的自注意力机制实现了全序列一次性并行计算,并直接将长程依赖距离缩短为 O(1)。
深刻机理RNN 隐藏状态 h_t = f(h_(t-1), x_t) 导致前向与反向传播必须按时序推进,硬件算力利用率(MFU)极低;Transformer 通过 QKᵀ 矩阵乘法,将时序关系转化为空间内积,完美适配 GPU Tensor Core 的并行矩阵加速。
架构权衡并行化的代价是注意力计算和显存随序列长度呈平方级 O(N²) 增长,这催生了后续 FlashAttention、线性注意力 KDA 等一系列工程演进。
02 缩放点积注意力中,为什么一定要除以 √d_k?不除会发生什么?
八股直觉防止内积数值过大导致 Softmax 进入饱和区,产生梯度消失。
深刻机理假设 q 和 k 的各个分量独立同分布且均值为 0、方差为 1,则内积 q·k = Σ_i q_i·k_i 的方差为 d_k。当 d_k 很大时,内积绝对值极大,Softmax 函数输出呈现极端 One-hot 分布,其局部导数趋近于 0。除以 √d_k 使方差重新归一化为 1。
架构权衡除以 √d_k 是以极小的标量运算代价,彻底保障了深层多头注意力的梯度平稳传递。
03 为什么多头注意力(MHA)要把维度切分成多个小头,而不是用一个大头?
八股直觉类似 CNN 的多通道卷积核,允许模型在不同表示子空间同时捕捉多种不同的语义关系。
深刻机理单头注意力只产生一组注意力权重分布,容易被最显著的单一相关性主导;h 个投影头(每个头维度 d_k = d_model / h)各自独立计算点积,在计算复杂度总量与单头严格守恒的前提下,大幅提升了模型的特征表征秩(Representation Rank)。
架构权衡MHA 的多头独立存储导致了推理阶段 KV Cache 的显存爆炸,后续演化出了 MQA、GQA 与 MLA 等低秩压缩变体。
04 简述 Transformer 中 Q、K、V 的角色分工。
八股直觉Q 是查询条件,K 是特征索引标签,V 是实际内容信息。
深刻机理借鉴经典数据库检索理念:当前 token 生成 Q 去与历史所有 token 的 K 做内积相似度比对,经 Softmax 归一化得到注意力权重分布,最终对 V 进行加权线性组合输出。
架构权衡将输入 x 通过三个独立投影矩阵解耦为 Q、K、V,比单一矩阵赋予了模型更强的非线性检索与特征路由表达力。
05 为什么语言生成必须加因果掩码(Causal Mask)?
八股直觉防止模型在自回归生成时“偷看”未来的答案。
深刻机理在训练阶段,自回归模型需要并行计算全序列的交叉熵损失;通过构造上三角置为 -∞ 的掩码矩阵,使 Softmax 在未来位置的注意力权重精确为 0,严格维持时序单向因果性。
架构权衡因果掩码破坏了双向注意力的全向感知(如 BERT),但完美契合了自回归预训练与大规模生成式交互。
06 为什么 Encoder-Decoder 逐渐被 Decoder-only 统一?
八股直觉Decoder-only 架构更统一、易扩展,自回归预训练天然兼容理解与生成任务。
深刻机理Decoder-only 免去了 Cross-Attention 的双重通信与状态缓存,在分布式张量并行(TP)与流水线并行(PP)上拓扑完全同构,极大简化了训练集群与 KV Cache 推理显存调度。
架构权衡虽然双向 Encoder 在特定分类抽取上略微高效,但 Decoder-only 在万亿参数 Scaling 与通用多任务泛化上展现出了压倒性优势。
07 2017 Transformer 为什么要引入前馈网络(FFN)?它占了多少参数?
八股直觉注意力只做线性加权聚合,FFN 引入非线性激活并充当“事实知识记忆库”,占整层约 2/3 参数。
深刻机理两层 MLP(维度 d_model → 4·d_model → d_model)通过 Key-Value 记忆网络机制存储预训练海量事实知识;若无 FFN,多次线性注意力叠加容易退化为低秩坍缩。
架构权衡密集 FFN 随参数变大计算开销剧增,直接催生了现代稀疏 MoE 架构的诞生。
08 2017 原版正弦绝对位置编码的数学原理是什么?
八股直觉用不同频率的正弦和余弦函数为每个位置生成独一无二的波形特征向量。
深刻机理依据三角函数和差化积公式,任意固定偏移量 k 的位置编码可以表示为位置 t 编码的线性变换(存在旋转矩阵 R_k 满足 PE_(t+k) = R_k · PE_t),赋予模型相对距离感知潜力。
架构权衡加法注入污染了原始语义词向量空间,且长文本外推时未见过的绝对位置值会引发严重的分布偏移,后被 RoPE 和 NoPE 取代。
09 残差连接(Residual Connection)的核心数学作用是什么?
八股直觉防止深层神经网络梯度消失与退化,让信息跨层直通。
深刻机理前向传播为 x_(l+1) = x_l + f(x_l),反向求导时 ∂L/∂x_l = (∂L/∂x_(l+1)) · (1 + ∂f/∂x_l)。常数项 +1 保证了无论分支导数如何,梯度始终有一条无衰减的直通高速通道传递至浅层。
架构权衡标准残差是标量逐层累加,在深达百层的现代模型中演进出了 AttnRes 块级注意力残差。
10 什么是 Post-LayerNorm?它有什么致命缺陷?
八股直觉将归一化放在残差相加之后;缺陷是深层梯度被反复除以方差而严重衰减,训练极易不稳定。
深刻机理Post-LN 破坏了纯净的加法直通路径(x_(l+1) = LN(x_l + f(x_l))),导致反向传播梯度链条必须穿透多次 LN 导数,浅层权重梯度极小,必须依赖小心翼翼的长 Warmup 预热。
架构权衡被 Pre-LN 拓扑完全取代,彻底解决了大模型训练初期的数值震荡问题。

3专题二:现代架构革新:归一化、位置与残差(10 题)

11 为什么 Pre-LN 成为几乎所有现代大模型(LLaMA/K3)的标准选择?
八股直觉Pre-LN 将归一化放在分支内部,保证主干残差纯加法直通,训练不震荡。
深刻机理形式为 x_(l+1) = x_l + f(LN(x_l)),展开后 x_L = x_0 + Σ_l f(LN(x_l)),求导时存在天然的恒等项 +1,消除了梯度消失风险,无需复杂的学习率调优即可稳定收敛。
架构权衡Pre-LN 在极深层数下主干信号模长会有所增长,现代模型通常配合 RMSNorm 保持数值尺度稳定。
12 RMSNorm 相比标准 LayerNorm 删减了什么?提速原理是什么?
八股直觉删掉了计算均值 μ 和中心化平移操作,仅保留均方根缩放;显著减少 GPU 显存带宽搬运。
深刻机理公式为 x̄ = x / RMS(x) ⊙ γ。大模型瓶颈在于显存访存带宽(Memory Bandwidth),删去两次求和均值统计量后,算子内核(Kernel)可在单次 GPU 寄存器读取中完成全部计算,更省访存、速度更快。
架构权衡去均值对特征表达能力几乎毫无损伤,RMSNorm 已成为当今开源大模型的统治级标准。
13 RoPE(旋转位置编码)的核心数学原理是什么?
八股直觉将向量每两维分成一组,在二维复数平面上旋转与位置成正比的角度,使内积仅取决于相对距离。
深刻机理通过正交旋转矩阵 R_Θ,m 变换 q,在计算注意力内积时:⟨R_m·q, R_n·k⟩ = qᵀ·R_(n−m)·k。绝对位置索引 m、n 在相乘时自然抵消,转化为仅含相对距离 n−m 的正交旋转。
架构权衡RoPE 具备天然的远程衰减性,但超长文本外推时高频分量易发生插值失真。
14 为什么 Kimi K3 敢于采用 NoPE(无显式位置编码)?
八股直觉因果掩码的下三角结构与 KDA 的逐通道遗忘门天然赋予了模型隐式时序感知。
深刻机理Decoder-only 的因果注意力矩阵破除了排列对称性;同时 KDA 线性注意力的通道衰减因子 α_t 引入了物理级别的单向时间衰减先验,无需在嵌入层显式编码位置即可自发区分时序顺序。
架构权衡彻底免去了超长序列扩展时复杂的 RoPE 频率基底调整与外推插值微调。
15 什么是 AttnRes(块级注意力残差)?解决了什么问题?
八股直觉在深层网络块之间引入动态注意力加权残差,改善深层特征流动。
深刻机理传统残差仅对浅层信号做无差别的简单加法累加,随着层数达到上百层,浅层特征容易被深层噪声稀释;AttnRes 允许模型动态依据相关性聚合历史块的残差特征。
架构权衡增加了极少量的跨块参数与状态管理,但显著改善了超深模型的表征稳定性。
16 什么是 SwiGLU 激活函数?为什么大模型纷纷抛弃 ReLU?
八股直觉结合了 Swish 激活与门控线性单元(GLU),表达能力远超硬截断的 ReLU。
深刻机理公式为 SwiGLU(x) = Swish(x·W₁) ⊙ (x·W₂)。平滑非单调的导数特性避免了神经元死锁(Dying ReLU),门控机制赋予了特征通道自适应信息过滤能力。
架构权衡需要 3 个权重矩阵,在相同参数量下通常将隐藏层维度缩减为原 FFN 的 2/3 × 4d。
17 大模型在 Prefill 和 Decode 两个阶段的计算特性有何本质不同?
八股直觉Prefill 是计算密集型(算得慢但跑满 GPU),Decode 是访存密集型(算得快但卡在显存读写)。
深刻机理Prefill 一次性处理长输入,进行大尺寸 GEMM 矩阵乘法,Arithmetic Intensity 极高(Compute-bound);Decode 每步只输入 1 个 token,进行 GEMV 向量矩阵乘法,GPU 算力核心长时间饥饿等待 HBM 搬运 KV Cache(Memory-bound)。
架构权衡催生了“计算与访存分离”的 Prefill/Decode 混合部署调度架构。
18 为什么 KV Cache 显存占用会随着并发数和上下文长度线性暴涨?
八股直觉每个并发请求的每个历史 token 都必须保存所有层的全部 Key 和 Value 向量。
深刻机理显存公式为 2(K+V) × 2 字节 × n_layers × n_heads × d_k × seq_len × batch_size。在 100 万 token 或千路并发下,KV 显存轻松突破数百 GB,远超模型权重本身。
架构权衡倒逼业界研发 PagedAttention 显存分页管理以及 GQA/MLA 压缩机制。
19 什么是 Per-Head Muon 优化器?相比传统 AdamW 有何突破?
八股直觉针对多头注意力矩阵施加谱范数正交化更新约束,训练稳定性极高。
深刻机理AdamW 仅对每个参数做标量一阶二阶矩估计,忽略了权重矩阵内部的几何结构;Muon 利用牛顿-舒尔茨迭代对更新矩阵进行正交化处理,约束谱半径,消除极深网络中的局部尖锐极小值。
架构权衡增加微量矩阵迭代开销,但允许模型以更高学习率稳定训练而不发生 Loss 尖峰。
20 为什么现代大模型普遍取消了注意力层后的 Dropout?
八股直觉预训练数据量达数万亿 token,模型几乎不会过拟合;Dropout 反而损害容量并降低训练效率。
深刻机理在大规模海量语料与自回归训练下,Underfitting(欠拟合)是主要矛盾;Dropout 会引入人工随机噪声并破坏 FlashAttention 等融合算子的极致硬件加速。
架构权衡移除了所有 Dropout,仅在特定微调小数据集时作为正则化备选。

4专题三:注意力压缩与线性注意力(10 题)

21 MQA(多查询注意力)的核心设计是什么?优缺点是什么?
八股直觉所有 Query 头强行共用同一组 Key 和 Value。
深刻机理将 KV 投影矩阵由多头压缩为单头,KV Cache 显存开销直接缩减至 1/h(例如 32 头下节省约 97% 显存),极大提升了推理并发吞吐。
架构权衡牺牲了一定的多子空间检索容量,在复杂长逻辑任务中性能有轻微掉点。
22 GQA(分组查询注意力)是如何平衡表达力与显存开销的?
八股直觉将 Query 头分组(如 8 组),每组共享 1 组 Key/Value,成为 LLaMA-3 的标准选择。
深刻机理介于 MHA 与 MQA 之间的折中平衡点:例如 32 个 Query 头分为 8 组(GQA-8),显存压缩至原版 25%,同时精度表现几乎与全量 MHA 毫无差异。
架构权衡虽优于 MQA,但在超长百万 token 序列下 KV 显存依然随长度线性增长。
23 MLA(多头潜在注意力)是如何实现降维打击的?
八股直觉用低秩投影将 KV 压缩为低维隐向量 c_t^KV,显存只存潜在向量,显存占用大幅降低(省约 90%,示意)且表达能力不降。
深刻机理通过下投影矩阵将隐藏状态压缩为 c_t^KV(一个 d_c 维向量);推理时利用矩阵乘法结合律,将解压矩阵预先吸收到 Query 投影中,实现计算时完全无需在显存中展开多头 KV。
架构权衡解耦了 RoPE 位置键以保留相对位置感知,奠定了 DeepSeek 与 K3 的长上下文推理基石。
24 线性注意力为什么能把计算和显存降为常数 O(1)?
八股直觉去掉 Softmax 束缚,利用乘法结合律调换相乘顺序,把所有历史信息融合进固定尺寸矩阵 S_t。
深刻机理公式变换为 Q(KᵀV),维护一个固定维度 d×d 的状态矩阵 S_t = S_(t-1) + k_t·v_tᵀ。解码单步仅需 o_t = q_t·S_t,计算与显存彻底与序列长度解耦。
架构权衡去 Softmax 后注意力权重平坦化,传统线性注意力面临状态饱和与长程召回退化。
25 KDA(Kimi Delta Attention)的「Delta 规则」解决了什么核心痛点?
八股直觉避免盲目累加导致的状态记忆饱和,用预测残差差值定向覆盖旧状态。
深刻机理更新公式为 S_t = S_(t-1) + β_t·(v_t − S_(t-1)·k_t)·k_tᵀ。先用旧状态预测当前 Value,仅以误差差值(Δ)更新联想记忆;固定大小的状态让长文本推理的状态占用不随长度增长,避免了盲目累加导致的数值爆炸。
架构权衡单步计算增加了一次内积残差,但大幅提升了长文本信息检索的清晰度。
26 KDA 中的「逐通道遗忘门 α_t」起到了什么作用?
八股直觉给不同特征维度赋予自适应的动态衰减率,重要的长期知识慢遗忘,局部修饰词快遗忘。
深刻机理状态更新变为 S_t = α_t ⊙ S_(t-1) + Δ_t。数据依赖的门控使模型具备多时间尺度的记忆衰减机制,同时天然形成了物理时序偏置。
架构权衡使线性注意力获得了媲美 RNN 遗忘门的高阶控制力。
27 为什么 Kimi K3 采用 3:1 的 KDA 与 Gated MLA 混合双轨?
八股直觉75% 的 KDA 跑高速省算力,25% 的 MLA 保证全局精准 Softmax 召回。
深刻机理纯线性注意力在极端复杂的全局检索与精密逻辑上仍有缺陷;3:1 周期交替用 25% 的 Gated MLA 层保持全局 token 间注意力、兜住召回精度,同时让其余 75% 的 KDA 层以固定大小状态高效运行。
架构权衡兼顾了理论吞吐极限与最强下游任务精度的帕累托最优。
28 FlashAttention 的核心加速原理是什么?它改变了数学结果吗?
八股直觉通过分块计算(Tiling)和重计算,完全不改变数学结果(无损),大幅减少显存读写。
深刻机理利用在线 Softmax(Online Softmax)技巧,在 GPU 片上高速 SRAM 缓存中分块完成 QKᵀ 与 V 的融合计算,避免在慢速 HBM 显存中物化巨大的 N×N 中间矩阵。
架构权衡前向传播不存 Attention 方阵,反向传播靠 SRAM 内重算,以少量算力换取显存带宽利用率翻倍。
29 什么是 PagedAttention?解决了什么显存碎片问题?
八股直觉借鉴操作系统的虚拟内存分页机制,将连续的 KV Cache 离散存储在不连续的物理显存块中。
深刻机理传统显存预分配导致内部碎片(未填满的预留空间)与外部碎片高额浪费;PagedAttention 按固定 Block 动态申请释放,将显存浪费率从 60% 降至 4% 以下(数字为示意)。
架构权衡vLLM 等现代推理框架的核心基础设施基石。
30 简述从 2017 MHA 到 2026 KDA+MLA 的十年注意力压缩主线脉络。
八股直觉MHA(未压缩)→ MQA/GQA(剪裁头数共享)→ MLA(低秩潜在压缩)→ KDA+MLA 混合(线性常数显存 + 低秩高精双轨)。
深刻机理一条清晰的从「粗暴参数剪裁」到「矩阵低秩数学降维」,再到「脱离 Softmax 实现循环状态递推」的工业自救史诗。
架构权衡使百亿到万亿参数模型在 100 万 token 上下文下的实时低成本服务成为现实。

5专题四:MoE 与负载均衡(8 题)

31 什么是 MoE(混合专家模型)?它为什么能解绑参数量与算力?
八股直觉把单一庞大 FFN 拆成许多小专家,每次仅通过门控 Router 激活少数几个专家。
深刻机理总参数量决定了模型容纳世界知识的静态容量,而激活参数量(Top-k 计算量)决定了单步推理的动态 FLOPs。MoE 实现了知识容量以数十倍扩展,而计算开销维持在极小水平。
架构权衡K3 达到了 2.8T 总参数仅消耗 104B 激活算力。
32 K3 的「896 选 16」是什么概念?休眠比例是多少?
八股直觉每个 token 从 896 个细粒度路由专家中激活 16 个,休眠专家占比高达 98.2%。
深刻机理相比早期的粗粒度 Top-2 方案,细粒度专家群(Fine-grained Experts)提供了指数级的专业组合能力(C(896, 16) 种组合),知识专业化分工更纯粹。
架构权衡细粒度专家增加了分布式节点间的通信调度频次,需要强大的 All-to-All 基础设施支撑。
33 专家路由中的「负载失衡(Load Imbalance)」会引发什么严重后果?
八股直觉少数热门专家被累死丢弃 token,大量冷门专家得不到训练变成僵尸权重,多卡训练严重卡顿。
深刻机理马太效应导致 Router 偏好单一路径;过载卡显存溢出发生 Token Drop,欠载卡提前结束进入空转等待(Straggler),整个集群吞吐断崖式下跌。
架构权衡是 MoE 从理论走向工业化生产的最大拦路虎。
34 传统 Auxiliary Loss(辅助损失)解决负载不均有什么副作用?
八股直觉把均衡目标强行加进损失函数,干扰主任务梯度优化,损伤模型精度。
深刻机理辅助 Loss 强迫模型在不适合的专家上分配概率,梯度反向传播污染了真实的语义表征学习。
架构权衡迫使业界探索无辅助损失(Auxiliary-loss-free)的偏置路由机制。
35 K3 的 QB(基于分位数的直方图均衡)偏置调整是如何实现无损均衡的?
八股直觉统计专家的激活排名分位数,在门控打分上动态做加减偏置,不改动反向梯度。
深刻机理对过度激活的热门专家施加动态降温偏置,对冷门专家施加助推偏置;由于偏置项不参与主干求导、不改变混合权重,在实际训练中观测不到可度量的残余负载不均衡,且不损伤任务表征能力。
架构权衡大幅缓解了大规模分布式训练中的通信慢卡木桶效应(训练侧的完美均衡另有 MoonEP 防线,Day 26 讲)。
36 什么是共享专家(Shared Experts)?它的作用是什么?
八股直觉每个 token 必须无条件经过的固定专家,专门负责沉淀通用基础常识。
深刻机理让共享专家兜底基础语法与常识逻辑,使其余路由专家能够心无旁骛地专精于细分领域知识。
架构权衡少量增加了固定激活参数,但显著提升了路由专家的专业化区分度。
37 为什么说 MoE 极其消耗显存容量,却节省推理算力?
八股直觉所有 2.8T 专家必须常驻在 GPU 显存中(需要超大规模集群),但每次只有 104B 在通电计算。
深刻机理显存容量开销对应总参数量(O(N_total)),浮点运算开销对应激活参数量(O(N_active))。MoE 是以显存容量换取单步推理延迟与计算成本的极佳工程实践。
架构权衡适合超大规模高并发服务,单卡边缘端部署则受限于显存门槛。
38 在设计存活表上,前馈网络经历了怎样的十年蜕变?
八股直觉2017 单路密集 FFN → 2020 粗粒度 MoE → 2026 K3 细粒度 Stable LatentMoE (896选16, QB)。
深刻机理从全员苦干的密集模型,走向高度专业化分工、98.2% 专家休眠的超稀疏智能体网络。
架构权衡成为当今 2T+ 参数前沿模型唯一的规模化生存法则。

6专题五:预训练、SFT 与强化学习(10 题)

39 预训练自回归的数学目标是什么?为什么说「压缩即智能」?
八股直觉最大化对下一个 token 的条件对数似然 Σ log P(x_t | x_1 … x_(t-1));极致预测下一个 token 必须在参数中压缩全世界的运行规律。
深刻机理自回归损失等价于对人类文明语料分布的无损交叉熵压缩;只有在隐空间构建了物理因果、语法与逻辑推理模型,才能在数万亿 token 尺度上持续降低测试集交叉熵损失。
架构权衡消耗了整个项目绝大部分的算力与电费,筑牢了一切智能的根本底座。
40 简述 Chinchilla Scaling Law 的核心启示。
八股直觉参数量与训练 token 量应同等比例放大,早期模型严重欠训练(Under-trained)。
深刻机理在固定计算预算 C ≈ 6·N·D 下,最优参数量 N 与数据量 D 呈对称幂律增长,推动了工业界从盲目堆参数转向使用数十万亿高质量 token 充分训练精悍模型。
架构权衡为万亿 MoE 的算力分配提供了严格的理论数学锚点。
41 K3 预训练是如何实现 100 万 token 长上下文渐进扩展的?
八股直觉四阶段课程:8K 启动 → 64K 核心 → 256K 退火 → 100 万 token 终极对齐。
深刻机理早期以短序列最大吞吐建立稠密知识库,后期 cooldown(冷却退火)阶段注入高质量长依赖合成数据,将代价高昂的长序列计算集中在整体训练预算的一小部分内,让模型逐步适应越来越长程的依赖。
架构权衡长程能力在 AA-LCR(Artificial Analysis Long Context Reasoning,第三方长上下文推理评测)等基准上接受检验。
42 什么是表面对齐假说(LIMA)?它对 SFT 数据工程有何指导意义?
八股直觉知识在预训练就定型了,SFT 只是激发交互风格;指导 SFT 追求「少而精」而非盲目堆量。
深刻机理SFT 数据量少(数千到数万条)但质量极高;低质噪声数据会破坏预训练学成的平稳先验分布并引发幻觉。
架构权衡后训练数据工程的最高原则:质量远胜数量。
43 SFT 训练中为什么要执行 Loss Masking(设置 Label=-100)?
八股直觉Prompt 部分不算损失,只对 Assistant 回复部分计算交叉熵梯度。
深刻机理模型的目标是学会“根据问题给出优质解答”,而不是背诵千奇百怪的用户提问;Masking 避免了无效梯度对模型参数的随机震荡。
架构权衡标准 SFT 训练代码必备的黄金工程细节。
44 为什么 SFT 无法突破人类上限,而强化学习(RL)可以?
八股直觉SFT 强制拟合人工标注(模仿上限),RL 靠环境奖励自主探索全局最优解(超越人类)。
深刻机理SFT 惩罚任何与标注不同的新解法;RL 仅关注最终结果是否客观正确,赋予模型在广阔解空间自由探索、多路假设验证与自发纠错的权利。
架构权衡使模型从直觉快思考(System 1)跃迁至长链条深度慢思考(System 2)。
45 什么是 RLVR(基于可验证奖励的强化学习)?为什么在代码数学上大获成功?
八股直觉利用编译器、单测或确定性数学比对自动判题给予 Reward,无需人工主观打分。
深刻机理代码和数学具备绝对客观的可验证性,避免了奖励作弊(Reward Hacking)与人类主观打分噪声,支撑数百万次高强度自动化闭环策略迭代。
架构权衡成为激发大模型复杂推理能力的绝对主力范式。
46 什么是 Test-time Compute(测试时算力扩展)?
八股直觉在推理阶段给模型分配更多思考 token 和搜索预算,以算力换取解难题的高成功率。
深刻机理推理模型不再按固定长度脱口而出,而是动态展开思考链、多分支探索与沙箱试错,打破了单次前向传播的计算预算枷锁。
架构权衡K3 支持 low 到 max 推理力度自由调节。
47 K3 的长周期智能体 RL 是如何在真实沙箱中训练的?
八股直觉让模型在持久化 Linux 沙箱中多步执行命令、查阅报错并自主 Debug,直到单测全绿。
深刻机理结合百万 token 上下文维护长期状态(Stateful Sandbox),在长达数十步甚至上百步的真实工程交互中进行强化学习策略优化。
架构权衡奠定了在 FrontierSWE、DeepSWE 等长周期软件工程智能体评测上的前沿成绩。
48 简述从预训练、SFT 到 RL 的现代大模型三阶段协同流水线。
八股直觉预训练注入世界知识(炼内功),SFT 对齐对话格式(学规矩),RL 激发深度推理与纠错(成大师)。
深刻机理三者在算力开销(预训练占绝对大头,SFT 与 RL 只占整体训练预算的一小部分)、数据形式(无监督 vs 精选示范 vs 标量奖励)与能力维度上各司其职,缺一不可。
架构权衡现代通用前沿大模型的标准生产工业流水线。

7专题六:多模态、系统工程与前沿评测(8 题)

49 原生多模态(Native Multimodal)的核心架构优势是什么?
八股直觉视觉与文本 token 在统一的 2.8T 主干网络中从头联合自回归预训练,模态融合无缝。
深刻机理此前的做法是以 SigLIP 等对比预训练模型初始化视觉编码器(偏重全局语义、牺牲细粒度线索);K3 放弃这一做法,完全从零开始、以下一 token 预测训练 MoonViT-V2,使视觉与文本 token 在统一主干中充分交互,精通细粒度几何、密集 OCR 与长视频理解。
架构权衡K3 采用自研 MoonViT-V2,配合 2×2 pixel-shuffle 下采样,把最高 3584×3584 像素的输入装进 100 万 token 上下文。
50 2.8T 巨兽的专家并行(EP)中,跨卡通信的瓶颈是什么?如何化解?
八股直觉All-to-All 全跨卡分发容易导致网络拥堵和慢卡等待;通过计算通信重叠(Overlap)与 QB 均衡化解。
深刻机理在 GPU 计算当前层密集注意力时,异步网卡利用独立 CUDA 流后台发起下一层专家的 RDMA 网络分发,将通信耗时完全隐藏在 GEMM 计算耗时阴影中。
架构权衡实现了超大规模 GPU 集群上的高模型算力利用率(MFU)。
51 什么是 4D 混合并行?DP、TP、PP、EP 分别解决什么维度的切分?
八股直觉DP 分切批次样本,TP 分切单个算子矩阵,PP 按网络深度层数切分,EP 切分 MoE 专家池。
深刻机理节点内依托高带宽 NVLink 走 TP,跨节点网络走 PP 和 EP,全局外层包络 DP,在多层物理拓扑下达到显存与网络带宽的最优协同。
架构权衡万亿级超大规模大模型训练的标准基础设施拓扑。
52 FrontierSWE 这类长周期编程基准考察的是什么能力?
八股直觉要求模型在真实软件工程任务上进行长周期智能体交互:定位问题、修改代码、迭代验证,而不是一次性问答。
深刻机理长周期任务把百万 token 长上下文检索、代码理解、工具调用与沙箱纠错串成一条链,考察的是整条智能体链路而非单点编码能力,也最大程度避免了刷榜与数据污染。
架构权衡K3 在 FrontierSWE 上以 81.2% 排名第二(截至 2026 年 7 月 16 日),仅次于 Claude Fable 5(86.6%),并大幅领先其他所有模型。
53 GPQA Diamond 评测的核心难度在哪里?
八股直觉由数理化博士专家盲审命题,题目防搜索引擎检索,考察极严谨的多步科学因果推演。
深刻机理排除了记忆性问答,专注于对前沿模型抽象思维与深度逻辑推导极限的高压检验。
架构权衡已成为衡量前沿推理模型代际跃迁的试金石。
54 Kimi K3 在全球竞技格局中处于什么位置?与顶尖专有模型有何差距?
八股直觉稳居全球开源阵营第一并超越绝大多数专有模型,仅落后于 Claude Fable 5 与 GPT-5.6 Sol。
深刻机理在长周期编程与智能体上逼近极境,差距主要存在于极端冷门学科的超大规模强化学习试炼场与极长多跳哲学推理。
架构权衡K3 开源了完整的 2.8T 权重,具有划时代的社区普及意义。
55 为什么说「设计存活表终极版」反映了近十年大模型的工程哲学?
八股直觉2017 原版的 7 大部件全被升级或重构,体现了围绕“显存、计算效率与训练稳定性”的极限追求。
深刻机理每一个模块的更迭都不是为了花哨的新概念,而是为了攻克 GPU 硬件物理墙(显存带宽墙、通信延迟墙、数值下溢墙)的必然选择。
架构权衡大模型发展的终极动力:在硬件约束下榨干每一焦耳电能的智能产出。
56 学完本课程后,如果面对一个全新的大模型架构,你应该从哪几个维度去剖析它?
八股直觉一看注意力与位置编码(长序列吞吐),二看归一化与残差拓扑(深层稳定性),三看 FFN 与 MoE(参数算力比),四看训练与系统基础设施(数据和并行)。
深刻机理架构决定理论上限,数据决定知识底座,强化学习决定推理深度,系统工程决定落地可行性。
架构权衡融会贯通底层原理,以不变的物理与数学规律应对万变的 AI 技术浪潮。

8下一步建议:按岗位分流

56 道题刷完,课程正式收官。但同样这套知识,不同岗位的人下一步该补的东西完全不同——别再用同一张书单了。

产品与运营岗:把技术理解「讲出来」

你不需要会推导公式,但需要能把技术翻译成业务语言。建议做三件事:

• 练转译:挑本课 3–5 个核心概念(注意力、KV Cache、MoE、强化学习),各写一段 200 字的白话解释,能给完全不懂技术的同事讲懂为止;
• 懂代价:讨论产品方案时说得出「这个功能为什么要付出显存、延迟或算力代价」——比如长上下文为什么贵、生成回答为什么慢在 Decode 阶段;
• 会追问:面对一个新架构发布,能用第 56 题的四个维度(注意力与位置、归一化与残差、FFN 与 MoE、训练与系统)向技术同事提出对的问题。

技术岗:三张补差清单

• 数学推导:亲手推一遍本课出现过的关键结论——内积方差随 d_k 增长所以要除以 √d_k、残差连接的梯度直通、RoPE 内积只含相对距离。能推出来,才算真懂;
• 手写代码:用 NumPy 从零实现一次带因果掩码的单头注意力,再写一个最简 KV Cache 解码循环,跑通一次胜过读十篇博客;
• 系统工程:补 GPU 显存层次(HBM/SRAM)、4D 混合并行(DP/TP/PP/EP)与推理服务(Prefill/Decode 分离、PagedAttention)的动手实验,最好在真实推理框架(如 vLLM)上完整跑通一次。

GRADUATION CERTIFICATE

🎉 恭喜你完成 30 天大模型设计演进全景通关!

从 2017 年《Attention Is All You Need》的开山基石,到 2026 年《Kimi K3 技术报告》的万亿前沿总成;从注意力内积到 NoPE、从 RMSNorm 到 896 选 16 的 Stable LatentMoE、从 Scaling Law 到沙箱长周期强化学习——你已经建立起了最系统、最硬核的大模型全景心智模型!

带着这套扎实的心智地图与三段式答题武器,勇敢去征服每一个大模型架构与算法巅峰!

《从 Attention 到 K3 · 大模型近十年设计演进》30 天课 · Day 30 / 30 终极大结局 · 返回课程首页