Attention→K3 三十天课 · Day 7 / 30 课程首页 面试视角 自测题
Day 7 · 周复盘 + 周测验

一周毕业考:把 K3 报告摘要读成大白话

第一周没有公式、没有代码,只建了一个心智模型:AI 说话 = 接龙,接龙靠打分,打分准头来自训练。今天做三件事——把 D1–D6 串成一条流水线、拿它逐词精读 K3 报告摘要、再用 10 道测验题验收。读过 7 天版的同学,这一天可以当查漏补缺。

学完你能回答
用一条流水线讲清「AI 说出一句话」的全过程
学完你能回答
K3 摘要里 2.8T / 104B / 896 选 16 / 100 万 token 分别是什么意思
学完你能回答
本周 6 道面试题,各用三句话给出「带为什么」的回答

1本周串讲:六天串成一条流水线

第一周的六天,其实不是六个孤立知识点,而是一台机器的六个零件。把它们按数据流动的顺序装起来,就是下面这张图——一段回答从「你说出口」到「AI 接完龙」的完整旅程:

一段回答的诞生流水线:文本拆成 token、发坐标、打分、采样、接龙循环,训练在幕后,窗口是边界 输入文本经 D2 拆 token、D3 发坐标、D1 打分、D4 采样,接回末尾循环;D5 训练在幕后提供打分准头,D6 窗口限制可见范围 一个回答的诞生流水线(框上的 Dn = 本周第几天讲的) 输入文本 「今天天气真」 D2 · 拆 token 今天 | 天气 | 真 D3 · 发坐标 每个 token 一串坐标 D1 · 打分 好 55% | 不错 22% D4 · 采样挑一个 按分数比例抽签 接到末尾 「今天天气真好」 接龙循环:每接出一个 token,拼回去再跑一遍(D1) D5 · 训练(幕后) 打分的准头,来自训练期一遍遍做题改错 D6 · 上下文窗口(边界) 流水线一次最多「看见」100 万 token
图 1 · 本周六天,一图收拢:文本进来先拆成 token(D2),每个 token 领一串坐标(D3),模型看着前面所有内容给候选 token 打分(D1),按分数采样挑一个接到末尾(D4),然后拼回去再来一遍——你看到的一整段回答,就是这个循环跑了几百上千次。打分的准头来自训练期的「做题改错」(D5),而整条流水线一次能「看见」的范围有上限,就是上下文窗口(D6)。图中分数与文本均为示意。

一天一句话,本周速览

打个比方
整条流水线像一家餐厅:客人点的菜(输入文本)先被切成标准食材(token),每样食材在货架上有固定位置(坐标),厨师尝一口决定下一味调料加什么(打分),偶尔凭手气换一种加法会出新菜(采样)。厨师的手艺是过去十年练出来的(训练),而案板就那么大,摆不下的食材他只能当不存在(窗口)。
严格来说:真实模型不是「依次加调料」——每一层里所有 token 是并行打分的,而且每个 token 只能参考排在它前面的内容,不能偷看后面(这条因果律第 2 周讲注意力时会反复强调)。
第一周里程碑达成检查:如果你能用图 1 向朋友讲清「AI 是怎么说出一段话的」,并且不借助任何「魔法」「意识」这类词,第一周的使命就完成了。

2K3 报告 §1 摘要:逐词精读

D1 那天我们看摘要像看天书,今天重来一次。打开《Kimi K3 技术报告》,摘要的第一句话是:

K3 原文(摘要)
「我们推出 Kimi K3:一个总参数量 2.8T 的混合专家(MoE)模型,激活参数 104B,具备原生视觉能力,上下文窗口达 100 万 token。」

逐词精读——这句话现在你能读懂什么:

  • 「总参数量 2.8T」✅ 完全读懂:参数就是 D5 说的「脑子里的数字」,训练时一遍遍被调整的那些。2.8T 即约 2.8 万亿个——这是这台接龙打分机的「脑容量」总量。
  • 「激活参数 104B」◐ 读懂一半:处理每个 token 时,真正参与计算的只有约 1040 亿个数字,约占总量的 1/27。「为什么能只用一部分还不掉链子」靠的是 MoE 机制本身——第 3 周(D18–D20)讲透。
  • 「混合专家(MoE)」◐ 读懂一半:把大脑拆成许多「专家小组」,每个 token 只叫醒其中几个干活,其余休息。这是「总量巨大」和「算得省」能同时成立的原因——机制细节第 3 周(D20)讲。
  • 「原生视觉能力」◐ 读懂一半:用 D2 的概念就能推出来——图片和视频也被切成 token,和文字 token 进同一个模型、走同一条流水线,而不是后期拼接一个「外挂眼睛」。「原生」意味着从训练第一天起图文就混在一起学——视觉部分的细节第 4 周(D23)讲。
  • 「上下文窗口达 100 万 token」✅ 完全读懂:这就是 D6 的窗口——流水线一次能「看见」的范围。换算一下量级(本课唯一一次字/token 换算:约 1 个汉字 ≈ 0.7–1 token):100 万 token 大致是一整部《红楼梦》还装得下富余的量。

再看摘要里紧挨着的另一句:

「这些进展,连同每个 token 从 896 个路由专家中有效激活 16 个的 Stable LatentMoE……」(摘要);§1 引言里写得更细:「Stable LatentMoE 将路由专家空间扩展到 896 个专家,每个 token 激活 16 个」。

「896 选 16」就是上面 MoE 的具体数字版:专家小组一共 896 个,每个 token 只派 16 个上场——相当于每 56 个里选 1 个,其余 98.2%(由 896/16 换算)此刻在休息(报告 §2.3 称之为「稀疏度 56」)。为什么敢把 98.2% 的专家晾在一边还不掉质量、896 个专家怎么分工不均怎么办——第 3 周(D20)讲。

2.8T 总参数与 104B 激活参数对比,及 896 个专家每 token 选 16 个的稀疏示意 总参数条长 560,激活条长按 27 比 1 等比缩到约 20;56 个方块代表每 56 个专家只上场 1 个 「巨大」与「很省」同时成立(条长按 27:1 等比绘制) 总参数 2.8T ≈ 2.8 万亿个数字 每个 token 激活 104B 只有约 1/27 真正参与计算,其余在休息 896 选 16 = 每 56 个专家上场 1 个(下图 56 格 = 56 个专家,示意)
图 2 · 摘要里最有反差感的一组数字:2.8T 总参数是「脑容量」,104B 激活是「每想一步真正动用的部分」——MoE 让这两件事同时成立(报告 §2.3 给出稀疏度 56,即 896÷16)。下面 56 个格子里只有 1 个橙色:每个 token 过来,只有约 2% 的专家为它干活。104B 不只有上场专家,还包括每层都要走的注意力与共享部分,所以是约 1/27 而不是 1/56。具体怎么选、选错了怎么办,第 3 周讲。
2.8T
总参数(摘要)
脑容量总量
104B
激活参数(摘要)
每个 token 实际动用
896→16
路由专家(§1)
每个 token 选 16 个
100 万
上下文窗口(摘要)
单位:token
摘要里还有几个词,现在读不懂——正常,先挂号 摘要和 §1 还出现了 KDA(一种省缓存的看上下文方式,第 3 周 D19 讲)、AttnRes(层与层之间的新连法,第 3 周 D21 讲)、强化学习后训练(训练出「会干活」而不只是「会接龙」,第 4 周 D25 讲)。今天只需记住它们都服务于图 1 那条流水线——没有一个是流水线之外的新物种。
进阶小注 ·「激活参数约 104B」来自稀疏激活:前向时路由只把 token 派给 16/896 个专家,未选中专家的权重不参与本次矩阵乘。稀疏度 56 = 896 ÷ 16(报告 §2.3)。

3本周面试题速查(D1–D6 各一道)

把本周 6 道面试题压缩成速查卡:每张卡先给一句「八股答」(背书的下限),再给三句话的「本课答」(带为什么)。面试时用本课答的骨架,往里填你自己的例子。

面试视角 · D1 接龙
面试官可能会问:「大语言模型本质上是在做什么?」
八股答自回归地逐 token 生成:每一步输出 token 表上的概率分布,采样一个接上去。
本课答本质是接龙:每一步看着已生成的全部内容,给 token 表里每个候选打分,挑一个接到末尾,再重复。所以一段话不是「想好了再说」,而是同一个打分动作重复几百上千次。这也解释了幻觉——接龙机制里没有「事实核查」这一步,流畅不等于真实。
面试视角 · D2 token
面试官可能会问:「为什么不能直接按字训练,要拆 token?」
八股答按字词表太大、按字母语义太碎,BPE 是折中方案。
本课答计算机只认数字,文字必须先编号;按整词编号,词表会随新词不断膨胀、永远收不全,按字母编号又拼不出完整意思。token 是「不大不小的零件」:常用零件覆盖几乎所有文本,生词也能拆成熟零件拼出来。而且 token 还是计费与上下文长度的统一计量单位——K3 摘要里的「100 万」说的正是它。
面试视角 · D3 坐标
面试官可能会问:「都说意思相近的词在向量空间里距离近——这个『近』是怎么来的?」
八股答Embedding 把离散 token 映射为连续向量,供神经网络计算。
本课答坐标一开始是随机的;训练中「我养了一只__」这类空格里猫、狗总可以互换,猜错了反向传播就把它们的坐标往一起调——亿万次之后,意思相近的 token 自动挨近。这张语义地图不是人工标注的,是训练为了猜准下一个 token 顺带学出来的副产品。
面试视角 · D4 采样
面试官可能会问:「大模型的温度调高会发生什么?为什么?」
八股答温度控制 softmax 分布的平滑度,高温让输出更随机。
本课答温度是随机性旋钮:调高会把高分候选和低分候选的分差拉平,低分候选也有机会被抽中,输出更跳脱也更容易胡说;调到 0 永远选最高分,稳定但死板。同门旋钮 top-p 是「只在累计概率够到 95% 的头部候选里抽」。K3 评测就用温度 1.0、单步任务 top-p 0.95(报告 §6.1.3)——是「接近自然生成状态」的配置。
面试视角 · D5 训练
面试官可能会问:「训练和推理的区别是什么?为什么训练贵那么多?」
八股答训练更新参数,推理冻结参数只做前向计算。
本课答训练是「改数字」:做题、对答案、按错的程度调整参数,重复亿万次;推理是「用数字」:参数一个不动,只做打分接龙。贵的原因也在此:单看一个 token,训练既要前向又要反向传播,成本大约是纯前向推理的 3 倍;而一次完整训练要在十几万亿 token 上前向+反向各跑一遍,相比一次对话推理贵出多个数量级。你聊天时它处在推理状态,所以它并没有把你的话「学进脑子」——要让它真正学会新东西,必须回到训练流程。
面试视角 · D6 窗口
面试官可能会问:「现在模型的上下文窗口越做越长,是不是越大越好?」
八股答窗口是模型一次能处理的最大 token 数,超出部分会被截断。
本课答不一定。窗口是 AI 的「工作台大小」:100 万 token 内的内容打分时都能参考,窗外的不存在——不是忘了,是从没进过视野。但「看得见」不等于「全记住」:内容越长,中间细节越容易被稀释,而且窗口越大成本越高。所以超长文档任务不能只靠堆窗口,还要配合检索、分段等工程手段。

4周测验:10 题验收(先自己答,再点开)

Q1(D1)AI 每说一个 token 之前,它到底在「算」什么?
它在给 token 表里每一个候选打一个分,分数再换算成「可能性」——合计正好 100%——然后挑一个接到末尾。它不是先想好整句再开口,而是把「打分 → 挑一个」这一个动作重复几百上千次。
Q2(D1)为什么 AI 会一本正经地胡说八道?
因为它是接龙打分机,不是数据库:知识藏在「这种说法后面通常怎么接」的统计规律里,机制里没有事实核查这一步。所以它能用非常流畅的句子说出完全虚构的内容——这不是「骗你」,是它的工作方式里本来就没有「查证」。
Q3(D2)为什么 AI 不按「一个汉字一个编号」或「一个字母一个编号」来认字?
按整词编号,词表会随新词不断膨胀、永远收不全;按单个汉字或字母编号,词表是小了,但序列会拖得很长,而且单个字/字母语义太碎——完整意思要拼许多个才表达出来,模型学起来费劲。token 走中间路线:不大不小的零件——常用零件拼得出几乎所有文本,生词也能拆成熟零件。
Q4(D2 + D6)K3 的「上下文窗口 100 万 token」大约是什么量级?
按本课 §2 给出的换算比例,100 万 token 大致相当于一整部《红楼梦》还装得下富余。注意这是「工作台大小」而不是「记忆力」——窗口内看得见,不等于每个细节都记得牢。
Q5(D3)编号 421 和 422(示意)明明相邻,为什么说编号「不带语义」?Embedding 怎么解决?
编号只是查表用的门牌号:422 在数字上挨着 421,意思却可能风马牛不相及。Embedding 给每个 token 发一串坐标,让意思相近的 token 在坐标空间里挨得近——「猫」和「狗」近,「编译器」远。这张语义地图是训练顺带学出来的,没有人工标注。
Q6(D4)温度调高会发生什么?温度 0 呢?
调高温度会把高分与低分候选的分差拉平,低分候选也可能被抽中:输出更跳脱、更有「创意」,也更容易跑题。温度 0 则永远选分数最高的候选:稳定可靠但死板。两个极端没有对错,看你要「创意」还是要「保险」。
Q7(D4)top-p 0.95 是什么意思?K3 评测用的采样配置是什么?
top-p 0.95 = 把候选按分数从高到低排,只在累计概率够到 95% 的头部候选里抽,长尾的怪选项直接不抽。K3 评测用温度 1.0,单步任务 top-p 0.95、智能体任务 top-p 1.0(报告 §6.1.3)。
Q8(D5)判断题:你多跟 AI 聊几天,它就会把你教它的东西「学进脑子」。
错。聊天发生在推理阶段,参数一个不动;它显得「记得你说过的话」,只是因为对话内容还在上下文窗口里。窗口一关(开新对话),一切归零。要让模型真正学会新东西,必须回到训练阶段去改数字。
Q9(D6)窗口外的信息对 AI 来说是什么状态?「看得见」等于「全记住」吗?
窗口外的信息对 AI 不存在——不是「忘了」,是从没进入它打分时的参考范围。而窗口内「看得见」也不等于全记住:内容越长,中间细节越容易被稀释,长文档中间的某句话可能就被「看漏」。
Q10(综合)判断题:K3 有 2.8T 参数,所以它每说一个 token 都要把 2.8 万亿个数字全算一遍。
错。2.8T 是总参数;因为 MoE 设计,每个 token 只从 896 个专家里激活 16 个,实际参与计算的约 104B,其余 98.2% 的专家此刻在休息(由摘要的 896/16 换算;报告 §2.3 称稀疏度 56)。「脑容量大」和「每步算得省」同时成立,机制第 3 周讲。

5下周预告:Transformer 内核周

第一周我们故意没回答一个问题:图 1 里「打分」那一步,盒子里面到底装了什么?为什么它「看前面所有内容」看得又快又准?答案全部来自 2017 年一篇只有十几页的论文——《Attention Is All You Need》。

这篇论文干了一件当时看来很激进的事:把之前主流「按顺序逐个 token 往后读」的架构整个扔掉,只留一个叫「注意力」的机制,结果反而更强。下周六天,我们就拆开这台 2017 年的机器:它之前的 AI 为什么慢(D8)→ 注意力怎么打分(D9)→ 为什么只能回头看(D10)→ 为什么要多头(D11)→ 词序信息从哪来(D12)→ 每一层完整在干什么(D13)。学完你将能徒手画出一次注意力计算——这是大模型面试里「架构原理」考察的基本功。

为什么先学近十年前的老论文?因为 K3 里的每个新设计(KDA、MLA、NoPE……)都是「2017 年某个零件的替换件」。不认识原零件,就看不懂替换的意义。第 2 周结束时,我们会开始填那张贯穿全课的「设计存活表」。
《从 Attention 到 K3 · 大模型近十年设计演进》30 天课 · Day 7 / 30 · 返回课程首页