1本周串讲:六天串成一条流水线
第一周的六天,其实不是六个孤立知识点,而是一台机器的六个零件。把它们按数据流动的顺序装起来,就是下面这张图——一段回答从「你说出口」到「AI 接完龙」的完整旅程:
图 1 · 本周六天,一图收拢:文本进来先拆成 token(D2),每个 token 领一串坐标(D3),模型看着前面所有内容给候选 token 打分(D1),按分数采样挑一个接到末尾(D4),然后拼回去再来一遍——你看到的一整段回答,就是这个循环跑了几百上千次。打分的准头来自训练期的「做题改错」(D5),而整条流水线一次能「看见」的范围有上限,就是上下文窗口(D6)。图中分数与文本均为示意。
一天一句话,本周速览
- D1 接龙:AI 说话的唯一动作是「看前面、猜下一个」,它是一台接龙打分机,不是数据库——所以它流畅但不保真。
- D2 token:文字必须拆成不大不小的零件并编号,AI 才认得了;token 也是计费和计长度的单位。
- D3 坐标:编号不带语义,Embedding 给每个 token 发坐标,意思相近的挨得近——这张语义地图是训练顺带学出来的。
- D4 采样:分数换算成合计 100% 的可能性,温度调随机性、top-p 圈候选范围;接龙带一点抽签,同样的问题才有不同的回答。
- D5 训练:训练 = 改数字(做题对答案),推理 = 用数字(直接接龙);你聊天时它永远在「考试」状态。
- D6 窗口:窗口内的内容看得见,窗口外的不存在;看得见 ≠ 全记住,内容越长细节越容易被稀释。
打个比方
整条流水线像一家餐厅:客人点的菜(输入文本)先被切成标准食材(token),每样食材在货架上有固定位置(坐标),厨师尝一口决定下一味调料加什么(打分),偶尔凭手气换一种加法会出新菜(采样)。厨师的手艺是过去十年练出来的(训练),而案板就那么大,摆不下的食材他只能当不存在(窗口)。
严格来说:真实模型不是「依次加调料」——每一层里所有 token 是并行打分的,而且每个 token 只能参考排在它前面的内容,不能偷看后面(这条因果律第 2 周讲注意力时会反复强调)。
第一周里程碑达成检查:如果你能用图 1 向朋友讲清「AI 是怎么说出一段话的」,并且不借助任何「魔法」「意识」这类词,第一周的使命就完成了。
2K3 报告 §1 摘要:逐词精读
D1 那天我们看摘要像看天书,今天重来一次。打开《Kimi K3 技术报告》,摘要的第一句话是:
K3 原文(摘要)
「我们推出 Kimi K3:一个总参数量 2.8T 的混合专家(MoE)模型,激活参数 104B,具备原生视觉能力,上下文窗口达 100 万 token。」
逐词精读——这句话现在你能读懂什么:
- 「总参数量 2.8T」✅ 完全读懂:参数就是 D5 说的「脑子里的数字」,训练时一遍遍被调整的那些。2.8T 即约 2.8 万亿个——这是这台接龙打分机的「脑容量」总量。
- 「激活参数 104B」◐ 读懂一半:处理每个 token 时,真正参与计算的只有约 1040 亿个数字,约占总量的 1/27。「为什么能只用一部分还不掉链子」靠的是 MoE 机制本身——第 3 周(D18–D20)讲透。
- 「混合专家(MoE)」◐ 读懂一半:把大脑拆成许多「专家小组」,每个 token 只叫醒其中几个干活,其余休息。这是「总量巨大」和「算得省」能同时成立的原因——机制细节第 3 周(D20)讲。
- 「原生视觉能力」◐ 读懂一半:用 D2 的概念就能推出来——图片和视频也被切成 token,和文字 token 进同一个模型、走同一条流水线,而不是后期拼接一个「外挂眼睛」。「原生」意味着从训练第一天起图文就混在一起学——视觉部分的细节第 4 周(D23)讲。
- 「上下文窗口达 100 万 token」✅ 完全读懂:这就是 D6 的窗口——流水线一次能「看见」的范围。换算一下量级(本课唯一一次字/token 换算:约 1 个汉字 ≈ 0.7–1 token):100 万 token 大致是一整部《红楼梦》还装得下富余的量。
再看摘要里紧挨着的另一句:
「这些进展,连同每个 token 从 896 个路由专家中有效激活 16 个的 Stable LatentMoE……」(摘要);§1 引言里写得更细:「Stable LatentMoE 将路由专家空间扩展到 896 个专家,每个 token 激活 16 个」。
「896 选 16」就是上面 MoE 的具体数字版:专家小组一共 896 个,每个 token 只派 16 个上场——相当于每 56 个里选 1 个,其余 98.2%(由 896/16 换算)此刻在休息(报告 §2.3 称之为「稀疏度 56」)。为什么敢把 98.2% 的专家晾在一边还不掉质量、896 个专家怎么分工不均怎么办——第 3 周(D20)讲。
图 2 · 摘要里最有反差感的一组数字:2.8T 总参数是「脑容量」,104B 激活是「每想一步真正动用的部分」——MoE 让这两件事同时成立(报告 §2.3 给出稀疏度 56,即 896÷16)。下面 56 个格子里只有 1 个橙色:每个 token 过来,只有约 2% 的专家为它干活。104B 不只有上场专家,还包括每层都要走的注意力与共享部分,所以是约 1/27 而不是 1/56。具体怎么选、选错了怎么办,第 3 周讲。
104B
激活参数(摘要)
每个 token 实际动用
896→16
路由专家(§1)
每个 token 选 16 个
摘要里还有几个词,现在读不懂——正常,先挂号
摘要和 §1 还出现了 KDA(一种省缓存的看上下文方式,第 3 周 D19 讲)、AttnRes(层与层之间的新连法,第 3 周 D21 讲)、强化学习后训练(训练出「会干活」而不只是「会接龙」,第 4 周 D25 讲)。今天只需记住它们都服务于图 1 那条流水线——没有一个是流水线之外的新物种。
进阶小注 ·「激活参数约 104B」来自稀疏激活:前向时路由只把 token 派给 16/896 个专家,未选中专家的权重不参与本次矩阵乘。稀疏度 56 = 896 ÷ 16(报告 §2.3)。
3本周面试题速查(D1–D6 各一道)
把本周 6 道面试题压缩成速查卡:每张卡先给一句「八股答」(背书的下限),再给三句话的「本课答」(带为什么)。面试时用本课答的骨架,往里填你自己的例子。
面试视角 · D1 接龙
面试官可能会问:「大语言模型本质上是在做什么?」
八股答自回归地逐 token 生成:每一步输出 token 表上的概率分布,采样一个接上去。
本课答本质是接龙:每一步看着已生成的全部内容,给 token 表里每个候选打分,挑一个接到末尾,再重复。所以一段话不是「想好了再说」,而是同一个打分动作重复几百上千次。这也解释了幻觉——接龙机制里没有「事实核查」这一步,流畅不等于真实。
面试视角 · D2 token
面试官可能会问:「为什么不能直接按字训练,要拆 token?」
八股答按字词表太大、按字母语义太碎,BPE 是折中方案。
本课答计算机只认数字,文字必须先编号;按整词编号,词表会随新词不断膨胀、永远收不全,按字母编号又拼不出完整意思。token 是「不大不小的零件」:常用零件覆盖几乎所有文本,生词也能拆成熟零件拼出来。而且 token 还是计费与上下文长度的统一计量单位——K3 摘要里的「100 万」说的正是它。
面试视角 · D3 坐标
面试官可能会问:「都说意思相近的词在向量空间里距离近——这个『近』是怎么来的?」
八股答Embedding 把离散 token 映射为连续向量,供神经网络计算。
本课答坐标一开始是随机的;训练中「我养了一只__」这类空格里猫、狗总可以互换,猜错了反向传播就把它们的坐标往一起调——亿万次之后,意思相近的 token 自动挨近。这张语义地图不是人工标注的,是训练为了猜准下一个 token 顺带学出来的副产品。
面试视角 · D4 采样
面试官可能会问:「大模型的温度调高会发生什么?为什么?」
八股答温度控制 softmax 分布的平滑度,高温让输出更随机。
本课答温度是随机性旋钮:调高会把高分候选和低分候选的分差拉平,低分候选也有机会被抽中,输出更跳脱也更容易胡说;调到 0 永远选最高分,稳定但死板。同门旋钮 top-p 是「只在累计概率够到 95% 的头部候选里抽」。K3 评测就用温度 1.0、单步任务 top-p 0.95(报告 §6.1.3)——是「接近自然生成状态」的配置。
面试视角 · D5 训练
面试官可能会问:「训练和推理的区别是什么?为什么训练贵那么多?」
八股答训练更新参数,推理冻结参数只做前向计算。
本课答训练是「改数字」:做题、对答案、按错的程度调整参数,重复亿万次;推理是「用数字」:参数一个不动,只做打分接龙。贵的原因也在此:单看一个 token,训练既要前向又要反向传播,成本大约是纯前向推理的 3 倍;而一次完整训练要在十几万亿 token 上前向+反向各跑一遍,相比一次对话推理贵出多个数量级。你聊天时它处在推理状态,所以它并没有把你的话「学进脑子」——要让它真正学会新东西,必须回到训练流程。
面试视角 · D6 窗口
面试官可能会问:「现在模型的上下文窗口越做越长,是不是越大越好?」
八股答窗口是模型一次能处理的最大 token 数,超出部分会被截断。
本课答不一定。窗口是 AI 的「工作台大小」:100 万 token 内的内容打分时都能参考,窗外的不存在——不是忘了,是从没进过视野。但「看得见」不等于「全记住」:内容越长,中间细节越容易被稀释,而且窗口越大成本越高。所以超长文档任务不能只靠堆窗口,还要配合检索、分段等工程手段。
4周测验:10 题验收(先自己答,再点开)
Q1(D1)AI 每说一个 token 之前,它到底在「算」什么?
它在给 token 表里每一个候选打一个分,分数再换算成「可能性」——合计正好 100%——然后挑一个接到末尾。它不是先想好整句再开口,而是把「打分 → 挑一个」这一个动作重复几百上千次。
Q2(D1)为什么 AI 会一本正经地胡说八道?
因为它是接龙打分机,不是数据库:知识藏在「这种说法后面通常怎么接」的统计规律里,机制里没有事实核查这一步。所以它能用非常流畅的句子说出完全虚构的内容——这不是「骗你」,是它的工作方式里本来就没有「查证」。
Q3(D2)为什么 AI 不按「一个汉字一个编号」或「一个字母一个编号」来认字?
按整词编号,词表会随新词不断膨胀、永远收不全;按单个汉字或字母编号,词表是小了,但序列会拖得很长,而且单个字/字母语义太碎——完整意思要拼许多个才表达出来,模型学起来费劲。token 走中间路线:不大不小的零件——常用零件拼得出几乎所有文本,生词也能拆成熟零件。
Q4(D2 + D6)K3 的「上下文窗口 100 万 token」大约是什么量级?
按本课 §2 给出的换算比例,100 万 token 大致相当于一整部《红楼梦》还装得下富余。注意这是「工作台大小」而不是「记忆力」——窗口内看得见,不等于每个细节都记得牢。
Q5(D3)编号 421 和 422(示意)明明相邻,为什么说编号「不带语义」?Embedding 怎么解决?
编号只是查表用的门牌号:422 在数字上挨着 421,意思却可能风马牛不相及。Embedding 给每个 token 发一串坐标,让意思相近的 token 在坐标空间里挨得近——「猫」和「狗」近,「编译器」远。这张语义地图是训练顺带学出来的,没有人工标注。
Q6(D4)温度调高会发生什么?温度 0 呢?
调高温度会把高分与低分候选的分差拉平,低分候选也可能被抽中:输出更跳脱、更有「创意」,也更容易跑题。温度 0 则永远选分数最高的候选:稳定可靠但死板。两个极端没有对错,看你要「创意」还是要「保险」。
Q7(D4)top-p 0.95 是什么意思?K3 评测用的采样配置是什么?
top-p 0.95 = 把候选按分数从高到低排,只在累计概率够到 95% 的头部候选里抽,长尾的怪选项直接不抽。K3 评测用温度 1.0,单步任务 top-p 0.95、智能体任务 top-p 1.0(报告 §6.1.3)。
Q8(D5)判断题:你多跟 AI 聊几天,它就会把你教它的东西「学进脑子」。
错。聊天发生在推理阶段,参数一个不动;它显得「记得你说过的话」,只是因为对话内容还在上下文窗口里。窗口一关(开新对话),一切归零。要让模型真正学会新东西,必须回到训练阶段去改数字。
Q9(D6)窗口外的信息对 AI 来说是什么状态?「看得见」等于「全记住」吗?
窗口外的信息对 AI 不存在——不是「忘了」,是从没进入它打分时的参考范围。而窗口内「看得见」也不等于全记住:内容越长,中间细节越容易被稀释,长文档中间的某句话可能就被「看漏」。
Q10(综合)判断题:K3 有 2.8T 参数,所以它每说一个 token 都要把 2.8 万亿个数字全算一遍。
错。2.8T 是总参数;因为 MoE 设计,每个 token 只从 896 个专家里激活 16 个,实际参与计算的约 104B,其余 98.2% 的专家此刻在休息(由摘要的 896/16 换算;报告 §2.3 称稀疏度 56)。「脑容量大」和「每步算得省」同时成立,机制第 3 周讲。
5下周预告:Transformer 内核周
第一周我们故意没回答一个问题:图 1 里「打分」那一步,盒子里面到底装了什么?为什么它「看前面所有内容」看得又快又准?答案全部来自 2017 年一篇只有十几页的论文——《Attention Is All You Need》。
这篇论文干了一件当时看来很激进的事:把之前主流「按顺序逐个 token 往后读」的架构整个扔掉,只留一个叫「注意力」的机制,结果反而更强。下周六天,我们就拆开这台 2017 年的机器:它之前的 AI 为什么慢(D8)→ 注意力怎么打分(D9)→ 为什么只能回头看(D10)→ 为什么要多头(D11)→ 词序信息从哪来(D12)→ 每一层完整在干什么(D13)。学完你将能徒手画出一次注意力计算——这是大模型面试里「架构原理」考察的基本功。
为什么先学近十年前的老论文?因为 K3 里的每个新设计(KDA、MLA、NoPE……)都是「2017 年某个零件的替换件」。不认识原零件,就看不懂替换的意义。第 2 周结束时,我们会开始填那张贯穿全课的「设计存活表」。