Day 1 · 开场:从成语接龙到下一个词预测
AI 每说一个 token,都在心里掷一次骰子
今天不碰任何公式,只做两件事:给你一张 30 天的课程地图 ,再回答一个最根本的问题——AI 每说一个 token 之前,心里到底在算什么账? 这是后面 29 天所有内容的地基。
学完你能回答
为什么回答是一个 token 一个 token 蹦出来的?
1 起点:这些你早就会了
大语言模型(英文缩写 LLM,就是 ChatGPT、Kimi 这类 AI 的学名)听起来吓人,但它的核心想法,你在语文课和数学课上都见过。先看这张对照表,把「你会的」翻译成「AI 在做的」:
你已经会的 AI 世界里对应的东西
成语接龙:「一心一意」后面接「意气风发」 AI 生成文本的本质动作就是接龙 ——顺着已经说出口的内容,接出下一个最小单位
掷骰子:每个面朝上的可能性是 1/6 概率分布 :AI 给每个候选各算一个「可能性」,加起来正好 100%
数学函数 y = f(x):输入一个数,吐出一个数 AI 整体就是一个巨型函数:输入一段话,吐出一排分数
查字典:每个字在字典里都有编号 AI 的词表 :每个候选对应一个编号——编号是 AI 唯一能「看懂」的东西
错题本:做错了记下来,下次改正 训练 :AI 猜错 → 对答案 → 调整(Day 5 讲;今天只关心「用」)
课程表:一学期分几周,每周有每周的重点 本课的 30 天地图 :4 周 + 收官 2 天(下一节细讲)
没有一项超出高中课堂。今天剩下的时间,就是把上面每一行「翻译」得更具体。
一个贯穿全课的单位约定。 AI 说话的最小单位叫 token (读作「透肯」,常译「词元」)。换算只此一次:约 1 个汉字 ≈ 0.7–1 个 token ;具体怎么切分是 Day 2 的主题。从今天起,全文统一用 token——它是 AI 世界里的计量单位:说话按它数,收费按它算,记忆也按它量。
2 课程地图:这 30 天怎么走
这门课讲一条近十年的演进线 :起点是 2017 年的论文《Attention Is All You Need》——它提出的 Transformer(一种模型骨架,第 2 周讲透)至今仍是所有大模型的地基;终点是 2026 年的《Kimi K3 技术报告》——目前站在开源前沿的一份「工程总账」。我们不背结论,而是像考古一样追问:近十年里,哪些设计活了下来,哪些被淘汰了,为什么?
30 天课程路线图:4 周 + 收官 2 天,主线是 2017 到 2026 的近十年设计演进
四个周卡片依次为语言模型的直觉、Transformer 内核、近十年改进接力、把模型炼出来,最后接收官 2 天;底部时间轴从 2017 年 Attention 论文指向 2026 年 K3 报告
30 天 = 4 周 × 7 天 + 收官 2 天
每周 6 天新课 + 1 天周复盘,每周结束都能「毕业」一次
第 1 周
D1–D7
语言模型
的直觉
第 2 周
D8–D14
Transformer
内核
第 3 周
D15–D21
近十年改进接力
第 4 周
D22–D28
把模型炼出来
收官
D29–D30
全局回顾
+ 面试准备
主线任务:每周填一格「设计存活表」——2017 年的每个设计,被谁接力、谁活到了 2026
收官 2 天:合成一张近十年演进总图(D29)+ 一场 50+ 题的模拟面试(D30)
2017 ·《Attention Is All You Need》
2026 ·《Kimi K3 技术报告》
图 1 · 30 天路线图: 四周各有一个可交付的里程碑——第 1 周能用自己的话讲清 AI 怎么说话;第 2 周能徒手画出一次注意力计算;第 3 周看懂 K3 每个部件的来历;第 4 周独立通读 K3 报告。收官 2 天把散点合成地图,再进模拟面试。
每周的读法是 6 + 1 :6 天新课,1 天「周复盘 + 周测验」。而贯穿四周的主线作业只有一张表——设计存活表 :注意力、位置信息、前馈层……2017 年的每个老设计,近十年里被谁改过、K3 最终选了谁。从第 2 周起每周填一格,到 D29 你会拥有一张完整的「近十年演进地图」,这是本课送给你的独家记忆点。
今天的位置: 你正在第 1 周第 1 天。这一周不碰公式,目标是建立「接龙 + 打分 + 训练」的心智模型——读完本周,K3 报告开头的关键句,每个词你都能读懂(D7 我们会真的逐词读一遍)。
3 AI 每说一个 token 之前,在算什么「账」?
先把所有花哨的说法都剥掉。AI 说话这件事,本质只有一个动作:看着已经说出口的全部内容,决定下一个 token 是什么 。而这个「决定」不是一拍脑袋,它能拆成四个清清楚楚的动作:
① 打分 :给词表里每一个 候选 token 算一个分数——十几万个候选,一个不漏。
② 成概率分布 :把这排分数换算成一排「可能性」,合计正好 100%。
③ 采样 :按可能性掷一次骰子,挑出一个 token(可能性大的更容易被挑中,但不保证)。
④ 循环拼接 :把挑中的 token 接到末尾,带着更长的上文回到 ①,再来一遍。
生成一个 token 的四个动作:打分、成概率分布、采样、循环拼接
输入「今天 天气 真」,先给词表每个候选打分,再换算成合计 100% 的概率分布,掷骰子采样出「好」,拼到末尾后循环回到第一步
输入:已经说出口的全部 token
今天
天气
真
?
还没说出口的部分,
AI 一律看不到(第 4 节)
① 打分:给全词表每个候选 token 一个分数(示意)
好
82 分
不错
41 分
糟
15 分
……词表里其余十几万个候选,也各有各的分(分数不用凑整)
② 成概率分布:把分数换算成可能性,合计正好 100%
好
55%
不错
22%
糟
8%
其他
15%
「其他」= 其余所有候选分到的剩余可能性;55% + 22% + 8% + 15% = 100%
③ 采样 → ④ 循环拼接:按可能性掷一次骰子,挑中一个,拼到末尾
好
拼到末尾 →
今天
天气
真
好
每个新 token 都走一遍完整循环
你看到的一整段回答 = 这四步重复几百上千次;每多一个 token,都要重新打一次全词表的分
图 2 · 生成一个 token 的完整瞬间(分数与百分比均为示意): 注意 AI 的产出不是「一个字」,而是全词表每个候选各自的分数 ;经过换算变成骰子的骰面;掷一次,挑一个,接上去,再从头来。图中循环箭头就是「流式输出」的真相。分数到百分比的换算方式,Day 4 讲。
打个比方
AI 像一个「读过人类几乎所有公开文字」的成语接龙高手。你说开头,它顺着文字里最常见的接法往下接;每接一步,都像掷一枚骰子——可能性大的面大,但小面偶尔也会中。注意:它没有「数据库」,不会去查「事实是什么」——这也是它偶尔一本正经胡说八道的原因:接龙这件事里,本来就没有「事实核查」这一项。
严格来说 ,有两处和真实骰子不同:其一,这枚骰子有十几万个面(整个词表),图上只画了三个;其二,每接完一个 token,骰面的分布就整体重洗一次——它不是一枚固定骰子。
记住这句话: AI 不是数据库,是一台「接龙打分机」。它「懂」的东西,全部藏在「给下一个 token 打分打得准不准」里。
进阶小注 · (给懂点数学/编程的你,可跳过)第 ① 步的「分数」有个专门名字,叫 logits(没经过换算的原始分,可正可负);第 ② 步的换算用 softmax——把任意一排实数变成一排合计为 1 的概率。用数学话说,这四步就是在回答一个问题:给定已经生成的全部 token,第 t 个 token 取每个候选的可能性各是多少。
4 只能回头看:AI 看不到「未来」
上面的循环里藏着一条铁律,很多人学了很久都没意识到:每一次打分,依据都只有「已经说出口的内容」 。还没生成的部分,对 AI 来说不是「保密」,而是根本不存在。成语接龙里你也一样:你只能根据前面已经接出来的成语往下接,没法偷看「后面会接什么」——因为后面还没有发生。
这条因果方向带来两个直接后果:
AI 没法先打好整段草稿再开口。 它说到第 10 个 token 时,并不知道第 50 个会是什么。你觉得它「思路连贯」,是因为每个新 token 都回头参考了前面所有 token。
你的话对它至关重要。 你的提问是「已经发生」的输入,它会完整读一遍再开始接龙——所以你给的上下文越清楚,它的骰子就掷得越准。这就是「提示词」为什么有用。
严格来说 ,边界要划清楚:AI 在开始回答前会把你的提问完整读入,这不违反因果律——提问本来就是过去时;它真正看不到的,只有自己还没生成的那部分。
记住这个词
这种「靠自己前面生成的内容,一个 token 一个 token 往下接」的生成方式,学名叫自回归 (autoregressive);因为它每步只预测下一个 token,所以也叫下一个词预测 (next-token prediction)。ChatGPT、Kimi、K3,无一例外都是这么说话的。
5 所以,回答才是一个 token 一个 token 蹦出来的
现在你可以解释一个天天见到的现象了:AI 的回答为什么像打字一样往外蹦?因为它真的就是一个一个算出来的 ——每多蹦出一个 token,背后都是图 2 那完整的一圈:重读全部上文 → 全词表打分 → 换算 → 掷骰子 → 拼接。这不是界面特效,是机制的实况直播。
顺带记住两个推论,后面几周会反复用到:回答越长,算得越久 (圈数正比于 token 数);上文越长,每圈越贵 (打分时要参考的内容越多)。AI 服务按 token 计费,道理就在这。
面试视角
面试官可能会问:「大语言模型本质上是在做什么?」
八股答 「就是预测下一个词。给定前面的文本,输出一个概率分布,采样得到下一个 token,自回归地生成。」三个术语背完就交卷——对,但等于什么都没解释,追问一句「具体哪几步」就卡壳。
本课答 把它拆成四个动作讲:① 打分 ——对全词表十几万个候选 token 各算一个分数;② 成概率分布 ——把分数换算成合计 100% 的可能性;③ 采样 ——按可能性掷骰子挑一个,不是永远挑分最高的,所以输出有变化(温度调低或贪心解码时会退化成总挑最高分——温度是 Day 4 的内容);④ 循环拼接 ——拼到末尾,带着更长的上文重新打分。再补一句因果方向:每一步只能依据已经生成的内容,看不到「未来」——所以回答只能一个 token 一个 token 蹦出来,也没法先想好整句再开口。能讲到这个颗粒度,面试官就知道你不是背的。
6 映射到 K3:§1 贡献列表第一条,今天先只读不拆
这门课的终点样本是 Kimi K3——月之暗面 2026 年发布的开源大模型。《Kimi K3 技术报告》§1 的贡献列表里有一条浓缩了全书的话,今天先请你原样读一遍,不要求拆 :
K3 原文(§1 引言 · 贡献总结第一条)
「我们训练了一个 2.8T 参数的原生多模态 MoE 模型,激活参数 104B,上下文窗口 100 万 token。」
今天的「逐词翻译」只有预告,不展开:
2.8T / 104B :T = 万亿,B = 十亿。「参数」就是 AI 脑子里的数字(§1 锚点表里的巨型函数的系数)。为什么「2.8T 很大」和「104B 很省」能同时成立?第 3 周见分晓。
MoE :混合专家——把大脑拆成很多「专家小组」分工的设计,第 3 周 D20 讲透。
原生多模态 :天生就能看图、看视频,不是后加的「外挂」,第 4 周讲。
上下文窗口 100 万 token :一次能「看见」的上文长度——单位正是今天学的 token,D6 专门讲它的代价。
到本周日(D7 周复盘),我们会把这句话逐词精读一遍,那时每个词你都有出处。
近 10 年
2017 Attention 论文 → 2026 K3 报告
7 自测题(先自己答,再点开看解析)
Q1 用四个动作说清:AI 生成一个 token 的完整过程是什么?
① 打分 :看着已说出口的全部内容,给词表每个候选 token 算一个分数;② 成概率分布 :分数换算成可能性,合计 100%;③ 采样 :按可能性掷骰子挑一个;④ 循环拼接 :接到末尾,带着更长的上文回到 ①。这四个动作也是面试题「大语言模型本质上在做什么」的本课答骨架。
Q2 判断题:AI 是先把整句话想好,再一个 token 一个 token 打出来的。
错。 它没有任何「草稿」。每一次打分只能依据已经说出口的内容 ,还没生成的部分对它根本不存在——说到第 10 个 token 时,它并不知道第 50 个会是什么。你觉得连贯,是因为每个新 token 都回头参考了前面所有内容。
Q3 为什么 AI 的回答是一个 token 一个 token 蹦出来,而不是一整段同时出现?
因为生成机制就是串行循环:每多一个 token,都要完整走一遍「打分 → 成概率分布 → 采样 → 拼接」 ,下一个 token 的打分依赖上一个的结果,无法并行。界面上「打字机」式的输出不是特效,是这个机制的实况。推论:回答越长算得越久,上文越长每步越贵。
Q4 这门 30 天课的结构和主线分别是什么?
结构:4 周 × 7 天(6 天新课 + 1 天周复盘)+ 收官 2 天 (D29 全局回顾、D30 模拟面试)。主线:从 2017 年《Attention Is All You Need》到 2026 年 K3 报告的近十年设计演进 ,具体落在一张「设计存活表」上——每周填一格,结课时拼成完整地图。
Q5 对 K3 报告 §1 贡献列表第一条「2.8T 参数、104B 激活、100 万 token 上下文」这句话,今天的学习要求是什么?
只读不拆。 今天只需要知道:T = 万亿、B = 十亿,参数是 AI 脑子里的数字,token 是计量单位;MoE、原生多模态、上下文窗口各有专门的一天(D20 / 第 4 周 / D6)。本周日 D7 周复盘会把这句话逐词精读——那时每个词都有出处。
明天 · Day 2Token:文字怎么变数字 按「字」切不行,按「字母」切也不行——AI 的切词师傅是怎么找到那条中间路线的?
进入 Day 2 →