Day 1 · AI 是怎么学会说话的
AI 每说一个字,都在心里做一次「接龙」
今天不碰任何 K3 的技术细节,只回答三个问题:AI 每说一个字之前,心里在算什么?它为什么不直接认字?它又是怎么「学会」的?——这是后面六天所有内容的全部地基。
0起点:这些你早就会了
大语言模型(英文缩写 LLM,就是 ChatGPT、Kimi 这类 AI 的学名)听起来吓人,但它的核心想法,你其实在语文课、数学课、英语课上都见过。先看这张对照表,把「你会的」翻译成「AI 在做的」:
| 你已经会的 | AI 世界里对应的东西 |
| 成语接龙:「一心一意」后面接「意气风发」 | AI 的日常工作就是接龙——接的是「下一个字/词」,而且它能看完整本书的上下文再来接 |
| 数学:掷骰子,每个面朝上的可能性都是 1/6 | 概率:AI 会给所有候选字各算一个「可能性」,加起来正好等于 100% |
| 数学:函数 y = f(x),输入一个数,吐出一个数 | AI 整体就是一个巨型函数:输入一句话,吐出一串「可能性」 |
| 英语课:un- 表示否定,-ness 表示名词 | AI 把词拆成「零件」来认,思路和拆词根一模一样(后面 §2 讲) |
| 查字典:每个字在字典里都有编号和释义 | AI 的「词表」:每个零件对应一个编号——编号是 AI 唯一能「看懂」的东西 |
| 考试:做完对答案,错的记进错题本 | 训练:AI 做题 → 对答案 → 把教训刻进「脑子」里(后面 §4 讲) |
| 看地图:北京和天津挨得近,和悉尼离得远 | AI 把每个词放在一张「语义地图」上:意思相近的词,位置靠得近(后面 §3 讲) |
看到没?没有一项超出高中课堂。今天剩下的时间,就是把上面每一行「翻译」得更具体一点。
1AI 每说一个字,都在算什么「账」?
先把所有花哨的说法都剥掉。AI 说话这件事,本质只有一个动作:看着前面已经说出的所有字,猜下一个字最可能是什么。你给 Kimi 发一句「今天天气真」,它脑子里干的事就是:给所有可能的字打分——「好」打 55 分、「不错」打 22 分、「糟」打 8 分……谁分高谁上。
图 1 · AI 工作的完整瞬间:输入「今天天气真」,AI 的产出不是「一个字」,而是几十万个候选字各自的分数。然后它挑一个(通常是分最高的)写下来,把这个新字接到末尾,再重复一次「打分 → 挑字」……你看到的一整段回答,就是这一个动作被重复了几百上千次的结果。
打个比方
AI 像一个「读过人类几乎所有公开文字」的接龙高手。你说开头,它顺着文字里常见的接法往下接。注意:它没有「数据库」,不会去查「事实是什么」——它的全部知识,都藏在它「接得准不准」这件事里。这也是它偶尔一本正经胡说八道的原因:它只是在按统计规律接龙,接龙这件事里没有「事实核查」这一项。
记住这句话:AI 不是数据库,是一台「接龙打分机」。它「懂」的东西,都是藏在打分能力里的统计规律。
进阶小注 ·(给懂点数学/编程的你,可跳过)这就是自回归语言模型:每一步计算条件概率 p(w_t | w_1…w_{t−1})。所谓「模型」,就是一个把前缀映射到词表上概率分布的参数化函数;「打分」就是取 logits,最后输出层是 softmax。
2为什么 AI 不直接认字,要先拆词?
你可能会问:AI 直接「认字」不就行了吗?不行——因为计算机只认数字,不认字。文字必须先变成编号,AI 才能算。可问题来了:
- 如果按一个汉字一个编号:中文几万个字还能忍,但英文单词有几十万、还在不断造新词,编号表会爆炸。
- 如果按一个字母一个编号:编号表倒是小了,但「学习」这种完整意思要拼好几个字母才表达出来,AI 很难从中悟出「词」的意思。
所以 AI 用的是中间路线:拆成「不大不小」的零件,这些零件有个英文名,叫 Token(读作「透肯」,中文常译作「词元」)。
图 2 · 文字进 AI 的必经之路:「深度学习」→ 拆成零件「深度」「学习」→ 查编号表变成 421、3071 两个数字。「学习」这个零件被海量词汇共用(学习、深度学习、机器学习……),这就是拆词的好处:常用零件能拼出几乎任何文本,遇到没见过的生词也能拆成熟零件拼出来——AI 永远不会碰到「不认识的字」。
这套「零件表」是怎么定出来的?(1 分钟)
打个比方
想象你在给一本词典压缩条目:先从单个字开始,反复把「经常挨在一起出现」的两个字块合并成一个新词条。「学习」在语料里出现了上亿次,就合并成一个词条;「的」+「确」也很常见,也合并……一直并到词条数达到预定规模(常见 10–20 万个)为止。这套做法有个英文缩写叫 BPE,你只需要记住它是「按出现频率合并字块」就行了。
为什么今天就要懂 Token?因为后面所有数字都跟它有关:K3 的「上下文窗口 100 万 token」、AI 按 token 收费、内存按 token 算——Token 就是 AI 世界里的「最小计量单位」,相当于你熟悉的「字节」。
进阶小注 ·这就是 BPE(Byte Pair Encoding):从字符级开始迭代合并最高频相邻对,得到子词(subword)词表;模型第一层是一个词表大小的查表(lookup)。英文里 unhappiness → un + happi + ness,跟拆词根是同一思路。
3编号变坐标:AI 的「语义地图」
编号 421 和 3071 能直接拿来算吗?不能——因为对数字 421 来说,422 并不比 99999 更「接近」它。可「学习」在意思上显然比「编译器」离「深度」更近。所以 AI 要做第二步:给每个编号发一个「坐标」(一串数字),让意思相近的词坐标挨得近。这个「发坐标」的动作,学名叫 Embedding(嵌入)。
图 3 · 从编号到「语义地图」:每个 Token 领到一串坐标数字。「猫」和「狗」的坐标挨得近,「编译器」离得远。从这一刻起,AI 的所有计算都在这个「坐标空间」里发生——后面几天的注意力、专家混合,全是拿这些坐标做运算。
打个比方
就像地图上的经纬度:北京和天津的坐标挨得近,北京和悉尼离得远。AI 在这张「语义地图」上做加减乘除找规律,本质上就是在处理「谁和谁挨得近、谁和谁离得远」这件事。
进阶小注 ·Embedding 是一张可学习的查表 E ∈ R^{V×d}(V = 词表大小,d = 隐藏维度),e = E[id]。所谓「语义距离」由训练隐式塑造;真实 d 通常上千(K3 是 7168 维),说「几千维」是保守的。
4「训练」是学习,「推理」是考试
同一个 AI,有两种状态,很多人读技术文章就是在这里绕晕的。训练 = 改脑子里的数字;推理 = 用脑子里的数字。一句话:训练时它是「学生」在做题改错,推理时它是「考生」在直接作答(平时你用 ChatGPT/Kimi 聊天,就是考试状态)。
图 4 · 左「训练」右「推理」:训练是循环改数字(猜 → 对答案 → 看错多少 → 调整),输入是带标准答案的文章;推理是循环接龙(打分 → 挑字 → 拼接 → 再打分),数字全程不动。训练一次要烧掉天文数字的电费和时间;而你和 AI 聊天的每一句,走的都是右边这条路。
一个小旋钮:AI 说话有多「随机」
考试状态打出来的分,还能加一个「随机性」旋钮(技术名叫 temperature,温度):
- 温度 = 0(标准答案模式):永远选分最高的字。稳定、可靠,但死板。
- 温度 = 1(正常模式):按分数比例随机挑,有时会选分第二第三的,更像真人说话。
- 温度调高(放飞模式):高分和低分差距被拉平,输出更跳脱、更有「创意」,也更容易胡说。
顺便剧透:K3 报告里评测 AI 用的是「温度 1.0、top-p 0.95」(§6.1.3,智能体任务用 top-p 1.0)——学完今天,这句评测配置你已经能看懂大半了。
进阶小注 ·训练 = 前向计算交叉熵损失 + 反向传播更新权重;推理 = 仅前向 + 采样(greedy / top-p / temperature 缩放)。「温度」即对 logits 做 ÷T 后再 softmax。
5坐标进去之后,中间发生了什么?(先剧透)
Token 的坐标进去,分数的分布出来——中间隔着一座「黑箱」:几十上百层运算。你现在只需要知道,每一层都在做两件事:
① 看上下文(注意力):让每个词「看一眼」整段话里的其他词,按关联程度把它们的想法汇总过来——这就是「AI 能记住你说过什么」的机制来源(Day 2 讲透)。
② 自己琢磨(前馈层):让每个词单独「想一下」——相当于逐位思考。
K3 里有两种「看上下文」的方式(KDA + MLA)、还有把「自己琢磨」这一步拆成 896 个专家分工的 MoE——它们全是这台「接龙打分机」里的零件。今天不用懂,但请记住一句总纲:不管内部多复杂,AI 的输入输出始终是「给候选词打分」。
6映射到 K3:现在能读懂报告第一句了
K3 是 Kimi 背后公司(月之暗面)2026 年发布的开源大模型,也是我们这七天要拆解的「样本」。报告《Kimi K3 技术报告》的第一段摘要里有一句话,现在每个词你都能看懂一大半:
K3 原文(§1 摘要)
「我们训练了一个 2.8T 参数的原生多模态 MoE 模型,激活参数 104B,上下文窗口 100 万 token。」
逐词翻译:
- 2.8T 参数:这个 AI「脑子里的数字」大约有 2.8 万亿个。数字越多,理论上「脑容量」越大(Day 4 细讲)。
- MoE:专家混合(Day 4),把大脑拆成很多「专家小组」,每次只问其中几个——这是 2.8T 能跑得动的关键。
- 激活参数 104B:处理一个字时,真正参与计算的数字只有 1040 亿个,其余大部分在「休眠」。
- 上下文窗口 100 万 token:AI 一次对话最多能「记住」约 100 万个词元——这是今天 Token 概念的直接应用。
896→16
896 个专家小组
每个字只问 16 个
这两个数字大得没概念?帮你换算一下:
- 2.8 万亿个数字,如果每个数字写 1 毫米宽,排成一条线有 280 万公里,能绕地球 70 圈。训练这么多数字,要烧掉天文数字的电费。
- 100 万 token,按中文大约 1 个字 ≈ 1 个 token 来算,就是一百万字的量——一整部《红楼梦》(73 万字)从头读到尾,还能再装下小半部《三国演义》。而你的「上下文」可能只够记住刚才那句话。
一句话总结今天的 K3 印象
K3 是一台 2.8 万亿数字的「接龙打分机」:每接一个字,只唤醒其中 104B 个数字(其余在 MoE 里睡觉),却能一口气记住 100 万 token 的上下文。「2.8T 巨大」和「104B 很省」两个事实同时成立——怎么做到的,正是 Day 4 的主题。
7自测题(先自己答,再点开看解析)
Q1AI 每说一个字之前,它到底在「算」什么?
它在给词表里每一个候选字打分(一个「可能性」,加起来等于 100%),然后挑一个(通常是分最高的)写出来。AI 的「思考」不是先想好整句话再开口,而是一个字一个字地接龙。
Q2为什么 AI 不直接「认字」,要先把文字拆成 Token?
因为计算机只认数字,不认字,文字必须先变成编号。按字编号,英文单词会爆炸;按字母编号,又拼不出「词」的意思。拆成不大不小的 Token 零件(如「深度学习」→「深度」+「学习」),既能让常用零件覆盖几乎所有文本,又能用零件拼出没见过的生词。
Q3AI 为什么有时候会一本正经地胡说八道?
因为它是「接龙打分机」,不是数据库。它的知识来自文字里学到的统计规律——「这个字在那种说法后面通常怎么接」——而接龙这件事本身不含「事实核查」。所以它可能用非常流畅的句子说出完全虚构的东西,这不是「骗你」,而是它的机制里就没有查证这一步。
Q4判断题:K3 有 2.8T 个数字,所以每次推理都要把 2.8T 个全算一遍。
错。2.8T 是总数;因为 MoE 设计,处理每个字时只激活其中 104B(约 1/27)参与计算,其余在休眠。「数字多」和「算得贵」是两回事——这正是 MoE 存在的意义,Day 4 详讲。
Q5「训练」和「推理」最本质的区别是什么?
训练 = 改脑子里的数字(做题 → 对答案 → 看错多少 → 调整,重复几万亿次,烧钱烧电);推理 = 用脑子里的数字(数字一个不动,直接打分接龙)。训练是「学生」阶段,推理是「考试」阶段——你每次跟 AI 聊天,都发生在考试阶段。
明日预告 · Day 2
注意力机制:全班一起开「讨论会」
AI 是怎么做到「看完整段话再决定下一个字」的?答案:每个词发言前,先听全班同学怎么说。
开始 Day 2 →