K3 七天课 · Day 1 / 7 课程首页 自测题 映射 K3
Day 1 · AI 是怎么学会说话的

AI 每说一个字,都在心里做一次「接龙」

今天不碰任何 K3 的技术细节,只回答三个问题:AI 每说一个字之前,心里在算什么?它为什么不直接认字?它又是怎么「学会」的?——这是后面六天所有内容的全部地基。

学完你能回答
AI 说话之前,在算什么「账」?
学完你能回答
为什么 AI 要先拆词、再认字?
学完你能回答
「训练」和「考试」有什么区别?

0起点:这些你早就会了

大语言模型(英文缩写 LLM,就是 ChatGPT、Kimi 这类 AI 的学名)听起来吓人,但它的核心想法,你其实在语文课、数学课、英语课上都见过。先看这张对照表,把「你会的」翻译成「AI 在做的」:

你已经会的AI 世界里对应的东西
成语接龙:「一心一意」后面接「意气风发」AI 的日常工作就是接龙——接的是「下一个字/词」,而且它能看完整本书的上下文再来接
数学:掷骰子,每个面朝上的可能性都是 1/6概率:AI 会给所有候选字各算一个「可能性」,加起来正好等于 100%
数学:函数 y = f(x),输入一个数,吐出一个数AI 整体就是一个巨型函数:输入一句话,吐出一串「可能性」
英语课:un- 表示否定,-ness 表示名词AI 把词拆成「零件」来认,思路和拆词根一模一样(后面 §2 讲)
查字典:每个字在字典里都有编号和释义AI 的「词表」:每个零件对应一个编号——编号是 AI 唯一能「看懂」的东西
考试:做完对答案,错的记进错题本训练:AI 做题 → 对答案 → 把教训刻进「脑子」里(后面 §4 讲)
看地图:北京和天津挨得近,和悉尼离得远AI 把每个词放在一张「语义地图」上:意思相近的词,位置靠得近(后面 §3 讲)

看到没?没有一项超出高中课堂。今天剩下的时间,就是把上面每一行「翻译」得更具体一点。

1AI 每说一个字,都在算什么「账」?

先把所有花哨的说法都剥掉。AI 说话这件事,本质只有一个动作:看着前面已经说出的所有字,猜下一个字最可能是什么。你给 Kimi 发一句「今天天气真」,它脑子里干的事就是:给所有可能的字打分——「好」打 55 分、「不错」打 22 分、「糟」打 8 分……谁分高谁上。

下一个词预测:给定前缀,给每个候选词打分 输入 token 序列「今天 天气 真」,模型给词表上每个候选词一个可能性分数 你已经说出的字(AI 看到的全部) 今天 天气 真 ? AI 给每个候选字打分(分数 = 可能性,合计 100%) 好 55% 不错 22% 糟 8% ……还有 30 多万个候选字,AI 也要给它们挨个打分
图 1 · AI 工作的完整瞬间:输入「今天天气真」,AI 的产出不是「一个字」,而是几十万个候选字各自的分数。然后它挑一个(通常是分最高的)写下来,把这个新字接到末尾,再重复一次「打分 → 挑字」……你看到的一整段回答,就是这一个动作被重复了几百上千次的结果。
打个比方
AI 像一个「读过人类几乎所有公开文字」的接龙高手。你说开头,它顺着文字里常见的接法往下接。注意:它没有「数据库」,不会去查「事实是什么」——它的全部知识,都藏在它「接得准不准」这件事里。这也是它偶尔一本正经胡说八道的原因:它只是在按统计规律接龙,接龙这件事里没有「事实核查」这一项。
记住这句话:AI 不是数据库,是一台「接龙打分机」。它「懂」的东西,都是藏在打分能力里的统计规律。
进阶小注 ·(给懂点数学/编程的你,可跳过)这就是自回归语言模型:每一步计算条件概率 p(w_t | w_1…w_{t−1})。所谓「模型」,就是一个把前缀映射到词表上概率分布的参数化函数;「打分」就是取 logits,最后输出层是 softmax。

2为什么 AI 不直接认字,要先拆词?

你可能会问:AI 直接「认字」不就行了吗?不行——因为计算机只认数字,不认字。文字必须先变成编号,AI 才能算。可问题来了:

所以 AI 用的是中间路线:拆成「不大不小」的零件,这些零件有个英文名,叫 Token(读作「透肯」,中文常译作「词元」)。

拆词:文本切成 token 零件,再查编号表变成数字 「深度学习」被切分成 深度/学习 两个 token,查编号表得到 421 / 3071 原始文本(人看的) 「深度学习」 拆成 Token(AI 看的) 深度 学习 查编号表 → 421 3071
图 2 · 文字进 AI 的必经之路:「深度学习」→ 拆成零件「深度」「学习」→ 查编号表变成 421、3071 两个数字。「学习」这个零件被海量词汇共用(学习、深度学习、机器学习……),这就是拆词的好处:常用零件能拼出几乎任何文本,遇到没见过的生词也能拆成熟零件拼出来——AI 永远不会碰到「不认识的字」。

这套「零件表」是怎么定出来的?(1 分钟)

打个比方
想象你在给一本词典压缩条目:先从单个字开始,反复把「经常挨在一起出现」的两个字块合并成一个新词条。「学习」在语料里出现了上亿次,就合并成一个词条;「的」+「确」也很常见,也合并……一直并到词条数达到预定规模(常见 10–20 万个)为止。这套做法有个英文缩写叫 BPE,你只需要记住它是「按出现频率合并字块」就行了。
为什么今天就要懂 Token?因为后面所有数字都跟它有关:K3 的「上下文窗口 100 万 token」、AI 按 token 收费、内存按 token 算——Token 就是 AI 世界里的「最小计量单位」,相当于你熟悉的「字节」。
进阶小注 ·这就是 BPE(Byte Pair Encoding):从字符级开始迭代合并最高频相邻对,得到子词(subword)词表;模型第一层是一个词表大小的查表(lookup)。英文里 unhappiness → un + happi + ness,跟拆词根是同一思路。

3编号变坐标:AI 的「语义地图」

编号 421 和 3071 能直接拿来算吗?不能——因为对数字 421 来说,422 并不比 99999 更「接近」它。可「学习」在意思上显然比「编译器」离「深度」更近。所以 AI 要做第二步:给每个编号发一个「坐标」(一串数字),让意思相近的词坐标挨得近。这个「发坐标」的动作,学名叫 Embedding(嵌入)。

Embedding:编号查表变成坐标,语义相近的词坐标距离近 编号 421 查表得到一串坐标数字,语义空间里猫和狗近、与编译器远 查表(给编号发坐标) 421 编号表(存着每个词的坐标) 421 号 → 一串坐标数字 一串坐标 数字(示意) 语义地图(真实空间有好几千维,这里画成平面) 猫 狗 编译器 意思相近的词 → 坐标挨得近;这是 AI 在训练中「顺带」自己悟出来的,没有任何人手工标注
图 3 · 从编号到「语义地图」:每个 Token 领到一串坐标数字。「猫」和「狗」的坐标挨得近,「编译器」离得远。从这一刻起,AI 的所有计算都在这个「坐标空间」里发生——后面几天的注意力、专家混合,全是拿这些坐标做运算。
打个比方
就像地图上的经纬度:北京和天津的坐标挨得近,北京和悉尼离得远。AI 在这张「语义地图」上做加减乘除找规律,本质上就是在处理「谁和谁挨得近、谁和谁离得远」这件事。
进阶小注 ·Embedding 是一张可学习的查表 E ∈ R^{V×d}(V = 词表大小,d = 隐藏维度),e = E[id]。所谓「语义距离」由训练隐式塑造;真实 d 通常上千(K3 是 7168 维),说「几千维」是保守的。

4「训练」是学习,「推理」是考试

同一个 AI,有两种状态,很多人读技术文章就是在这里绕晕的。训练 = 改脑子里的数字;推理 = 用脑子里的数字。一句话:训练时它是「学生」在做题改错,推理时它是「考生」在直接作答(平时你用 ChatGPT/Kimi 聊天,就是考试状态)。

训练循环与推理循环对比 训练:喂文章预测对比答案算错多少调整数字;推理:拿输入预测采样拼接循环直到结束 训练 = 学习(改数字) 推理 = 考试(用数字) 喂入海量文章(几百万本书) 每段都藏着「标准答案」 AI 试着猜下一个字 给每个候选字打分 翻答案,看猜得有多离谱 猜得越偏,惩罚越重 微调脑子里的数字,下次更准 ← 重复几万亿次 拿到你说的话 脑子里的数字一个都不动 给所有候选字打分 走一遍「考试流程」 挑一个字,接到末尾 再来一轮 → 继续接龙 循环直到输出「结束」或达到字数上限
图 4 · 左「训练」右「推理」:训练是循环改数字(猜 → 对答案 → 看错多少 → 调整),输入是带标准答案的文章;推理是循环接龙(打分 → 挑字 → 拼接 → 再打分),数字全程不动。训练一次要烧掉天文数字的电费和时间;而你和 AI 聊天的每一句,走的都是右边这条路。

一个小旋钮:AI 说话有多「随机」

考试状态打出来的分,还能加一个「随机性」旋钮(技术名叫 temperature,温度):

顺便剧透:K3 报告里评测 AI 用的是「温度 1.0、top-p 0.95」(§6.1.3,智能体任务用 top-p 1.0)——学完今天,这句评测配置你已经能看懂大半了。

进阶小注 ·训练 = 前向计算交叉熵损失 + 反向传播更新权重;推理 = 仅前向 + 采样(greedy / top-p / temperature 缩放)。「温度」即对 logits 做 ÷T 后再 softmax。

5坐标进去之后,中间发生了什么?(先剧透)

Token 的坐标进去,分数的分布出来——中间隔着一座「黑箱」:几十上百层运算。你现在只需要知道,每一层都在做两件事:

① 看上下文(注意力):让每个词「看一眼」整段话里的其他词,按关联程度把它们的想法汇总过来——这就是「AI 能记住你说过什么」的机制来源(Day 2 讲透)。

② 自己琢磨(前馈层):让每个词单独「想一下」——相当于逐位思考。

K3 里有两种「看上下文」的方式(KDA + MLA)、还有把「自己琢磨」这一步拆成 896 个专家分工的 MoE——它们全是这台「接龙打分机」里的零件。今天不用懂,但请记住一句总纲:不管内部多复杂,AI 的输入输出始终是「给候选词打分」。

6映射到 K3:现在能读懂报告第一句了

K3 是 Kimi 背后公司(月之暗面)2026 年发布的开源大模型,也是我们这七天要拆解的「样本」。报告《Kimi K3 技术报告》的第一段摘要里有一句话,现在每个词你都能看懂一大半:

K3 原文(§1 摘要)
「我们训练了一个 2.8T 参数的原生多模态 MoE 模型,激活参数 104B,上下文窗口 100 万 token。」

逐词翻译:

  • 2.8T 参数:这个 AI「脑子里的数字」大约有 2.8 万亿个。数字越多,理论上「脑容量」越大(Day 4 细讲)。
  • MoE:专家混合(Day 4),把大脑拆成很多「专家小组」,每次只问其中几个——这是 2.8T 能跑得动的关键。
  • 激活参数 104B:处理一个字时,真正参与计算的数字只有 1040 亿个,其余大部分在「休眠」。
  • 上下文窗口 100 万 token:AI 一次对话最多能「记住」约 100 万个词元——这是今天 Token 概念的直接应用。
2.8T
脑子里的数字总量
≈ 2.8 万亿个
104B
每个字真正用到的
只有约 1040 亿
896→16
896 个专家小组
每个字只问 16 个
1M
一次记住 100 万
个 token(词元)

这两个数字大得没概念?帮你换算一下:

一句话总结今天的 K3 印象 K3 是一台 2.8 万亿数字的「接龙打分机」:每接一个字,只唤醒其中 104B 个数字(其余在 MoE 里睡觉),却能一口气记住 100 万 token 的上下文。「2.8T 巨大」和「104B 很省」两个事实同时成立——怎么做到的,正是 Day 4 的主题。

7自测题(先自己答,再点开看解析)

Q1AI 每说一个字之前,它到底在「算」什么?
它在给词表里每一个候选字打分(一个「可能性」,加起来等于 100%),然后挑一个(通常是分最高的)写出来。AI 的「思考」不是先想好整句话再开口,而是一个字一个字地接龙。
Q2为什么 AI 不直接「认字」,要先把文字拆成 Token?
因为计算机只认数字,不认字,文字必须先变成编号。按字编号,英文单词会爆炸;按字母编号,又拼不出「词」的意思。拆成不大不小的 Token 零件(如「深度学习」→「深度」+「学习」),既能让常用零件覆盖几乎所有文本,又能用零件拼出没见过的生词。
Q3AI 为什么有时候会一本正经地胡说八道?
因为它是「接龙打分机」,不是数据库。它的知识来自文字里学到的统计规律——「这个字在那种说法后面通常怎么接」——而接龙这件事本身不含「事实核查」。所以它可能用非常流畅的句子说出完全虚构的东西,这不是「骗你」,而是它的机制里就没有查证这一步。
Q4判断题:K3 有 2.8T 个数字,所以每次推理都要把 2.8T 个全算一遍。
错。2.8T 是总数;因为 MoE 设计,处理每个字时只激活其中 104B(约 1/27)参与计算,其余在休眠。「数字多」和「算得贵」是两回事——这正是 MoE 存在的意义,Day 4 详讲。
Q5「训练」和「推理」最本质的区别是什么?
训练 = 改脑子里的数字(做题 → 对答案 → 看错多少 → 调整,重复几万亿次,烧钱烧电);推理 = 用脑子里的数字(数字一个不动,直接打分接龙)。训练是「学生」阶段,推理是「考试」阶段——你每次跟 AI 聊天,都发生在考试阶段。
返回课程首页 · 本课程基于《Kimi K3 技术报告》编写,概念图均为原创示意