K3 七天课 · Day 5 / 7 课程首页 自测题 映射 K3
Day 5 · 训练流水线:预训练 → SFT → RL → MOPD

一台 K3 是怎么「教」出来的?

前四天讲了 K3 的身体结构(注意力、便签本、专家大脑)。今天讲它怎么长大:先自己读几百万本书(预训练),再让老师示范正确答案(SFT),再在考试里试错拿奖励(RL),最后把 9 个「特长生」合并成一个「全能选手」(MOPD)。

学完你能回答
训练 K3 分哪四大步?每步在干什么?
学完你能回答
「原生多模态」是什么意思?为什么重要?
学完你能回答
9 个 RL 专家模型是怎么来的?又怎么合并成 1 个?

0起点:这些你早就会了

今天讲的是「怎么把一个人教成才」。K3 的四个训练阶段,你在学校里全都经历过:

你已经会的AI 世界里对应的东西
自己背课本、读课外书,没人教也能学会预训练(Pre-training):让模型自己读海量文章,学语言规律
老师讲例题、给标准答案,你照着学SFT(监督微调):喂给模型「标准答案示范」,教它好好说话
月考、竞赛:自己做题,对了加分错了扣分RL(强化学习):让模型自己尝试,用「奖励」引导它变强
学校把「奥数特长生 + 作文特长生」组队参赛MOPD(多教师蒸馏):把 9 个专才合并成 1 个全才
先修语文数学,再学素描美术原生多模态:K3 从第一天起就文字 + 图片一起学(不分开补课)

核心就一句:预训练给「语感」,SFT 给「礼貌」,RL 给「本事」,MOPD 负责「合体」。

1总览:K3 的成长流水线

K3 不是「一次性造出来」的,而是分四步走的。每一步都在调那 2.8T 个数字,但方法完全不同:

K3 训练四步流水线 预训练、SFT、RL、MOPD 四个阶段依次连接,每步方法不同 K3 的成长流水线:四步走,步步不同 ① 预训练 自学读书 读几百万本书 学语言规律 打知识底子 ② SFT 老师示范 喂标准答案 学好好说话 学用工具 ③ RL 考试 + 奖励 自己尝试 对了加分 错了扣分 ④ MOPD 特长生合并 9 个专才 合成 1 个全才 (Day 6 前的大招) 阅读(预训练)→ 示范(SFT)→ 试错(RL)→ 合体(MOPD)——每一大步都不可少
图 1 · K3 的成长流水线:① 预训练——自己读海量文章,长出「语感」(Day 1 讲的接龙能力主要来自这里);② SFT——老师示范「标准答案」,学会有问有答、会用工具;③ RL——放进真实任务里自己试,对了加分、错了扣分,越试越强;④ MOPD——把 9 个特长生「合体」成一个全能选手。前两步给「地基」,后两步给「能力上限」。
打个比方
把 K3 想象成一个「AI 学生」:预训练 = 泡在图书馆自学(没人教,全靠悟);SFT = 名师一对一示范标准答案;RL = 参加真实比赛,赢了得奖金、输了被扣分;MOPD = 学校把各科状元的知识「注入」到你脑子里,让你一个人会所有科目。
进阶小注 ·后训练的官方三阶段范式(§4.1):SFT → RL → MOPD。SFT 建立「冷启动策略」;RL 在不同推理力度下训练「领域专家」;MOPD(Multi-Teacher On-Policy Distillation)把这些跨领域、跨力度的策略整合进单一模型。注意:MOPD 与预训练无关,它属于后训练(post-training)。

2预训练:读什么?读多少?

预训练的本质是「海量阅读」:把全世界能公开拿到的文字、代码、图片,一股脑喂给模型,让它反复练习「下一个字是什么」。读得越多越杂,语感和知识就越扎实。

K3 读的书分四大类(文本)+ 一大类(视觉):

预训练数据四大文本领域 + 视觉语料 Web 文本、代码、数学、知识四大领域,配大规模视觉语料 预训练吃什么:四大文本领域 + 视觉语料 Web 文本 网页、文章、百科 全世界的日常文字 代码 程序、开源仓库 学会「写代码」 数学 公式、习题 学会「推理」 知识 专业资料、书籍 深知识储备 视觉语料 图像描述 · 图文交错文档 · OCR · 感知 · 视频 · 视觉编程数据 文本负责「语言与知识」,视觉负责「看懂世界」——两路数据在训练中交错出现(下一节)
图 2 · 预训练数据长这样:文本四大领域——Web 文本(日常文字)、代码(会写程序)、数学(会推理)、知识(专业储备);下面还有一整条视觉语料(图像、视频、OCR……)。数据不是拿来就用,要先「洗」:去重、过滤低质量、调好各类占比。K3 还专门给知识与数学数据做了「改写」,让内容更耐读。
一个细节:代码、数学数据特别有用,因为它们天然「可验证」——程序能不能跑、答案对不对,机器能自动判断。这为后面的 RL(考试 + 奖励)准备了最好的「试卷」。K3 报告里说:代码、数学、知识这类数据还会被「改写」——换种说法重写一遍,让模型读到更多样的表达。
进阶小注 ·数据管线:基于规则的启发式 + 基于分类器的质量打分 + 去重;各领域采样比例通过小模型消融实验确定。视觉数据沿用 K2.5 的分类体系,并大幅扩展程序化多模态数据——把代码片段与其渲染出的视觉结果(SVG、3D 资产、网页、游戏、CAD)配对,这是「视觉在环」能力的原料。

3训练配方:文字和图片,从第一天就一起学

很多 AI 是「先学语言,再补视觉」——像先修完语文,再单独上一门美术课。K3 不一样,它用的是原生多模态:从训练的第一天起,文字 token 和图片 token 就在同一个「接龙」里交错出现,同一个大脑一起学。

原生多模态:文字与图片 token 在同一个接龙里交错 今天 天气 真 [图][图] 好 ? 这些 token 一起喂给同一个骨干网络 原生多模态:文字和图片在同一个「接龙」里一起学 今天 天气 真 [图] [图] 好 ? … 同一个共享大脑(骨干网络) 文字 token 和图片 token 走同一条路,一起学习「下一个 token 是什么」 蓝色 = 文字 token,红色 = 图片 token —— 训练目标只有一个:预测下一个(可能是字,也可能是图)
图 3 · 原生多模态训练:一行「句子」里既有文字 token(蓝色),也有图片 token(红色),它们交错排列、喂进同一个骨干网络。训练目标始终是「预测下一个 token」——下一个可能是字,也可能是图的某个小块。这样,K3 从第一天起就学会「看图说话」和「说图生图」,而不是等语言模型练完再补视觉课。

K3 团队为什么坚持这么做?报告给了一个关键证据:老办法(先对比预训练视觉编码器再接进 LLM)训练不稳定——梯度忽高忽低、频繁尖峰;而「从头开始、图文一起练」的 K3 全程稳定。换句话说:原生多模态不只是理念,还是更稳的工程选择(Day 7 讲 MoonViT-V2 时会细说)。

除了「图文一起学」,训练配方还有三个旋钮:优化器(Per-Head Muon,Day 7 讲)、学习率调度(K3 用余弦衰减,弃用流行的 WSD,理由是公平对比下余弦更优)、上下文长度(从 8K 起步,慢慢拉到 64K,再在收尾阶段冲到 256K → 100 万)。

进阶小注 ·训练配方(§3.3):Per-Head Muon 优化器 + Kimi K2 引入的权重裁剪(weight-clipping) + QB 负载均衡;学习率余弦调度、1% 线性预热、权重衰减 0.1。上下文课程(§3.4):预训练 8K → 64K,cooldown 阶段 256K → 100 万(Day 3 讲过渐进式扩展)。原生多模态意味着语言与视觉从训练伊始联合优化,而非事后嫁接。

4SFT:老师示范「标准答案」

预训练读完几百万本书的 K3,已经「会说话」但还「不会干活」——你问它问题,它可能答非所问。于是第二步:SFT(监督微调),给它看大量「标准答案」,像老师讲例题一样教它。

关键问题是:这些「标准答案」从哪来?K3 的做法很聪明——让上一代更强的模型先做一遍题,把优秀答卷收集起来当教材(这叫「合成数据轨迹」)。再经过多轮验证、人工把关,筛出真正高质量的样例。

SFT:优秀答卷 → 人工把关 → 教材 上一代模型产出示范答案,经过验证和人工标注,成为 K3 的教材 SFT 的教材是怎么来的? 上一代模型出题 生成大量示范回答 (合成数据轨迹) 多轮验证 + 人工把关 自动检查一遍 真人再筛一遍 成为 K3 的教材 教它怎么回答问题 怎么用工具 SFT 后,K3 学会了「有问必答、按规矩办事」——为下一阶段的「考试」做好了准备 (同时从 SFT 起就边训练边「预习」低精度量化,为日后省钱——Day 7 再讲)
图 4 · SFT 的教材生产线:① 让上一代领域专用模型先做大量题目,收集「优秀答卷」(合成轨迹);② 自动 + 人工双重把关,筛掉错的、坏的;③ 精选后的样例成为教材,教 K3 学会规范回答和精确调用工具。SFT 覆盖了大量复杂智能体任务——不只是「答个题」,还包括「一步步完成一件工作」。
进阶小注 ·SFT 数据用 XTML(eXtensible Token Markup Language) 对话模板序列化,以一致地表示复杂智能体轨迹;且从 SFT 阶段起即应用量化感知训练(QAT)(权重 MXFP4、激活 MXFP8),让模型提前适应部署时的低精度(§4.1.4)。

5RL:考试 + 奖励,越试越强

SFT 只是「照着答案学」,学的再好也就是老师的水平。要超越老师,得靠 RL(强化学习):把 K3 扔进真实任务里,让它自己尝试,做对了给奖励、做错了扣分——练到后来,它甚至能做出老师都不会的题。

K3 的 RL 有个特别的设计:不是训练一个「全能 RL 模型」,而是拆成 3 大领域 × 3 档推理力度 = 9 个专家模型,每个专才各练各的:

9 个 RL 专家模型 = 3 大领域 × 3 档推理力度 通用、智能体、编程三个领域,每行有 low、high、max 三档推理力度,共 9 格 RL 专家 = 3 大领域 × 3 档推理力度 = 9 个模型 low(少想一会儿) high(多想一点) max(想得最久) 通用 通用 × low 通用 × high 通用 × max 智能体 智能体 × low 智能体 × high 智能体 × max 编程 编程 × low 编程 × high 编程 × max 通用(聊天、推理、搜索)· 智能体(长任务、深度研究)· 编程(软件工程、内核、Web)
图 5 · 九个 RL 专家模型:行是三大领域——通用(问答、推理、搜索)、智能体(长周期任务、深度研究、写作)、编程(软件工程、内核优化、Web 开发);列是三档推理力度——low(少想一会儿,便宜快)、high(多想一点)、max(想得最久,最聪明)。两两交叉,共 9 个专家,各练各的、互不干扰。

「推理力度」怎么控制?靠思考预算:每个问题先估一个「该想多久」的预算,超时就把这题的奖励直接判负——逼着模型在该快的题上别磨蹭、在该难的题上多想。这和考试「每道题限时」是一回事。

「奖励」从哪来?分两种:可验证的任务(程序能不能跑、数学答案对不对)让机器直接判分;不可验证的任务(文章写得好不好)则请一个「AI 裁判」(生成式奖励模型)来打分——裁判还得遵守流程:先读作品 → 列评分标准 → 再逐项打分,防止它乱给分。

RL 循环:生成 → 打分 → 更新 → 再生成 四个节点组成循环:模型生成回答、验证器打分、更新模型、下一轮生成 RL 的一天:生成 → 打分 → 更新 → 再生成 模型生成回答 (一次采样多条尝试) 验证器 / 裁判 打分、判断对错 更新模型 (策略优化) 下一轮生成 (用更新后的模型) 一轮迭代 反复成千上万次 长任务用「部分 rollout」:不等所有轨迹跑完,先更新一批,其余排到下一轮(省时间、不拖尾)
图 6 · RL 的循环:① 模型生成回答(一次可能采样好几条);② 验证器(能自动判的)或 AI 裁判(不能自动判的)打分;③ 分数转成「梯度」,更新模型;④ 用更新后的模型再来一轮。如此反复成千上万次,模型越试越强。K3 还用了「部分 rollout」技巧:长任务不用等全部跑完才开始更新,跑完一批先更新一批——省时间、不拖尾。
打个比方
RL 像「题海战术 + 立即批改」。学生(模型)每做一题,老师(验证器)当场批改给分;做对了就记住这个思路(加分),做错了下次避免(扣分)。题越做越难,学生也越来越强。而且 K3 是分科训练的——数学组、语文组、编程组各练各的,最后再合体。
RL 在哪跑?在「沙箱」里跑。让 AI 自由尝试是很危险的——它可能乱删文件、乱装软件,甚至「骗过裁判」。所以 K3 把每次尝试都关在一个安全沙箱(隔离的迷你虚拟机)里:弄坏了也不怕,直接丢弃重来。K3 整个训练过程一共创建了 5100 多万个这样的沙箱。这是「又强又安全」的保障。
进阶小注 ·RL 技术要点(§4.1.2):部分 rollout(partial rollout)——每轮采样 N 条提示 × K 条补全,完成比例达 λ 即暂停推进策略优化,被暂停的轨迹下一轮优先恢复;配合逐 token 正则化容忍离策略数据的陈旧性。推理力度控制:token 预算 b₀(x) × 乘数 τ,超预算的任务奖励覆写为 −1,τ 按领域配置、分阶段退火。不可验证任务用智能体 GRM(锦标赛式二元对比 + 强制评分协议 + 冗长度预算),防 reward hacking。沙箱:AgentENV 基于 Firecracker 的 microVM,支持暂停/恢复/fork/快照,最高 6.5× 内存超配。

6MOPD:9 个特长生,怎么合成 1 个全能选手?

9 个专家各有所长,但 K3 最终要交付的是一个模型。怎么合?直接把 9 个模型的数字平均?不行——会互相打架。K3 用的是 MOPD(多教师在线策略蒸馏):让一个「学生模型」逐个 token 地向 9 位「老师」学习。

MOPD:9 个教师模型蒸馏合并为 1 个学生模型 9 个教师模型的输出汇聚到漏斗,指导学生模型训练,最终得到统一的 Kimi K3 MOPD:9 位老师 → 1 个学生 9 个领域专家(教师) 通用·low 通用·high 通用·max 智能体·low 智能体·high 智能体·max 编程·low 编程·high 编程·max Kimi K3 统一模型(学生) MOPD:训练学生模型时,每个 token 都参照「领域 + 力度」配对的老师来学 → 最后 1 个模型拥有全部 9 位老师的本事
图 7 · MOPD 多教师在线策略蒸馏:训练最终模型时,每遇到一个任务,就按「领域 + 推理力度」挑出对应的那位老师;学生模型每写一个 token,都要跟老师的「答案」对照着学(越接近老师越好)。9 位老师的本事,就这样一个 token 一个 token 地「蒸馏」进同一个学生身体里——最终交付的是一个模型,但它同时会 9 位老师的绝活。

为什么要绕这么大一圈?直接拿 9 个模型当 9 个产品不就行了?——因为用户要的是一个全能助手:今天让它写代码、明天让它写文章、后天让它做深度研究,一个模型都得会。9 个模型轮流切换既费钱又麻烦,还会在任务之间「人格分裂」。MOPD 让 K3 成为一个「平时全能、关键时刻还能切换到 max 深度思考」的统一大脑。

进阶小注 ·MOPD 奖励(式 15):对给定领域 d 与力度档位 e,教师与学生之间的逐 token OPD 奖励 = clip(log 教师概率 / 学生概率, −R_max, R_max)(停梯度、裁剪极端信号)。稠密奖励无缝融入 RL 框架,天然兼容部分 rollout 等基础设施优化。与更细粒度的 top-k 蒸馏目标相比,MOPD 在收敛速度与最终性能上均无劣势,因此被采用。

7映射到 K3:原文里怎么说训练的?

今天的每一步,都能在报告里找到原话:

K3 原文(§3.1 预训练数据)
「Kimi K3 的预训练语料经过精心筛选,涵盖四大主要文本领域——Web 文本、代码、数学与知识——并配有大规模视觉语料。」

逐词翻译:「精心筛选」= 不是网上有什么就吃什么,要先清洗、去重、调比例;四大文本领域 + 视觉语料,就是图 2 里那四块 + 下面一条。

K3 原文(§3.3 训练配方)
「我们的预训练以 8K token 的上下文长度开始,随后在后续训练阶段扩展至 64K token。」

逐词翻译:训练 K3 时,「一口气读多长」是慢慢加码的:先让它读 8K 长度的短文(8K ≈ 几千个汉字),再逐步加长到 64K——再到 Day 3 讲过的 cooldown 阶段 256K → 100 万。就像学生先读短课文,再读长篇小说。

K3 原文(§4.1.2 强化学习)
「将三大领域专家与 {low, high, max} 三个推理力度档位交叉组合,共得到九个专家模型。」

逐词翻译:3 个领域 × 3 档「想多久」= 9 个模型,就是图 5 那个 3×3 表格。推理力度由「token 预算」控制:预算是「这个题该想多久」的估计值,超了直接判负。

K3 原文(§4.1.3 多教师在线策略蒸馏)
「我们采用多教师在线策略蒸馏(MOPD),将这些跨推理力度的领域专用能力整合进统一模型。」

逐词翻译:「跨推理力度」「领域专用」= 9 个专才;「整合进统一模型」= 合体成一个 K3。合体方式是「蒸馏」——学生模仿老师的答案,而不是粗暴平均。

4
预训练文本领域
(Web/代码/数学/知识)
9
RL 专家模型
(3 领域 × 3 力度)
3
推理力度档位
(low / high / max)
1
最终交付的
统一模型(MOPD 合体)
一句话总结今天的 K3 印象 K3 的「成长」分四步:预训练(读万卷书,长出语感和知识)→ SFT(老师示范,学会礼貌和规矩)→ RL(考试 + 奖励,9 个特长生各练各的绝活)→ MOPD(9 合 1,一个模型拥有全部绝活)。明天开始深挖 K3 的「独门创新」:注意力残差怎么让信息跨层流动、Stable LatentMoE 三件套怎么在极端稀疏下稳住训练。

8自测题(先自己答,再点开看解析)

Q1预训练、SFT、RL 分别做什么?用「学习」来比喻。
预训练 = 自学读书:读海量文章代码,长出「语感」和知识储备(接龙能力来自这);SFT = 老师示范:喂标准答案,学会有问有答、按规矩办事;RL = 考试 + 奖励:自己尝试,对了加分、错了扣分,越试越强(能超过老师)。第四步 MOPD = 特长生合并:把 9 个专才合成 1 个全才。
Q2「原生多模态」是什么意思?为什么说它比「先学语言再补视觉」更稳?
原生多模态 = 从训练第一天起,文字 token 和图片 token 就在同一个「接龙」里交错出现,同一个骨干网络一起学,而不是先练好语言、再事后嫁接视觉编码器。更稳的证据:老办法(用对比预训练初始化视觉编码器)在接入 LLM 后梯度忽高忽低、频繁尖峰,而从头图文一起练的 K3 全程稳定。
Q39 个 RL 专家模型是怎么来的?「推理力度」怎么控制?
3 大领域(通用 / 智能体 / 编程)× 3 档推理力度(low / high / max)= 9 个专家。推理力度靠思考预算控制:每个问题先估一个「该想多久」的预算(token 数),超出预算的答案直接判负——逼模型在该快的题上别磨蹭、在该难的题上多想。超预算判负还有个好处:防止模型「过度思考」刷分。
Q4MOPD 是干什么的?为什么叫「多教师」?
MOPD 把 9 个领域专家合并成 1 个统一模型:训练学生模型时,按「领域 + 力度」挑对应的老师,学生每写一个 token 都对照老师的答案学(越接近越好)。叫「多教师」是因为有 9 位老师;「蒸馏」= 学生模仿老师的概率分布,而不是粗暴平均权重。
Q5RL 的「奖励」从哪来?为什么要用沙箱?
两种来源:可验证任务(程序能不能跑、数学答案对不对)由机器自动判分;不可验证任务(文章好坏)由「AI 裁判」(生成式奖励模型)按固定流程打分。用沙箱是因为让 AI 自由尝试有风险——它可能乱删文件甚至「骗过裁判」;沙箱(隔离的迷你虚拟机)让它可以放手尝试、弄坏就丢,K3 训练全程创建了 5100 多万个沙箱。
返回课程首页 · 本课程基于《Kimi K3 技术报告》编写,概念图均为原创示意