Attention→K3 三十天课 · Day 22 / 30 课程首页 面试视角 自测题
Day 22 · 预训练全景

预训练:大模型世界知识的真正源泉

如果把大模型的诞生比作一个人的一生,预训练(Pre-training)就是它通读全人类图书馆的 18 年寒窗苦读,烧掉了整个项目绝大部分的电费与算力。今天我们看懂预训练到底在炼什么:海量互联网脏数据怎么洗成黄金、Scaling Law 是怎么指导算力分配的,以及 K3 的四阶段上下文渐进扩展课程。

学完你能回答
预训练到底给模型注入了什么?
学完你能回答
什么是 Scaling Law(缩放定律)?
学完你能回答
K3 是怎么从 8K 渐进扩展到 100 万窗口的?

1起点:这些你早就会了

预训练的本质,就是建立世界底层规律的概率模型:

你已经会的AI 世界里对应的东西
通读群书:把古今中外数万本书全读一遍,建立博闻广识预训练(Pre-training):在海量无标注互联网语料上进行大规模自回归预测
投入产出比:买多少材料、雇多少工人,算力与参数的数学公式Scaling Law(缩放定律):计算量、参数量与数据量的最佳幂律配比
读书由浅入深:先读短篇寓言,再读长篇学术专著渐进式上下文课程:上下文窗口从 8K、64K 逐步拉伸至 100 万 token
淘金过滤:把沙子、泥浆洗掉,只留下纯金颗粒数据清洗流水线:去重、过滤毒性低质内容、合成高质量代码数学数据
健身增肌:负重(参数)和训练量(数据)要一起加,只加一边效果差Chinchilla 配比:参数量与训练 token 量要同步扩展,预算才花得值

2预训练到底在炼什么?(压缩即智能)

很多初学者好奇:预训练没有人工给它打标签,它怎么知道什么是对什么是错?

核心机制:互联网就是最天然的自监督教材
一句话:「苹果从树上掉到了_____」。
• 模型猜「地上」,损失很小;猜「天上」,损失巨大并被严厉惩罚。

为了在几万亿 token 的互联网文本中把下一个 token 猜得越来越准,模型必须被迫在它的 2.8 万亿个参数里,建立起物理定律、语法逻辑、历史常识、编程语法乃至人类情感的深层世界模型!
OpenAI 前首席科学家 Ilya Sutskever 也反复表达过类似观点:把下一个 token 预测得足够好,模型就不得不学会文本背后的世界运行规律。

严格来说,模型学到的并不是人类意义上「理解」的物理定律,而是 token 之间的统计规律——只是要把大规模语料上的预测误差压到足够低,这些统计规律必须内化出类似世界模型的结构,「理解」是我们对这种结构的通俗描述。

3Scaling Law(缩放定律):算力投资的指南针

2020 年 Kaplan 等人与 2022 年 DeepMind Chinchilla 实验证实了著名的大模型缩放定律(Scaling Law):

L(N, D) ∝ (N_c / N)^α_N + (D_c / D)^α_D

• N 是模型参数量,D 是训练数据 token 量;
• 只要算力(Compute C ≈ 6·N·D)以指数增长,模型的测试损失(Loss)就会精确地沿着一条平滑的幂律直线稳定下降!

4K3 的长上下文预训练:四阶段渐进课程

如果一开始就用 100 万 token 训练,不仅算力开销极其昂贵,而且模型在初期根本学不会基础语法。在《Kimi K3 技术报告》§3.4 中,K3 团队设计了四阶段渐进扩展课程。其中收尾阶段叫冷却退火(cooldown)——把学习率逐步降到接近 0,并换上更高质量的数据,让模型平稳收敛:

Kimi K3 四阶段上下文渐进扩展预训练流水线 从 8K 基础预训练,到 64K 主力训练,再到 256K 冷却退火,最终完成 1M 上下文对齐 K3 上下文窗口四阶段渐进课程(§3.4) 阶段 1: 8K 启动 海量文本快速吞吐 建立基础通用内功 阶段 2: 64K 主力 长篇论述与代码 攻克中长距离依赖 阶段 3: 256K 冷却 cooldown 阶段 高质量合成数据 阶段 4: 100 万达成 超长文档与智能体 防止退化为局部模式
图 22.1:K3 上下文渐进扩展流水线。把代价高昂的长序列计算集中在整体训练预算的一小部分内,逐级拉伸上下文,保证了全长度区间的平稳收敛。

5面试视角

面试视角 · 高频考点
面试官可能会问:「什么是预训练的 Scaling Law?为什么长上下文模型不直接从头用 1M 长度开始预训练?」
八股答「Scaling Law 是指算力、参数和数据成比例增加时 Loss 会持续下降。从头用 1M 训算力太贵,而且短文本学不好,所以要分阶段扩窗。」——答对了核心,若能从数据利用率与注意力计算比解释则更出色。
本课答「核心是算力效率与课程学习(Curriculum Learning)的协同:① Scaling Law:指导了固定计算预算下参数量 N 与训练 token 量 D 的最优算力分配平衡点(C ≈ 6·N·D);② 直接 1M 预训练的弊端:在预训练早期,模型主要学习局部语法和基础事实,超长上下文中的长程依赖信号信噪比极低,若直接在 1M 上做注意力和序列打包,大量计算资源被浪费在无效的长程 Attention 矩阵上;③ 多阶段渐进课程(如 K3 的 8K → 64K → 256K → 1M):在短序列阶段以最高吞吐建立稠密的世界知识底座,在后期的冷却退火(cooldown)阶段注入高质量长文本与合成依赖数据,把代价高昂的长序列计算集中在整体训练预算的一小部分内,平稳解锁百万 token 上下文能力。」

6映射到原文:K3 报告 §3.2 与 §3.4

今天讲的四阶段课程出自 §3.4(长上下文扩展);而 §3.2(规模定律)里有一句话,把 Scaling Law 在 K3 身上的实战结果讲透了——注意 2.5× 的正确口径:

K3 原文(§3.2 规模定律)
「由于这些改动也改变了最优训练区间,我们开展了专门的规模定律研究,重新调校关键超参数,包括批量大小、学习率、token 与参数之比(TPP)以及模型形状。在留出的 OOD 验证数据上评估,规模定律曲线(图 7)表明,这些改进合计带来了相较 Kimi K2 约 2.5× 的整体规模效率提升。」

逐词翻译:

  • 「最优训练区间」:就是 Scaling Law 告诉我们的算力分配甜点位——多少参数配多少 token、用多大批量和学习率。K3 换了架构(KDA、MLA、LatentMoE 等),甜点位跟着移动,所以要重新做一次规模定律研究来定位它。
  • 「OOD 验证数据」:out-of-distribution,训练时没见过的留出数据。在没见过的数据上测损失,才算数。
  • 「2.5× 的整体规模效率提升」:这是架构 + 数据 + 训练配方所有改进合在一起带来的整体规模扩展效率提升,不是某一个零件的功劳——不能解读成「KDA 或 3:1 架构让吞吐快了 2.5 倍」。同样算力预算下,新配方把损失压到了原来 2.5 倍算力才能到的位置。

§3.4 则给出了第 4 节那张图的原文依据:「预训练期间窗口从 8K 增长到 64K token,cooldown 阶段从 256K 扩展到 100 万 token。」——四阶段课程不是拍脑袋,是写进报告的正式设计。

2.5×
K3 相较 K2 的整体规模扩展效率提升(§3.2)
4 阶段
K3 上下文窗口渐进扩展的课程设计(§3.4)
C≈6ND
密集模型预训练浮点计算量估算公式
100 万
K3 最终达成的上下文窗口(token)

7自测题(先自己答,再点开看解析)

Q1 为什么说「预训练是模型世界知识的真正源泉」?
解析:因为绝大多数事实知识、常识、语法结构和逻辑规律,都是在预训练阶段通过阅读几万亿无监督互联网文本并预测下一个 token 建立起来的。
Q2 简述 Chinchilla Scaling Law 的核心发现。
解析:模型参数量 N 和训练 token 量 D 应该以等比例同等放大(而不是只盲目增加参数量),算力分配最优时能达到最低的测试损失。
Q3 为什么预训练数据中代码(Code)和数学数据极其重要?
解析:代码和数学数据包含严密的因果链条、严格的逻辑结构和跨函数符号依赖,能极大激发模型的逻辑推理与复杂规划能力。
Q4 什么是冷却退火(cooldown)阶段?
解析:在预训练最后阶段,将学习率逐渐降至接近 0,并大幅提高精选高质量数据(如合成数据、权威教材)的比例,使模型损失快速收敛到极致。
Q5 K3 的长上下文扩展分为哪四个阶段?
解析:8K 启动 → 64K 核心预训练 → 256K 冷却退火 → 100 万 token 终极对齐。
《从 Attention 到 K3 · 大模型近十年设计演进》30 天课 · Day 22 / 30 · 返回课程首页