如果把大模型的诞生比作一个人的一生,预训练(Pre-training)就是它通读全人类图书馆的 18 年寒窗苦读,烧掉了整个项目绝大部分的电费与算力。今天我们看懂预训练到底在炼什么:海量互联网脏数据怎么洗成黄金、Scaling Law 是怎么指导算力分配的,以及 K3 的四阶段上下文渐进扩展课程。
预训练的本质,就是建立世界底层规律的概率模型:
| 你已经会的 | AI 世界里对应的东西 |
|---|---|
| 通读群书:把古今中外数万本书全读一遍,建立博闻广识 | 预训练(Pre-training):在海量无标注互联网语料上进行大规模自回归预测 |
| 投入产出比:买多少材料、雇多少工人,算力与参数的数学公式 | Scaling Law(缩放定律):计算量、参数量与数据量的最佳幂律配比 |
| 读书由浅入深:先读短篇寓言,再读长篇学术专著 | 渐进式上下文课程:上下文窗口从 8K、64K 逐步拉伸至 100 万 token |
| 淘金过滤:把沙子、泥浆洗掉,只留下纯金颗粒 | 数据清洗流水线:去重、过滤毒性低质内容、合成高质量代码数学数据 |
| 健身增肌:负重(参数)和训练量(数据)要一起加,只加一边效果差 | Chinchilla 配比:参数量与训练 token 量要同步扩展,预算才花得值 |
很多初学者好奇:预训练没有人工给它打标签,它怎么知道什么是对什么是错?
2020 年 Kaplan 等人与 2022 年 DeepMind Chinchilla 实验证实了著名的大模型缩放定律(Scaling Law):
L(N, D) ∝ (N_c / N)^α_N + (D_c / D)^α_D
• N 是模型参数量,D 是训练数据 token 量;
• 只要算力(Compute C ≈ 6·N·D)以指数增长,模型的测试损失(Loss)就会精确地沿着一条平滑的幂律直线稳定下降!
如果一开始就用 100 万 token 训练,不仅算力开销极其昂贵,而且模型在初期根本学不会基础语法。在《Kimi K3 技术报告》§3.4 中,K3 团队设计了四阶段渐进扩展课程。其中收尾阶段叫冷却退火(cooldown)——把学习率逐步降到接近 0,并换上更高质量的数据,让模型平稳收敛:
N 与训练 token 量 D 的最优算力分配平衡点(C ≈ 6·N·D);② 直接 1M 预训练的弊端:在预训练早期,模型主要学习局部语法和基础事实,超长上下文中的长程依赖信号信噪比极低,若直接在 1M 上做注意力和序列打包,大量计算资源被浪费在无效的长程 Attention 矩阵上;③ 多阶段渐进课程(如 K3 的 8K → 64K → 256K → 1M):在短序列阶段以最高吞吐建立稠密的世界知识底座,在后期的冷却退火(cooldown)阶段注入高质量长文本与合成依赖数据,把代价高昂的长序列计算集中在整体训练预算的一小部分内,平稳解锁百万 token 上下文能力。」今天讲的四阶段课程出自 §3.4(长上下文扩展);而 §3.2(规模定律)里有一句话,把 Scaling Law 在 K3 身上的实战结果讲透了——注意 2.5× 的正确口径:
逐词翻译:
§3.4 则给出了第 4 节那张图的原文依据:「预训练期间窗口从 8K 增长到 64K token,cooldown 阶段从 256K 扩展到 100 万 token。」——四阶段课程不是拍脑袋,是写进报告的正式设计。
N 和训练 token 量 D 应该以等比例同等放大(而不是只盲目增加参数量),算力分配最优时能达到最低的测试损失。