K3 七天课 · 系列导航

从零开始,读懂 47 页 AI 技术报告

不假设你懂编程、懂数学、懂 AI——假设你只有高中水平:会背单词、会玩成语接龙、知道概率是什么,就足够跟上。先讲概念(用比喻和图解)→ 再回到 Kimi K3 报告对应章节。每篇末尾还有「进阶小注」,给懂点编程/数学的你点破术语。

7篇课程
30–60分钟 / 天
30+张原创图解
25道自测题
1
AI 是怎么学会说话的?(接龙、Token、语义地图)
AI 每说一个字前在算什么 · 为什么先拆词再认字 · 词在「语义地图」上的位置 · 训练像考试改错题 · 读懂 K3 的 2.8T / 104B / 1M
→ K3 §1 总览 今日内容 ✓
2
注意力机制:全班一起开「讨论会」
AI 怎么做到看完整段话再开口 · 每个词如何「听全班发言」再决定自己说什么 · 为什么顺序很重要 · 学会「上下文」这个词
→ K3 §2.1 架构 今日内容 ✓
3
Kimi 的看家本领:一口气记住 100 万字
为什么记的东西越多越慢越贵 · 「便签本」KV Cache 是什么 · KDA:不抄全文、只记重点笔记的省力方案
→ K3 §2.1 KDA 今日内容 ✓
4
2.8 万亿数字,为什么每次只用 1040 亿?(MoE)
把大脑拆成 896 个专家小组 · 每个字只问 16 个 · 怎么让专家不吵架、不偷懒 · 规模定律:为什么越大越划算
→ K3 §2.3 + 3.2 今日内容 ✓
5
训练一台 K3:从几百万本书到会聊天
预训练=海量阅读 · 教它做事(SFT)· 奖励机制(RL)· 9 个专家合并成 1 个(MOPD)· 5100 多万个沙箱是什么概念
→ K3 §3–5 今日内容 ✓
6
K3 创新深读(上):AttnRes + Stable LatentMoE
用前 5 天学到的武器,逐条拆 K3 的独门绝技:信息跨层串门的 AttnRes、极端稀疏下稳住训练的 Stable LatentMoE 三件套
→ K3 §2 全文 今日内容 ✓
7
K3 创新深读(下)+ 大考成绩单
从零训练的视觉编码器 MoonViT-V2 · Per-Head Muon 优化器 · 看懂 benchmark 分数 · 为什么 K3 便宜又强 · 六个真实案例
→ K3 §2.4–2.5 + §6–7 今日内容 ✓
使用说明
本课程基于《Kimi K3 技术报告:开放的前沿智能》编写 · 所有概念图均为原创示意,非官方图表