K3 七天课 · Day 7 / 7 课程首页 自测题 映射 K3
Day 7 · 收官:创新深读(下)+ 大考成绩单

K3 的「眼睛」怎么长的?它到底考了多少分?

最后两块拼图:MoonViT-V2(从零训练出来的视觉编码器)和 Per-Head Muon(把优化器按头拆开)。然后进入「放榜环节」:四大轴线评测、第三方裁判打分、性价比对比,最后看看 K3 已经能干的六件真事。

学完你能回答
MoonViT-V2 为什么不沿用 SigLIP 预训练?
学完你能回答
Per-Head Muon 和普通 Muon 差在哪?
学完你能回答
K3 四大轴线里哪项最强、哪项最弱?省多少钱?

0起点:这些你早就会了

今天一半讲「K3 怎么被教出来」,一半讲「K3 考了多少分、能干多少活」。先对号入座:

你已经会的AI 世界里对应的东西
背单词卡:先看图片对照学「猫 = cat」,再学造句对比预训练(SigLIP):先让 AI 学「图和文字配对」,再接入语言模型
直接读带插图的课本,边读边学会认图下一 token 预测训练(MoonViT-V2):视觉编码器直接跟着「接龙任务」一起学
全班同学挤一瓶牙膏,力气大的把别人挤没了全矩阵正交化:所有注意力头共用一个更新方向,大的头占主导
每人一管自己的牙膏,各挤各的Per-Head Muon:每个注意力头单独做正交化,互不干扰
期末考试:全班同一张卷子,看谁分高基准评测:同一批考题考所有模型,比分数
买东西看「效果 ÷ 价格」成本效率:同样分数谁花的钱少,同样钱谁分高

核心就一句:今天先看 K3 的「眼睛」(MoonViT-V2)和「健身方式」(Per-Head Muon),再看它「考试和干活」的成绩单——收官日,把前六天拼成完整画像。

1K3 的「眼睛」:MoonViT-V2 从零开始学看

K3 是原生多模态模型——它能看到图和视频,还能把「看图」和「读文字」当成同一种接龙游戏来学。而负责「看」的部分,就是视觉编码器 MoonViT-V2。

以前的做法(包括 K3 的前一代 K2.5)都是:先用 SigLIP——一种「看图配对文字」的预训练模型——把视觉编码器初始化好,再接入语言模型。理由很朴素:先让 AI 学会看图,后面学说话不就省劲了吗?

但 K3 团队放弃了这个「省劲」的做法,原因只有一个词:不稳定。把预训练好的编码器接进 LLM 一起优化时,梯度会忽大忽小、频繁爆尖峰,训练像在颠簸的路上开车。于是他们干脆从零开始,让视觉编码器直接跟着「下一 token 预测」这个主任务一起学——就像不先背单词卡,而是直接读带插图的课本。

两种训练方式对比:SigLIP 初始化 vs 从零训练 左:先看图配文字再接入语言模型,梯度波动大;右:直接跟语言模型一起做下一 token 预测,梯度平稳 两种「练眼睛」的方式对比 老办法:SigLIP 预训练初始化 阶段一:单独学看图 (图 ↔ 文字配对) 阶段二:接入语言模型 (联合优化) 梯度忽大忽小、尖峰频繁 → 训练颠簸 K3 做法:MoonViT-V2 从零训练 直接一起学 图、文字同一种接龙 一起更新 不需要 SigLIP 帮忙 梯度平稳 → 训练一路顺风 结果:视觉评测与 SigLIP 基线相当,但训练更稳、表示更贴合语言目标
图 1 · 两种「练眼睛」的方式:左边老办法分两阶段(先 SigLIP 配对学习、再接入语言模型),但联合优化时梯度颠簸、尖峰频繁;右边 K3 让视觉编码器直接从零开始、跟着「下一 token 预测」主任务一起学,梯度一路平稳——而且最终视觉分数和 SigLIP 基线不相上下。报告原话是:对比预训练「并非必要的初始化手段」。

MoonViT-V2 长什么样?27 层、约 0.4B 参数的视觉 Transformer,用 RMSNorm,并且把线性投影和注意力投影里的所有偏置项都去掉——这又是为了稳定。它还做到「看图」和「看视频」共用同一套参数,靠一个 2×2 的 pixel-shuffle 下采样把视觉 token 压到四分之一,于是最高 3584×3584 像素的超大图,也能塞进 100 万 token 的上下文里。

原文摘录 · §2.4 MoonViT-V2
「我们完全从零开始、以下一 token 预测训练 Kimi K3 的视觉编码器 MoonViT-V2……当把预训练编码器接入 LLM 时,联合优化会变得不稳定:SigLIP 初始化的 MoonViT-3D 梯度范数持续偏高且尖峰频繁,而 MoonViT-V2 在整个训练过程中保持稳定。」
「值得注意的是,我们发现 MoonViT-V2 在各项视觉评测中与 SigLIP 初始化的基线相当,这表明在规模化多模态语言模型中,对比预训练并非必要的初始化手段。」

2优化器也动刀:Per-Head Muon「按头拆开」

还记得 Day 1 说的「训练 = 改数字」吗?到底怎么改,由优化器说了算。K3 用的优化器叫 Muon,它对矩阵参数做一种叫 Newton–Schulz 正交化的数学操作——你可以理解成「让参数矩阵的更新方向保持优雅、不走歪」。

但这里有个问题:注意力里的 Q、K、V 投影矩阵,其实是很多个「头」(head)拼在一起的。以前的 Muon 是整块矩阵一起正交化——相当于把全班同学的头按进同一管牙膏里挤,结果力气大的头主导了大家共同的方向,力气小的头得不到足够的「更新」,被带偏了。

K3 的改法:沿着头的方向把矩阵切开,每个头单独做正交化——一人一管牙膏,各挤各的。这样每个头的更新尺度趋于一致,跨头的学习更均衡,规模更大时训练也更稳定;顺带还省了一点算力(在小块上做正交化迭代更便宜)。

全矩阵正交化 vs 逐头正交化 左:所有头一起正交化,大的头主导;右:每个头单独正交化,更新均衡 普通 Muon vs Per-Head Muon:谁挤牙膏? 普通 Muon:一整管牙膏 Q 矩阵(内含 8 个头) 整体正交化 → 大脑袋说了算 头 1–6 的更新被「大块头」带动 Per-Head Muon:一人一管 头 1 单独正交 头 2 单独正交 头 3 单独正交 … 每个头更新尺度一致 → 学习更均衡 直觉:全矩阵正交化把所有头当成一个整体,大的头主导方向;逐头切开后各头更新均衡、还更省算力。
图 2 · 谁挤牙膏:左——普通 Muon 对整块 Q/K/V 投影矩阵做正交化,头部尺度不均时,大的头会主导共享更新方向;右——Per-Head Muon 沿头维度把矩阵切开,每个头单独正交化,更新尺度趋于一致、训练更稳、开销还略降。Q、K、V 三组投影都这么处理。
原文摘录 · §2.5 Per-Head Muon
「全矩阵正交化把所有头视为单一耦合块,梯度或动量尺度较大的头会主导共享的更新方向,而尺度较小的头则得不到充分归一化的更新;逐头正交化使各头的更新尺度趋于一致。实践中,这一设计带来了跨头更均衡的学习动态,并提升了更大规模下的训练稳定性。」

3放榜:四大轴线,K3 考了多少分?

前六天把 K3 的「身体」讲完了,现在是检验环节。报告把考试分成四大轴线:推理与知识、编程、智能体、视觉。每一类都有专门的「考题」(基准测试),考所有模型、比分数。

四大轴线评测概览 四条轴线各列 2-3 个代表性分数 K3 四大轴线成绩单(代表性基准) 推理与知识 93.5 GPQA 研究生级 ✓ 56.0 HLE-Full(用工具) 23.4 CritPt 研究级 ✗ 短板:研究级推理 仍落后顶尖闭源 编程 77.8 ProgramBench 第 1 ✓ 81.2 FrontierSWE 第 2 88.3 Terminal-Bench 2.1 强项:智能体编程 逼近 GPT-5.6 Sol 智能体 91.2 BrowseComp 第 1 ✓ 95.0 DeepSearchQA F1 94.5 MCPMark-Verified 最强项:智能体 多榜第一 视觉 94.3 Math-Vision 97.8 +Python 工具 23→41 ZeroBench +工具 原生视觉强 工具放大能力 百分比为各代表性基准分数;→ 表示「加 Python 工具后提升到」
图 3 · 四大轴线成绩单:推理与知识——研究生级考题(GPQA)93.5% 与前沿持平,但研究级考题(HLE-Full 56.0%、CritPt 23.4%)仍落后顶尖闭源,是明确的短板;编程——ProgramBench 第 1、FrontierSWE 第 2(81.2%)、Terminal-Bench 2.1(88.3%)几乎追平 GPT-5.6 Sol(88.8%);智能体——BrowseComp 91.2%、DeepSearchQA F1 95.0%,多榜第一,是最强项;视觉——Math-Vision 94.3%,加上 Python 工具升到 97.8%,ZeroBench 从 23% 跃到 41%,原生视觉 + 工具是它的杀手锏。
一句话读懂成绩单:K3 是「全能型选手,两头突出」——智能体和编程最强,视觉靠「自带眼睛 + 会调工具」也很能打;唯独最难的研究级推理(HLE、CritPt)还差顶尖闭源一截,报告自己也承认这是下一步重点改进方向。
原文摘录 · §6.1.4 评测结果
「在研究生水平的推理上,Kimi K3 与前沿水平相当,GPQA Diamond 得分 93.5%。但在研究级任务上仍有差距:在 HLE-Full 上……得分分别为 56.0%(使用工具)和 43.5%(不使用工具);在 CritPt 上得分 23.4%……表明研究级推理仍是重点改进方向。」
「在极具挑战的 ZeroBench-main 上与 Claude Fable 5 战平(23.0%,pass@5),使用 Python 工具后跃升至 41.0%。」

4第三方裁判 + 性价比:不仅考得好,还便宜

自己的报告当然说自己好,所以 K3 发布后,还有第三方机构独立评测。看三个代表性结果:

第三方评测三榜 Artificial Analysis 57.1 第 4;Vals AI 74.7% 第 2;WebDev Arena 1678 Elo 第 1 第三方独立评测:三张榜单 Artificial Analysis 57.1 Intelligence Index 580 个模型 · 第 4 名 Claude Fable 5 · 59.9 GPT-5.6 Sol · 58.9 Vals AI 74.7% GDP 加权行业基准 39 个模型 · 第 2 名 Claude Fable 5 · 75.1% GPT-5.6 Sol · 73.1% WebDev Arena(人类投票) 1,678 Elo 分(等级分) 99 个模型 · 第 1 名 🏆 领先 Claude Fable 5 的 1,634 WebDev Arena 登顶意味着:K3 是首个在该榜单拿第一的开源模型——开源打平甚至超过闭源。
图 4 · 第三方三榜:Artificial Analysis 综合智能指数 57.1(580 个模型第 4,仅次于 Claude Fable 5 与 GPT-5.6 Sol);Vals AI 行业加权 74.7%(39 个模型第 2);WebDev Arena 人类投票 Elo 1,678(99 个模型第 1)——「首个登顶的开源模型」。

再看性价比(分数 ÷ 成本)。报告比了四个覆盖编程与智能体任务的套件,核心结论一句话:K3 以「接近最高分」的分数,花「别人零头」的钱。

成本效率对比 四个套件的分数与成本对比 同样的分数,K3 花的钱少多少? KCB 2.0 落后 Claude Fable 5 仅 4.0 分,成本只花它的 38% BrowseComp 单任务 $2.03:GPT-5.6 Sol 的一半,比 Claude 低一个数量级 GDPval-AA v2 比 Claude Fable 5 便宜 2.6 倍,比 GPT-5.6 Sol 还低 13%
图 5 · 四个套件上的性价比:蓝色条形代表「K3 的分数表现」占满行、浅色条形是「成本差距」的直观示意。KCB 2.0 落后 4.0 分但成本仅 38%;BrowseComp 拿第一的同时单任务成本只有 GPT-5.6 Sol 的一半、比 Claude 低一个数量级;GDPval-AA v2 Elo 差距 50 分内、成本却便宜 2.6 倍。报告原话:K3「以仅为 Claude Fable 5 零头的成本交付接近最高水平的分数」。
原文摘录 · §6.3 / §6.4 第三方与成本效率
「在 WebDev Arena 以 1,678 Elo 在 99 个模型中排名第一(领先 Claude Fable 5 的 1,634)——是首个登顶该榜单的开源模型。」
「总体而言,Kimi K3 在全部四个套件上都位于或接近成本效率前沿,以仅为 Claude Fable 5 零头的成本交付接近最高水平的分数。」

5光说不练假把式:六个真实案例

分数是「考试」,案例是「干真活」。报告用六个案例展示 K3 在真实技术任务上的能力——注意,这些都是它独立自主完成的。

六个真实案例 六个案例卡片:GPU 内核、编译器、芯片、科研、知识工作、视频 K3 已经能干的六件真事 ① GPU 内核优化 把自家模型的内核改快 KDA −73.6% DSA −55.1% AttnRes 283.6→114.4 ms 与 Claude Fable 5 持平 ② 从零写编译器 MiniTriton:类 Triton 编译器 ~90% roofline 优于 PyTorch 还能端到端训 GPT 梯度差 ≤ 10⁻⁴ ③ 设计推理芯片 48 小时自主连续运行 >8,700 token/s 146 万标准单元 100 MHz 时序收敛 RTL 已开源 ④ 科研编程 复现天体物理 I–Love–Q 2 小时 vs 1–2 周 3,000+ 行 Python 300+ 状态方程,还发现论文公式不一致 20+ 篇论文交叉验证 ⑤ 知识工作 AI ASIC 42 年历史研究网站 120+ 轮迭代打磨 2,800+ 次搜索 87 份季报 + 99 份 PDF(11,000+ 页) 另一案例:391 个引力波事件、20+ 子智能体 ⑥ 视频剪辑 3Blue1Brown 风格科普视频 56 个源片段 节拍帧级同步 片段筛选、动作匹配、音频处理 相当于剪辑师 1–2 天工作量
图 6 · 六件真事:① GPU 内核:KDA 提速 73.6%、DSA 提速 55.1%、AttnRes 延迟 283.6→114.4 ms;② MiniTriton:从零写编译器,张量核矩阵乘逼近 cuBLAS(约 90% roofline),还能端到端训练 GPT;③ 芯片:48 小时自主设计推理芯片原型,>8,700 token/s、146 万标准单元;④ 科研:复现 I–Love–Q 普适关系,2 小时完成研究人员 1–2 周的工作,还发现已发表公式里的不一致;⑤ 知识工作:做出 AI ASIC 42 年历史研究网站(120+ 轮迭代、2,800+ 次搜索),并行分析 391 个引力波事件;⑥ 视频:制作讲解自身架构的 3Blue1Brown 风格视频。
一个反直觉的细节:报告说,后期开发阶段中,一个早期的 K3 检查点就已经承担了他们「大部分的内核优化工作」——也就是说,K3 还没训完,就已经在帮工程师优化 K3 自己的内核了。自己优化自己,这大概是「用 AI 造 AI」最直观的例子。
原文摘录 · §7 案例研究
「在 4 mm² 的分析面积预算内,该设计在 100 MHz 下完成时序收敛,RTL 仿真的解码吞吐量超过 8,700 token/s,集成 146 万个标准单元、0.277 MiB SRAM,以及融合反量化的 INT4 MAC 阵列。RTL 代码已在 GitHub 上开源。」
「Kimi K3 查阅了 20 余篇论文并交叉验证其结果,实现了完整的数值计算流水线,评估了 300 多个状态方程,发现了已发表公式中的不一致之处,编写了超过 3,000 行 Python 代码,并产出一个交互式 HTML 仪表盘——全程约两小时,而有经验的研究人员通常需要一到两周。」

6收官:七天,我们把 K3 讲完了

最后用一张「路线图」把七天串起来,看看我们从「零基础」走到了哪里:

七天课程路线图 从接龙游戏到完整画像的七步 七天路线图:从「接龙游戏」到「完整画像」 Day 1 语言的接龙 Token·Embedding 学习=改数字 Day 2 注意力机制 Q·K·V·多头 KV Cache Day 3 长上下文 KDA·衰减·NoPE 1M 上下文 Day 4 MoE 专家 896 选 16 2.8T/104B Day 5 训练流水线 预训练→RL→MOPD 9 专家合一 Day 6 创新上 AttnRes·三件套 跨层+稳定 Day 7 创新下+成绩单 视觉·优化器·评测 案例·性价比 完整画像:开源 2.8T MoE · 原生视觉 · 100 万 token 上下文 全球首个开源的 3T 级模型:智能体/编程第一梯队,视觉+工具能打,研究级推理待补 它「开源」意味着:所有人都能下载、使用、研究、改进——这才是整份报告最重要的意义
图 7 · 七天路线图:Day 1 学会「接龙」世界观 → Day 2 注意力怎么找重点 → Day 3 怎么记住 100 万字(KDA)→ Day 4 怎么用 1040 亿干活(MoE)→ Day 5 它怎么被教出来 → Day 6 跨层与稳定的创新 → Day 7 眼睛、优化器、成绩单与真事。七块拼图合成一句话画像:开源 2.8T MoE、原生视觉、100 万 token 上下文,全球首个开源 3T 级模型。
收官寄语 · 一个非技术读者也能带走的三句话 第一句:K3 证明「变大」不是唯一出路——KDA、AttnRes、Stable LatentMoE 这些「巧思」让 2.8T 参数既强又稳。
第二句:K3 在智能体、编程、视觉+工具上已经和最强闭源模型掰手腕,而且便宜一个数量级。
第三句:它是开源的——这份报告里的每一个数字,全世界都能验证、能复现、能站在它上面继续往前走。

7自测题(先自己答,再点开看解析)

Q1MoonViT-V2 为什么不沿用 SigLIP 预训练初始化?
因为训练不稳定:把预训练好的编码器接入 LLM 联合优化时,SigLIP 初始化的编码器梯度范数持续偏高、尖峰频繁,训练像在颠簸路上开车。K3 改为从零开始、直接跟着下一 token 预测任务学,梯度全程平稳;而且最终视觉评测分数和 SigLIP 基线相当——报告结论:对比预训练「并非必要的初始化手段」。
Q2Per-Head Muon 和普通 Muon 差在哪?为什么更好?
普通 Muon 对整块 Q/K/V 矩阵做 Newton–Schulz 正交化,把所有注意力头当成一个耦合整体——梯度/动量尺度大的头会主导共享的更新方向,小的头得不到充分归一化的更新。Per-Head Muon 沿头维度切开矩阵、每个头单独正交化,使各头更新尺度趋于一致,学习更均衡、更大规模下训练更稳,还因在小块上做迭代而略省开销。
Q3四大轴线里,K3 哪项最强、哪项最弱?
最强:智能体(BrowseComp 91.2%、DeepSearchQA F1 95.0% 等多榜第一)和编程(ProgramBench 第 1、FrontierSWE 第 2)。视觉靠「原生眼睛 + Python 工具」很强(Math-Vision 94.3%→97.8%、ZeroBench 23%→41%)。最弱:研究级推理——HLE-Full 56.0%、CritPt 23.4%,仍落后 Claude Fable 5 / GPT-5.6 Sol,是报告承认的下一步改进方向。
Q4第三方评测里,K3 拿了什么名次?
Artificial Analysis:57.1 分,580 个模型第 4(仅次于 Claude Fable 5 和 GPT-5.6 Sol);Vals AI:74.7%,39 个模型第 2;WebDev Arena:Elo 1,678,99 个模型第 1——首个登顶该榜单的开源模型,领先 Claude Fable 5(1,634)。
Q5K3 的「性价比」优势体现在哪?用一句话总结
报告原话:「以仅为 Claude Fable 5 零头的成本交付接近最高水平的分数」。具体:KCB 2.0 落后 4.0 分但成本仅 38%;BrowseComp 拿第一且单任务 $2.03,是 GPT-5.6 Sol 的一半、比 Claude 低一个数量级;GDPval-AA v2 比 Claude Fable 5 便宜 2.6 倍。
返回课程首页 · 本课程基于《Kimi K3 技术报告》编写,概念图均为原创示意