Day 7 · 收官:创新深读(下)+ 大考成绩单
K3 的「眼睛」怎么长的?它到底考了多少分?
最后两块拼图:MoonViT-V2(从零训练出来的视觉编码器)和 Per-Head Muon(把优化器按头拆开)。然后进入「放榜环节」:四大轴线评测、第三方裁判打分、性价比对比,最后看看 K3 已经能干的六件真事。
学完你能回答
MoonViT-V2 为什么不沿用 SigLIP 预训练?
学完你能回答
Per-Head Muon 和普通 Muon 差在哪?
学完你能回答
K3 四大轴线里哪项最强、哪项最弱?省多少钱?
0起点:这些你早就会了
今天一半讲「K3 怎么被教出来」,一半讲「K3 考了多少分、能干多少活」。先对号入座:
| 你已经会的 | AI 世界里对应的东西 |
| 背单词卡:先看图片对照学「猫 = cat」,再学造句 | 对比预训练(SigLIP):先让 AI 学「图和文字配对」,再接入语言模型 |
| 直接读带插图的课本,边读边学会认图 | 下一 token 预测训练(MoonViT-V2):视觉编码器直接跟着「接龙任务」一起学 |
| 全班同学挤一瓶牙膏,力气大的把别人挤没了 | 全矩阵正交化:所有注意力头共用一个更新方向,大的头占主导 |
| 每人一管自己的牙膏,各挤各的 | Per-Head Muon:每个注意力头单独做正交化,互不干扰 |
| 期末考试:全班同一张卷子,看谁分高 | 基准评测:同一批考题考所有模型,比分数 |
| 买东西看「效果 ÷ 价格」 | 成本效率:同样分数谁花的钱少,同样钱谁分高 |
核心就一句:今天先看 K3 的「眼睛」(MoonViT-V2)和「健身方式」(Per-Head Muon),再看它「考试和干活」的成绩单——收官日,把前六天拼成完整画像。
1K3 的「眼睛」:MoonViT-V2 从零开始学看
K3 是原生多模态模型——它能看到图和视频,还能把「看图」和「读文字」当成同一种接龙游戏来学。而负责「看」的部分,就是视觉编码器 MoonViT-V2。
以前的做法(包括 K3 的前一代 K2.5)都是:先用 SigLIP——一种「看图配对文字」的预训练模型——把视觉编码器初始化好,再接入语言模型。理由很朴素:先让 AI 学会看图,后面学说话不就省劲了吗?
但 K3 团队放弃了这个「省劲」的做法,原因只有一个词:不稳定。把预训练好的编码器接进 LLM 一起优化时,梯度会忽大忽小、频繁爆尖峰,训练像在颠簸的路上开车。于是他们干脆从零开始,让视觉编码器直接跟着「下一 token 预测」这个主任务一起学——就像不先背单词卡,而是直接读带插图的课本。
图 1 · 两种「练眼睛」的方式:左边老办法分两阶段(先 SigLIP 配对学习、再接入语言模型),但联合优化时梯度颠簸、尖峰频繁;右边 K3 让视觉编码器直接从零开始、跟着「下一 token 预测」主任务一起学,梯度一路平稳——而且最终视觉分数和 SigLIP 基线不相上下。报告原话是:对比预训练「并非必要的初始化手段」。
MoonViT-V2 长什么样?27 层、约 0.4B 参数的视觉 Transformer,用 RMSNorm,并且把线性投影和注意力投影里的所有偏置项都去掉——这又是为了稳定。它还做到「看图」和「看视频」共用同一套参数,靠一个 2×2 的 pixel-shuffle 下采样把视觉 token 压到四分之一,于是最高 3584×3584 像素的超大图,也能塞进 100 万 token 的上下文里。
原文摘录 · §2.4 MoonViT-V2
「我们完全从零开始、以下一 token 预测训练 Kimi K3 的视觉编码器 MoonViT-V2……当把预训练编码器接入 LLM 时,联合优化会变得不稳定:SigLIP 初始化的 MoonViT-3D 梯度范数持续偏高且尖峰频繁,而 MoonViT-V2 在整个训练过程中保持稳定。」
「值得注意的是,我们发现 MoonViT-V2 在各项视觉评测中与 SigLIP 初始化的基线相当,这表明在规模化多模态语言模型中,对比预训练并非必要的初始化手段。」
2优化器也动刀:Per-Head Muon「按头拆开」
还记得 Day 1 说的「训练 = 改数字」吗?到底怎么改,由优化器说了算。K3 用的优化器叫 Muon,它对矩阵参数做一种叫 Newton–Schulz 正交化的数学操作——你可以理解成「让参数矩阵的更新方向保持优雅、不走歪」。
但这里有个问题:注意力里的 Q、K、V 投影矩阵,其实是很多个「头」(head)拼在一起的。以前的 Muon 是整块矩阵一起正交化——相当于把全班同学的头按进同一管牙膏里挤,结果力气大的头主导了大家共同的方向,力气小的头得不到足够的「更新」,被带偏了。
K3 的改法:沿着头的方向把矩阵切开,每个头单独做正交化——一人一管牙膏,各挤各的。这样每个头的更新尺度趋于一致,跨头的学习更均衡,规模更大时训练也更稳定;顺带还省了一点算力(在小块上做正交化迭代更便宜)。
图 2 · 谁挤牙膏:左——普通 Muon 对整块 Q/K/V 投影矩阵做正交化,头部尺度不均时,大的头会主导共享更新方向;右——Per-Head Muon 沿头维度把矩阵切开,每个头单独正交化,更新尺度趋于一致、训练更稳、开销还略降。Q、K、V 三组投影都这么处理。
原文摘录 · §2.5 Per-Head Muon
「全矩阵正交化把所有头视为单一耦合块,梯度或动量尺度较大的头会主导共享的更新方向,而尺度较小的头则得不到充分归一化的更新;逐头正交化使各头的更新尺度趋于一致。实践中,这一设计带来了跨头更均衡的学习动态,并提升了更大规模下的训练稳定性。」
3放榜:四大轴线,K3 考了多少分?
前六天把 K3 的「身体」讲完了,现在是检验环节。报告把考试分成四大轴线:推理与知识、编程、智能体、视觉。每一类都有专门的「考题」(基准测试),考所有模型、比分数。
图 3 · 四大轴线成绩单:推理与知识——研究生级考题(GPQA)93.5% 与前沿持平,但研究级考题(HLE-Full 56.0%、CritPt 23.4%)仍落后顶尖闭源,是明确的短板;编程——ProgramBench 第 1、FrontierSWE 第 2(81.2%)、Terminal-Bench 2.1(88.3%)几乎追平 GPT-5.6 Sol(88.8%);智能体——BrowseComp 91.2%、DeepSearchQA F1 95.0%,多榜第一,是最强项;视觉——Math-Vision 94.3%,加上 Python 工具升到 97.8%,ZeroBench 从 23% 跃到 41%,原生视觉 + 工具是它的杀手锏。
一句话读懂成绩单:K3 是「全能型选手,两头突出」——智能体和编程最强,视觉靠「自带眼睛 + 会调工具」也很能打;唯独最难的研究级推理(HLE、CritPt)还差顶尖闭源一截,报告自己也承认这是下一步重点改进方向。
原文摘录 · §6.1.4 评测结果
「在研究生水平的推理上,Kimi K3 与前沿水平相当,GPQA Diamond 得分 93.5%。但在研究级任务上仍有差距:在 HLE-Full 上……得分分别为 56.0%(使用工具)和 43.5%(不使用工具);在 CritPt 上得分 23.4%……表明研究级推理仍是重点改进方向。」
「在极具挑战的 ZeroBench-main 上与 Claude Fable 5 战平(23.0%,pass@5),使用 Python 工具后跃升至 41.0%。」
4第三方裁判 + 性价比:不仅考得好,还便宜
自己的报告当然说自己好,所以 K3 发布后,还有第三方机构独立评测。看三个代表性结果:
图 4 · 第三方三榜:Artificial Analysis 综合智能指数 57.1(580 个模型第 4,仅次于 Claude Fable 5 与 GPT-5.6 Sol);Vals AI 行业加权 74.7%(39 个模型第 2);WebDev Arena 人类投票 Elo 1,678(99 个模型第 1)——「首个登顶的开源模型」。
再看性价比(分数 ÷ 成本)。报告比了四个覆盖编程与智能体任务的套件,核心结论一句话:K3 以「接近最高分」的分数,花「别人零头」的钱。
图 5 · 四个套件上的性价比:蓝色条形代表「K3 的分数表现」占满行、浅色条形是「成本差距」的直观示意。KCB 2.0 落后 4.0 分但成本仅 38%;BrowseComp 拿第一的同时单任务成本只有 GPT-5.6 Sol 的一半、比 Claude 低一个数量级;GDPval-AA v2 Elo 差距 50 分内、成本却便宜 2.6 倍。报告原话:K3「以仅为 Claude Fable 5 零头的成本交付接近最高水平的分数」。
原文摘录 · §6.3 / §6.4 第三方与成本效率
「在 WebDev Arena 以 1,678 Elo 在 99 个模型中排名第一(领先 Claude Fable 5 的 1,634)——是首个登顶该榜单的开源模型。」
「总体而言,Kimi K3 在全部四个套件上都位于或接近成本效率前沿,以仅为 Claude Fable 5 零头的成本交付接近最高水平的分数。」
5光说不练假把式:六个真实案例
分数是「考试」,案例是「干真活」。报告用六个案例展示 K3 在真实技术任务上的能力——注意,这些都是它独立自主完成的。
图 6 · 六件真事:① GPU 内核:KDA 提速 73.6%、DSA 提速 55.1%、AttnRes 延迟 283.6→114.4 ms;② MiniTriton:从零写编译器,张量核矩阵乘逼近 cuBLAS(约 90% roofline),还能端到端训练 GPT;③ 芯片:48 小时自主设计推理芯片原型,>8,700 token/s、146 万标准单元;④ 科研:复现 I–Love–Q 普适关系,2 小时完成研究人员 1–2 周的工作,还发现已发表公式里的不一致;⑤ 知识工作:做出 AI ASIC 42 年历史研究网站(120+ 轮迭代、2,800+ 次搜索),并行分析 391 个引力波事件;⑥ 视频:制作讲解自身架构的 3Blue1Brown 风格视频。
一个反直觉的细节:报告说,后期开发阶段中,一个早期的 K3 检查点就已经承担了他们「大部分的内核优化工作」——也就是说,K3 还没训完,就已经在帮工程师优化 K3 自己的内核了。自己优化自己,这大概是「用 AI 造 AI」最直观的例子。
原文摘录 · §7 案例研究
「在 4 mm² 的分析面积预算内,该设计在 100 MHz 下完成时序收敛,RTL 仿真的解码吞吐量超过 8,700 token/s,集成 146 万个标准单元、0.277 MiB SRAM,以及融合反量化的 INT4 MAC 阵列。RTL 代码已在 GitHub 上开源。」
「Kimi K3 查阅了 20 余篇论文并交叉验证其结果,实现了完整的数值计算流水线,评估了 300 多个状态方程,发现了已发表公式中的不一致之处,编写了超过 3,000 行 Python 代码,并产出一个交互式 HTML 仪表盘——全程约两小时,而有经验的研究人员通常需要一到两周。」
6收官:七天,我们把 K3 讲完了
最后用一张「路线图」把七天串起来,看看我们从「零基础」走到了哪里:
图 7 · 七天路线图:Day 1 学会「接龙」世界观 → Day 2 注意力怎么找重点 → Day 3 怎么记住 100 万字(KDA)→ Day 4 怎么用 1040 亿干活(MoE)→ Day 5 它怎么被教出来 → Day 6 跨层与稳定的创新 → Day 7 眼睛、优化器、成绩单与真事。七块拼图合成一句话画像:开源 2.8T MoE、原生视觉、100 万 token 上下文,全球首个开源 3T 级模型。
收官寄语 · 一个非技术读者也能带走的三句话
第一句:K3 证明「变大」不是唯一出路——KDA、AttnRes、Stable LatentMoE 这些「巧思」让 2.8T 参数既强又稳。
第二句:K3 在智能体、编程、视觉+工具上已经和最强闭源模型掰手腕,而且便宜一个数量级。
第三句:它是开源的——这份报告里的每一个数字,全世界都能验证、能复现、能站在它上面继续往前走。
7自测题(先自己答,再点开看解析)
Q1MoonViT-V2 为什么不沿用 SigLIP 预训练初始化?
因为训练不稳定:把预训练好的编码器接入 LLM 联合优化时,SigLIP 初始化的编码器梯度范数持续偏高、尖峰频繁,训练像在颠簸路上开车。K3 改为从零开始、直接跟着下一 token 预测任务学,梯度全程平稳;而且最终视觉评测分数和 SigLIP 基线相当——报告结论:对比预训练「并非必要的初始化手段」。
Q2Per-Head Muon 和普通 Muon 差在哪?为什么更好?
普通 Muon 对整块 Q/K/V 矩阵做 Newton–Schulz 正交化,把所有注意力头当成一个耦合整体——梯度/动量尺度大的头会主导共享的更新方向,小的头得不到充分归一化的更新。Per-Head Muon 沿头维度切开矩阵、每个头单独正交化,使各头更新尺度趋于一致,学习更均衡、更大规模下训练更稳,还因在小块上做迭代而略省开销。
Q3四大轴线里,K3 哪项最强、哪项最弱?
最强:智能体(BrowseComp 91.2%、DeepSearchQA F1 95.0% 等多榜第一)和编程(ProgramBench 第 1、FrontierSWE 第 2)。视觉靠「原生眼睛 + Python 工具」很强(Math-Vision 94.3%→97.8%、ZeroBench 23%→41%)。最弱:研究级推理——HLE-Full 56.0%、CritPt 23.4%,仍落后 Claude Fable 5 / GPT-5.6 Sol,是报告承认的下一步改进方向。
Q4第三方评测里,K3 拿了什么名次?
Artificial Analysis:57.1 分,580 个模型第 4(仅次于 Claude Fable 5 和 GPT-5.6 Sol);Vals AI:74.7%,39 个模型第 2;WebDev Arena:Elo 1,678,99 个模型第 1——首个登顶该榜单的开源模型,领先 Claude Fable 5(1,634)。
Q5K3 的「性价比」优势体现在哪?用一句话总结
报告原话:「以仅为 Claude Fable 5 零头的成本交付接近最高水平的分数」。具体:KCB 2.0 落后 4.0 分但成本仅 38%;BrowseComp 拿第一且单任务 $2.03,是 GPT-5.6 Sol 的一半、比 Claude 低一个数量级;GDPval-AA v2 比 Claude Fable 5 便宜 2.6 倍。
七天课程 · 全部完成 🎉
恭喜你,从「完全看不懂报告」到「能看懂 K3 的关键创新」
想回看某一天?从课程首页进入;想挑战原报告?白话解读版就在首页。
回到课程首页