Kimi K3 技术博客:开放的前沿智能
月之暗面发布 2.8 万亿参数的 Kimi K3——全球首个开源 3T 级模型,性能逼近 Claude Fable 5 和 GPT 5.6 Sol,API 价格仅为顶级闭源模型的 1/3 到 1/5。本文逐段拆解官方发布稿,还原技术设计取舍,并标出跑分话术里该打折扣的地方。
本文译自月之暗面(Moonshot AI)官方博客,发布于 2026 年 7 月,是最新模型 Kimi K3 的技术发布稿。
- 发布方:月之暗面(Moonshot AI)—— Kimi 系列模型的开发公司
- 主角:Kimi K3 —— 2.8 万亿参数的开源大模型,全球首个"3T 级"开源模型
- 文档性质:官方技术博客 = 一半技术展示 + 一半产品营销,两个身份都要记得
- 关键节点:模型权重 2026 年 7 月 27 日前放出;技术报告随后发布
▍发布方:月之暗面是谁 中国大模型"六小虎"之一,2023 年成立,靠 Kimi 智能助手的长文本能力出圈——它是国内最早把"一口气读几百页文档"做成招牌能力的公司。2025 年起转向开源策略,Kimi K2 成为当时最受关注的开源模型之一,被称为"中国开源阵营的主力选手",与 DeepSeek、阿里 Qwen、智谱 GLM 并列。K3 是它迄今最大的一次押注。
▍三句话看懂 Kimi K3 ① 块头全球最大:2.8 万亿参数,开源模型里史无前例,但每次回答只激活约 320 亿("大医院、少出诊")。 ② 能力对标顶级闭源:官方称整体仍逊于最强的 Claude Fable 5 和 GPT 5.6 Sol,但稳超其他所有模型——开源与闭源的差距被压到历史最小。 ③ 最便宜的前沿:API 定价约为顶级闭源模型的 1/3 到 1/5,且权重免费放出。
▍内容地图 原文按"编程 → 知识工作 → 架构 → 获取方式 → 跑分表 → 局限性"展开:前半部分是能力展示(大量精心设计的 demo 案例),中段是架构与定价(干货浓度最高),跑分表要带着批判眼光读(出题人是厂商自己),结尾的"局限性"是全文最诚实的一节。
今天,我们正式发布 Kimi K3——我们迄今最强大的模型。Kimi K3 是一个 2.8 万亿参数的模型,基于我们的 Kimi Delta Attention 和 Attention Residuals 构建,具备原生视觉能力和 100 万 token 的上下文窗口。它是全球首个开源的 3T 级模型,旨在为长周期编程、知识工作和推理任务提供前沿智能。
尽管其整体性能仍落后于最强大的专有模型 Claude Fable 5 和 GPT 5.6 Sol,但 Kimi K3 在我们的评估套件中展现了前沿水平的表现,并持续优于其他所有受测模型。




Kimi K3 现已在 Kimi.com、Kimi Work、Kimi Code 和 Kimi API 上线。发布初期,Kimi K3 默认使用最大思考力度(max thinking effort),低力度和高力度模式将在后续更新中推出。我们正与推理合作伙伴和开源维护者密切合作,对齐技术细节,确保模型在整个生态中可靠落地。完整模型权重将于 2026 年 7 月 27 日前发布。关于架构、训练和评估的更多细节将随 Kimi K3 技术报告一同公布。
开放的 3T 级模型
Kimi K3 是首个达到 2.8 万亿参数的开源模型。它标志着 Kimi 在规模化前沿持续推进的最新一步:在过去十二个月中,有九个月开源模型的规模上限都是由 Kimi 模型刷新的。
"参数"可以粗略理解为模型大脑里的"连接强度",数量越多,能记住和组合的规律越复杂。2.8 万亿个参数,如果每个参数用 1 毫米厚的便签纸写下来,叠起来能绕地球大半圈。一个更直观的坐标:人脑的神经突触约有 100 万亿个,K3 的参数量约为人脑突触数的 1/40——当然,参数和突触只是粗略类比,两者的工作方式完全不同。
另外注意:K3 每次回答问题时只激活其中约 32B(320 亿)参数参与计算——大模型不一定"全力运转",这正是下面 MoE 要讲的事。
"过去 12 个月里有 9 个月开源模型规模上限由 Kimi 刷新"——这句话的背景是:2025 年以来,中国的开源模型(DeepSeek、Qwen、GLM、Kimi 等)进入了参数规模与能力的快速膨胀期,"最大开源模型"的头衔几乎每个月都在易主。K3 把开源模型的规模上限从千亿级直接推进到 2.8 万亿的"3T 级",意味着开源阵营与闭源巨头(OpenAI、Anthropic、Google)在模型体量上的差距基本被抹平,竞争焦点转向效率与工程。
Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建——这两项架构更新旨在改善信息在序列长度和模型深度两个维度上的流动方式。我们还扩大了混合专家(MoE)的稀疏度,在 Stable LatentMoE 框架下实现了 896 个专家中激活 16 个。结合改进的训练与数据配方,这些结构性变化使整体规模化效率相比 Kimi K2 提升了约 2.5 倍,让模型能更有效地将算力转化为智能。

传统大模型像一位全科医生:不管看什么病,都要整个大脑全部运转一遍。MoE(Mixture of Experts,混合专家)则像一家有 896 个专科诊室的大医院:病人进门,分诊台判断病情,只叫 16 个最相关的科室会诊,其余 880 个科室休息。
好处显而易见——医院可以建得很大(总参数 2.8 万亿),但每次看病的成本只取决于出诊的那几个科室(激活参数约 320 亿)。这就是 K3"块头大、花销小"的核心秘密。"896 选 16"这个比例(约 1.8%)在业内属于非常激进的稀疏度,分诊台一旦分错科室,治疗效果就崩了,所以原文才说"路由和优化成为一阶挑战"。
这两个拗口的名字对应大模型的两个老毛病:
- KDA(Kimi Delta Attention) 解决"读长文"的成本问题。传统注意力机制像每读一个字都要把前面整本书重翻一遍,书越厚越慢;KDA 属于"线性注意力"家族,更像边读边维护一张不断更新的摘要卡片,成本不再随篇幅爆炸式增长。这也是 K3 敢做 100 万 token 上下文的底气。
- AttnRes(Attention Residuals) 解决"深层遗忘"问题。大模型有近百层,信息层层传递时容易像"传话游戏"一样变形丢失;AttnRes 让后面的层可以有选择地回头查阅前面各层的原始表示,而不是被迫接受逐层累积的结果。
注意:以上是基于公开信息的通俗化解读,两项技术的完整细节要等技术报告发布才能确认。
编程
Kimi K3 具备强大的长周期编程能力。在极少人工监督下,它可以持续推进长时间的工程会话、在海量代码库中导航,并编排各类终端工具。
Kimi K3 还擅长融合软件工程与视觉推理的任务——它能利用截图和视觉信息来优化游戏开发、前端和 CAD。
下面的案例展示了 Kimi K3 的编程能力如何转化为开放式的软件创造和科学研究。
内核优化
我们测试了各模型优化 GPU 内核的能力。每个模型在完全相同的沙箱中独立工作,最多有 24 小时对四个任务进行性能分析、重写和基准测试——任务涵盖 AttnRes、KDA 以及一个 512 头维度的 MLA 内核,硬件平台包括 NVIDIA Hopper GPU 和来自另一家厂商的 GPGPU。Kimi K3 的表现与 Fable 5(含回退)相当,并大幅超过 Opus 4.8、GPT 5.6 Sol 和 GPT 5.5。
GPU 内核(kernel)是跑在显卡上的小程序,负责具体的数学计算。大模型训练和推理时,99% 的时间都花在内核上——它就像汽车的发动机:车快不快,主要看发动机燃烧效率高不高。
优化内核是公认的硬活:既要懂数学,又要懂硬件(显存怎么搬运、几千个计算核心怎么分工),往往一个数字的改动就会让结果出错。资深的 GPU 工程师优化一个生产级内核,通常需要几天到几周,而且这类人才全行业都非常稀缺。
AttnRes 内核优化
给定 AttnRes 的 FLA Triton 实现及其生产环境形状(96 层、模型维度 8192、8192 个 token),任务是在不改变数值结果的前提下,让训练侧算子尽可能快。在连续 15 小时的迭代中,K3 设计了一种新颖的两阶段内核算法,在保持相同数值的前提下融合内核,将前向+反向时间从 283.6 毫秒压缩到 114.4 毫秒。值得注意的是,K3 和 Fable 5(可能含回退)达到了相近的性能,而 K3 每次迭代的优化速度更快。
计算时间缩短到原来的 40%,也就是速度快了约 1.5 倍。听起来不多?在大模型训练里,这样的算子要被执行几十亿次——相当于每天通勤 2 小时的人突然只要 48 分钟就能到公司,一年省下的时间是几百个小时。对训练一个 2.8 万亿参数的模型来说,这种幅度的内核优化直接对应真金白银的算力成本。
这个案例真正惊人的地方不是"快了 1.5 倍",而是过程:AI 在无人干预的情况下连续工作 15 小时,自己跑基准、自己分析瓶颈、自己发明了一种论文里不存在的新算法。这相当于把一位资深 GPU 专家关进机房一整天,出来时带着一个生产可用的优化成果。
冷静注脚:这是厂商自选、自评的展示案例,且有对手模型"可能含回退"的注脚,横向比较需打折看待;但"AI 可以长时间自主推进工程任务"这个趋势本身,已被多家实验室独立观察到。
注:Claude Fable 5 由第三方评估,其结果可能包含回退行为。在大多数模型中,部分轨迹包含轻微的、可接受的精度捷径,仍处于我们的数值容差范围内。GPGPU 指用于图形渲染之外通用计算的 GPU。
在 Kimi K3 开发的后期阶段,团队大部分内核优化工作都是由 Kimi K3 的一个早期版本完成的。
GPU 编译器开发
我们进一步测试了 Kimi K3 能否从零构建一套 GPU 编程系统。Kimi K3 开发了 MiniTriton——一个紧凑的类 Triton 编译器,拥有基于 MLIR 的 tile 级 IR 层、优化 pass 和 PTX 代码生成流水线。在受支持的 roofline 基准测试中,MiniTriton 的性能与 Triton 和 torch.compile 持平甚至更优——在特定负载上击败了 Triton。在微基准之外,MiniTriton 还支撑了端到端的 nanoGPT 训练,收敛稳定,损失曲线与参考实现紧密贴合、仅有微小偏差——在真实负载上验证了完整流水线。这些结果表明,Kimi K3 能构建一套连贯的端到端编译器——从 DSL 前端、IR pass 到 PTX 代码生成和运行时——而不仅仅是孤立的内核;其从零实现的 Tensor Core 路径已经可以与 Triton 经过深度优化的技术栈相媲美。
编译器是把人类写的代码"翻译"成机器指令的系统。AI 帮忙写一段代码,相当于翻译一篇文章——今天的大模型已经做得很好;但从零造一个编译器,相当于编一整套词典加语法书,让以后所有翻译都有章可循。
Triton 是 OpenAI 开源、整个行业都在用的 GPU 编程工具,被全球工程师打磨了多年。K3 从零写出的 MiniTriton 在部分负载上追平甚至超过它——就像一个人单枪匹马编出的词典,某些词条的释义比商务印书馆整个编辑部的版本还准。需要说明:这仅限于"受支持的 roofline 基准测试"范围,离完整替代 Triton 还很远。
游戏开发与数字创作
Kimi K3 将强大的 3D 推理、编程和视觉能力结合在一起,可以把概念、图片和视频变成完全可玩的交互体验。Kimi K3 通过在代码与实时截图之间无缝迭代,实现了真正的"视觉在环"——即时看到输出并持续改进。
案例 1:3D 开放世界
Kimi K3 使用 Three.js WebGPU 和 GPU 计算构建了一个完全程序化生成的浏览器 3D 探索游戏。它程序化生成了环境,并使用 3D 资产生成工具创建了骑手和马匹模型,打造出一个包含森林、木屋村庄、雪山和动态天气的辽阔开放世界。使用的外部资产:带动画的牛仔和马匹模型以及地形数据。
芯片设计
作为一项早期概念验证,Kimi K3 设计了一款芯片,用来运行一个基于其自身架构的纳米级模型。在一次 48 小时的自主连续运行中,K3 使用开源 EDA 工具和 Nangate 45nm 工艺库完成了芯片的构建、优化和验证。在 4 平方毫米的面积内,该芯片在 100 MHz 下完成时序收敛,仿真中解码吞吐超过 8,700 token/s,集成了 146 万个标准单元、0.277 MB SRAM,以及一个融合反量化的 INT4 MAC 阵列。由模型为模型打造的芯片,体现了 K3 的长周期智能体能力。
芯片设计是工程学里门槛最高的领域之一:一枚真实芯片从设计到验证,通常要一个几十人的团队协作数月。K3 在 48 小时里独自走完了"设计—优化—验证"全流程。
用数字感受规模:4 mm² 大约是指甲盖的 1/6,146 万个标准单元相当于在这点面积里规划一座百万人口城市的每栋楼、每条路,还要保证"车流"(电信号)在 100 MHz 的节拍里一个不堵车(时序收敛)。还要泼一盆冷水:这是基于 45nm 教学级工艺库的仿真成果,离流片(真正制造出来)还有很长的路;"AI 设计芯片"是趋势信号,不是产业现实。
面向科研的编程
Kimi K3 打通了科学文献与可执行代码之间的通路,能够自主实现、验证和分析复杂的计算研究工作流。
在一个案例中,Kimi K3 用约两小时完成了通常需要一位经验丰富的研究员一到两周才能完成的工作。为了复现计算天体物理学中的 I–Love–Q 普适关系,它查阅并交叉验证了 20 多篇论文,实现了完整的数值计算流水线,评估了 300 多个状态方程,发现了已发表公式中的不一致之处,生成了 3,000 多行 Python 代码,并产出了一个用于探索结果的交互式 HTML 仪表盘。
知识工作
Kimi K3 推进了端到端的知识工作。在公开基准之外,Kimi K3(max)在我们的内部评估中持续取得提升——这些评估源自真实用户-智能体工作流中反复出现的模式和挑战。这些在多种面向生产的工作流中一致的优势,反映了 Kimi K3 智能体式知识工作能力的广泛进步。

交互式可视化研究
以下是 Kimi Work 中的 Kimi K3 在金融咨询和科学研究领域产出的几个例子:
案例 1:交互式 42 年 AI ASIC 行业研究网站
一份可以层层深入钻取的交互式研究报告:42 年的 ASIC 行业,经过 120 多轮递归式自我改进完成。Kimi K3 将证据转化为定制图表、动画示意图和交互式视觉叙事。它通过 2,800 多次网页搜索/抓取和 1,100 多次终端数据拉取获取数据,覆盖了 11,000 多个页面,横跨 87 份季报和 99 份原始 PDF。
假设一个人每分钟认真读完 1 页,11,000 页需要不吃不喝连读 8 天;按每天工作 8 小时算,是一个多月的全职阅读量——这还只是"读",不包括理解、交叉核对和写成报告。AI 在单次任务里完成这个量级的信息吞吐,正是"深度研究"类产品和人类研究员的本质差异:不是更聪明,而是阅读量可以大三个数量级。
案例 2:核聚变行业研究
一份咨询风格的行业报告,带有交互式可视化——包括时间线、漏斗图、区间条形图、甘特图,以及出版级品质的幻灯片。
核聚变行业研究演示文稿(原文查看,PPTX 未随本文迁移托管)
案例 3:GWTC-5 引力波分析
使用 20 多个并发子智能体分析了 391 个引力波事件,产出 7 幅科学可视化图、2 张表格,以及基于 10 多篇论文的文献综述。
一个 AI 处理 391 个引力波事件,就像一个人要批 391 份不同的试卷——又慢又容易串行出错。"子智能体"(subagent)的做法是:主 AI 当项目经理,把试卷分给 20 多个"实习生"(子智能体)同时批改,每人分到十几份,最后由项目经理汇总、查重、写总评。
这就是当前 AI 工程的主流范式:单个模型再强也有上下文和注意力上限,"分身并行"是突破上限最便宜的办法。
GWTC-5 引力波分析演示文稿(原文查看,PPTX 未随本文迁移托管)
Kimi K3 还特别擅长制作信息图风格的演示文稿,比如下面展示的完全可编辑的热力图和年度报告:
(热力图和年度报告是原页面上的交互式嵌入内容,未能归档。)
Widgets 与 Dashboard
在 Kimi Work 中,我们引入了两项新功能——Widgets 和 Dashboard——让与 Kimi K3 的交互更加可视化、更可持续。Widgets 让你直接在对话中生成可交互组件,并可连接本地数据或外部插件以持续更新。Dashboard 则把你最关心的 Widgets 汇聚到一个围绕主题、项目或目标组织的持久化个性化视图中。
视频编辑
Kimi K3 擅长动态设计、动画和视频编辑,因为它的原生多模态架构能在同一个模型内理解文本、图像和视频。
在一个例子中,K3 制作了一段 3Blue1Brown 风格的、讲解其自身架构的动态图形视频,把技术概念转化成了动画图示和转场。
在另一个例子中,Kimi K3 从 56 段素材剪辑出了自己的预告视频,完成了素材筛选、动作匹配剪切、帧级节拍同步、音频处理和多轮修改。这样一条高密度短视频,经验丰富的剪辑师通常需要一到两个工作日,新手则需要三到五天。
架构与基础设施
Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建。KDA 为注意力的规模化提供了高效基础,而 AttnRes 则在深度维度上有选择地检索表示,而非均匀地累积它们。两者共同构成了一个为远超万亿参数规模而设计的模型的架构主干。
Kimi K3 使用 Stable LatentMoE,有效激活 896 个专家中的 16 个。在这种稀疏度下,路由和优化成为一阶挑战。Quantile Balancing 直接从路由器分数的分位数推导专家分配,消除了启发式更新和一个敏感的平衡超参数;Per-Head Muon 则扩展了 Muon,对各个注意力头独立优化,实现大规模下更具适应性的学习。Sigmoid Tanh Unit(SiTU)和 Gated MLA 分别改善了激活控制和注意力选择性。这些进展共同实现了 2.8 万亿参数规模下稳定而高效的训练。
Kimi K3 从 SFT 阶段起就应用量化感知训练,采用 MXFP4 权重和 MXFP8 激活,以兼容广泛的硬件。为防止专家不均衡在大规模专家并行下损害吞吐,我们引入了一种完全均衡的专家并行训练方法,关键路径上采用静态形状且无主机同步。由于推理效率同样受益于更大的高带宽通信域,我们建议将 Kimi K3 部署在 64 张或更多加速卡的超节点配置上。最后,由于 KDA 给传统的前缀缓存带来了新挑战,我们已向 vLLM 社区贡献了相应的实现,将随模型一同发布。带预填充缓存的 KDA 使我们能够以极具竞争力的 token 价格提供 Kimi K3 服务,尽管它规模庞大且上下文很长。
模型训练时,每个参数都用很高的精度(类似相机的 RAW 原片)存储,又大又贵。"量化"是把参数转成更紧凑的格式(MXFP4 可以理解为"4 比特精度的 JPG"):体积小了好几倍,加载和计算都更快,而模型的"画面内容"——智能水平——几乎看不出差别。
K3 的特别之处在于从训练早期就"按照 JPG 的标准来拍照"(量化感知训练),而不是拍完 RAW 再硬压,所以画质损失更小。
想象你让 AI 读一本 300 页的小说,然后接连问它 20 个问题。没有缓存时,每问一个问题,AI 都要把 300 页从头到尾重读一遍——前 19 次的阅读完全是重复劳动。前缀缓存让 AI 把"读过的小说"留在记忆里,每次只读你新提的问题。
这就是 K3 API 定价里"缓存命中输入 $0.30 vs 未命中 $3.00"相差 10 倍的原因,也是官方宣称编程场景缓存命中率超 90% 的含金量所在——缓存命中越多,服务成本越低,价格才有下降空间。原文说 KDA 架构给传统前缀缓存带来了新挑战,他们为 vLLM(最流行的开源推理引擎)贡献了适配代码,这是开源生态互相成就的典型案例。
"建议部署在 64 张或更多加速卡的超节点上"是一句容易被略过的大实话:K3 虽然开源,但个人和小团队根本部署不起——64 张高端 GPU 的硬件投入是数百万元量级。所以"开源"对大多数人的真实含义是:你可以免费用各家云厂商部署好的 K3,或者等社区出量化/蒸馏小模型,而不是"下载到自己电脑上跑"。开源降低了使用成本和研究门槛,但没有消除算力门槛。
更多技术细节将在即将发布的技术报告中公布。
上面这两段技术含量极高的描述(KDA、AttnRes、Quantile Balancing、Per-Head Muon……)目前全部来自厂商自己的博客,技术报告尚未发布,没有论文细节、没有第三方复现。正确的读法是:先把它们当作"厂商声明的设计意图",等技术报告和开源社区(如 vLLM 适配代码)落地后再升级为"已验证的事实"。这不是说它们在吹牛,而是说现在下任何结论都为时过早。
获取方式
- Kimi K3 智能体:从手机应用商店下载或更新最新版 Kimi App,支持 iOS、Android 和 HarmonyOS,或访问 kimi.com。
- 用 Kimi K3 工作:下载最新版 Kimi Work 桌面应用(3.1.0 或更高版本),支持 Windows 和 Apple 芯片的 Mac。
- 用 Kimi K3 编程:在终端运行 Kimi Code,使用
/model命令选择 Kimi K3。 - 用 Kimi API 构建:访问 Kimi API 平台 并选择
kimi-k3。定价为缓存命中输入 $0.30/MTok、缓存未命中输入 $3.00/MTok、输出 $15.00/MTok。依托 Mooncake 的分离式推理架构,Kimi 官方 API 在编程负载中的缓存命中率超过 90%。 - 将 Kimi 引入你的组织:Kimi Enterprise 提供企业级数据隐私和成员管理,个人账号与组织账号完全隔离。访问定价页面并选择"Get Kimi Enterprise"即可为你的团队订阅。
1M token(MTok)在中文语境下约等于 60–100 万汉字——量级上接近一整套《三体》三部曲。按缓存未命中输入 $3.00/MTok 算,把一整套《三体》丢给 K3 读一遍,成本大约是一杯奶茶钱(二十多元人民币);如果开启缓存(编程场景命中率超 90%),同样内容的后续提问只要原来的 1/10。
横向看:这个价格大约是顶级闭源模型 API 的 1/3 到 1/5。对普通用户,网页版和 App 免费额度就够体验;对开发者,K3 把"前沿级智能"的调用成本打到了一个新档位——这可能比跑分排名影响更深远。
完整基准测试表
在往下看任何数字之前,先建立四个"防带节奏"的意识:
- 出题人是谁:表里标着 (Internal) 的基准(Kimi Code Bench 2.0、DECK-Bench)是 Kimi 自己出的题。自己出题自己考,成绩天然偏高,这类行的参考价值最低。
- 考试工具不同:脚注显示不同模型用了不同的"答题框架"(KimiCode / Claude Code / Codex)。同一学生用不同文具考试成绩都会变,跨列对比只能看个大概。
- 脚注里的让步:Fable 5 的分数"可能含回退"(考砸的科目可能重考过),GPT-5.6 Sol 有 10% 的题目触发了安全护栏没答完。这些都会影响公平性。
- "—"的含义:GLM-5.2 在很多行缺席,说明这张表只收录了对叙述有利的部分基准,不是全景。
结论:这张表能说明"K3 处于第一梯队",但任何"K3 在 X 项上领先 Y 分"的精确论断都不必当真。真正的裁决要等第三方机构(如 LMArena、Artificial Analysis)的独立复测。
编程
| 基准 | Kimi K3 (max) | Claude Fable 5 (max, with fallback) | GPT 5.6 Sol (max) | Claude Opus 4.8 (max) | GPT 5.5 (xhigh) | GLM-5.2 (max) |
|---|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 67.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 70.8 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 83.4 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 64.9 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 14.0 | 13.0 |
| PostTrain Bench | 36.6 | 41.4 | 34.6 | 34.1 | 28.4 | 34.3 |
| MLS Bench | 48.3 | 49.9 | 46.2 | 42.8 | 35.5 | 40.4 |
| Kimi Code Bench 2.0 (Internal) | 72.9 | 76.9 | 64.8 | 71.7 | 69.0 | 64.2 |
智能体
| 基准 | Kimi K3 (max) | Claude Fable 5 (max, with fallback) | GPT 5.6 Sol (max) | Claude Opus 4.8 (max) | GPT 5.5 (xhigh) | GLM-5.2 (max) |
|---|---|---|---|---|---|---|
| GDPval-AA v2 (Elo-score) | 1668.0 | 1760.0 | 1748.0 | 1600.0 | 1494.0 | 1514.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | 84.4 | — |
| DeepSearchQA (f1-score) | 95.0 | 94.2 | — | 93.1 | — | — |
| Toolathlon-Verified | 73.2 | 77.9 | 74.9 | 76.2 | 73.5 | 59.9 |
| MCP Atlas | 84.2 | 84.7 | 83.6 | 83.6 | 82.8 | 82.6 |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 22.7 | 12.9 |
| Job Bench | 52.9 | 57.4 | 46.5 | 48.4 | 38.3 | 43.4 |
| AA-Briefcase (Elo-score) | 1548.0 | 1583.0 | 1495.0 | 1354.0 | 1158.0 | 1260.0 |
| APEX-Agents | 41.0 | 43.3 | 39.9 | 39.4 | 38.5 | 35.6 |
| Office QA Pro | 63.3 | 69.9* | 63.2* | 63.9* | 60.9* | 41.4 |
| SpreadsheetBench 2 | 34.8 | 34.7* | 32.4* | 31.6* | 29.1* | 28.1 |
| DECK-Bench (Internal) | 73.5 | 73.0 | 74.7 | 66.9 | 68.2 | 68.6 |
推理与知识
| 基准 | Kimi K3 (max) | Claude Fable 5 (max, with fallback) | GPT 5.6 Sol (max) | Claude Opus 4.8 (max) | GPT 5.5 (xhigh) | GLM-5.2 (max) |
|---|---|---|---|---|---|---|
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 93.5 | 91.2 |
| HLE-Full | 43.5 | 53.3 | 44.5 | 49.8* | 41.4* | — |
| HLE-Full w/ tools | 56.0 | 63.0 | 58.0 | 57.9* | 52.2* | — |
视觉
| 基准 | Kimi K3 (max) | Claude Fable 5 (max, with fallback) | GPT 5.6 Sol (max) | Claude Opus 4.8 (max) | GPT 5.5 (xhigh) | GLM-5.2 (max) |
|---|---|---|---|---|---|---|
| MMMU-Pro | 81.6 | 81.2 | 83.0 | 78.9 | 81.2 | — |
| MMMU-Pro w/ python | 83.4 | 86.5 | 84.6 | 82.7 | 83.2 | — |
| CharXiv (RQ) | 84.8 | 88.9 | 84.6 | 80.5 | 84.1 | — |
| CharXiv (RQ) w/ python | 91.3 | 93.5 | 89.1 | 89.9 | 89.0 | — |
| MathVision | 94.3 | 94.8 | 95.8 | 86.7 | 92.2 | — |
| MathVision w/ python | 97.8 | 98.6 | 97.8 | 97.1 | 96.8 | — |
| BabyVision w/ python | 85.7 | 90.5 | 88.9 | 81.2 | 83.6 | — |
| ZeroBench_main (pass@5) | 23.0 | 23.0 | 17.0 | 17.0 | 22.0 | — |
| ZeroBench_main w/ python (pass@5) | 41.0 | 46.0 | 35.0 | 34.0 | 41.0 | — |
| WorldVQA ForceAnswer | 51.0 | 56.7 | 41.8 | 39.1 | 38.5 | — |
| OmniDocBench | 91.1 | 89.8 | 85.8 | 87.9 | 89.4 | — |
| PerceptionBench | 58.5 | 57.2 | 59.7 | 47.2 | 55.8 | — |
脚注
- 测试硬件不一致:部分基准(PostTrain Bench、SWE Marathon)是在 H20 GPU 上重校准后测的,而非官方标准的 H100。H20 是 NVIDIA 受出口管制推出的"特供版",算力远弱于 H100——更换硬件会影响模型在性能敏感任务上的表现,这也是分数与官方榜单有出入的原因之一。
- 成绩是"考三次取平均":多数分数是 2-3 次运行的平均值。大模型回答有随机性,单次成绩可能上下浮动好几分,所以表里 1-2 分的差距基本没有意义。
所有 Kimi K3 结果均在推理力度设为 'max'、temperature = 1.0、top-p = 1.0 的条件下获得。根据基准的不同,每个模型在三种智能体框架之一下评估——KimiCode、Claude Code 或 Codex——具体如下。
编程类基准
- DeepSWE。 Kimi K3 使用 KimiCode 框架评估。GLM-5.2 的分数取自 GLM-5.2 发布博客(https://z.ai/blog/glm-5.2);其余分数均来自 DeepSWE 官方排行榜(https://deepswe.datacurve.ai/),在该榜单上 Kimi K3 使用 mini-SWE-agent 框架取得 67.3 分。我们报告的是 DeepSWE v1.1 任务。
- Terminal-Bench 2.1。 Kimi K3 使用 KimiCode 框架评估。对于其他所有模型,我们报告其跨框架的最佳分数:GLM-5.2 使用 Claude Code(https://z.ai/blog/glm-5.2);Claude Opus 4.8 和 Claude Fable 5 使用 Terminus 2(https://artificialanalysis.ai/evaluations/terminalbench-v2-1);GPT 5.5 和 GPT 5.6 Sol 使用 Codex(https://openai.com/index/previewing-gpt-5-6-sol/)。
- Program Bench。 Kimi K3 使用 KimiCode 框架评估。GLM-5.2 的分数来自 https://z.ai/blog/glm-5.2;其余分数均来自 https://www.vals.ai/benchmarks/programbench。
- SWE Marathon。 Kimi K3、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架评估;GPT-5.6 Sol 使用 Codex 框架评估。GLM-5.2 的分数来自 https://z.ai/blog/glm-5.2。我们的评估基于官方 v1.1 任务的 H20 校准分支(https://www.swe-marathon.org/):GPU 任务的 Docker 镜像、性能门槛和参考 oracle 已针对 H20 重新校准,正确性和防作弊验证器保持不变。此外,Claude Fable 5 在我们的评估中有 35% 的任务触发了回退,这可能对其测得的性能产生了负面影响。
- FrontierSWE。 Kimi K3 使用 KimiCode 框架评估,GPT-5.6 Sol 使用 Codex 框架评估;其余结果均来自 https://www.frontierswe.com/。Dominance 分数使用官方评估脚本从原始分数重新计算,数据截至 2026 年 7 月 16 日。
- PostTrain Bench。 GLM-5.2、GPT-5.5 和 Claude Opus 4.8 的分数采用 PostTrainBench 官方结果(https://posttrainbench.com/)。Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 使用官方 Harbor 实现在最大推理力度下评估,在 H20 GPU(而非官方设置的 H100)上跑三次取平均——Kimi K3 和 Claude Fable 5 使用 Claude Code 框架,GPT-5.6 Sol 使用 Codex 框架。
- MLS Bench Lite。 Kimi K3 使用 KimiCode 框架评估;GLM-5.2 和 Claude 系模型使用 Claude Code 框架;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架。
- KCB 2.0。 Kimi K3 同时使用 KimiCode 和 Claude Code 框架评估;GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架。除 GPT-5.5 使用 "xhigh" 档位外,所有模型均以最大推理力度评估。我们同时注意到,在这项内部基准上,10% 的任务触发了 GPT-5.6 Sol 的网络安全护栏。
生产力与智能体类基准
- 在 OfficeQA Pro 中,每个测试用例向智能体提供整个 PDF 语料库,所有 PDF 均以图片形式渲染,不提供机器可读文本。
- OfficeQA Pro 和 SpreadsheetBench 2。 Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架评估;GPT 5.5 和 GPT 5.6 Sol 使用 Codex 框架评估。
- MCP Atlas。 所有模型在 500 任务的公开子集上评估,上限 100 轮,使用 Gemini 3.1 Pro 作为评判模型。
- AutomationBench。 所有模型在 600 任务的公开子集上评估,其余方面均遵循官方 GitHub 设置。
- BrowseComp。 我们采用 Claude 模型卡中使用的上下文压缩策略,在 30 万 token 处触发。当使用 100 万 token 上下文窗口且不做上下文管理时,Kimi K3 的得分为 90.4。Claude Fable 5、Claude Opus 4.8、GPT 5.6 Sol 和 GPT 5.5 的结果引自 https://www.anthropic.com/news/claude-fable-5-mythos-5 和 https://openai.com/index/gpt-5-6/。
- GDPval-AA、AA-Briefcase 和 APEX-Agents 的分数引自 https://artificialanalysis.ai/。
多模态基准
- 除 ZeroBench 遵循官方设置运行五次外,所有多模态分数均为三次运行的平均值。MMMU-Pro 按官方协议评估,保留原始输入顺序,并将图像置于文本输入之前。
- PerceptionBench。 PerceptionBench(https://www.kimi.com/blog/perception-bench)是一个聚焦原子级视觉感知能力的基准。
局限性
营销文档里出现"局限性"章节本身就少见,这三条翻译成人话是:
- "不能半路换司机"——K3 依赖完整的思维历史,会话中途从别的模型切过来,输出可能直接失控。这说明它的能力提升有一部分绑定在特定使用方式上,通用性打折。
- "会替你做主"——遇到模糊指令时 K3 倾向于自己拿主意。对想放权的人是优点,对要求严格按流程走的业务是隐患。
- "体验不如头部闭源"——官方亲口承认与 Fable 5、GPT 5.6 Sol 存在体验差距。结合跑分表看这句话很有意味:分数接近,但"好用程度"仍有距离——分数能量化的东西,和日常使用的体感,从来都不是一回事。
- 对思维历史的敏感性。 K3 在保留思维历史的模式下训练。如果智能体框架未按要求回传所有历史思维内容,或者将一个正在使用其他模型的会话中途切换到 K3,生成质量可能会变得极不稳定。我们建议使用经过兼容性验证的框架(如 Kimi Code),并避免在会话中途切换到 K3。
- 过度主动。 K3 的训练特别强调长周期、高难度任务。因此,当任务执行中遇到小问题或用户意图模糊时,它可能会代替用户做出意料之外的决定。如果你的应用要求智能体在明确边界内行动、避免过度自由发挥,请在系统提示词或
AGENTS.md中对 K3 施加更明确的行为约束。 - 尽管 K3 整体上是一个极具竞争力的模型,但与 Claude Fable 5 和 GPT 5.6 Sol 相比,它在用户体验上仍存在明显差距。
- 想尝鲜的普通读者:现在就可以去 kimi.com 或 Kimi App 免费体验。最能感受差异的玩法是丢给它一个超长文档(比如一份几百页的 PDF 年报)再提问——100 万 token 上下文是 K3 的招牌能力。
- 学生/研究者:7 月 27 日权重放出后可以下载研究,但别指望本地跑得动(官方建议 64 卡超节点)。关注 vLLM 社区的适配进展和第三方复测,那才是真正的成绩单。
- 开发者:可以先用 API 试水(缓存命中后价格很低),接入前细读"局限性"三条——尤其是"过度主动",生产环境务必在系统提示词里写清行为边界。
- 下次再读任何厂商发布稿,先做三个检查:① 表里的基准是谁出的题?② 对手模型用什么工具、什么条件考的?③ 免责脚注和"局限性"章节藏了什么?——带上这三问,营销稿也能读出干货。