Day 27 · 真实力全景透视
评测与成绩单:Kimi K3 到底有多强?
在过去,很多模型靠死记硬背选择题在榜单上刷出虚假高分;而现代大模型进入了「真实世界能力大考」。今天拆解《Kimi K3 技术报告》第 6 节的硬核成绩单:看懂 GPQA、HLE、FrontierSWE 到底在考什么,诚实看清 K3 强在哪些地方、距离全球最强专有模型还有什么差距,以及开源 2.8T 权重的历史意义。
学完你能回答
GPQA、HLE、DeepSWE 分别在考什么?
学完你能回答
开源完整模型权重为什么是一场重磅事件?
1起点:这些你早就会了
现代大模型权威评测,拒绝刷八股题库,全面转向专业级实战考核:
| 你已经会的 | AI 世界里对应的东西 |
| 博士级专家答辩:连普通本科生都看不懂题目的极难理科考核 | GPQA Diamond:由生物、物理、化学博士命题的高难度科学推理基准 |
| 人类知识的未解难题与综合大考:防污染的极难多学科试卷 | HLE-Full(Humanity's Last Exam):涵盖哲学、数学、医学的顶尖综合基准 |
| 真实 GitHub 程序员修 Bug:阅读万行项目、复现 issue、提交通过全部单测的 PR | DeepSWE:真实开源仓库 issue 修复的智能体编程基准 |
| 资深运维在纯命令行终端里排障:没有图形界面,一步步把系统修好 | Terminal-Bench 2.1:命令行界面中的高难度真实任务基准 |
| 选秀比赛由第三方评委打分,而不是选手自报成绩 | 第三方独立评测:Artificial Analysis、Vals AI、WebDev Arena 等外部榜单(§6.3) |
| 不光看考了多少分,还看为这个分数补了多少课、花了多少钱 | 成本效率:分数要连同单任务推理成本一起读(§6.4) |
2拒绝污染:现代大模型的四大权威基准
在 2026 年,单纯考选择题(如 MMLU)已失去区分度。K3 评测重点锚定在极难被预训练污染、具备高可验证性的前沿基准:
四大权威试卷拆解
1.
GPQA Diamond(博士级科学推理):由各学科 PhD 专家精心设计,要求极严谨的多步物理/化学/数学推导,常人甚至无法通过搜索引擎找到答案;
2.
DeepSWE(真实 GitHub 工程修 Bug):给模型一个真实存在的开源仓库和一个复杂的 issue 描述,要求模型像资深工程师一样自主定位文件、修改代码并通过验证测试;
3.
HLE-Full(人类终极考试):全球数百位顶尖学者联合命题,专为测试前沿模型极限而设计;
4.
Terminal-Bench 2.1(命令行实战):在纯终端环境里完成高难度的真实任务,K3 在此几乎追平最强专有模型(88.3% 对 88.8%)。
严格来说,「防污染」只是大幅降低了死记硬背的收益,没有任何基准能彻底杜绝训练语料混入相似题目;而且同一基准的分数受推理力度、智能体 harness 等评测配置影响(报告 §6.1.3),跨报告比分数之前要先核对配置是否一致。
图 27.1:全球大模型竞技图谱。K3 站上了开源前沿王座,以极强长周期工程能力逼近闭源顶尖巨头。
3诚实的技术边界:落后在哪、为什么?
在技术报告中,Kimi 团队展现了极其罕见的学术诚实性:
报告客观承认的技术差距
尽管 K3 稳定领先所有开源与大部分商用模型,但整体依然落后于最顶级的专有模型(Claude Fable 5 与 GPT-5.6 Sol):
• 短板写实(§6.1.4):在研究级任务上仍有差距——HLE-Full 得分 56.0%(使用工具)与 43.5%(不使用工具),均落后于 Claude Fable 5 和 GPT-5.6 Sol;CritPt 仅 23.4%,报告原话是「研究级推理仍是重点改进方向」;
• 开源的价值:K3 开源了完整的 2.8T 权重(包括前沿的 KDA/AttnRes 算法算子),让全球研究者和开发者第一次能够在本地完整复现与部署前沿级的长周期智能体。
4别人说了才算:第三方独立榜单(§6.3)
自家报告的分数难免被质疑「既当运动员又当裁判」,所以报告专门用一节汇总第三方机构的独立评测结果(截至 2026 年 7 月 23 日):
• Artificial Analysis:Intelligence Index v4.1 得分 57.1,在 580 个模型中排名第四,仅落后于 Claude Fable 5(59.9)和 GPT-5.6 Sol(58.9),领先其他所有参评模型;
• WebDev Arena:以 1,678 Elo 在 99 个模型中排名第一(领先 Claude Fable 5 的 1,634)——是首个登顶该榜单的开源模型;
• Vals AI:在其 GDP 加权行业基准套件上以 74.7% 在 39 个模型中排名第二,仅次于 Claude Fable 5(75.1%),领先 GPT-5.6 Sol(73.1%)。
第三方榜单与自家评测互相印证:K3 的位置不是自封的——它稳定处于「仅次于个别顶尖专有模型」的那一档。
5分数之外的第二张成绩单:性价比怎么读(§6.4)
单看分数会漏掉一半信息:完成同样的任务,推理成本花了多少?报告 §6.4 把四个编程与智能体套件上的「分数 vs 单任务成本」放在一起比较:
• Kimi Code Bench 2.0:K3 落后 Claude Fable 5 4.0 分,但成本仅为其 38%;
• BrowseComp:K3 取得最佳分数(91.2%),单任务成本 2.03 美元——是 GPT-5.6 Sol(90.4%)的一半,比 Claude 各模型在最大力度下的成本低一个数量级。
报告的总结是:K3 在全部四个套件上都位于或接近成本效率前沿,「以仅为 Claude Fable 5 零头的成本交付接近最高水平的分数」。对企业落地来说,这张「性价比成绩单」往往比绝对分数更重要。
6面试视角
面试视角 · 高频考点
面试官可能会问:「如何客观评估一个前沿大模型的能力?为什么现在行业更看重 DeepSWE 和 GPQA 而不是 MMLU?」
八股答「MMLU 是选择题,容易被刷榜和数据污染,区分度不高。GPQA 考博士级深度理科推理,DeepSWE 考真实工程解决代码 Bug,更能反映实际工作能力。」——分析非常专业,若能结合动态推理力度(Test-time Compute)则无可挑剔。
本课答「核心是从静态记忆检索向动态长链条问题求解的评测范式迁移:① 传统基准(MMLU)的失效:单步选择题容易被预训练海量语料无意识污染(Data Contamination),且依赖直觉匹配(System 1),无法衡量复杂推理;② 前沿基准(GPQA / HLE)的硬核性:GPQA 专家级防搜试题要求模型进行多步因果推导,考验复杂符号与科学规律抽象;③ 端到端工程基准(DeepSWE)的实战性:在真实持久沙箱中,模型需要进行『阅读万行代码 → 复现 Bug → 规划修改 → 运行回归测试 → 自我纠错』的几十步连续动作,对百万 token 长上下文理解、工具调用鲁棒性与 System 2 慢思考形成了全方位的高压验收。」
7映射到原文:K3 报告 §6 与摘要
K3 原文(§1 摘要)
「大量评测表明,Kimi K3 在长周期编程、智能体、知识、推理与视觉任务上均达到前沿水平。尽管其整体性能仍落后于最强的专有模型——即 Claude Fable 5 与 GPT-5.6 Sol——但在我们评测套件中的所有其他开源与专有模型中,Kimi K3 均稳定领先。我们开源了 Kimi K3 的完整模型权重,以促进未来研究,并加速前沿智能的更广泛部署与采用。」
逐词翻译:
- 「长周期编程、智能体、知识、推理与视觉」:对应 §6 的评测板块划分——今天看到的 GPQA、HLE-Full、DeepSWE、Terminal-Bench、BrowseComp 就分布在这些板块里。
- 「仍落后于最强的专有模型」:报告自己点名了 Claude Fable 5 与 GPT-5.6 Sol 两座大山,没有回避——这就是第 3 节「诚实边界」的原文出处。
- 「所有其他开源与专有模型中稳定领先」:注意限定词「其他」——K3 是第二名梯队的领跑者、开源阵营的第一名,这个表述与第 4 节第三方榜单互相印证。
- 「开源了完整模型权重」:2.8T 参数全部公开,任何人都能下载、复现、部署——这是 Q5 讨论的那件「重磅事件」的原文依据。
93.5%
GPQA Diamond 得分
研究生级推理与前沿相当(§6.1.4)
91.2%
BrowseComp 最佳成绩
网页浏览智能体基准(§6.1.4)
81.2%
FrontierSWE 长周期编程
排名第二(§6.1.4)
57.1
Artificial Analysis 指数
580 个模型中排第四(§6.3)
8自测题(先自己答,再点开看解析)
Q1 为什么现在的评测要强调「防数据污染(Data Contamination)」?
解析:如果测试题本身已经混在几万亿 token 的预训练语料中被模型背诵过,那么模型拿高分只是死记硬背的结果,无法体现真实的未知问题推理与泛化能力。
Q2 DeepSWE 评测要求模型完成什么操作?
解析:要求模型根据一个 GitHub Issue 描述,在真实的开源代码仓库里定位问题、编写补丁并通过验证测试——考的是端到端的真实软件工程能力。
Q3 GPQA Diamond 试卷的设计特点是什么?
解析:由物理、化学、生物学 PhD 专家命题,题目极难且经过交叉盲审验证,即使用搜索引擎查阅也极难直接找到答案,专注于考察高阶科学逻辑推演。
Q4 Kimi K3 在全球模型梯队中处于什么位置?
解析:仅落后于顶尖闭源模型 Claude Fable 5 与 GPT-5.6 Sol,在所有开源模型(如 LLaMA)及其他商业专有模型中稳定保持领先。
Q5 为什么开源 2.8T 这样规模的完整权重极其罕见且重要?
解析:因为万亿参数 MoE 的训练需要巨额算力与工程投入(具体成本报告未披露,数千万美元为示意量级),此前这一档的模型几乎全部闭源;开源完整权重使全球学术界与工业界能够直接拥有前沿级的推理基座,并自由进行定制、部署与科研探索。
明天 · Day 28
第 4 周复盘:K3 全景拆解与设计存活表终极完成版
点亮设计存活表全部 7 大部件,再用第 4 周 10 题综合测验验收——为最后两天的收官冲刺做好准备!
进入 Day 28 →