洞见·Latent Space·2026.01.08

Artificial Analysis:独立大模型评估服务 (George Cameron)

独立大模型评测平台 Artificial Analysis 两位创始人复盘:如何防止厂商作弊的“神秘顾客”政策、LLM 评测的暗黑艺术、Omniscience/GDPval/Openness 三大新指标,以及推理成本的“微笑曲线”。

Overview 背景概览

本文译自Latent Space 播客,发布于 2026 年 1 月 8 日。本期对话由 Shawn Wang (swyx) 主持,受访嘉宾为独立大模型(LLMs)评测与分析平台 Artificial Analysis 的联合创始人 George Cameron(负责技术与评测工程)与 Micah Hill-Smith(负责商业与战略)。

在大语言模型(LLM,Large Language Model)技术日新月异、各家厂商自吹自擂的时代,如何以独立第三方的客观视角,为企业和开发者提供公允的性能、速度与成本度量?本期播客复盘了 Artificial Analysis 从一个个人痛点催生的侧边项目,成长为被誉为“AI 界的 Gartner”的商业化历程。两位创始人不仅揭秘了防止厂商作弊的“神秘顾客”政策,还深入剖析了评估模型的暗黑艺术,并重点介绍了其最新推出的三大创新指标:评估事实知识与幻觉的“全知指数”(Omniscience Index)、评测复杂白领工作流的“GDPval”智能体基准(及开源的 Stirrup 智能体框架),以及衡量模型透明度的“开放性指数”(Openness Index)。最后,访谈以推理成本的“微笑曲线”和 Blackwell 硬件革新为引,展望了未来多模态及智能体时代下评测边界的不断拓宽。

▍嘉宾:George Cameron Artificial Analysis 联合创始人兼 CTO。前数据科学与量化工程专家,负责平台的核心评测管线、硬件基准测试及智能体评测框架的设计。

▍嘉宾:Micah Hill-Smith Artificial Analysis 联合创始人兼 CEO。曾创办法律 AI 辅助工具,在发现模型基准评测痛点后与 George 联手打造该平台,负责公司的商业化订阅与企业战略合作。

▍关于 Artificial Analysis Artificial Analysis 成立于 2024 年 1 月,是目前 AI 行业中最受瞩目的独立第三方模型与托管服务评测平台。通过独立运行 API 请求,实时度量主流闭源和开源模型在不同托管商(如 Fireworks、Together、Perplexity 等)下的输出速度(Output Speed)、延迟(Latency)、质量(Quality)及性价比。平台致力于为企业决策提供高可信度的数据支撑,帮助开发者跨越模型选型的迷雾。

起源:从开发者痛点到独立评估服务

Micah: 这对我们来说某种程度上是一个“圆满闭环”的时刻——Artificial Analysis 第一次在播客上被提到,就是你和 Alessio 在 Latent Space 上做的。

swyx: 那是 2024 年 1 月。我自己都不记得了,但那期内容对我影响确实很大。我翻出了 2024 年 1 月 16 日前后的 AI News,当时我写道:“一个宝藏级的模型与托管商对比网站刚刚上线”,还配了几张截图,说它是独立第三方,把质量与吞吐量的取舍标得清清楚楚,并且按模型和托管商逐个拆分。不过我当时也喷了你们一句:搞模型评测怎么能没有 Fireworks?好在你们有 Together、有 Perplexity,我们大概就是从那时开始聊起来的。 欢迎来到 Latent Space,George 和 Micah!我一直在密切关注你们的进展,祝贺你们度过了非常精彩的一年。你们两人的组合现在真的隐隐成为了 AI 行业预定的“新高德纳(Gartner)”,对吧?

George: 哈哈,但有一个关键区别:你绝对没办法通过付钱让我们给你刷榜或美化结果。

swyx: 对,就是这样。

George: 这一点非常重要。

Micah: 我们就用这个最火辣的观点开场吧。

swyx: 好,那我该怎么付钱给你们?说正经的——你们是怎么赚钱的?

Micah: 我们非常乐意聊这个。这几年是一段相当了不起的旅程,到 2026 年 1 月,Artificial Analysis 就满两岁了。起初,我们网站上的所有评测数据都是免费提供的,目的是帮助开发者和企业在这波 AI 浪潮中对模型、托管商和技术栈进行选型,这件事我们会一直坚持做下去。目前我们团队已经发展到 20 多人,业务运转得相当可持续,并构建了两个主要的商业化支撑点。 第一是面向企业客户的“基准与洞察订阅服务”(Benchmark & Insights Subscription),我们希望成为企业获取 AI 数据与洞察的首选,用标准化分析报告解决他们实际部署 AI 时的高难度选型决策;第二是面向整个 AI 技术栈公司的“私有基准评测服务”(Private Benchmarking)。 我们再次强调,没有任何人能通过给钱在我们的公开网站上买到排名。这一点我们从第一天起就非常明确:如果我们失去了独立客观的立场,那我们的评测也就失去了任何价值。

swyx: 那么对于财富 500 强企业,这种订阅服务具体是怎样的?是我给你们打电话,你们拉一份定制报告,或者来我办公室办工作坊吗?

George: 我们的基准与洞察订阅主要是标准化的行业报告,覆盖企业在理解和选择 AI 技术时面临的关键议题。例如其中一份是模型部署报告:究竟应该使用无服务器(Serverless)推理、托管专属部署方案,还是自己租显卡运行推理?这是大企业普遍面临的真实决策,而且极难权衡——这些东西对所有人来说都太新了。我们的报告和洞察订阅就是帮企业理清这类问题。 而私有基准评测则完全不同:公开评测不带任何商业交易,私有评测则是我们根据企业的特定规格、或某些 AI 公司的需求,在不对外公开的前提下创建并运行基准,帮他们理解自己构建的东西。这主要依靠我们在运营公开评测过程中积累的工程技术和评测方法学。

swyx: 我们待会再聊背后的技术栈。先把时间拨回这个项目刚诞生的时候。你们当时一个在悉尼、一个在旧金山?我记得我们还打过一次 Zoom 电话。你们最初为什么想到要创立 Artificial Analysis?

Micah: 当时我在澳大利亚悉尼,George 在旧金山——他是澳大利亚人,不过已经搬过去了。 故事大概始于 2022 年底到 2023 年初,我们两个人都对 AI 抱有极大的兴趣。2023 年,我当时正在构建一个法律 AI 研究助手,在它的时代里算做得相当不错。在构建的过程中,我发现当你真正动手去用大语言模型(LLM,Large Language Model)做系统时,每一个环节最终都会归结为一个评测问题。我当时设计了一个多阶段算法,试图弄清楚在保证效果的前提下,每个节点所需的最小可用模型(Minimal Viable Model)是什么,以优化准确度、延迟和成本。但当时市面上根本没有一个客观的第三方平台来评测这些模型在不同服务商下的真实表现,更没有人度量速度与成本的取舍。于是我们决定自己动手写一个,原本它只是我们两个人的业余侧边项目(Side Project)。

swyx: 你们当时并没有坐下来宣布“这就是我们的事业了”。我第一次给你们打电话时,你们应该还没决定要开公司吧?

Micah: 确实如此。那时 George 没辞掉他的工作,我也没停下法律 AI 的项目——它就是个地地道道的业余项目。

George: 是的,当时纯粹是因为我们自己作为这个领域的构建者需要这个工具,想着别人或许也会觉得有用。我们买了域名,把代码部署到 Vercel 上,然后在推特(Twitter)发了帖子。非常感谢 swyx 你的第一波转发,让我们发布的这个项目迅速获得了社区的关注。 紧接着,整个行业发布新模型的速度开始疯狂加速,尤其是 Mixtral 8x7B 的推出,真正改变了行业格局,让大家开始关注其他 Serverless 推理商,开始认真思考速度和成本。这也让我们的评测平台迅速变得越来越有价值。

独立评测的方法学与资金挑战

swyx: 我喜欢和你们这种横跨整个生态的人聊天:我对人们想要什么只有理论,而你们手里有数据——这显然更有说服力。再说回起源。在你们创立这个平台之前,行业的现状是每个实验室发论文时都会附带一份对比表格,里面他们自己的模型永远是各项指标的最佳。我记得我还亲手干过抄数字的活儿——大概每个人都有一个 Excel 或 Google 表格,把每篇论文里的数字复制粘贴上去。但由于不是独立复现的,数字常常对不上:你复现的竞品数据永远惨不忍睹,因为你可能根本没正确设置竞品模型的参数。当时 Percy Liang 主导的 Stanford HELM 也在做类似的整理。如果是我来做,我可能会直接使用 EleutherAI 的 Eval Harness 框架。

Micah: Eval Harness 是一个非常优秀的开源项目。说到底,如果只是一个简单的问答评测,你要做的不过是问一串问题、检查答案对不对,本不该有多难。但实际上,需要控制的变量多到惊人——大模型评测绝对是一门“暗黑艺术”。 最核心的原因在于,各大实验室在测试时使用的提示词(Prompting)千差万别。当你只在几分之差上竞争时,动手脚的空间非常大——极端情况下,你甚至可以直接把答案“喂”进模型里。最疯狂的例子是当年谷歌发布 Gemini 1.0 Ultra:他们需要一个能宣称超越 GPT-4 的数字,于是在 MMLU 的每一个主题里都构建了 32 个思维链(CoT,Chain-of-Thought)few-shot 示例来跑分,而这些示例从未公开过。

swyx: 他们其实从未真正发货过 Ultra,对吧?就是那个一直没放出来的版本。

Micah: 至少没有大范围开放。我确信它存在过,但确实如此。所以我们从第一天起就非常确定:必须亲自动手,用完全相同的方式对所有模型运行全部测试。而且我们从一开始就认定,不能孤立地看这些分数——必须把它们和成本、性能放在一起看。

swyx: 从技术和财务角度看,运行这些测试的开销非常大,这是我当初望而却步的原因。你们当时不担心成本吗?应该还没有融资吧?

Micah: 刚开始完全是我们自掏腰包。幸运的是,两年前的数字远没有现在难看——当时所有评测加起来,花费也就几百美元量级。一方面模型数量极少,另一方面评测复杂度也低得多:我们只是问一些问答类题目,最初甚至连思维链都不让模型跑,直接采样一个答案完事。现在的开销则完全是指数级暴涨,原因有很多,我们慢慢聊。

答案解析与格式控制:评测背后的工程细节

swyx: 对于没做过这类工作的人来说,光是解析(Parsing)模型的返回结果就是一整门学问。模型想怎么答就怎么答,有时候它其实知道正确答案,但返回的格式不对——除非你在解析器里专门做兼容处理,否则这一题就只能记零分。这里面的工作量不小。而且还有一个开放问题:模型没有遵守你规定的输出格式,你到底该不该给它分数?

Micah: 这取决于你想测什么。如果你考察的是它能否解决某一类推理问题,而不想顺带测试它的“答案格式化能力”,那么你可以采用“LLM 答案提取器”(LLM-as-Answer-Extractor)的方式,确保无论它怎么组织语言,都能把答案提取出来。不过如今这个问题已经小多了:只要你给模型明确的指令和几个答案格式的示例,它基本都能按你的格式输出,之后用一个简单的正则表达式(Regex)就能完成判分。

swyx: 是的。还有一堆类似的问题,比如多选题里模型有时会天然偏向第一个选项,所以你必须把选项顺序随机化。一旦深入钻研基准测试,你会发现全是这种细微之处——你都不知道大家怎么还敢相信这些跑分数字,真是一门“暗黑艺术”。

Micah: 另一个问题是,不同基准的方差(Variance)差异极大。如果你按各家实验室给自己模型建议的温度,去跑一套题量不大的四选一多选题评测,只跑一遍,看到的方差会大得吓人。所以我们在开发新评测、为智能指数升级纳入新指标时,会对所有评测做海量重复运行,调试出合适的重复次数,把结果收紧到我们满意的 95% 置信区间——最终汇总出的智能指数,能保证在 95% 置信度下误差不超过 ±1 分。

swyx: 而这等于把成本直接乘上了一个倍数。

George: 没错,这只是过去几年成本增长远超线性的众多原因之一。补充一个细节:我们会在网站上公布运行 Artificial Analysis 智能指数的成本数字,但目前公布的口径是基于“只跑一遍”的假设,因为我们想借此反映指数中各分项的权重构成。而由于实际评测中存在大量重复测试,我们的真实成本远高于网站上公布的那个数字。

Highlights 高光金句

“为了确保评测的绝对中立,我们做的每一件事都聚焦于提供最好的独立指标,确保没有人能以任何方式操纵它们……我们建立了‘神秘顾客’政策:我们会用非自家域名注册的账号,在厂商无法识别的情况下重跑智能评测和性能基准。因为行业里一个非常好的因素是,每个厂商都希望确信,他们的竞争对手也绝对无法操纵我们的评测。” "So we laser focus, like, on everything we do on having the best independent metrics and making sure that no one can manipulate them in any way... We have what we call a mystery shopper policy... we will register accounts not on our own domain and run both intelligence evals and performance benchmarks without them being able to identify it. Because, like, a thing that turns out to actually be quite a good... good factor in the industry is that they all want to believe that none of their competitors could manipulate what we're doing either."

▍点拨:独立评测的真正护城河不是技术,而是“激励相容”的机制设计——让每个厂商都确信对手无法作弊,防作弊就从评测机构的单方承诺变成了全行业的共同利益。这与交易所、审计机构的信任结构同源。

评测的暗黑艺术与“神秘顾客”机制

swyx: 我比较好奇的是成本侧:你们和实验室之间没有特殊协议吧?他们不给你们打折?——其实是混合模式。那么关键问题来了:他们有时会给你们一个特殊端点,各大实验室在提供新模型测试时,会不会在特定通道上进行某些“特殊优化”,导致测试数据好于实际公开接口的数据?

Micah: 这确实是行业中真实存在的作弊隐患。为了杜绝这一现象,我们推行了“神秘顾客(Mystery Shopper)”政策。我们和所有合作的实验室都公开了这一条款:虽然我们会接受厂商预先提供的私有测试通道进行先期评测,但我们一定会通过匿名域名注册的普通用户账号,在公开端点上以普通用户的身份重新跑一遍测试。如果两边的性能和准确率有差异,我们绝对会采用普通用户拿到的真实数据。 实际上,各大厂商对此非常配合,甚至很支持我们这样做。因为在高度竞争的市场中,他们也不希望任何竞争对手能通过在接口端动手脚来从我们这里骗取高分。

swyx: 确实如此,这一点我从没想过。我之前在数据库行业待过,围绕基准测试的各种猫腻见得多了。那么在防范作弊和机制漏洞方面,除了针对测试集进行针对性训练(Data Contamination)外,我这份“猫腻清单”上还漏了什么吗?

Micah: 最根本的一个其实不是直接的作弊,而是更概念性的问题:被度量的东西,会变成实验室定向攻关的目标。我说的不是在测试集上训练那种事。作为研究者,你有无数办法针对性提升某个特定指标,理想情况下这些努力恰好也能提升真实用户的广泛体验,但并不必然如此。 比如,为了在各种公开竞赛数学题(Competition Math)上拿高分,厂商们投入大量资源进行针对性对齐,模型现在在这类题上表现惊人——这类推理和现代编程智能体有一定相关性,但显然不能划等号。一旦某个评测集变成全行业紧盯的目标,它的分数就可能持续上涨,却不再反映模型通用智能的真实进步。过去几年如此,未来几年也会如此。没有银弹,唯一的办法是不断开发新东西,持续度量对真实用户最重要的能力。

Inverse 反向思考

▍指标异化与古德哈特定律:一旦某个特定的基准测试(如 MMLU 或 GSM8K)成为行业公认的模型能力风向标,各大模型实验室的训练研发就会开始针对性地进行“刷榜式训练”(Hill-Climb)。这并不代表模型在真实场景下的泛化智能也同等提升。因此,评估机构必须不断设计并迭代全新的、高难度的未公开数据集(Held-out Sets),来对抗这种评估失真。

评估标准的演进:从 V1 到 V4

swyx: 没错。顺便说,你们早期主要是跑别人的评测,现在已经开始自研了——走到前沿、把现有评测耗尽之后,这是必经之路,这块我们待会聊。先说下一个里程碑:你们后来决定加入 AI Grant 并搬到旧金山,是第二期还是第四期来着?第四期,好。和 Nat Friedman 还有 Daniel Gross 合作感觉如何?

Micah: 非常棒。Nat 和 Daniel 显然都是行业顶尖的,同期入选的也是一批很酷的公司。他们在这个领域和许多头部公司做过大量出色的工作,并且和我们的使命高度同频——我们和 AI Grant 里其他典型的 AI 创业公司不太一样,他们完全理解并支持我们想做的事。

swyx: 他们给过什么真正影响你们的建议吗?或者哪场活动让你们印象特别深?

Micah: 我很怀念那些来 AI Grant 做炉边谈话(Fireside Chat)的讲者们。

swyx: 那份名单确实豪华得离谱。

George: 完全同意。印象最深的是和 Nat、Daniel 聊创业中那些没有标准答案的难题——如何有条理地梳理它们、做出艰难的决策。在我们打造 Artificial Analysis 的过程中,他们一直是极好的导师。另一个好处是,同期以及整个 AI Grant 网络里的公司都在不断挑战 AI 能力的前沿,和他们保持联系、确保 Artificial Analysis 对他们有用,反过来也支撑着我们想清楚该怎样建设这个平台。

swyx: 这点我持保留意见:某种程度上说,你们的目标用户并不是 AI Grant 里这些身处前沿的公司吧?

Micah: 是,也不是。AI Grant 的公司们做的事情,是把实验室释放出的能力推向极限、构建出色的应用——这让他们中间的一些人成为 Artificial Analysis 最典型的重度用户(Power Users),也是对我们哪里做得好、哪里不好、下一步想要什么意见最强的一批人。如今构建任何 AI 应用,大概率都要同时用一堆不同的模型,并在应用的不同环节频繁切换模型,以优化准确率、速度和成本。他们中很多人并不是我们的付费客户——网站上的数据我们不收费——但他们绝对是我们的重度用户。

swyx: 聊聊评测本身吧。你们从 MMLU、GPQA 这类通用评测起步,是怎么一步步搭出整体指数的?V1 里有什么,后来又怎么演进?

Micah: 先铺垫一下背景:Artificial Analysis 智能指数是我们的合成指标,目前由 10 个不同的评测数据集组成——我们相当确信,它是衡量“模型有多聪明”的最佳单一数字。当然它说明不了全部问题,所以我们把整个网站的图表都开放出来,让大家深入每个细项、看清各种取舍。目前指数里有几个对行业非常重要的问答类数据集、两个智能体(Agentic)数据集、我们自研的长上下文推理数据集,以及一些面向具体用例的项目。随着时间推移,我们最关注的是对 AI 越来越重要的能力:首先是智能体能力——大家都爱自己的编程智能体,模型在这类工作上的表现对我们非常重要;其次是与有经济价值的用例挂钩;再就是模型至今仍然吃力的地方,比如长上下文,这些能力和用例不会消失,我们会持续评测。

swyx: 但我真正想问的是 V1、V2 到 V3 的纵向对比——当年的评测放到今天有多“不够看”。这种迭代本身就反映了行业的变迁。

Micah: V1 放到今天会彻底饱和(Saturated):几乎每一个新发布的模型都能打穿它,像 HumanEval 那样写一段简单 Python 函数的任务,现在已经轻而易举。人们很容易忘记过去两年的进步有多大——我们每天玩的是“今天版对上周版”的赛马游戏,比如这周谁的 10B 以下小模型最强,这对很多开发者、尤其对旧金山这座城市非常重要。但只要你把镜头拉远到两年前,当年我们用来评测模型的绝大部分内容,今天连相当小的模型都能 100% 解决——顺便说,这也是各智能层级成本一路下降的关键驱动力之一。所以从 V1 到 V2 再到 V3,我们不断提高难度、覆盖更广泛的用例,努力贴近开发者真正关心的东西,而不再只是 MMLU 和 GPQA 所代表的那类问答评测。

swyx: 你要补充点什么吗?要不我们直接带大家看看网站上的基准图表,边看边聊?

Micah: 好啊。这也正好可以聊聊我们最近推出的一些新东西。

George: 以及我们想把它带向何方。目前智能指数和评测主要聚焦“原生智能”(Raw Intelligence),但我们想多元化对智能的理解——我们自研和合作的新评测会聚焦幻觉这类主题,现有评测体系里还有很多该测而没测的东西,我们想把它们补上来。不过在这之前——

图表巡礼:o1 跳变、DeepSeek 的“节礼日”与改名史

swyx: 先给听众报个时间戳:目前的第一名是 Gemini 3 Pro High,然后是 70 分的 Claude Opus、GPT 5.1 High——你们还没收录 5.2——以及 Kimi K2 Thinking。哇,它还挂在榜上。这就是当前的前四名。这个排名很快就会给这期播客打上时间戳——希望我们一年后再看时,会觉得“天呐,当时他们怎么这么可爱”。

George: 哈哈,绝对会这样。我先快速调个视图。我特别喜欢这张图表。

Micah: 这张图确实是我们的心头好——George 和我在各种会议演讲里几乎每次都把它放在第一页,用来说明我们身处什么样的历史时刻。它就是刚才“拉远镜头”那番话的可视化版本:回到一年多以前,o1 和 Claude Sonnet 3.5 之前,世界上还没有推理模型、也没有编程智能体这回事,玩法完全不同。再往前一点,从图上看,OpenAI 在长达一年多的时间里高不可攀——你肯定记得,当时人们公开讨论的问题甚至是“AI 到底会不会有竞争”“OpenAI 会不会一骑绝尘”“是不是只剩几家前沿实验室、其他人只能调用他们的 API”。总体而言,我很欣慰我们最终走向的是一个多模型的世界,而且过去几年每个季度竞争都在加剧。今年尤其疯狂。

George: 你们也能看到,把所有模型都加上之后,这张图现在很难读——点太多了,但这也反映了我们切身感受到的疯狂。

swyx: 这张图上默认高亮的是 14 个模型,这是人工挑选的吗?里面有一些不太传统的名字。

George: 是的,这是我们在智能指数图表中默认高亮的模型,是一份人工策展(Curated)的清单。不过有一件事我觉得很多用户都不知道:我们的图表是可以自定义的,你可以自己选择高亮哪些模型。去掉一些名字之后,图就会易读很多。

swyx: 确实。我很喜欢能在这张图上看到 o1 的那次跳变——看,2024 年 9 月。还有 DeepSeek 的那次跳变。

George: 那一次真的非常接近 OpenAI 的领先位置了,差不多就是一年前的事。

Micah: DeepSeek V3 发布那天正好是新西兰的“节礼日”(Boxing Day,圣诞节的次日)。2024 年下半年我们一直在跟踪 DeepSeek 和其他一些知名度较低的全球玩家,也跑过他们早期模型的评测。我印象非常深刻:当时我正在新西兰和家人过圣诞节,一边陪家人一边跑评测,看着 DeepSeek V3 的结果一条一条地回来。这是他们 V3 架构的第一代,671B 参数的混合专家模型(MoE)。 我们当时就被深深震撼了——那一刻我们确信,DeepSeek 不再只是众多玩家之一,而是一跃成了牌桌上的重要角色。全世界真正注意到它,是几周后他们在 V3 之上叠加强化学习(RL,Reinforcement Learning)、R1 横空出世的时候。但这一切的地基,绝对是那个完全开放权重、强到离谱的底座模型——当时它是我们测过的最强开源权重模型。

George: 顺便给不熟悉的听众解释一下,节礼日就是圣诞节的后一天。我自己来自新加坡。

swyx: 我们很多人记住节礼日是因为另一个原因——那年的海啸。当然,那已经很久以前了。说回这个指数的名字,到底该叫 AAQI 还是 AAII?我记得你们以前好像叫它质量指数(Quality Index)?

Micah: 你的记性不错。很久以前我们确实叫它质量指数,那时候我们讲的是质量、性能和价格这三件套,后来才把“质量”改成了“智能”(Intelligence)。

George: 我们改过好几次名。比如在网站上加入硬件基准测试之后,评测上升到了系统层面,于是我们把原来的“吞吐量”(Throughput)指标改名为“输出速度”(Output Speed),因为吞吐量这个词放在系统层面用更贴切。

新度量维度:Omniscience、GDPval 与 Openness

swyx: 接下来聊聊你们最近推出的三个新指数:Omniscience、GDPval 和 Openness。首先是 Omniscience Index(全知指数),它和传统的问答测试有什么区别?

Micah: Omniscience 指数和我们之前跑的大部分智能评测不太一样,它是专门为模型的知识储备和幻觉(Hallucination)问题打造的:当模型不知道答案、答不对的时候,它说“我不知道”的概率有多大,还是一本正经地给出错误答案?我们改变了计分规则,分值范围在 -100 到 +100 之间:给出错误答案就扣分。我们深信这是最合理的做法——面对事实性知识问题,说“我不知道”绝对比答错更有价值。 我们的目标之一,是扭转评测为实验室和模型创造的激励:迄今为止,几乎所有 AI 评测都以简单的正确率作为主指标、作为被吹捧的数字,于是模型什么都该蒙一把,说“我不知道”没有任何好处。我们要改掉这一点。

swyx: 这还涉及一个更通用的领域——校准(Calibration):模型对答案的置信度与答案正确性之间的匹配。

George: 完全同意。我们没有把置信度直接放进这个指数,原因在于:我们认为正确的做法不是直接去问模型“你有多自信”。

swyx: 也许可以试试——比如在输出里加一个 JSON 的 confidence 字段,让它吐个数出来。我们这些年做过好几期评测主题的播客,之前采访过 Hugging Face 维护开源榜单的 Clementine Fourrier,她的头号需求之一就是某种“幻觉率与置信度校准”的度量。所以,嘿,现在有一个了。

Micah: 当然,像我们做的所有事情一样,它不是完美的指标,也不是幻觉问题的全部图景,但相当有用,结果也很有趣。比如在幻觉率榜单上,Anthropic 的 Claude 系列排在最左边,是我们测过的模型里幻觉率最低的。这个发现很有意思,它大概和人们喜欢 Claude 模型的许多“之前没被度量过的体感”高度相关。

参数量的“八卦”:Grok 的数字与缩放路线之争

Micah: 另外说一个关于 Omniscience 的小发现:它的“准确率”维度与我们测量的其他任何指标相比,都更紧密地跟踪模型的总参数量(Total Parameters)。这在直觉上很合理:这是一个纯知识型评测——不看训练方式,只看模型召回了多少事实——而它与总参数量高度相关。

swyx: 坊间传闻 Gemini 3 Pro 的尺寸到底是多少?先说好,这些只是传闻,没有任何官方信源确认过。我听到各种各样的数字,不知道该信哪个。

Micah: 如果你把 Omniscience 准确率对总参数量画一条拟合线,再把所有开源权重模型放上去,就能眯着眼睛看出一个事实:目前最强的前沿模型,大概率比开源权重模型“封顶”的 1 万亿参数大得多。这里还有一个有趣的额外数据点:Elon Musk 最近披露了 xAI 的数字——Grok 3 和 Grok 4 是 3 万亿参数,Grok 5 是 6 万亿(不过还没发布)。把这些线索拼在一起,你完全可以合理推测:Gemini 3 Pro 很可能比它们还大,落在 5 到 10 万亿参数的区间。当然我要声明,我其实一无所知——只是基于这张图表,你会自然得出这个结论。

swyx: 说实话,我有点想劝大家别猜太多。这事其实没那么重要——只要厂商能以可持续的成本把模型服务出来,就够了。

George: 而且闭源实验室和开源权重模型玩家的激励也不一样。开源模型要考虑支持别人自部署;而对于大规模做推理的实验室来说,推理成本更多取决于激活参数量(Active Parameters)而非总参数量。所以行业天然有动力去做“更大、更稀疏”的模型。

Micah: 对开发者和企业用户来说,正如你所说,模型多大根本不重要。你该看的是我们度量智能的各个维度、是“运行智能指数的成本”(Cost to Run Intelligence Index)这个数字,是基于刊例价(List Price)的 Token 效率与成本效率——只有这些才真正重要。

swyx: 就是不利于我们内容创作者造谣了——本来我可以做梗图:“看,GPT-4 是这么个小圆圈,GPT-5 是这么大的圆圈”。这玩法确实火过一阵。

Micah: 但这本身其实是个很有意思的信号:过去几年,这些模型的总尺寸很可能并没有显著放大。所以总参数量这条轴上还有很大的上升空间,尤其随着新一代硬件的到来。

swyx: 摘下我“瞎起哄”的帽子说点正经的:我确实有这种感觉——尤其刚从欧洲回来——很多人觉得 Ilya Sutskever 可能是对的:预训练这个范式已经没有太多数量级可以继续缩放了,因此我们至少需要开始探索一条不同的路径。

Value 核心价值

▍全知与诚实:为什么“诚实度”比“正确率”更重要:在生产环境中,一个回答错误却极其自信的模型,对业务造成的损害远大于一个大方承认“我不知道”的模型。Omniscience 指数引入惩罚机制(答错扣分,答对加分,回答“不知道”不扣分),极大地扭转了评测界只注重正确率的偏见,促使厂商在后训练阶段(Post-Training)优化模型的校准度(Calibration),提高输出的真实可靠性。

幻觉率的细节与 Critical Point:研究级物理难题

swyx: 这个幻觉测试的数据集是公开的吗?有没有保留集(Held-out Set)?

Micah: 这一个有保留集。我们只公开了 10% 的测试题,因为它是纯事实性知识问答,如果全部公开,数据污染(Data Contamination)会来得非常容易。我们也会定期更新题目来防污染,但把大部分题目留在手里,才能让这个指标长期可靠。这个指数还能按话题做非常细粒度的拆解,一部分已经在网站上公开了,后续还会放出更多。

swyx: 我注意到一个现象:Haiku 的幻觉率低于 Sonnet,Sonnet 又低于 Opus——在普通的能力评测里,这个顺序可是反过来的。你怎么看?

George: 一个有趣的发现是,智能水平和幻觉率之间其实并没有很强的相关性——模型总体上更聪明,并不意味着它更懂得在不知道的时候说不知道。另外值得注意的是,Gemini 3 Pro 在“准确率”维度上相比 Gemini 2.5 系列有一次巨大的飞跃,它知道的东西确实多得多;但在幻觉率上,Google 的几代模型之间几乎没有变化。这说明幻觉率的高低更多取决于各家不同的后训练(Post-Training)配方。

swyx: 我打赌 Pro 的表现会很猛——等等,我说的其实是 GPT Pro。有传闻说,GPT Pro 其实就是把模型跑 8 次、再在上面叠一层 LM 裁判。未经证实,只是传闻。

George: 嗯,是有这个传闻。

Micah: 你要怪的话,可以部分怪我们:我们此前对“智能”的定义里,一直没有把幻觉当作减分项。而这正是我们现在要改变的。

swyx: 我认识很多聪明人,自信满满地说错话。

George: 哈哈,这非常“人类”。而且说实话,这也有它的适用场景——很多情况下人们恰恰希望模型“幻觉”一下、大胆一试,比如写代码或者头脑风暴新点子的时候。我们新加入的一个评测 Critical Point 就和这个话题有关:它是非常难的物理题。

swyx: 它更像 HumanEval 那种类型,还是像 FrontierMath 那种?

George: 和 FrontierMath 比较类似。这些是物理学界的研究者才能回答的研究级问题,模型在它们面前非常挣扎——目前的最高分只有 9% 左右(译者注:原文转录疑有笔误,取 9%)。这个评测由普林斯顿等多所高校的学者联合开发,我们是它的发布合作伙伴(Launch Partner)。有趣的是,这些学者告诉我们,当他们把模型当作探索物理学新想法的“思想伙伴”时,会故意把温度(Temperature)调到尽可能高——因为他们就是要模型去“幻觉”,有时候幻觉出来的真是新东西。

swyx: 所以幻觉不是在任何场景下都要打压的。另外还有个显而易见的问题:每家实验室的系统卡(System Card)里都有自己的幻觉数字,你们选择不为这些数字背书、另起炉灶自己做,这本身就是一种立场。某种意义上,Artificial Analysis 的其余部分都是别人可以独立复跑的公开基准,而这项是你们作为服务提供的——你们必须直面“凭什么由你们来做”的质疑。你们的答案是什么?

Micah: 对幻觉这个主题,合理的测量维度本来就有很多种。我们把自己这个叫做 Omniscience 幻觉率,并不想宣称它是“人类最后的幻觉基准”。更大图景的回答是:未来我们会三管齐下——内部自研评测、与学术界合作、与 AI 公司共建评测。我们对 AI 技术栈的很多环节都有强烈的判断:哪些地方没被测好、哪些开发者关心的能力应该被测得更多更好。Critical Point 就是我们与学术界合作的例子;和几家头部公司的合作也在路上——这类合作我们会在独立性上格外小心,但只要披露得当,我们完全可以接受。很多实验室过去也发布过优秀的数据集,被我们独立地使用并取得了很好的效果。未来大家会看到我们用这几种方式放出更多东西。

swyx: 那么关于 GDPval 基准呢?我记得这是 OpenAI 大概一个月前才发布的评测集,发布时我就很看好,还和它的 lead researcher Tejo 聊过。它用某种 GDP 口径筛选出 44 个任务,代表编程之外的广义白领工作。你们还做了自己的版本——给还不太了解的听众回顾一下吧。

George: 那是一个非常棒的数据集。

Micah: 每个任务都带有一大堆详细说明,很多还附带输入文件。44 个任务内部又拆成大约 220 到 225 个子任务,那才是我们实际运行智能体的粒度。不过我得说,它并不一定能覆盖人们工作的全部——没有评测是完美的。为了让任务定义得足够清晰、可以运行,它们只能带少量输入文件和非常具体的指令。最贴切的理解方式是:它们很像面试流程里带回家的那种高难度考题(Take-home Exam)。

swyx: 对听众来说,关键的变化是:它不再是一条长提示词,而是“给你一个 zip 文件,里面有电子表格、PPT 或 PDF,放手去干,回答这个问题”。

George: OpenAI 发布了一个很棒的数据集和一篇很好的论文,论文考察了各家网页聊天机器人在该数据集上的表现,推荐大家去读。我们做的,是把这个数据集变成一个可以在任何模型上运行的评测:我们创建了一个参考智能体执行环境(Reference Agentic Harness)来跑这些模型,又开发了一套基于 AI 的评分方法来比较输出——用 Gemini 3 Pro Preview 做结果对比,我们做了相当全面的测试,确保它与人类偏好对齐。一个有趣的数据点是:Gemini 3 Pro 自己下场“答题”时,表现其实没那么好。这就是我们在 GDPval AA 上做的事。

swyx: 用 LLM 当裁判要警惕的是自我偏好(Self-preference)——模型通常偏爱自己的输出,而这次不存在这个问题。

Micah: 我们现在对“什么时候适合用 LLM 裁判”的理解,和几年前早期的 LLM-as-a-Judge 已经很不一样了。当年以 MT-Bench 为代表的那批工作,评判的是对话和文风这类东西。而在这里,评审模型做的事和“考生”做的事完全不同:答题时,模型带着全套智能体工具——代码解释器、网页检索、文件系统——经过几十上百轮操作去创建文档;评分时,我们走另一条管线,把产出文件提取成视觉和文本两种版本喂给 Gemini,同时给出任务标准,让它判断两份输出中哪一份更符合标准。 我们验证了它非常擅长做对这件事,绝大多数情况下与人类偏好一致。原因在于:它有足够的原生智能;输出的呈现方式是正确的;输出由智能体任务产生、与评审模型自身的工作方式截然不同;而且我们是让它对照标准做两两比较,而不是零样本地问它“哪个更好”。

swyx: 明白了。那为什么用埃洛积分(ELO),而不是像 GDPval 原版那样用百分比?

George: 因为这些任务的输出是文档,有些任务的输出甚至是视频或音频。

swyx: 还有视频任务?是什么任务?

George: 数据集里就有——比如“当个 YouTuber”,做一条营销视频。

Micah: 模型得自己去互联网上找素材再剪到一起。明确说,模型目前在这项任务上还不太行——用代码工具干这活还是太难了。

George: 所以这里不存在可以用来计算正确率的“标准答案”,很难定义对错,只能在相对意义上比较。这就是为什么我们用 ELO 方法,在同一任务上对各模型的输出做两两对比。

swyx: 你知道你们该做什么吗?雇一个人类承包商去做同样的任务,给人类也算一个 ELO 分,这样榜单里就有了人类锚点。原版 GDPval 的百分比之所以有用,就在于 50% 代表“普通人类”,超过 50 就是超越人类了。

Micah: 我们没有把分数锚定在人类水平上。我同意锚定有帮助,但我们想把这个分数泛化到非常多的模型上——用 ELO 呈现的好处之一就是可以持续加入新模型,榜单在很长时间内都不会过时。而且,把这些任务的表现和人类直接对比其实有些微妙:人类完成任务的路径和模型完全不同。

swyx: 我还挺喜欢你们把 Llama 4 Maverick 也放进去了。这算是它的“最后一舞”吗?

Micah: 不不不,它是 Meta 发布过的最好的模型,所以目前还留在首页默认清单里。

George: 另一个有意思的收录是:我们还在最新版本的各家网页聊天机器人上跑了这套任务。

swyx: 哦对,我完全漏看了这个。就是带棋盘格底纹的那组?

George: 没错。带棋盘格标记的条目用的是厂商自己的执行环境,不是我们的。真正有意思的发现是:拿 Claude 4.5 Opus 来说,它在 Claude 网页聊天机器人里的表现,反而差于同一个模型在我们智能体执行环境里的表现——而且每个案例都是如此,模型在我们的环境里全都跑赢了厂商自己做的聊天机器人环境。

swyx: 我对此的反向解释是:聊天机器人本来就是为消费场景设计的,而你们把它推到了极限场景。

Micah: 约束不同,能给模型的自由度也不同,而且还有成本目标——我们这边基本是让模型想干多久就干多久。至于聊天机器人那边的参照数据,就是靠手动复制粘贴进去跑出来的,我们不会像维护几百个模型那样持续更新它们。

swyx: 要不你们找 Browserbase 聊聊,他们能帮你们自动化。我认真想过,这些聊天机器人版本其实应该变成 API——它们本身就是名正言顺的“另一种智能体”。

Micah: 过去一年这个方向演化非常大。各大聊天机器人应用里可用的工具已经分化得相当厉害,能连接的数据源也越来越多——这意味着你使用模型的方式和体验,比以往任何时候都更不一样。

swyx: 说到工具和数据连接,你马上能想到的、值得一提的例子是什么?

Micah: 我最喜欢的例子是:直到不久之前,让 LLM 帮我起草一封有用的邮件基本是不可能的。因为你发邮件很少是为了写而写——所需的上下文可能是一堆历史邮件、会议笔记,或者公司里某个角落存的资料。对我来说是 Google Drive、OneDrive,以及我们 Supabase 数据库里的数据。理想情况是模型能接入所有这些并干出有用的活。目前在 2025 年底让我印象最深、甚至有些意外“居然真的能用了”的是:我可以让模型通过 Supabase MCP 做只读查询,跑一串 SQL 做相当有分量的数据分析、画图,还能读我的 Gmail 和 Notion。公平地说,这些功能在 ChatGPT 和 Claude 里目前也就是“勉强能用”的程度。

George: 因为听众听完真的会去试。顺便说:如果你收到 Micah 发来的邮件,那大概率不是聊天机器人写的。

Micah: 确实,我从来没真的把聊天机器人起草的邮件发出去过——暂时还没有。

swyx: 你能感觉到拐点在靠近,明年这个时候我们回来看进展。顺便给 Supabase 点个赞——创始人是另一位著名的新西兰人(Kiwi)。你们和他就 AI 建设、AI 基础设施有过什么交流吗?

George: 我们在 Twitter 私信里聊过,因为我们是 Supabase 的深度用户和重度用户。另外补充一个关于 GDPval AA 的点:正是基于“模型在我们的环境里反而跑赢聊天机器人”这个发现,我们意识到,这个参考执行环境其实是一个相当不错的通用智能体环境。它非常极简,遵循了 Claude Code 里的一些设计思路:我们只给它上下文管理能力、网页搜索与浏览工具和代码执行环境。

Micah: 我们还可以给它配更多工具,但默认就这些。针对 GDPval 我们专门加了一个“查看图像”的工具——模型可以用终端把文本拉进上下文,但要把视觉信息拉进来,就得给一个定制工具。

George: 结果就是,我们意外造出了一个不错的通用智能体执行环境(Agentic Harness),并于昨天在 GitHub 上开源了它,命名为 Stirrup。大家如果想构建面向特定任务的通用智能体,它是一个很好的起点。

Micah: 最佳用法是直接 git clone,然后让你顺手的编程智能体按你的需求改它——代码行数不多,编程智能体改起来非常顺手。

Tips 知识科普

▍埃洛积分系统 (Elo Rating System):在复杂的生成式任务(如 GDPval 中的演示文稿制作、宣传视频剪辑或财务预测分析)中,很难像传统多选题一样定义绝对的“正确率”。Artificial Analysis 采用埃洛积分系统,通过模型对战的形式(LLM-as-a-Judge),由评审模型对两个模型的输出结果进行两两比较,并根据胜负率计算动态天梯积分。这种方式不仅能更客观地排列模型梯度,也极具动态扩展性。

swyx: 这真是造福社区的举动,大家可以在上面探索和折腾。类似的还有 terminal-bench 团队做的 Harbor:一个“极简 harness(他们叫 Terminus)+ RL/Docker 独立运行环境”的组合。不知道你们看过没有,它会成为人们采纳的标准吗?

George: 我们从评测的角度看过,我们很喜欢 terminal-bench,Artificial Analysis 上也托管着它的基准。从编程智能体的角度看它也不错,而且它可以成为任何类型智能体的基座。我认为行业正在走到这样一个阶段:模型已经足够聪明、工具也足够好,只给一套极简的工具集、放手让模型自己控制智能体工作流,表现反而更好——而不是用另一个更重的框架去规定它的流程。

swyx: 那么第三个指标——Openness Index(开放性指数)是出于什么考量?

Micah: 这是最近几周我们聊的三个新东西里的最后一个。先说明一下:我们的工作其实是开源与闭源的混合——有些我们开源,有些是专有的;比如去年的长上下文推理数据集(LCR)我们就开源了,网站上的部分性能基准也在考虑开源,但也有一些我们在持续迭代。 开放性指数是一种思考“模型有多开放”的新方式。长期以来我们一直跟踪模型是否开放权重、许可证是什么——这告诉你“你可以拿权重做什么”。但“开放”还有另一个此前没人跟踪的重要维度:它的制造过程披露了多少——预训练数据与后训练数据的透明度、你是否被允许使用这些数据、训练方法和训练代码的透明度。我们把这些维度合在一起为模型打分,让你在一个地方看清“模型到底有多开放”的全貌。

swyx: 我见过其他人尝试做过类似的东西,但都没维护下去。这事确实重要。这个分数有上限吗?满分 20?

George: 目前是 18 分制。我们有一个开放性指数页面,本质上就是在各个维度上越开放得分越多,最高 18 分。目前的领头羊某种意义上是 AI2(Allen Institute for AI),凭借他们极其开放的 OLMo 3 32B Think 模型。

swyx: Hugging Face 呢?

George: 哦,他们有个较小的模型快上榜了——我们得先跑完智能基准才能让它上站。

swyx: 你们的榜单可不能没有 Hugging Face——我们爱 Hugging Face,赶紧上。FineWeb 那套工作真的太棒了。

Micah: 完全同意。这个指数很酷的一点在于:如果你想整体理解这些模型、理解各家公司贡献的东西能让你做什么,它给了你这张全景图。我们会把它和智能指数覆盖的所有模型一起保持更新,作为理解模型的又一个视角。

swyx: 往下滚到那张取舍(Trade-offs)图。这张真的很关键——显然,你完全可以“超级开放但很笨”。从图上看,这条斜率似乎注定朝这个方向走。

Micah: 很多人都希望实验室在这条轴上“爬山”刷分。不幸的是,斜率朝下可能是个基本事实:一旦你把东西开放了,其他人就都能达到你现在的水平。

swyx: 那我给你们的计分系统挑挑刺:比如我只开放了一点点数据,未必就比一个在开放权重上投入巨大努力的人“更好”到哪儿去。要是我,我会调整分值权重,让它更准确地反映对开源的实际贡献。

Micah: 按贡献的“分量”加权是很难的。我们刻意把它设计成定义清晰、没人能对分类结果产生分歧的体系——我们不去评判某项贡献对行业影响大还是小,只看你披露了多少数据。我认为这种说法依然成立:哪怕一个模型没那么聪明、甚至在同尺寸档位里不在前沿,但选择开放全部数据和全部训练代码,本身就是对行业极有价值的事情——即便它不是该档位最聪明的模型,我们也想认可这一点。

swyx: 还要特别点名 NVIDIA 和 Nemotron——他们做的事情得到的认可远远不够。老实说,这对 NVIDIA 来说也是销售赋能。

Micah: 完全正确。NVIDIA 过去一年在 Nemotron 系列模型上确实投入了巨大努力。

swyx: 而且很多人都在用 Nemotron 做合成数据之类的东西。行业里一个有趣的“秘密”是:NVIDIA 在某种程度上养活了所有这些玩家。

Micah: 毕竟,世界上有更多 AI,是符合他们利益的。

swyx: 说回许可证。你们推的每个指数都内嵌了某种观点或价值观。今年关于“开放”的一个争议就是有人在许可证上动手脚:Llama 就有那么一条——如果你的日活用户超过 7 亿,就不能直接用他们的模型,得另行洽谈。当然,大多数人永远到不了 7 亿用户。你们的客户在许可证方面有什么担忧?

Micah: 开放性指数里对此有详细的细分,这其实也正是当初推动我们做这个指数的问题之一。我们的观点很简单:使用 OSI 官方认可的许可证(如 MIT 或 Apache 2.0)有很大优势,因为这样“勾就直接打上了”——你甚至不需要读条款,是 Apache 2.0 就可以随便用。当然,公司不使用完全开放的许可证往往也有很好的理由。指数会把这些讲清楚:拿到最高档的就是那类许可证,完全没问题;往下的档位则分别对应“需要署名”和“禁止商用”等情况。

推理成本的“微笑曲线”与硬件效率

swyx: 接下来聊聊你们做的趋势报告,也正好以此收尾——这可是你们的“面包与黄油”。我强烈推荐大家去看 George 在 AI Engineer World's Fair 上的演讲,里面预览了那张非常经典的“微笑曲线(Smiling Curve)”。人们平时只能从实验室的营销话术里听到“我们一直在降价”,所以这张图值得装进每个人的脑子里。能帮听众解释一下吗?

Micah: 没错,营销话术只说对了一半,那不是全貌。当前市场存在两个看似矛盾、但都成立的趋势。 第一,智能的成本在大幅下降:在固定智能层级上,大模型推理的成本过去几年一直在暴跌。一个标志性的事实是:如今获得 GPT-4 级别的智能,比 GPT-4 刚上线时便宜了 100 倍以上——我心里的数字其实是 1000 倍。我们按智能指数分数段跟踪“运行智能指数的成本”,每个分数段的曲线都在飞速下探,而且每解锁一个新的智能层级,下探速度还在加快。 第二,虽然单次推理极其便宜,但现在在 AI 推理上花大钱的可能,比几年前高得多。

swyx: 看看 Amazon Nova 那批模型就知道了,便宜得离谱。

Micah: 我平常对外的保守口径就是 100 倍。不过公平地说,这张幻灯片是大概六个月前做的——概念上依然成立,但具体数字可能该微调了,市场变化太快。这也是为什么会有“微笑曲线”:左手成本下降,右手消耗量暴增。

George: 英伟达股价起飞。

swyx: 可不是嘛。我刚听说一家刚经历这个转变的初创公司,仅编码智能体(Coding Agents)一项的开销,折合每位员工就高达 5000 美元。这也太夸张了。

Micah: 看来我们得把自己的数字提上去了,我们还没花到那个水平。

swyx: 我当时就想:你们是不是哪里搞错了?

Micah: 中间确实可能存在一些效率问题,但我能想到很多把 AI 推理用到这个程度的方式,所以我不觉得这有那么离谱。我们做这张幻灯片正是要回答这个疑问:疯狂之处在于两件事同时成立——左边,GPT-4 级智能的成本降了 100 到 1000 倍;右边,即便小模型已经能做 GPT-4 级别的事,我们仍然想用大模型、用比以往更大的模型去追求前沿智能,推理模型在烧 Token,我们还把它们扔进智能体工作流里,让它们消耗海量输入 Token、产出海量输出 Token、长时间连续工作。两件事叠加,今天的总开销就比几年前高出好几个量级。

George: 没错。背后的驱动因素有很多,我们在报告里归纳了六个关键项——而过去 12 个月里,每一项都发生了剧烈变化。

swyx: 那我来挑硬件效率的刺,你们也跟踪硬件。幻灯片上写的是 3 倍提升?但现实里英伟达下一代芯片的效率提升并没有宣传的 4 倍,实际可能只有 2 倍左右?而且这更像一个功耗(Power)故事,而不是纯粹的算力/Token 效率故事。硬件这边到底什么情况?

Micah: 答案很不幸是“看情况”,而且取决于不同负载类型和不同的思考方式。一个最简单的思考框架是:取一个有代表性的模型,在你实际需要、也负担得起的现实速度下提供服务,然后看每块 GPU 能实现的吞吐量。这很重要,因为每 GPU 吞吐量和单用户速度之间存在取舍——把服务做得更快是要花更多钱的。当你把这套账算到大型稀疏混合专家模型(MoE)头上时,从 Hopper(H100/H200)升级到 Blackwell 带来的提升会远超 2 到 3 倍。这话应该不算有争议:我相当确信 Blackwell 已经带来了巨大的收益,而且英伟达未来几年的路线图还会继续带来巨大收益——这些会以更低的单位 Token 总成本传导给在上面跑模型的公司,让更大的模型、更多的 Token 以更低的成本成为可能。再叠加上软件和模型层面的各种改进,我的预测是:微笑曲线的左右两端,未来几年都会各自再延续一个数量级,这会解锁非常多的东西。

推理模型与 Token 效率:从二元分类到连续光谱

swyx: 我想先给稀疏化泼点冷水。DeepSeek 当年大力推动细粒度专家(Fine-grained Experts)架构,激活参数占总参数的比例一路从大约 25% 降到 15% 甚至更低——但总不能无限低下去吧?5% 左右是不是就是下限了?

Micah: 下限一定存在,但市面上已经有比 5% 低得多的数字了:OpenAI 的开源模型 GPT-OSS 大杯大约是 5% 激活,Kimi K2 大概是 3%。

swyx: 我看过那些数字,还算过。我当时就想:这应该就是极限了吧。

George: 5% 大致就是当今已发布的开源权重模型的水平。而让我对“激活比例不会再降”这个直觉保持警惕的一点是:在我们的基准里,性能与总参数量的相关性远高于与激活参数量的相关性——Omniscience 的准确率维度和总参数量强相关,和激活参数量几乎无关。所以这条路上可能还有不小的空间。

Facts 核心事实

▍大模型稀疏化(Sparsity)与知识上限:混合专家模型(MoE)通过将模型稀疏化(只激活部分参数,例如 GPT-OSS 激活约 5% 的参数,Kimi K2 激活约 3%),大幅度降低了每次推理的计算量(Active Parameters)和推理延迟。然而评测显示,模型在事实性知识召回上的表现与“总参数量”(Total Parameters)强相关,而与“激活参数量”(Active Parameters)几乎无关。这意味着我们无法通过无限降低激活参数来保持无限的知识容量,这也是物理硬件存储无法规避的硬约束。

swyx: 好,我们时间不多,但我想留点时间聊聊推理模型与非推理模型、以及 Token 效率的问题。大家习惯于把模型分成“推理”和“非推理”两类,但圈内人对这个二分法其实越来越不舒服——本质上不过是 API 返回里有没有那个“思考标签”(Think Tag)而已。何况今年还有 GPT-5 这样的模型。你们是怎么处理这个分类的?

Micah: 就拿 GPT-5 来说:在 ChatGPT 消费端它是一个模型路由器(Model Router);在 API 端,你可以选不同的版本、可以调每个版本的推理强度(Reasoning Strength)——这正是这件事如今如此复杂的原因。今年早些时候,我们有一张特别好用的幻灯片:在我们的智能指数里,推理模型平均每次查询消耗的 Token 数是非推理模型的 10 倍。那时候这个二分法清晰又好用,但现在完全不是了——不仅因为很多模型可以调节推理强度,更因为不同模型之间的 Token 效率差异已经超过了一个数量级。所以现在评估任何一个应用的成本,正确的起点是用类似我们“运行智能指数的成本”(Cost to Run Intelligence Index)这样的指标,去比较不同模型、不同推理强度下的表现——从非推理到推理已经是一个连续光谱(Spectrum),而不是非黑即白。我们仍然会展示“推理/非推理”的分类——以 API 里是否有独立的思维链参数来定义——但它不再必然意味着更长的端到端延迟,也不再必然比挂着“非推理”牌子的模型消耗更多 Token。

swyx: 对,GPT-5.1 Codex 发布时有张图就很漂亮:最快 10% 的查询变得更快,最慢 10% 的查询愿意花更久——这正是你想看到的效率曲线。

Micah: 没错,这一点极其重要:你想要的模型行为,不是“平均少用 Token”,而是“该多花时间时多花时间,不该时就不花”。OpenAI 宣称 5.1 Codex 在这方面做得更好。我们目前还没有公开发布这个维度的数据,但在内部分析里一直在跟踪题目难度与 Token 消耗之间的相关性。结论是,模型整体正在变得更会“量力而花”。再乘以智能体工作流里动辄几十上百步的执行步数,Token 效率和轮次效率(Turn Efficiency)在明年会变得非常关键。

swyx: 如果二选一,Token 效率和轮次效率,哪个更值得优化?

Micah: 取决于应用场景,两者都会非常重要。反正总成本就是——

swyx: Tau-bench Retail、Tau-bench Airline。

George: 有个很有意思的例子:在 Tau2-bench Telecom 这个智能体基准里,按单 Token 价格算更贵的模型(比如 GPT-5),总成本反而比一些小的开源模型更低——因为 GPT-5 能更快抵达答案,用更少的轮次解决客户的问题。它每轮用的 Token 可能更多、单价也更贵,但架不住轮次少。所以我认为“到达答案所需的轮次”会成为一个被越来越多人讨论的指标。

swyx: 接下来聊聊多轮对话(Multi-Turn)与单轮对话评测的取舍问题。大部分基准评测为了并行和自动化,都被局限在单轮上;但实际人机交互绝大多数是多轮,尤其是快速的多轮交互。

Micah: 历史上基准评测确实是单轮的,但我认为未来完全不必如此。我们的指数里现在就有几个智能体基准,包括刚才聊的 GDPval——我们用 Stirrup 智能体跑这些评测时,允许模型最多进行 100 轮的系统交互。这在工程实现上确实很难:要解决各种基础设施问题,还要如你所说做并行化,因为我们需要在数百个模型上以极快的速度运行——我们希望这样,实验室也希望我们这样跑他们的模型。

多模态基准:图像、视频与语音竞技场

swyx: 我们还没聊到多模态(Multimodality),这块其实巨大。

George: 是的,我们还做语音(Speech)、图像(Image)和视频(Video)的基准测试。

swyx: 我很喜欢你们的做法,非常聪明:视频生成耗时太长,所以你们把候选视频预生成好,让用户直接在竞技场(Arena)里挑选自己偏好的结果,最后汇总出天梯排名。这样还顺带绕开了实时生成可能冒出不合规内容的敏感问题。

Micah: 这是好事还是坏事,取决于你的立场。但这意味着我们带着一种相当主动的“创意指导”(Creative Direction)思路,去研究创意专业人士和普通用户到底想用这些图像、视频模型做什么,然后据此设计竞技场的分类,在大家真正关心的维度上收集投票数据。这里我想对听众喊个话:如果你在用我们的竞技场,可以主动向我们提交希望覆盖的需求——那些被低估的品类、模型表现差但实验室又不重视的领域。如果你想让某个问题被解决,手上的杠杆之一就是给我们发几条相关的提示词(Prompt),我们说不定就能为它开一个新的评测分类。这就回到了我们前面聊的逻辑:一个东西一旦被度量,就会有人针对它优化——你完全可以利用这一点为你服务。

swyx: 作为内容创作者,我特别需要“信息图”(Infographic)生成。我拿过 DeepSeek 最新的论文,把里面关于搜索智能体和编程智能体的描述丢给模型,直接生成了一张信息图。我觉得这种“工业级”用例不需要多高的设计品味,但要求模型严格遵从预设的参考规范——这在 Nano Banana 系列上越来越重要,听说 OpenAI 的 Image 2 也快有这个能力了。总之,行业需要激励的是这种“干粗活”的实用场景,而不只是艺术创作。

展望未来:永不满足的智能需求与 V4 前瞻

swyx: 明年这个时候我们会在聊什么?你看到了哪些正在兴起、但还没进入大众讨论的话题?

Micah: 我先给一个“无聊”的答案:我们大多数图表上的曲线都在朝某个方向走,而我们的总体预测是——它们会继续朝那个方向走。明年我们聊的可能还是类似的话题,只是沿着这个轨迹又走了一年之后,世界的体感会很不一样。

swyx: 我恰恰是“不变的真理”的粉丝,因为你可以围绕它们做规划、做建设。媒体行业——播客、newsletter、Twitter——都对“变化”上瘾,天天喊“一切都被颠覆了”。但总有一些真理是恒定的,你可以信赖它们。

George: 我认为其中一条真理是:对 AI 智能、对更聪明的 AI 的需求是永不满足的(Insatiable)。有些人不同意,觉得智能到了某个阈值之后就不需要更多了。对此我总反问:你在工作里带过人吗?如果有一个按钮能让你带的员工更聪明、活儿干得更好,你会不按吗?换成按在自己身上呢?除了继续给“原生智能”跑分,我们还想沿着更多轴线深入理解模型——幻觉只是一个开始,接下来我们想帮大家理解模型的“行为”和“性格”(Personality),让人们能做出更精细的选型决策。

swyx: “性格基准”——这确实是 OpenAI 正在大力投入的方向,如果你们做出来了,一定要去和 Fiji 和 Roon 聊聊。那么,下一版智能指数里会有什么?V3 眼看着就要饱和了。

Micah: 要不要我们就在这儿独家爆料一下?我们现在是 V3,下一个大版本叫 V4。会加进来的东西,很多就是今天我们聊到的、最近几周刚上线的指标,所以不算特别意外:加入 GDPval 之后,指数里会有真正强有力的通用智能体表现维度;加入 George 前面说的 Critical Point——那个类似 FrontierMath 的物理评测——让我们能用一套全新的、极难的研究级问题数据集来观察模型;此外还会纳入 Omniscience 和幻觉率。难点在于怎么把这些量纲不同的指标加权组合在一起,我们要确保不产生任何奇怪的、误导性的扭曲。 每次大版本迭代都是一次“一次性重置”。我们保证在同一个版本号内部,分数绝不漂移(Drift),大家可以放心引用和对比;但一旦升到 V4.1,那些数字就和 V4 不具可比性了。

swyx: 顺便问一句,最近关于 Tau-bench 准确性的争议你们关注了吗?据说 Tau-bench 里有相当高比例的测试题是“根本不可能完成”的。

Micah: 早期版本可能确实有这个问题。Tau2-bench Telecom 我们相当有信心是靠谱的——如果非要说有什么问题,那就是模型们已经太擅长做它了。所以,Tau3 赶紧来吧。

swyx: 再次感谢 George 和 Micah 带来如此硬核的分享。我很庆幸在你们成名之前就认识了你们——现在你们真的成名了。

Micah: 是我们的荣幸。真的很感谢你一路以来的支持——我开头说的不是客套话:Artificial Analysis 被 Latent Space 报道,对我们来说是一个非常关键的节点。在那之前,我就是 Latent Space 差不多一年的听众了,听了你的声音很多很多个小时,只是那时还不认识你本人。后来你报道了我们,我才有机会认识你,差不多两年前第一次见到你。说实话那真的很酷,今天能来也很开心。

George: 也感谢你一直是社区里这么棒的成员,把那些还没有关注度的项目带到聚光灯下、带给你的听众。

swyx: 其实严格说不是我的功劳——是我们 Discord 社群里有人把它丢进来的。我依靠社区,社区也在自我喂养。不知道是谁把它带到了我眼前,我们真该回去查一查。但我一看到就觉得:这东西很棒,这是我一直想要的东西——我想自己建一个,只是太害羞、太笨或者说太懒了没动手,而你们把它建出来了,现在它已经成了一番事业。谢谢你们来到这里。

George: 你们也做出了很多很酷的东西,比如这档播客。谢谢,就到这里,感谢!

Takeaway 行动指南
  • 关注推理成本与复杂度的双向飞轮:随着以 GPT-5 和 Gemini 3 系列为代表的尖端模型持续降价,开发者应积极拥抱“Stirrup”等轻量级代理框架,设计更深度的多轮自纠错(Multi-turn Self-correction)工作流,以用更多的廉价 Token 换取高难度的执行成功率。
  • 用客观数据支撑部署架构选型:在“Serverless API、托管专属部署方案或自租显卡运行推理”之间的权衡,是企业落地 AI 时公认极难且缺乏客观数据的决策。应借助独立第三方的部署基准报告(输出速度、延迟、性价比等度量)进行核算,而非凭厂商宣传或直觉决策。
  • 理性看待大模型评测集并设计内部分流(Routing)体系:切勿迷信单一的 MMLU 或 GPQA 跑分,由于古德哈特效应,公开跑分已高度失真。企业架构中应当利用 Omniscience 与 GDPval 评测思想,针对垂直领域的具体数据设计 Held-out 内部基准集,并通过路由器(Router)依据任务复杂度动态分流,以实现准确率与成本的最优平衡。