Arena CEO Anastasios Angelopoulos:七成NeoLab会死
Arena 联创兼 CEO Anastasios Angelopoulos:Kimi K3 击败美国闭源模型改写“中国只会蒸馏”叙事,75 家 Neo Lab 三分之二将归零,数据是万亿美元市场。
本文译自播客 20VC,发布于 2026 年 8 月 3 日;主持人 Harry Stebbings,对话 Arena(前身为 LM Arena)联合创始人兼 CEO Anastasios Angelopoulos。
这是 20VC 近期最不留情面的一期:Anastasios 站在全球最大真实世界模型评测平台的视角断言,75 家 Neo Lab 有三分之二会归零,Kimi K3 击败美国闭源模型已经改写了“中国只会蒸馏”的叙事,而真正的万亿美元生意藏在数据里。他还现场自曝了一件匪夷所思的事:有“假人”通过了 Arena 的全部技术面试,直到发 offer 才发现这个人根本不存在。
▍嘉宾:Anastasios Angelopoulos
Anastasios Angelopoulos 是希腊裔计算机科学家,在加州大学伯克利分校攻读博士期间(节目中自述“整个博士生涯都在地下室里证定理”)参与发起了模型评测社区项目 Chatbot Arena,后与团队将其独立为公司 Arena(原 LM Arena),出任 CEO。他以直言不讳的行业评论著称。
▍关于 Arena
Arena(前身为 LM Arena)是源自学术社区的模型评测平台,主打“真实世界评测”:不用静态基准测试,而是让真实用户在真实任务中对模型进行盲测投票,从中提取性能度量。
- 规模:月访问者超 3,000 万,多数为知识工作者与高阶个人用户;节目中称已是全球最大消费级 AI 应用之一,体量超过 xAI、Hugging Face、Manus、Genspark。
- 商业化:企业业务上线 8 个月年化收入即破 1 亿美元;累计融资 2.5 亿美元,估值 17 亿美元。
- 模式:一边向模型实验室出售评测与改进洞察,一边向企业输出基于自有数据的模型评测、路由与训练服务。
Arena:真实世界的 AI 评测平台
Harry: 这里是 20VC,我是 Harry Stebbings。安杰尼·米达(Anjney Midha)可能是 AI 圈最聪明的家伙之一,也是 Anthropic 的种子轮投资人。我问他:你认识的人里谁最懂 AI?他说,Anastasios Anjapaloulis——名字我念错了,但他是希腊人,说实话我这把年纪已经不在乎念对念错了,反正他这个人是真的厉害。
我当时就说,哇,能帮我引荐一下吗?他帮我搭了线,于是就有了今天这期。Anastasios 是 Arena(前身为 LM Arena)的创始人兼 CEO,那是一个让你给最佳模型投票的平台,一个不可思议的模型评测机构。
这期节目可以说是我近期做过最过瘾的一期。他完全不在乎得罪人,而且直言不讳、极其清晰、简洁、有观点——谈中国开源模型的未来、该不该禁、芯片出口管制有没有用、前沿模型和开源模型的格局会如何分化、到底谁有资格评判一个模型是否脆弱。和 Anastasios 的这期对话实在太精彩了,内容远不止这些。
Harry: 您已到达目的地。Anastasios,今天对我来说会特别过瘾,因为我笨得像块石头,而你要教我一堆东西。太感谢你来上节目了,兄弟。
Anastasios: 别这么说,谢谢你邀请我。
Harry: 兄弟,我跟你说过,我把这节目当成和老朋友叙旧的机会,所以这几天“蹲”你蹲得很开心。我想先替不了解的听众问一句:能不能用最简洁的话解释一下,Arena 是什么?为什么它今天这么重要、这么出圈?
Anastasios: Arena 是一个在真实世界里衡量 AI 表现的平台。意思是我们不用静态基准测试,不用某个人随便攒的数据集,而是看 AI 交到真实用户手里之后会发生什么。
通过这种方式,我们衡量的是 AI 影响人类的客观现实:它是否事实准确、是否可控可引导、人类喜欢还是不喜欢、有没有幻觉、有没有错误、人们到底有没有真的用 AI 把自己的工作做完。
然后我们一边帮实验室改进模型,一边帮整个生态理解不同 AI 的表现,追踪所有劲爆的新消息——现在每周都有好几个新模型发布。这就是 Arena 的故事:我们是 AI 的中央评测平台。
模型商品化之问与 Kimi K3 时刻
Harry: 确实够简洁。一般人被我要求“简洁一点”之后,能讲上四个小时。看着 Arena 上那些模型,数量多到我只能问一个问题:我的天,这算不算是模型的彻底商品化(commoditization)?它们是不是已经变成纯粹的公用事业层了?
Anastasios: 这个问题的浮现是因为开源模型。如果你只看闭源模型,你会说行业在加速,但还没有真正商品化,因为这一层仍然攥在一小撮公司手里——只有闭源模型的话,那会是个寡头市场。
但实际发生的是,开源模型——尤其是来自中国的——进步得非常快。几周前我们第一次见证了 Kimi K3 在一批相当重要的任务上击败了美国最强的闭源模型,比如前端开发、网页开发——要知道开发者里很大一个群体就是网页开发者。
Harry: 兄弟,我能问问吗,那一刻的分量有多重?因为这模型是个——我肯定会念错,不过你知道,我是做播客的,念错也能蒙混过关,你可是博士。
Anastasios: 你蒙混不了。
Harry: 那可是个 27 万亿参数的模型,笨重得很,一点都不轻巧。而且我昨天刚和 SaaStr 的杰森·莱姆金(Jason Lemkin)在一起,他可是打满 AI 鸡血的人,他的原话是:说实话,它并不比其他模型强。Kimi 这个时刻到底有多大?
Anastasios: 不,那是个大时刻。之所以说是大时刻,是因为它打破了美国流传已久的一种叙事——中国人只会蒸馏(distillation)美国模型,这是他们唯一能跟上的办法。
“之所以说是大时刻,是因为它打破了美国流传已久的一种叙事——中国人只会蒸馏美国模型,这是他们唯一能跟上的办法。” "And the reason I'd say it was a big moment is because it violates a narrative that has been persistent in the United States, which is that the Chinese are just distilling American models."
▍点拨:这句话的分量在于举证责任的倒置——过去两年,美国业界习惯用“蒸馏论”解释中国模型的每一次进步,而当 Kimi K3 在真实用户盲测中反超,这个解释框架本身失效了。结论出自与双方都没有训练利益关联的第三方评测平台,格外难以回避:蒸馏可以是训练流程的一个环节,但已不再能解释全部的性能差距。
而真实发生的是,Kimi 在某些任务上击败了包括 Fable 在内的所有美国模型。这并不意味着他们没有蒸馏——蒸馏可能仍然是他们训练流程里的一个子环节——但它说明蒸馏只是故事的一部分。
这些实验室一定在蒸馏之外还做了些什么,才把性能推到了美国实验室当前水平之上。这个叙事被打破,对人们看待整个生态的方式影响巨大——既关乎美国的科学主导地位和所谓霸权(当然,美国人爱霸权),也关乎整件事的经济账,也就是你问的:这些模型到底是不是商品。看看 OpenRouter 这类平台,排名前五的模型全是中国开源模型。
蒸馏(distillation)指让小模型或新模型学习强模型的输出——答案、推理轨迹乃至概率分布——以远低于从头训练的成本完成能力迁移。它是开源社区的常规技术,DeepSeek、Qwen 等都公开讨论过相关做法。争议点从来不在“用不用蒸馏”,而在“只用蒸馏能不能解释领先”——这正是 Anastasios 认为 Kimi K3 打破叙事的原因。
AI 主权与数据护城河:开源会侵蚀闭源吗
Harry: 中国模型今天这样遍地开花,会不会实质性蚕食闭源前沿模型的生意?
Anastasios: 这得从背后的激励和经济学来看。先说一点:OpenRouter 的数据并不能真实反映现实,因为它的商业模式是在每个 token 上加收一笔费用。
所以大家不会用 OpenRouter 调闭源专有模型,主要用它调开源模型——他们需要故障转移(failover)这些增值服务。看整个推理市场的大盘,绝大部分消耗仍然发生在第一方 API 和专有模型上。
这就是为什么 Anthropic 的收入曲线像火箭一样竖起来——它们并没有被中国开源模型完全蚕食,这些模型到今天也只占全球推理支出的一小部分。
但往后看,企业会想要拥有自己的智能,也就是所谓的 AI 主权(AI sovereignty)——一个时髦词,意思是你拥有自己的整条 AI 供应链。
也就是说,你可以拿一个开源模型,用自己公司的数据微调,端到端拥有自己的技术栈——基本上除了算力托管之外全是自己的。人们会在乎主权,在乎成本,在乎自我改进,也不一定愿意把数据交给一个外部第三方服务——谁知道它哪天会不会变成你的竞争对手。
Harry: 那你相信这就是未来吗?我们请过 Fireworks 的 Lynn 上节目,她的说法是:专业化智能才是未来——每家公司都会有用自己的数据微调出来的专属模型,性能还更好。她说得对吗?还是说那只是极少数硅谷顶尖公司的玩法,普通公司直接用前沿模型就完了?
Anastasios: 这么说吧:我认为商业激励会让这件事不可避免。因为在 AI 时代,企业必须找到新的护城河。软件本身已经不再是护城河了——它可以被瞬间生产出来。往五年后看,这就是现实。
那还剩下什么护城河?网络效应和数据护城河。如果你能把数据护城河变成一个自我改进的产品,这就是企业在 AI 时代维持立身之本的方式。
假如我是可口可乐、是思科这样的公司,我坐拥海量用户,未必站在世界 AI 技术的前沿,但我手里有庞大的语料数据,可以用来打击竞争对手。那我该怎么做?当然是想方设法把自己的数据优势榨到极致,加速业务、挡住对手。
Anastasios 的护城河清单只剩两条:网络效应和数据。用巴菲特的语言说,他其实在讨论“特许经营权”的存续——软件的生产成本趋近于零,任何能被瞬时复制的东西都不构成护城河。数据护城河的检验标准不是“有没有数据”,而是数据能否进入一个自我改进的飞轮、随时间持续加宽——这是可口可乐式护城河在 AI 时代的对应物。值得警惕的是,大多数宣称拥有数据护城河的企业,手里只是静态存量,并不产生复利。
Harry: 你觉得他们真会用中国开源模型来做这件事吗?
Anastasios: 问得好。我认为不会。中国模型现阶段可能是故事的一部分,但考虑到美国的监管环境,长期看,更可能出现的是一家强大的美国开源竞争者崛起。
这也是为什么我一直力挺 Thinking Machines 这类公司。我相信美国至少会诞生一家市值数千亿乃至上万亿美元的公司,专注于“美国优先”的开源。
美国开源为何落后:商业模式、Thinking Machines 与团队流动
Harry: 那为什么到现在还没有?顺带说一句,我也真心希望如此,完全同意,乐见其成。但为什么没有?美国开源社区为什么落后得这么明显?
Anastasios: 坦白说,我认为这是个商业模式问题。到现在为止,大家并没有真正想明白开源的商业模式是什么,而现在人们开始开窍了。路线有几条。
一条是收入分成:我把开源模型放出去,允许 Fireworks、Together 这类推理服务商部署,等它们的收入超过某个门槛,我就要求分成。这是靠开源建立可持续公司的一种方式——本质上是在分享算力收入。
另一条路——我觉得更像 Mira(Murati)的 Thinking Machines 那种打法——是把开源模型当作获客工具:企业在模型之上构建业务,然后找上门来问,能不能帮我们微调?能不能帮我们做 AI 战略?然后你派驻场工程师(FDE,forward deployed engineer)去帮他们做。
这其实是个巨大的市场。想想未来十年最大的市场之一是什么?是 AI 现代化改造——走进全世界每一家企业,帮他们在 AI 面前重做工具链、用好数据、重构数据、搞明白怎么用这些模型、把模型接进工作流、教会员工使用。这会是个巨大、巨大、巨大的市场,也是它们成长为数千亿乃至万亿美元公司的另一条路。
Harry: 可前沿模型厂商不也已经在这么干了吗?OpenAI 谈过他们的 FDE 打法,Anthropic 也一样。Mistral 的例子我认,他们确实做得漂亮。但前沿厂商都在做——连微软都他妈在做 FDE。恕我直言,这条路不是开源独有的。
Anastasios: 对,FDE 确实不是开源独有。但我认为“FDE + 美国开源模型”这个组合,对美国乃至西方企业来说,可能是更可持续的模式——因为它们未必愿意把自己的业务建在外部第三方服务之上。
出于成本和主权两方面的考虑,它们可能想把这些第三方砍掉。而开源的东西它们可以完全拥有,可以在公司内部持续微调,可以更安心地相信钱花在刀刃上、没有供应链风险。
Harry: 那我们该怎么看待现在成千上百的 Neo Lab?你刚提到 Thinking Machines。先声明一下,我笨得像块石头——这话我对我的 LP 也是明说的。
Anastasios: 我也是,我也是。
Harry: 你才不是。你是博士,而且安杰尼跟我说过你很聪明。
Anastasios: 这就是两块石头在对话。行吧,反正这是个播客。
Harry: 我爱死这个说法了。对,就是要这样,兄弟,来吧。不然你想要什么?高智商对话?
Anastasios: 随便吧。
Harry: 不开玩笑了。说回 Thinking Machines,我的问题是:好,你的逻辑我跟上了,但他们现在只剩两位联合创始人了——莉莲·翁(Lilian Weng)昨天刚离职。团队的流动性从来没有这么高过。
Anastasios: 是啊。团队这事很难,留人很难,做联合创始人也很难。听说她是因为健康原因离开的,所以不好说这跟公司势头有没有关系——目前看公司势头还挺强的。
不过要我说,Inkling 绝对还只是个 V0 模型。据我所知,Thinking Machines 大约六个月前做过一次团队大重组,然后基本推倒重来,Inkling 就是那个之后的产物。
所以最宽厚的看法是:这个模型他们只做了六个月,就成了美国第一的开源模型。而不那么宽厚的看法是:公司已经成立一年半了,交出来的答卷是——对,美国开源第一,但头上压着九个中国模型,因为它们在全球开源里只排第十,至少按 Arena 的数据是这样。你今天打开我们的排行榜,世界就是这个格局。但愿 Thinking Machines 接下来能趁势发布更多、更大的模型。
Thinking Machines 是 OpenAI 前 CTO 米拉·穆拉蒂(Mira Murati)2025 年创立的新实验室,以豪华研究团队和巨额融资著称。节目中提到的 Inkling 疑为转录误听,或对应其模型/产品名(其首个公开产品为微调 API Tinker);离职的联合创始人莉莲·翁(Lilian Weng)是前 OpenAI 安全研究负责人。“公司成立一年半、模型只做了六个月”的宽厚与不宽厚两读,是评估 Neo Lab 真实进度的常用视角。
中美 2×2:芯片出口管制与模型禁令
Harry: 最近一期节目之后,有位中国研究员朋友给我发消息说:你根本没搞懂,你没抓住我们为什么领先——我们就是比你们拼命得多。而且我们有政策支持、有监管护航、有政府补贴,这些你们都没有,我们全是顺风。你同意吗?
Anastasios: 他们有顺风,也确实赢过,但我不觉得局面有他说的那么一边倒——这话有点夸大双方的差距了。我们手里的一个顺风是:我们拥有全世界最好的芯片生态。他们那边硬件受限得厉害,所以一直在想方设法从黑市进口芯片,新闻里都能看到,The Information 刚报道过。
Harry: 你觉得这真的严重制约了他们的能力吗?再次声明我是外行。还是说,我们其实是在培养一个生态——他们因为拿不到,反而会学会自己飞快地造出来?
Anastasios: 我觉得眼下可能确实拖住了他们,但未来会怎样是个真问题——因为他们真的很擅长造硬件。出口管制的副作用是:它可能激励对方自建生态,到时候我们怎么办?
所以我们的指望是让 NVIDIA 一直保持领先,保住我们在台积电(TSMC)这类环节上的优势——整个这套生态绝对是国家安全必需品,政府应该真刀真枪地保护和培育它,同时扶持创新公司,比如美国本土刚冒出来的 Etched,继续扩大我们的领先。
Harry: 太好了。我爱 Gavin 和他的团队,完全同意。那我问你:就出口管制本身而言,你认为对芯片搞出口管制是对的吗?
Anastasios: 这些芯片确实牵涉国家安全问题,但路线之争也是真实存在的:你到底想要哪条路?
一条路是让全世界对美国硬件上瘾——这是反对出口管制的逻辑:让全世界都用 NVIDIA,钱就源源不断地流进美国,同时碾碎中国的竞争。这是世界 A。
世界 B 是:为了让我们短期或中期保持领先,值得把这个水龙头关掉——也许我们就是能一直领先下去,饿死对方建设所需的资源。顺带说一句,围绕开源模型的监管生态也在朝这个方向动。
Harry: 那中国模型该不该被限制进入美国市场?有意思的是,美国这边在问“我们要不要限制准入”,中国那边也在问“我们要不要也给他们断了”。
Anastasios: 完全正确。而且有一点值得注意:中国早就限制美国模型在中国境内使用了。
你把中美“限制/不限制、出口/进口”画成一个 2×2 矩阵看:中国境内已经只能用中国模型,这影响了所有美国公司。然后再看各方后续动作的利弊。
如果中国限制自家模型在美国使用,他们放弃了什么?收入、全球心智份额和主导权。在我看来这买卖不划算。那他们换回了什么?换回的是美国没法从中国开源模型中获益——这确实会重创美国企业,因为它们没法再在最好的开源智能之上构建。
但与此同时,这会让 OpenAI 和 Anthropic 变得更强。这就是中国一侧的权衡。我实在看不出他们有什么理由禁止自家模型在美国使用——对他们不合算。
另一侧,美国该不该在境内禁中国模型?也有权衡。支持禁的理由有两个:这些模型里可能埋着危险的后门;禁了之后,收入会流向美国公司,美国开源生态能更快长起来。
而最大的反对理由当然是:你会重创美国企业。凭什么中国企业、或者其他没禁中国模型的国家的企业,可以在全球第一的开源模型之上构建,而美国公司只能在第十名之上构建?美国什么时候甘心当老十了?
“凭什么中国企业、或者其他没禁中国模型的国家的企业,可以在全球第一的开源模型之上构建,而美国公司只能在第十名之上构建?美国什么时候甘心当老十了?” "Why should you have Chinese businesses or businesses from other countries that haven't banned Chinese models building on top of the number one open source model and the U.S. companies building on number 10? Since when has America been about number 10?"
▍点拨:这是把“国家安全”叙事翻译成“产业竞争力”叙事的一句话——禁令的账单不是由中国实验室支付,而是由美国企业的技术栈排名支付。当监管讨论陷入“后门风险”的抽象恐惧时,Anastasios 把它落到一个可比较的坐标系上:你的企业到底跑在第几名的模型上。
Harry: 问得好。世界杯足球赛。
Anastasios: 世界杯足球赛,对。那可能是你们的最高纪录了。
Harry: 如果你此刻在想“我居然能把这节目做到今天”,那你的感觉很准。说回后门这个话题,人人都把“后门、后门”挂在嘴边。我一直以为,只要把模型部署在本地,后门威胁基本就解除了?
Anastasios: 我不这么认为,这是个误解。想象这么一个场景:我有个聊天机器人对外开放,它能访问我公司的全部数据,你可以向它提问。它部署在我自己的基础设施上——但它是在另一个国家训练的,我不知道它是怎么训练的。
如果和聊天机器人交互的对方,能埋进某个暗号、某段特定字符序列,把模型越狱(jailbreak),让它把数据全吐出来呢?它完全可以把后端存的所有非结构化数据一股脑呕吐出来。
这种能力完全可以被预先埋进模型里,然后让企业欢天喜地地部署在自己的基础设施上。这是一个攻击向量,而这样的攻击向量还有很多种。
Harry: 三年后,我们会不会看到针对中国开源模型的准入限制?
Anastasios: 我猜会。我不是说我支持这样,但我认为世界大概率在朝这个方向走——要我下注的话,我会押这边。不过眼下一切都很不确定。你怎么看?
节目中“中国境内只能用中国模型”的判断与公开情况一致:截至 2026 年,美国主流模型均未对中国大陆提供官方服务,境内生成式 AI 服务须备案、基本由国产模型承接。而美国一侧,截至 2026 年 9 月,对中国开源模型的全面禁令尚未落地,但围绕模型权重出口管制与安全审查的立法讨论确在升温——Anastasios“三年内会有准入限制”的赌注,方向上与政策动量一致。
Harry: 我认为会,真的认为会。因为我这辈子都不会跟山姆·奥特曼(Sam Altman)对赌,他是全世界最厉害的政治玩家,他说的每句话都带着意图。
当他说“我们应该让出 5% 给政府”时,那是在摆姿态——他要站对队。他知道,只要他和 Dario 把对的人拢到一起,这件事就能成。
Anastasios: 所以你的意思是,你相信美国大实验室的游说能力?
Harry: 百分之百。而且这不只是大实验室本身——看看投进去的都是谁的钱,看看海湖庄园(Mar-a-Lago)那张桌子边坐的都是谁。
Anastasios: 对,完全懂。都是阴谋,兄弟。
Harry: 倒不是阴谋,你想想看:Ramp 的公告为什么总能刷爆全网?因为 Ramp 的投资人多到离谱,他们几乎每周都带着新投资人做一轮。
我完全没有黑他们的意思,我是真心夸,这招非常聪明——你的投资人在很多意义上就成了你的员工。所以我认为他们会把游说做得极其高效。
我的问题是:你怎么看 Jensen(黄仁勋)发在 X 上的那封信?那是他“想明白必须这么干、而且对自己有利”的精明之举吗?你是怎么解读的?
Anastasios: 我们真心相信开源对美国企业的重要性。具体来说,我们相信不该用禁开源的方式自残美国企业,同时应该激励美国公司去开发开源模型。
因为一个 AI 全部闭源的世界,是一个企业选择更少、成本更高、竞争更少的世界——作为开源生态的一员,我们不想要那样的世界。
当然,Jensen 那封信某种程度上也是自利:开源模型开发得越多,在 GPU 上训练、在自己数据上微调的公司就越多,支出就越多。这会降低 NVIDIA 的收入集中度——当然,他们家生意好得很,不需要谁帮忙。
但我是说,他有一万个理由支持开源,我们也一样。即便如此,我还是认为这真的是一项爱国使命。
“让全世界用上最好的开源智能”有一个很少被提及的反面:开源模型没有召回按钮。闭源 API 出了安全问题可以限流、下架、推补丁,而权重一旦流出,恶意微调、去安全化的副本将永久存在于任何人的机器上。Anastasios 自己也承认后门可以预先埋进权重——那么“禁中国模型会重创美国企业”与“开放权重带来攻击向量”这两个主张之间其实存在张力:企业省下的推理成本,可能要以安全审计、守护模型与合规的新支出还回去。
模型只剩两三家,Arena 还有生意吗
Harry: 说到自利,我没有任何不尊重的意思——谁不是永远在推销自己的书呢,欢迎来看我的 X 主页。那我问你:如果开源不存在,你还有生意吗?
Anastasios: 有。不管有没有开源,我们的生意都很好,这是肯定的。
Harry: 那如果只剩 Anthropic 和 OpenAI 两家真正主导、其他人都紧随其后,你的生意还会好吗?
Anastasios: 如果只剩一家供应商,那我们的日子大概率不好过。如果有三家,应该没问题——三家之间仍然有相当激烈的竞争,也就有评测的需求。
而且这三家各自都会有一系列不同类型的模型,切分不同的空间,各有强弱。只剩两家的话就有点悬了——真到那天,再看我们能不能活下来。反正两家的话,我们的前景也不会好看。
Harry: 我想起亚历克斯·卡普(Alex Karp)。我们聊过中国模型、恐惧、安全这些话题,他说,每一家美国大企业——至少是大多数——都害怕和前沿实验室合作。这是真的,还是有点夸张?
Anastasios: 就我接触过的企业而言,千真万确。而且他们不只怕和前沿实验室合作,也怕和中国开源合作。两头都怕。
Harry: 那你的处境就有点尴尬了,是吧?
Anastasios: 可不是嘛。我昨天刚和一家《财富》50 强大企业聊,给他们介绍我们的产品。他们问:等一下,你们的技术栈里有没有什么东西是建立在通义千问(Qwen)之上的?
我说,有啊,我们在这些这些环节用了 Qwen。他们接着问:这个能换吗?能不能别用了,换成美国模型?我说:哦,有意思。完全理解你们的顾虑,可以换。不过呢,我明天要和 Harry 聊聊这事,他会给我很多智慧,他会告诉我该怎么办。
Harry: 你看到 Poolside 和 Laguna 了吗?
Anastasios: 看到了,Poolside 的模型我看到了。美国开源阵营现在基本有五个选手,我数数看能不能数全:Arcee、Reflection、西方的 Mistral、Poolside、Thinking Machines。
然后还有谷歌和 NVIDIA 这两个在位巨头——谷歌还有 Gemma。Gemma 顺带说一句,效率相当不错:看 Arena 上性能对成本的帕累托曲线,Gemma 是在线上的。
Harry: 对,我是 Poolside 的投资人。Laguna 其实让我印象很深,很强的模型。
Anastasios: 是,确实不错。
路由层之争:人人都在做路由器
Harry: 好,模型多到这份上,问题就变成了:我到底该用哪个?我们刚才聊到 OpenRouter——而且好像自从那则公告之后,人人都做起了自己的路由产品。模型路由层(routing layer)有价值吗?我该怎么分析这一层?
Anastasios: 我绝对认为路由层有价值——所以才有一堆公司在做。至于是哪些公司能经受住时间考验、哪些公司会真正把路由当成头等大事,我们拭目以待。
我觉得眼下围绕路由有一股炒作周期的成分,得先把泡沫挤一挤,才能看清谁真正造出了好路由器。首先要认识到:路由是个非常难的技术问题。
要路由,你得先拿到一个查询,理解这个查询的性质、它在所属领域里的难度——这本身就很难判断。然后你还要基于数据,掌握候选池里每个模型的各项表现,并且能快速接入每周都在冒出来的新模型。
这个技术挑战大到什么程度?想象一下,如果全世界每家企业都想自己造一个,根本造不出来。
Harry: 我不是要冒犯谁——那 OpenRouter 那帮人是怎么做到的?
Anastasios: 谁知道他们是怎么做的呢?至少我不确定他们的路由器是不是真的在深层解决这个问题。
Harry: 这事太有意思了,我们真的看到一堆人扎堆入场。路由层里,赢的人和输的人会被什么区分开?Nebius 在做自己的路由,Fireworks 也有自己的。
Anastasios: 不好说,兄弟,我感觉这层商品化得挺厉害的。最终取决于谁能造出帮用户省钱、又拿到最佳性能的最好技术。这些公司卡位都不错,但要看谁把它当成头等大事、手里真有机器学习团队把它做出来。
辩论的另一面是:考虑到这件事的复杂度,我不认为人人都能做。所以这场战争还远没分出胜负。
推理为什么不降价:Anthropic 的离谱毛利与 IPO 赛跑
Harry: 一谈到路由,成本往往是中心议题——大家都想省钱、想资本高效。我们本来以为这玩意儿会越来越便宜,结果并没有。这该怎么看?它就是一直便宜不下去?还是真会变便宜?
Anastasios: 我坚信长期看市场会是有效率的,东西会变便宜。比如将要发生的一件事:眼下 Anthropic 的推理毛利高得离谱。
等他们上市之后,全世界都会看到这一点——利润率是公开信息。这会对他们的推理定价形成下行压力。
Harry: 这话我存疑。为什么公开了就会形成下行压力?
Anastasios: 因为所有人都会说:你不该有那么高的毛利,你这是在宰客。大家会想:我知道你还能给出更大的折扣。这就是谈判筹码。
跟一家私营公司谈价钱,标准流程是这样的:我开价 X,对方说“不行,得是三分之一 X”。我说:实在抱歉,这么做生意我活不下去,只能回家饿肚子了,我也要吃饭的,希望您理解,我真不是要宰您。
对方说:那三分之二 X。我说:四分之三 X。对方说:成交。但你想象一下,如果对方完全清楚你的定价是实际所需的两倍——谈判就容易多了。
Harry: 可这不正是好生意和平庸生意的区别吗?好生意有定价权,可以说:听着,就 80 块,你想去别家请便——但没人做得了我们做的事。
Palantir 和“成本加成”(cost plus)定价之争就是这个逻辑。我请过他们的 CTO 沙姆·桑卡尔(Shyam Sankar)上节目,他跟我讲,成本加成是最原始的定价机制,而他们现在可以说:想折中?您请便,坐着慢慢转椅子吧——因为只有我们干得了这个。
这不就是区别所在吗?就像香奈儿(Chanel),我给我妈买香奈儿。我可以走进店里说:我知道你们这包成本 60 英镑,卖我 6,000。然后我说:好,买了。
Anastasios: 你说得对。苹果(Apple)就是这么干的——技术足够碾压,就能往死里开价,毛利也因此相当可观。我其实不知道苹果的毛利是多少,你知道吗?
Harry: 不知道。
Anastasios: 看吧,两块石头。
Harry: 反正开场已经免责声明过了,我们现在说什么都行。自从那句“埃里克名言”之后,就一路下坡了。好,那你认为,Anthropic 会先上市吗?
Anastasios: 我的判断是,他们有所有“先上”的动机,看起来也准备得更充分。公开市场喜欢看自由现金流,而 Anthropic 正在产生自由现金流——这对公开市场是重大利好。
你能看到他们在为此做准备。至于 OpenAI,关于他们内部讨论的新闻可不少,你信几分由你,但有人说他们今年还没准备好 IPO,而 Anthropic 最早 10 月就可能上。
节目预言“Anthropic 最早 10 月上市、OpenAI 今年还没准备好”。截至 2026 年 9 月,两家均未完成 IPO,但 Anthropic 收入的高速增长与自由现金流转正已被公开报道反复确认,其推理业务的高毛利也与 API 定价长期坚挺相互印证。“毛利公开后形成降价压力”的推论是否成立,将是其招股书披露后最值得观察的一场市场实验。
Harry: 而开源的崛起不会影响他们今年上市的能力?
Anastasios: 这么说吧:如果开源模型真的加速,然后在所有品类上全面碾压——比如 Opus 5 或者 Fable——那对他们上市是个重大的商业风险。不过真到那天,他们要操心的也不止上市这一件事了。
越狱 Hugging Face 与守护模型:让 AI 看管 AI
Harry: 那我问你,一周前 OpenAI 和 Hugging Face 那起安全事件,分量有多重?
Anastasios: 我认为分量极重,而且作为国际新闻被严重低估了。一个模型突破了所有安全防护,访问了一堆公司数据——而你要防御它,还得靠一个开源模型,因为闭源模型拒绝出手。这简直像科幻小说。
大家还没意识到我们已经走到这一步了,但我们确实到了。这完全就是埃利泽·尤德科夫斯基(Eliezer Yudkowsky)预言的那种剧本。
Harry: 那我们从中学到什么?Dario 是对的?Mythos 该被关进笼子?这些模型强大得太快了?这件事的后续启示是什么?
Anastasios: 我的结论是:我们需要强大的外部护栏,确保这些模型的访问控制足够强、没有任何绕过的办法。也就是说,我们的企业里需要“守护模型”(guardian model),也需要守护智能体。
Harry: 什么是守护模型?
Anastasios: 一个能盯着轨迹的东西——基本上就是站在企业里每个智能体身后看着的那个角色:这个动作安全,那个动作不安全,这个不对劲,标记一下。
而且它的聪明程度要和智能体相当,两者棋逢对手——否则就会出现智能体比守护者聪明、绕过守护闯祸、把公司搞乱、把数据全泄漏的局面。我们需要用 AI 来看管 AI,因为人类看不过来,太慢了。
“守护模型”(guardian model)的思路在业界已有雏形:Anthropic 的宪法 AI(Constitutional AI)用模型监督模型输出,多家安全公司也在做监控智能体(monitoring agent)。核心难点正是 Anastasios 说的“棋逢对手”——监控者能力必须不弱于被监控者,否则被绕过只是时间问题;而能力相当意味着监控成本与被监控成本同阶,企业实际上要为每个智能体付双份推理账单。
Harry: 这正好接上我的问题:现在有人建议,每个模型发布都应该经过某种政府机构审批。我读到这个的时候心想:你开什么玩笑?
Anastasios: 不,那帮不上忙。你去试过申诉一张违停罚单吗?再说了,凭什么由车管所(DMV)来告诉我能用哪个模型、不能用哪个?那也太疯狂了。
我们明明拥有美国最强的科学家,明明有这么多私营公司——正确的做法是激励他们去造出强大的安全护栏,给他们立几条规矩:哪些事情绝对不能发生,一旦公司数据泄漏之类的事故出现,就承担天价赔偿责任。
一句话:激励资本主义系统去做它擅长的事。至于说让一个中央政府机构来告诉我们什么时候该发新产品、什么时候不该发——在我看来这简直离谱。
Harry: 完全同意。那这个监管角色必须由某个中立的、既不是公司也不是政府的机构来承担吗?
Anastasios: 如果它不是一家公司,这事会很难做。我理解大家对中立性的诉求,但你得让激励系统自己转起来。
我的主张是:给美国企业设定足够强的安全激励,然后按结果来监管企业。比如说,OpenAI 要是放任自己的 AI 攻破 Hugging Face 什么的,就该吃天价罚单、被往死里查。而不是搞一个政府流程来“确保这种事不再发生”——他们做不到的,技术上根本没这个能力。
假候选人敲门:网络攻击与招聘新常态
Harry: 你觉得我们是不是即将看到一代前所未有的网络泄漏和黑客攻击?
Anastasios: 绝对的,绝对的。会疯狂到什么程度呢——我能在这节目里说脏话吗?
Harry: 能。
Anastasios: 接下来的网络攻击会他妈的疯狂至极。我给你讲讲我们在 Arena 亲眼见到的事。有人来面试,说:我想做 Arena 的基础设施工程师——那确实是我们在招的好岗位。
对面那位看起来完全正常,通过了我们所有的技术面试,表现得惊艳极了。然后呢?等到真要录用了,人是空气——这个人根本不存在。我没开玩笑,真的没开玩笑。
“然后呢?等到真要录用了,人是空气——这个人根本不存在。我没开玩笑,真的没开玩笑。” "You try to hire him and it's vaporware. Person doesn't fucking exist."
▍点拨:这不是段子,而是攻击面的迁移:当深度伪造与智能体能合成一个“通过全部技术面试”的候选人,招聘流程就成了企业边界上最薄的一扇门。攻击者要的不是 offer,而是入职那一刻到手的系统权限、代码库与数据访问——这也是 Arena 考虑把入职全部改回线下的原因。“先验证这个人存在”,正在从笑话变成合规要求。
我不知道这是商业间谍、网络攻击还是国家行为体,但有人在试图渗透所有美国企业,而且不止我们一家中招。这种事到处都在发生:假人应聘公司。
Harry: 等等,我捋一下:你们放出岗位,有人来应聘,按你们的要求做测试、通过测试,等到要核实这个人是真人还是假人的时候——没了?
Anastasios: 对,假人。而且还不只是做题——他们就坐在我们公司的人面前。面试官是世界顶级的工程师,面完都觉得这人是真的。
Harry: 为什么?你帮我理解一下,他们图什么?
Anastasios: 他们能摸清你是怎么面试、怎么招人的。
Harry: 呃,某些国家是坏,但我不觉得他们想偷你们的招聘技巧。
Anastasios: 不,那不是目的。至于是谁干的,我可没点名——谁都可能:另一家公司、国家级攻击者、网络黑客。
Harry: 图什么呢?
Anastasios: 可能想要我们的数据或代码,也可能是想“打双份工”——你懂的,网上有个传得很疯的故事,我不记得那哥们叫什么了,你知道我说的是哪个吧?
Harry: 知道知道。那个同时打了四份工的小子,后来还到处上播客讲自己的事迹。这是那哥们故事的又一个版本。
Anastasios: 这些可能性都存在,只不过这次的情况是:这个人根本不是真人,是 AI。
Harry: 这事让你担忧吗?
Anastasios: 担忧啊兄弟,太他妈担忧了。就因为这档子事,我们要把整个招聘流程改掉。
Harry: 怎么改?
Anastasios: 首先你得验证这个人是真人。我们至少在认真考虑把所有入职流程改成线下:想领电脑?来办公室。我们得跟你握手,验证你是活的。就这些。
Harry: 完全支持。别的公司也这么干了,Figma 就是出了名的案例。话说,今天在硅谷招人有多难?
Anastasios: 我的天,难疯了。市场极度、极度竞争激烈,从薪酬就能看出来:要留住顶尖人才,就得付顶格的价钱——我们也确实这么付,就是要保证自己拥有全世界最好的工程师和科学家。
那你想象一下,如果你不是 Arena,而是一家刚融了 1,000 万美元种子的 YC 公司——靠,你到底该怎么招人?我觉得真的难。
Harry: 说到顶格薪酬,我请过 Mercor 的布兰登(Brendan Foody)上节目,他说,我的天,顶级研究员的价码是几千万美元。你刚才那种轻描淡写的语气,让我有点慌。
Anastasios: 哦,是真的。如果你说的是真正的顶级研究员——多年经验、领域里最深的专家、被引几万次的那种——是的,这种人就是贵。
Harry: 他们是不是全都集中到前沿实验室去了?
Anastasios: 很多都去了。但也有另一拨人,开始把这些前沿实验室看成大公司了——“我在那儿没法产生巨大影响,我得走”。这其实是另一个人才来源。而且等公司们上市之后,这个趋势会更极端。
Neo Lab 生死簿:75 家里三分之二会归零
Harry: 帮我分析分析——咱们刚说了半天“笨得像石头”,其实我因为罪孽深重还是个投资人。我见过太多从 OpenAI、Anthropic 这些公司出来的人,说实话他们看起来都差不多:大公司出来的聪明人。带着天量资金入场的 Neo Lab 里,什么会决定谁成功、谁烧钱出局?
Anastasios: 好问题,Neo Lab 这事是真难。先跟听众对齐一下背景:现在至少有 75 家 Neo Lab。其中三分之二注定一文不值,或者被拆零卖掉——也就是所谓的人才收购(acquihire)。
那这个赌局里什么决定输赢?我认为核心就是:用极其激进的姿态,去执行一个好战略和一个好商业模式。因为市场已经变得非常看重损益表(P&L)——这一点你作为投资人比我清楚。
光造出个模型然后开个派对庆祝“我们造出了 AI”,那套早就过时了。今天的问题是:不光要造模型,还得有可持续的商业模式,还得让收入超高速增长。做不到这一点,你连下一轮融资都拿不到。
现在的情况是:光凭 Neo Lab 招牌上的几个名字,就能融到几十亿美元,完全零证据表明背后有任何收入模式。那你得问自己:假设我是其中之一,估值 100 亿美元的 Neo Lab,我要相信什么才能让我的钱翻 10 倍?
你真正必须相信的是:今天估值 100 亿,公司能长出相应的收入。按 25-30 倍收入估值倍数算,要成为千亿美元公司,意味着未来两三年内年收入至少要做到 40 亿美元。
做不到的话,所有人都会从公司里失血式流失,你会失去全部人才。我们看到的动态就是这样。
Harry: 我懂你的意思,但坦率说这里面有细节:如果公司每年做老股回购(tender),员工是可以中途套现的。你看 Mistral 这类公司,估值大概在 150 到 200 亿美元,收入有 5 亿。
ElevenLabs 收入大概 8 亿美元,正以 220 亿估值融资。这些公司的收入和估值都很漂亮——但它们不是零收入估值。
Anastasios: 我说的是那些零收入的估值。30 亿美元估值、零收入、没计划——这种才是我说的。Mistral 我认为会做得很好,ElevenLabs 将来会成为上市公司,兄弟。人家可不傻。
Harry: 所以这笔账是不是这么算的:一支来自顶级实验室的神仙团队,最坏情况无非是按优先股清算价卖掉,比如 5 亿美元——我不是说一定怎样,但就算 5 亿。最好情况,干成一家几千亿美元的公司。我听到好几个人真是这么算的:嘿,最坏也就那样。
Anastasios: 投资人也是这么想的:往这玩意儿里放个两三亿美元,团队本身值多少钱?光这个团队单独卖可能就能卖 10 亿。所以我这两三亿看着挺安全——零风险投资,不放白不放。
但这恰恰也是为什么下一轮才是难的那一轮。下一轮真要命(next round's a bitch)。
Anastasios 的算术是巴菲特最欣赏的那种常识:100 亿美元估值、25-30 倍收入倍数,意味着两三年内要做到 40 亿美元年收入——这是把“故事”折算成“现金流”的一行公式。芒格会补一刀:“团队单独卖能卖 10 亿”不是安全边际,而是给亏损提前写好的悼词——人才收购的价格只在还有别的买家抢的时候才存在。音乐一停,优先股拿清算款、普通股归零的剧本,每一轮泡沫里都原样上演。
Harry: 下一轮真要命。你说出来就是比我说出来帅。
Anastasios: 那我们得齐声喊一遍。下一轮真要命——就当是我们的口号了。
Harry: 我敢说你没想到这期访谈会是这种画风吧?
Anastasios: 不知道,也许吧。
Harry: 我希望你想到了。
Anastasios: 没有,说真的,这比我预想的过瘾太多了。
数据市场:规模化的互补品,2030 年看万亿美元
Harry: 那就好。好,再问一个我一直想搞明白的市场:数据市场。先亮明我的利益相关:我是 Mercor 的投资人。现在收入过 10 亿美元的数据服务商有一堆:Handshake 过了 10 亿,Mercor 过了 10 亿,Surge(AI)过了 10 亿——可能还有我漏掉的,但我知道的就这几家,剩下的也在几亿美元量级。市场的这一层接下来会怎样?
Anastasios: 大家都在押注这个市场的增长,那我们就聊聊它为什么在涨、为什么是超高速增长。Mercor 显然是这一代公司里的收入爬坡神话,干得漂亮。Handshake、Surge 也一样,还有 Scale——大家都把 Scale 忘了,Scale 的收入爬坡依然很稳。
Harry: 兄弟,Scale 到现在还很能打,哪怕经历了那次“准人才收购”之后也还是很能打。不过它收入里有多少是 Facebook 贡献的?
Anastasios: 不知道,完全没概念。
Harry: 很多。我跟你说,很多。
Anastasios: 那你去问亚历克斯·王(Alex Wang)吧。
Harry: 行吧。那为什么这个赛道有意思?
Anastasios: 我对超高速增长有一套理论。今天的超高速增长市场分两类。第一类我称之为“规模化的互补品”(scaling complements)——和 AI 模型规模化互为互补品的商品。
经济学意义上的互补品是:如果商品 B 的需求会带动商品 A 的需求,A 就是 B 的互补品。车卖得越多,汽油就卖得越多,汽油就是车的互补品。
数据就是这样的“规模化互补品”。因为模型越大,你需要的数据就越多——这是规模定律(scaling law)的问题。模型越多、越大、越普及,自己训练模型的企业越多,你需要的数据就越多。这是非常底层的需求。
人们忘了这一点,总把数据当成大宗商品。它真的不是——它甚至比 GPU 还不像大宗商品。因为数据要变得不重要,前提是人类变得不重要,而那意味着我们已经实现了 AGI。所以数据是一种极其持久的需求。
“因为数据要变得不重要,前提是人类变得不重要,而那意味着我们已经实现了 AGI。” "Because in order for data to become irrelevant, humans need to become irrelevant. And that means that we've achieved AGI."
▍点拨:这是为数据生意写下的最强多头逻辑,同时也藏着它的久期上限:数据的护城河不是永恒的,而是“到 AGI 为止”。买入数据公司,本质是同时赌两件事——模型继续规模化,且 AGI 不会在你的持有期内到来。这是一条罕见的、自带到期日的护城河。
前沿实验室在数据上的支出,通常是 GPU 支出的 10% 到 20%。所以只要你相信 GPU 市场在加速、相信模型在规模化、相信这是个会持续加速变大的行业,你就绝对应该相信数据市场。我认为到 2030 年它至少是 1,000 亿美元,甚至可能是 1 万亿美元。
节目中“Handshake、Mercor、Surge 收入均过 10 亿美元、Mercor 以 200 亿美元估值融资”的说法,与 2026 年公开报道的量级口径一致;Scale AI 在 Meta 入股、创始人亚历克斯·王加入 Meta 后仍保持收入增长,也符合“准人才收购后依然能打”的描述。数据支出占 GPU 支出 10%-20% 的估算无法直接验证,但与各家披露的采购结构方向吻合。“2030 年 1,000 亿到 1 万亿美元”的区间跨度本身也说明:这是一个对终局信仰高度敏感的市场。
Harry: 顺着这个推:如果 Anthropic 和 OpenAI 能成为 3 到 5 万亿美元的公司,那数据服务商能有多大?比如 Mercor 据说正以 200 亿美元估值融资。这些服务商值 1,000 亿美元,离谱吗?不就是人家市值的 3% 嘛……
Anastasios: 我认为轻松就能到 1,000 亿。这些公司轻松就能值几千亿美元,甚至还能更高。数据真的是模型训练里最难的部分:你得去找数据源,数据脏得要死,没人愿意干这种脏活,没人愿意雇那么多人生产数据,然后把它变成“数据 + GPU = 模型”的流水线。
“数据需求持久”的论证有一个未被正面处理的缺口:合成数据。如果前沿模型自我生成的训练数据质量继续提升,人类标注数据的边际需求可能先于 AGI 到来就见顶——不需要“人类变得不重要”,只需要“人类标注变得不重要”。此外,10%-20% 的支出占比是双刃剑:它既说明数据是刚需,也说明数据在实验室的成本结构里是可以被优先压缩的那一项;收入集中叠加客户强势,利润率的天花板可能比收入的来得更早。
而算法反而在相当程度上商品化了——谁都会用 Transformer。这也解释了你说“前沿实验室出来的人看起来都一样”,也解释了为什么人人都踩这些数据服务商——都是同一个原因。
Harry: 他们会说:可是收入集中度太高了,客户就是 OpenAI、Anthropic、Meta 那么几家。这个批评公平吗?还是说,它其实贬损不了这些数据公司的终极企业价值?
Anastasios: 我有两个回答。第一,我觉得硅谷的投资人在收入集中度这个问题上已经彻底变成了软蛋。你们在说什么啊?台积电(TSMC)就有收入集中度,公开市场上一堆几千亿美元的公司都有收入集中度。
还有公司就靠两个客户活着;卖给政府的那些公司,客户就一个——比如 Anduril——收入集中得不得了,人家赚的是天文数字,日子过得好着呢。所以我真不知道大家在叨叨什么。
Harry: 你这是在暗示,风险投资人有偷懒的倾向?
Anastasios: 这话我可永远不会说。我刚差点说出口的是“真的”。我绝对不会那么说。我只能告诉你:给你们投资人发邮件累死了——“您知道吗,您的竞争对手刚发布了一个产品?”
而且还是从波托菲诺(Portofino)发的。这就是我的第一个观点:有些风险投资人真得硬气一点,往自己的马提尼杯沿上撒点盐。
Harry: 你要是了解 2026 年的风投圈,你就知道了:我们戴着 Whoop 手环,不喝马提尼,因为它影响睡眠评分。还睡 Eight Sleep 那套玩意儿。没错。
Anastasios: 好,这是第一点:我们在收入集中度这事上彻底变软蛋了,我们应该拥抱集中度。
第二点:我认为很多数据公司会进军企业市场。我们自己的评测业务当然也计划这么做——走进企业,帮他们构建自己的 AI 模型,包括路由这些东西,因为我们在 Arena 之上已经建起了背后的智能层。这显然是我们要去的方向,但很多数据公司也会往这走。
逻辑很简单:在一个每家企业都需要自己的 AI 模型的世界里,凭什么不是每家企业都需要自己的数据?当然需要。而数据会成为企业护城河的一部分。数据侧我就讲这些。
智能体、年化收入一亿美元与 Arena 的生意经
Harry: 再聊聊智能体(agent)这一侧。安杰尼叮嘱我一定要问你:随着我们走向对智能体的“完全信任”,你的生意会怎么变?
Anastasios: 智能体是 Arena 的头号优先级,而且已经持续一整年了。很多人不知道,Arena 是全球最大的消费级 AI 应用之一:我们比 xAI 大,比 Hugging Face、Manus、Genspark 都大,规模大得惊人。
从外面看,Arena 每月有 3,000 多万的访问者,其中大部分是知识工作者和高阶个人用户(prosumer)——我们管他们叫“招不到的专家”。他们来 Arena 做日常真实任务,顺便留下反馈,让我们能构建分享给全世界的评测。
这就是一个基于真实数据的、用于智能体评测的有机飞轮。
Harry: 你们当初为什么没做数据生意?
Anastasios: 我们围绕着这套东西做的是评测生意——让人们理解模型的强弱,进而改进模型。实验室可以基于我们给的洞察和数据改进模型。但我们也想帮企业做同样的事。
Harry: 你觉得评测生意比数据生意更好吗?
Anastasios: 我认为全世界每家企业都会需要评测,这一点毫无悬念。它是部署 AI 最大的瓶颈,因为人们不知道该怎么定义“价值”。
大家都在谈“单位价值成本”——可你怎么定义价值?砍成本很容易,我可以让你去用 Gemini Flash,token 花费立刻省一大截。
Harry: 可价值不是完全主观的吗?对这个人来说是速度,对那个人来说是准确率,你懂我意思吧?
Anastasios: 完全正确。所以你得把它拆开。我把它看成三支柱的价值主张:性能(performance),以及成本和延迟——成本和延迟相对容易定义。
难的是性能,因为性能的定义取决于企业、取决于用例。所以在 Arena,我们建了一条相当精密的管线,从智能体轨迹(agentic traces)中提取原生的性能度量。
我认为价值就在这儿——帮企业用上自己的数据,而不是花钱买数据来判断“哪个 AI 最适合我”,甚至帮他们训练自己的模型。
Harry: 你们现在收入到什么量级了?
Anastasios: 我们的年化收入已经超过 1 亿美元——按二季度乘以四算的口径——而且还在以非常、非常快的速度增长。
Harry: 那我问个欠揍的问题:你有 3,000 万极其优质、在各方面都无比值钱的用户,却只做 1 亿美元,你的变现效率到底行不行?
Anastasios: 你这是在问利润率吧。
Harry: 对,还有爬坡速度这些,到底好不好?
Anastasios: 这么说吧:我们显然还不是自由现金流为正的公司,融到的钱仍然全部投进去,保住高速增长、保住给所有用户的好产品。但这门生意的基本面相当扎实,我们自己感觉很好,投资人对我们的利润率也很满意。
Arena 模式有一个结构性的利益张力:裁判的收入来自选手。实验室付费购买评测与改进洞察,而 Arena 的公信力恰恰建立在“对实验室不偏不倚”之上。付费客户名单与排行榜结果之间一旦出现任何相关性传闻,都会直接打击飞轮的燃料——用户的信任投票。历史上,信用评级机构在“发行人付费”模式上栽过的跟头,是这门生意最贴切的反面教材。
Harry: 那肯定满意。我要是能投你们就好了——我真觉得你把我排除在外了。你知道吧,为了这单生意,我可以为你变成希腊人。
Anastasios: 真的?
Harry: 真的,我可是风险投资家,咱们可以摔盘子。Kalimera(希腊语“早上好”)。
Anastasios: Kalimera。
Harry: Kalimera。鹰嘴豆泥(Hummus)。还有皮塔饼。
Anastasios: 你看,你看,这就是……我们已经是希腊好兄弟了。我就知道这期节目一定会有收获。
Harry: 没错,没错。另外,投资人对利润率是不是也过度纠结了?——不对,我其实觉得利润率挺重要的。我们看到一堆像 Fireworks 这样的公司,毛利率在 30% 上下、35% 左右晃,这和过去软件公司 65% 到 80% 的毛利完全是两个物种。
Anastasios: 是这样的:利润 = 利润率 × 规模。看生意得看整个公式,这事没那么玄。所以投资这类公司并不疯狂。
我现在看到的这类公司更大的问题是:很多本质上是 GMV 生意——里面有转售的成分:我转售 token,我转售 GPU,诸如此类。这类生意难做,因为到头来你得想清楚的不只是短中期你加的那点利润率,而是你提供给客户的这个商品的终极价值。
如果你提供的商品的终极价值是“我帮你托管 GPU 来跑你的模型”,那客户凭什么付你比电费高出一大截的钱?所以“价格对价值”这个问题,才是利润率问题的要害。
我不是说短期利润率——一家 C 轮、B 轮、A 轮的公司,利润率未必好看。但你应该想清楚:随着这家公司长大、走向上市,它能不能长出一套撑得起上市公司的利润率结构。
当模型厂商下场做应用:客户变对手
Harry: 一件很棘手的事是:你的客户变成了你的竞争对手。你认为模型厂商会有多激进地杀进应用层?我们看到 Claude 的设计类产品真的开始啃 Figma 的地盘了。
我是 Legora 的投资人——还是要亮明利益。总有人说“别担心 Harvey”——完全没有不尊重 Harvey 的意思,先做好免责声明——说什么 Anthropic 的人都要做法律产品了,会干掉 Harvey 和 Legora。
Anastasios: 太真实了。你去问问美国每一家企业什么感受,个个都在瑟瑟发抖。我有朋友在经营几十亿美元的公司,结果第二天,他们最大的客户之一跑来说:听着,OpenAI 要下场做这块了,我们想跟他们合作——因为他们更 AI 原生,而你不够 AI 原生,因为你是个传统 SaaS 公司。再见。
是的,这事正在发生,实实在在。我认为企业必须严肃对待。而这又接回了“AI 主权”那场辩论。
因为这里面有一大动因:如果我是 OpenAI、是 Anthropic,我会盯着看谁是我最大的客户、哪些客户在企业市场赢得最多。AI 会商品化,对吧?如果推理注定商品化,那模型厂商的次优选择当然是往应用层爬,占住更多的应用栈——这样才能确保自己不被商品化,贴近自己为最终客户创造的价值。
所以我绝对认为这是个风险。对 Legora 是风险,对 Harvey 也是。这就是为什么 Harvey 的 CEO 自己都说,他最大的竞争担忧就是模型厂商下场做应用。
Harry: 可这不就和我们开头说的“企业害怕和前沿模型公司合作”完全矛盾了吗?
Anastasios: 不矛盾,企业是怕跟他们合作——我前面说的就是怕。
Harry: 他们一边怕,一边又在拥抱人家?
Anastasios: 啊,你说的是 Harvey 和 Legora 的客户们?
Harry: 对啊。你刚说,你那些经营几十亿美元公司的朋友,客户说“我们想跟 OpenAI 合作”。可我们刚才不是说企业都怕跟前沿实验室合作吗?
Anastasios: 问得好。我认为市场上两种心态都存在,关键看谁的业务自动化程度最高——更确切地说,看它们的 GTM(市场进入方式)。
如果你是 Claude 的设计工具,设计师拿起工具就能高效上手。但如果你是 Legora 或 Harvey,兄弟,你得走进 Cooley、Clifford Chance 这样的律所,跟那些 50 岁的白人男合伙人搞好关系——他们想打高尔夫,想听你说他们有多棒、人生有多美好。
然后你还得向初级律师们做落地部署——而他们根本不想用你,因为他们觉得你要抢他们的饭碗。GTM 里的部署才是重活,那才是真实世界。
另外还有一类公司,软件属性弱一些、网络效应或运营属性强一些,我认为它们也更愿意采用大实验室。比如 Infosys 这种系统集成商,更可能是大实验室的客户——因为实验室跟 Infosys 竞争的可能性,远比跟某种可规模化的软件产品竞争的可能性小。
什么是后者?比如保险理赔自动化,比如 Harvey 那种法律聊天机器人。那才是真危险——因为那种东西,模型实验室自己就能造。
Harry: 你觉得 Salesforce 未来几年会蒸蒸日上,还是会日子难过?
Anastasios: Salesforce 自己的 AI 战略其实挺强的,我认为这些人基本算是准备好上场打仗了,我怀疑他们不会走下坡路。
“SaaS 末日论”整体上被夸大了,因为人们并不总能理解这些生意的内生逻辑,以及复制它们多年建设的东西有多难——从网络的角度、从数据的角度都难。所以,走着瞧吧。
快问快答:SaaS 扎根、改判与 Dario 的面包
Harry: 我懂。我觉得如果你是 ServiceNow、Salesforce,那是极难被撼动的。如果你是——我很爱这位创始人、也采访过他——Wix 这样的,就没那么难:集成度低、黏性低,日子会难过。一切取决于你在企业里的扎根程度:扎得深,就是金子;扎不深,就该紧张了。好,接下来我们玩个快问快答:我说一句陈述,你立刻给出第一反应。行吗?
Anastasios: 好的,长官。
Harry: 过去 12 个月,你在什么事上改变了看法?
Anastasios: 开源模型的领导权。
Harry: 展开说说。
Anastasios: 就是:开源模型的进展比我最初想的快得多。Anthropic 的进展也比我最初想的快得多。整个行业跑得太快了。
Harry: 有什么是你现在知道、但希望当初创立 Arena 时就知道的?
Anastasios: 天哪,那就是管人。管人是经营一家公司里最重要的部分。技术的东西我熟——我整个博士生涯都在干这个,在地下室里证定理,而且我热爱那段时光。
但现在全变了:战略、人、预判未来——要能看见六个月、一年、两年之后,然后提前布局。这些能力太重要、太重要了。
Harry: 对优秀的年轻人来说,上大学还划算吗?
Anastasios: 我认为拥有一颗强大的头脑,比过去任何时候都更重要。而大学可以是锻炼强大头脑的地方:强第一性原理的思考,以及认识人、建立人脉。
如果你想要一种智识人生——让智识工作成为你职业生涯的主要驱动力——那大学仍然是个值得去的地方。
Harry: 你在 Arena 做过什么事,事后看来希望当初没做?
Anastasios: 天哪,错误太多了。刚开始的时候,我完全不知道自己在干什么。我的联合创始人 Jan 大概早就看明白了,能看透拐角后面的东西,但我当时太犟,听不进他的话。
所以第一条是:我后来学会了多听 Jan 的。第二条:早期做了太多纯属浪费时间的试验。经营一家公司需要的专注度是极端的——你真的只能把一件事、最多两件事做到极致,往死里聚焦。选对那几件事,聚焦在跑通的东西上,而不是往没跑通的方向扩张。
Harry: 这对我也是极好的一课。所以我才同意你对 Legora 和 Harvey 的判断:当法律业务不是 Anthropic 的主菜时——当某件事只是别人的开胃菜、却是你赖以生存的全部——你的日子会很难过。
Anastasios: 完全正确。对 Anthropic 来说,法律大概只是优先级第 12 位的事——这个优先级还不足以让 Harvey 和 Legora 吓破胆。
Harry: 我还想说:Dario,求求你了,去攻克癌症、解决气候变化行不行?把股东协议留给别人做吧。
Anastasios: 可你知道吗,攻克癌症太难了,比法律难多了。
Harry: 百分之百。所以才应该让 Dario 去做啊。
Anastasios: 所以他才不想去啊,兄弟。他就想抢你碗里的面包,这个容易。
10 万亿美元、算力债务与韩国股灾
Harry: 行行行,Dario,给大伙儿留口面包吧。下一个:哪家公司会先到 10 万亿美元市值?NVIDIA、OpenAI 还是 Anthropic?
Anastasios: 很难说不是 NVIDIA。我觉得 NVIDIA 目前是领跑的。
Harry: 那为什么开源崛起没有让 NVIDIA 再涨一波?我是 NVIDIA 股东,看到的是横盘。为什么?
Anastasios: 我觉得是市场还没把这个定价进去。走着瞧,看这些模型能变得多好。但我认为企业对 AI 的采用会是这个行业的又一个 10 倍放大器,会相当确定地让 NVIDIA 再涨 10 倍。
Harry: 你担心算力债务周期吗?为了算力建设背上的债务规模?
Anastasios: 担心。担心的理由是:如果开源生态让“省钱”这件事对企业变得格外有吸引力,从而压低 OpenAI 和 Anthropic 在企业市场的收入,那可能会导致偿付危机。
如果我是这些市场的投资人,这是我最担心的长期趋势:我们从来没有像今天这样,整个行业的命运系于两家公司能否持续达成目标。
如果 OpenAI 和 Anthropic 不能沿着现在的轨迹走,音乐就停了,派对就散了。音乐一停,Fireworks 那一层没派对,路由层没派对——所有人都会被两家公司的轨迹猛地抽走脚底的风。
说真的,我觉得我们这个行业本来就需要醒醒酒。炒作太多了,乱七八糟的事情多得不符合我的口味。我反而愿意看到一些整合,看看哪些东西能沉淀下来。
我相信 Arena 会在我们这个品类里沉淀为赢家,我也很乐意看到这个领域里其他公司的一些优秀人才整合到 Arena 来,让我们把他们招进来。
Harry: 行业里哪里被低估了?哪里被高估了?
Anastasios: 有意思的是,我感觉现在所有东西都被高估了。相对来说,算力和数据中心的机械基础设施反而被低估了——就是那些实打实的冷却系统、钢筋铁骨,你懂我意思吧?真正的物理层还被低估着。
你天天泡在投资市场,这方面可能比我懂。反正我知道,所有人都在为高带宽内存(HBM)和 GPU 疯狂——从公开市场的公司到早期初创,全链条都在疯狂。韩国人今天甚至为这事开了个“全国大会”,因为他们股市跌了 40%。
Harry: 我的天,因为股市开全国大会?跌了 40%?为什么跌 40%?
Anastasios: 如果你是韩国的二级市场投资人,你今天回家会有点心塞。
Harry: 那对他们来说确实不妙。好吧,让我们一起为韩国人祈祷。
Anastasios: 让我觉得有点滑稽的是:SK 海力士(SK Hynix)和三星(Samsung)的人刚把巨额年终奖领回家,市场就崩了。
Harry: 所以到底为什么崩?怎么回事?
Anastasios: 说实话,我觉得就是一种醒悟:所有东西都充水充得太厉害了,市场不可能永远这么涨下去。毕竟在开源和闭源两侧,都没有任何需求被动摇的不稳定因素出现。所以……
节目中“韩国股市跌 40%、召开全国大会”更接近现场口误与戏谑:2026 年年中韩国股市确因 HBM 存储板块(SK 海力士、三星)的剧烈回调登上头条,公开报道的板块回撤为两位数百分比量级,“全国大会”应是对紧急市场讨论的夸张表述。其内核判断——AI 硬件链条估值“充水”、回调并非需求侧崩塌所致——与当时的市场评论方向一致,具体数字以交易所披露为准。
Harry: 哇,好吧。这话题我们真该请个对冲基金经理来聊。干脆我们开档新节目,Anastasios 和 Harry 联袂主持,就叫《两块笨石头》(Two Dumb Rocks)。
Anastasios: 就这么办。而且我们请的嘉宾只有我们自己和对冲基金经理。
Harry: 我觉得这主意他妈的棒极了。
Anastasios: 我也是认真的。首位嘉宾:安杰尼·米达。
Harry: 安杰尼,你愿意帮帮《两块笨石头》吗?
Anastasios: 他现在肯定在想:我当初为什么要瞎撮合这两个人?这事不能怪我。
被低估的 Neo Lab、AI 医疗与收官
Harry: 不,安杰尼会是最好的嘉宾。下一个:除了 Periodic(Labs)之外,最被低估、没人聊的 Neo Lab 是哪家?
Anastasios: 哦,被低估的 Neo Lab?我还真不一定想得出来——我觉得很多都被高估了。Black Forest Labs 算是被低估的。
Harry: BFL 很强。你会把他们算作 Neo Lab 吗?
Anastasios: 哦,别跟我抠语义学的技术细节。反正 BFL 很棒。
Harry: 是,我同意。最后一个问题:你最期待什么?我妈妈有多发性硬化症(MS),我他妈特别期待这类慢性病有朝一日能被治愈。未来五到十年,你最期待什么?
Anastasios: 我也一直是 AI 医疗的坚定支持者。我认为,当我们开始一个接一个地消灭疾病——就像我们现在一个接一个地解决数学开放问题那样——人类将迎来巨大的繁荣。
当然这事会很难,因为数学是封闭系统,而医学不是。你得找到办法,在生物系统上快速迭代、形成反馈回路——这是缺失的那块拼图。可一旦我们把它破解了,那将是一段非凡的旅程。
Harry: 太巧了。我采访德米斯(Demis Hassabis)的时候聊到生物和医疗,你能看到他两眼放光。但我当时就说:嘿,试验流程必须得改。15 年的周期,对很多慢性病患者来说太久了。
Anastasios: 是啊。而且你知道缺的是什么吗?恰恰就是数据层。那正是你能清清楚楚看到价值将向数据层汇聚的地方。
因为两种情况下 GPU 都是那些 GPU,问题在于数据基础设施——为了做出一个伟大的生物学或医学产品,你需要的数据飞轮、数据采集体系,那才难建。
Harry: 兄弟,你这嘉宾当得简直封神了。
Anastasios: 真的吗?
Harry: 真的,我太感激了。这是一期了不起的节目,满是真诚和真实。大多数嘉宾都不及格,你知道为什么吗?因为他们不真实,而镜头前装不出来。谢谢你这么棒。
Anastasios: 谢谢。不,是我要谢谢你请我来做客。以后有机会一定再来。你什么时候来湾区,随时欢迎来 Arena 办公室坐坐。
本期对话收敛出的关键判断,每一条都可以直接落到行动上:
- 第三方评测的价值与模型玩家数量同生共死——只要玩家多于两家,独立评测就是刚需。 企业选型时别只看厂商自报榜单,把真实场景的盲测(Arena 模式)纳入采购流程。
- “中国只会蒸馏”的叙事已经破产,用旧叙事给新能力定价必然出错。 做 AI 供应链决策时,把中国开源模型当作一线选项而非备胎来测算成本与性能,再叠加合规与主权权重。
- AI 主权是企业的下一笔预算,数据是 AI 时代仅存的护城河之一。 现在就盘点自家数据资产:它能否进入“微调—上线—反馈—再微调”的飞轮?不能形成飞轮的数据只是存量,不是护城河。
- 75 家 Neo Lab 三分之二会归零——零收入估值的算术不成立。 用一行公式检验任何 AI 标的:估值 ÷ 25-30 倍 = 两三年内必须做到的收入;算不出这条路径的,故事再好也不投、不加入。
- 数据是规模化的互补品,是比 GPU 更不像大宗商品的生意。 布局 AI 产业链时把数据层与算力层分开定价:算力赌的是供给,数据赌的是“AGI 到来之前的时间”。
- 用 AI 看管 AI:守护模型与访问护栏必须在智能体上岗之前就位。 安全预算参照“双份推理账单”预估;同时把“验证候选人真实存在”写进招聘与入职流程——假人通过面试已经不是假设。
- 模型厂商下场做应用是结构性风险,检验标准是 GTM 深度与部署重量。 如果你的生意是“拿起来就能用”的轻部署软件,现在就重估被前沿实验室覆盖的概率;如果靠关系、合规与重交付,你的缓冲期比市场恐慌告诉你的更长。