洞见·20VC·2026.08.10

OpenRouter 创始人 Alex Atallah:没人通吃模型市场,企业更防美国大厂

OpenRouter 创始人 Alex Atallah 回应 Stripe 百亿美元收购传闻:没人能通吃模型市场,路由层商品化之争,以及企业为何更忌惮 Anthropic 与 OpenAI 而非中国模型。

Overview 背景概览

本文译自20VC,发布于 2026 年 8 月 10 日;主持人哈里·斯泰宾斯(Harry Stebbings),对话 OpenRouter 创始人兼 CEO 亚历克斯·阿塔拉(Alex Atallah)。

为什么美国企业更忌惮 OpenAI 和 Anthropic,而不是中国模型?坐在连接数百个模型与全球开发者的“路由层”上,Alex 正面回应了甚嚣尘上的 Stripe 收购传闻,用平台一手数据验证了“越降价越赚钱”的杰文斯悖论,并断言这将是科技史上最大的市场——而没人能通吃,包括 OpenAI。

▍嘉宾:亚历克斯·阿塔拉 (Alex Atallah)

OpenRouter 创始人兼 CEO,连续创业者:

  • OpenSea 岁月:2017 年与德文·芬泽(Devin Finzer)联合创立 OpenSea——第一家 NFT 交易平台,2022 年 1 月 C 轮估值 133 亿美元,2022 年起逐步淡出日常运营。
  • OpenRouter 时代:2023 年联合创立 OpenRouter 并任 CEO,切入 LLM 基础设施,主张“多模型未来”与 AI 生态的“神经多样性”。
  • 下一步兴趣:非营利方向——用 AI 帮助研究者攻关那些“不附带商业模式、拿不到风投”的问题,如罕见病研究与城市公共品改善。

▍关于 OpenRouter

OpenRouter 是 2023 年成立于纽约的 LLM 统一路由网关,号称“通往大模型世界的网关”。

  • 核心模式:一个 API 接入 60 多家服务商的 500 多个模型,按质量、速度、价格每五分钟实时调度流量;定价为按量付费抽成 5.5%,另有按承诺消费额计费的企业版。2026 年 8 月年化收入约 1.4 亿美元,较 2025 年底的约 5000 万美元增长近两倍。
  • 融资与估值:2026 年 5 月完成 1.13 亿美元 B 轮融资,估值 13 亿美元,累计融资约 1.7 亿美元。
  • 收购进展:2026 年 7 月《华尔街日报》曝出 Stripe 洽谈以约 100 亿美元收购;本期录制于官宣之前——8 月 19 日 OpenRouter 宣布加入 Stripe,据报道作价超过 75 亿美元、以股票为主,为 Stripe 史上最大收购。

一期应景的访谈:Stripe 的 100 亿美元报价

Harry: 这里是 20VC,我是哈里·斯泰宾斯(Harry Stebbings)。我现在唯一真正在乎的,就是在对的时机为你带来最优质、最应景的访谈。今天做客的是 OpenRouter 联合创始人兼 CEO 亚历克斯·阿塔拉(Alex Atallah)——OpenRouter 是通往大模型世界的网关。据报道,Stripe 曾开出 100 亿美元的收购报价;公司此前完成了估值超过 13 亿美元的融资,是这个市场的领头羊。

而这期访谈来得不能更应景了:这家公司会选择保持独立,还是卖给 Stripe,答案将非常有趣,我们拭目以待。不过本期是提前录制的,几周后我们会再回来跟进核实。这期节目非常精彩,很高兴能把 Alex 请进演播室。

Harry: Alex,这期我期待太久了,老兄。我想促成它有一阵子了。我从 Menlo 的马特(Matt)那儿听到过太多关于你的事,又找安杰尼·米达(Anjney Midha)打听过你,连你之前的室友都聊过——背调做得堪称疯狂。谢谢你能来,老兄。

Alex: 谢谢,很高兴来到这里。

从 OpenSea 到 OpenRouter:把“扛住洪峰”刻进骨子里

Harry: 我想从 OpenRouter 之前聊起,先聊 OpenSea。那是一段相当传奇的旅程。亲历了 OpenSea 的一切之后,你把什么带到了 OpenRouter?

Alex: OpenSea 是第一家 NFT 交易平台。和 OpenRouter 很像,它在很长一段时间里都很小——直到 A 轮前后,我们都把团队规模压得很低,那还是在 AI 之前。2020 年 10 月 NFT 突然爆发,我们的反应是:完了,人手严重不足。

服务器快被熔穿了,搜索索引在爆炸,还出了几次大宕机,维持网站在线非常吃力。我当时最怕的就是变成加密货币界的“Twitter 宕机鲸”(fail whale)(译者注:Twitter 早年宕机时展示的鲸鱼页面,是互联网圈“撑不住流量”的经典梗)——我最大的目标就是别让 OpenSea 变成那条鲸鱼。

于是我们一点点搭团队,把平台和基础设施管住,确保系统可以预期地扩容——具体说就是做压测,让网站扛得住十倍流量,哪怕当时根本没有那么大的量。加密货币就是这样,你永远不知道下一秒会发生什么:某些时刻流量会突然暴涨,完全取决于当时的内容和社区热度。

那段经历让我积累了大量基础设施和扩容方面的经验,后来都带到了 OpenRouter。我花了很多时间思考:怎么做出一个永远在线的东西,让人们从基础设施层面就能真正信赖它,哪怕市场剧烈动荡、流量洪峰来袭。

这对 AI 行业当然极有用——和所有公司一样,尤其是 Anthropic,大家都经历过不可预测的增长,我们也一样。虽然也有过几次磕绊,但整体上好了太多。OpenSea 把这套东西刻进了我的骨子里,让我能卓有成效地把它带到 OpenRouter。

Facts 时空复盘

Alex 的“洪峰基建论”有据可查:NFT 市场在 2021 年底至 2022 年初达到顶峰,OpenSea 单月交易量一度接近 50 亿美元;2022 年年中起交易量崩塌超九成,公司同年 7 月裁员约两成,估值从 133 亿美元峰值大幅回落,2025 年起靠 OS2 平台与 SEA 代币转型自救。

在“暴涨—崩盘”的极端周期里维持服务可用的能力,正是他后来为 OpenRouter 构建的基础设施底盘——AI 推理需求的波动性,与当年的 NFT 流量洪峰高度同构。

意料之外的生态:推理服务商打败了云大厂

Harry: 回到公司的创立初心:在生态和模型格局里,发生了什么你当初没料到的事?

Alex: 我们没料到的一点是:会冒出一个专门为开放权重模型(open-weight model)提供托管和推理服务的公司生态。早期这并不明朗——这个市场完全可能是个垄断格局:三大超大规模云厂商(hyperscaler)通吃所有开放权重模型的托管,创业公司远远落后。

现实呢?你什么时候听过有人在云大厂上跑 GLM?从来没有。大家用的是 Fireworks、Together 这样的推理服务商(inference provider)。从我们看到的榜单看,把开放权重模型托管得最好的都是这批公司。

早期我们只有“服务商一”和“备用服务商”的概念,不展示具体是哪家在做托管——因为当时我们算不上一个市场(marketplace),更像是一个发现和探索新模型的工具。我们想建一个模型实验室的市场,但推理服务商这一层会不会也成为市场,我们并不确定。

结果证明,这些公司比云大厂干得好得多:上模型的速度快得多,各种托管的边角问题也解决得更好。而可用性(uptime)会是一个长期问题,不会由市场供给侧自动神奇地解决。

“token 不是 token”:推理层会商品化吗

Harry: 很多人认为,推理服务商这一层是可商品化的环节,会随着竞争被抹掉,或者利润率被打没。你怎么看这个论断?

Alex: 眼下我们处在一个供给极度受限的市场,而且这种受限大概率还会持续很久——几乎所有推理服务商都常年处于算力短缺状态。

你可能会问:既然 GPU 这么值钱,谷歌、亚马逊、微软为什么不冲出去把 GPU 全买光,让这些推理服务商统统出局?因为造 GPU 的人不希望这样。英伟达的头等大事之一就是避免客户集中——他们希望大量客户各自拿到独立的 GPU 配额,希望市场保持多样性,希望算力层保持竞争。

这对生态是好事,用户也乐见其成:对英伟达好,对终端用户也好。正是这种格局,让推理服务商能不断创新“怎么把模型服务得更好”。

就说 Kimi K3 这一个模型:月之暗面(Moonshot)刚发了一份基准测试,列出各家推理服务商服务 Kimi K3 的表现——在那些完全静态、众所周知的基准上,各家的数字差异相当大。我们自己也在持续做这件事:对所有模型在所有开放权重服务商上的表现做基准测试,结果一直差异明显,而且随时间变化。这些模型非常“情绪化”,非常不确定(non-deterministic)。

Inverse 反向思考

Alex 把“推理服务商不会被云大厂通吃”归因于英伟达的客户分散策略——但这是供应商意志决定的格局,不是结构性必然。分散客户的动机只在 GPU 供不应求时成立;历史上每一轮硬件周期都会从短缺走向过剩,一旦算力过剩,推理服务商之间的价格战会先把利润率打穿。

“商品化”的威胁因此不是被证伪,而是被推迟。届时能活下来的,恐怕正是 Alex 自己偏爱的那类做定制硬件和底层优化的厂商——其余同质化玩家的结局,和他所反驳的论断并无二致。

Harry: 我请过 Fireworks 的 Lynn 上节目。当时我引用加文·贝克(Gavin Baker)的话——“token 就是 token(a token is a token)”——她纠正我说:token 其实不是 token,一家服务商能让一个 token 顶别人好几个用。就好比去同一家店,你可以绕整个街区,也可以直接开到门口。token 可以被做得更高效、跑得更远,而这正是服务商的工作。

Alex: 我同意。某种意义上,我们提供的服务就是帮人们发现对的服务商。当某家服务商能把 token 用得更值时,我们在核心路由技术上投入了海量时间,让这家服务商立刻获得更多流量。

一旦我们侦测到质量提升、速度变快或价格下降,流量立刻倾斜过去。这套机制每周七天、每五分钟就在运转,大模型的格局随时在变,用户体验也因此实实在在地变好。

Harry: 如果只能投一家推理服务商,你投谁?

Alex: 这个问题我恐怕得保持中立。我确实偏爱那些做定制硬件、做非常底层优化的服务商,也喜欢那些努力让定制化变得更简单的服务商。

今天你做微调(fine-tuning),得到的是一个从基座模型独立出来的全新模型。而很多推理服务商在做 LoRA——有人叫它“弹药夹”(cartridge)——这类东西有望在不同模型之间迁移。我们也许会看到这样一个未来:你做完微调后想换基座模型,成本可能只要几百美元,甚至几十美元。

Tips 知识科普

LoRA(Low-Rank Adaptation,低秩适应)是一种参数高效微调技术:冻结基座模型的全部权重,只训练一对低秩小矩阵,可训练参数量通常不到全量微调的百分之一,显存与算力成本随之大降。

多个 LoRA 可以挂在同一个基座上即插即用,这正是 Alex 所说“弹药夹”(cartridge)可迁移性的来源——微调成果不再是一个独立的大模型,而是一个几十到几百 MB 的补丁文件,换基座模型的成本因此有望从一次完整训练降到几十美元。

每家都有专用模型的世界,利好谁

Harry: 行,我懂了——Fireworks 是你的最爱,没关系,我懂,我也是。说正经的:Lynn 上节目时说,你不该“租用”智能,你应该“拥有”它。未来每个公司都会有用自己的数据训练的专有模型。在一个每家公司都有为自己量身定制的模型的世界里,这对 OpenRouter 的生意是利好还是利空?

Alex: 绝对是利好。

Harry: 为什么?按常理,公司会死守自己那个专有的、用自己的数据训练的模型,而不会向百花齐放的模型生态敞开。

Alex: 我不这么看。我们从第一天起的使命,就是提升整个 AI 生态的“神经多样性”(neurodiversity)。我们坚信多模型的未来不可避免。

来做个思想实验:假设你是对的,存在某个能满足你所有需求的模型——无论对公司还是对个人。然后越来越多的人开始用它。接着一定会有人想:我要做一个“神经异类”模型——一个有点不一样的模型,说话方式不一样,能冒出第一个模型永远想不到的点子,因为它用的是完全不同的训练数据。这就必然创造出“两个模型都要用”的需求。

创造力是无法验证的,你没法给创意打个简单的分数。两个模型一起用,比只用一个更容易产生创意——前提是另一个模型的训练方式不同、数据集不同,或者刚做了大更新。死守单一模型,在我看来毫无道理。

Harry: 完全明白。也就是说,公司会把自己的核心工作流跑在自己的专用模型上,同时用大量其他模型——而这部分模型选择就走 OpenRouter。

Alex: 对。回到你刚才的问题:当公司用自己的数据训练自己的模型时,你周围的整个生态也在做同样的事,这里得推演一下博弈论。

如果人人都在自研模型,而所有模型实验室又都在用新获得的数据、从别的公司买来的数据不断训练新模型——那些数据对你都有潜在价值——你的最优策略是什么?是去试那些新模型:看能不能用它们提高效率,看能不能把它们融合起来拿到更好的前沿性能,看能不能用它们降成本。

无论你的目标是改善利润率还是做大公司,你都有动力去用生态创造出来的东西。而自研的那个模型,你得不断改进才能不掉队,它永远赢不下整个市场。

这会是一个巨大的市场——科技史上最大的市场,甚至可能是人类历史上最大的市场。没人能通吃,你造不出一个通吃的模型。

Highlights 高光金句

“这会是一个巨大的市场——科技史上最大的市场,甚至可能是人类历史上最大的市场。没人能通吃,你造不出一个通吃的模型。” "This is going to be the biggest, biggest market in tech ever and biggest market probably in human history. No one's going to win all of it. You're not going to build a model that wins all of it."

▍点拨:这句断言是全篇的立论原点:如果市场大到没人能通吃,那么“该用哪个模型”就永远是一个问题,路由与选择层的价值就不是过渡形态,而是长期生态位。值得注意的是,这个判断同时也在为“多模型未来”自我实现——OpenRouter 的利益与这套叙事深度绑定,听者宜把它当立场而非纯预测。

既然如此,不如做一个以某种“非常有用、对你的业务至关重要”的专长而闻名的模型,靠这个专长立住。我认为很多企业会往这个方向走:做自己的模型,打造自己的“品牌智能”(branded intelligence)。品牌本身就是护城河的重要部分,而模型会成为品牌的载体。

Value 价值视角

用巴菲特的框架检验“品牌智能”:品牌之所以是护城河(喜诗糖果、可口可乐),是因为它能降低选择成本并支撑持续溢价。模型要成为品牌载体,前提是输出差异可感知、可稳定复现——而本期后段 Harry 在 Arena 上“只认结果不认牌”的体验恰恰说明,模型层的品牌溢价正在流失。

真正接近护城河的是 Alex 没明说的另一样东西:路由层沉淀的实时基准数据与用户切换行为——数据飞轮带来的调度优势符合“越用越好用”的复利结构,这比“品牌智能”的叙事扎实得多。

路由层商品化之争:为参与而做,还是为赢而做

Harry: 你刚才提到在路由技术上投入了海量时间。很多人认为路由技术正在商品化:Ramp 发布了类似产品;我之前提过的 Merge——我们投的一家公司——也发布了这类产品;还有好几家都在做号称类似的路由技术。这一层真的在商品化吗?

Alex: 我觉得很多公司做路由器,只是因为这事时髦——他们看到这里在增长,或者至少是在做网关。这里面有两个问题。

第一,这会立刻把你放进“模仿者”而不是“赢家”的心态里:你是在为参与而参与、为存在而存在,而不是为赢而战——也许你只是想服务现有客户,顺便蹭一点 AI 增长。这种心态一上来,就让这个网关比全情投入的公司落后好几个月。

我百分之百专注于做最好的路由器、网关和 LLM 市场,这体现在我们的产品里、我们内部做的基准测试里、我们看到的与竞品的对比里。对我们这不是支线任务——对别的公司,可能是。

第二个问题是,它削弱了所有用户的杠杆(leverage)。我深信要给用户和开发者更多杠杆——说到底,让他们用上更多模型,就是让他们对 AI 领域发生的一切创新拥有更多杠杆。你想能用上所有模型,想降低对任何单一模型的依赖。

如果你建在一个不给你完整市场、完整灵活性、完整定制能力的路由器或网关之上,你就拿不到整个生态的全部杠杆,等于被切走了一块——把你公司所有员工需要的东西都切走了。OpenRouter 的本质就是给人更多选择,因为选择就是杠杆。

定价:5.5% 抽成、企业版与三年后的收入线

Harry: 这套服务的定价是抽成 5.5%?

Alex: 那是我们按量付费(pay-as-you-go)的方案。后来我们加了企业版,定价模式完全不同,目前非常成功——大致是按承诺消费额(committed spend)来,承诺额度内不再抽成。

Harry: 我正想问这个。公司小的时候会很爱你们;但规模一上来,他们就会骂:这也太贵了——抽成已经占成本的大头,不如自己造路由。

Alex: 我觉得有些公司只是还没意识到我们有企业版,也有一部分是我们的责任——定价方案做得不够细。我们很快会推出一个商业自助版(business self-serve),让定价更合理。

另外,如果你自带推理资源接入 OpenRouter——比如自带密钥(bring your own keys)——手续费就免了。只有当你用的是 OpenRouter 提供的算力、又不在企业版计划内时,才收那笔费用。除此之外,我们需要能大致预测需求,所以才做承诺消费额模式。

Harry: 三年后,OpenRouter 的主力收入线会是什么?

Alex: 这在很多方面取决于经济形势。如果整个 AI 市场未来四年保持现在的增速——每年十倍到十五倍甚至更多——那是非常惊人的增长。

在那个世界里,我猜人们会继续低估自己需要多少推理量,而我们的收入主力还是今天的主力:帮企业和创业公司消化计划外的推理需求。

这正是 OpenRouter 最擅长的:当你需要试一个原本没打算试的模型,当你在某个模型上的用量超出预期,我们用最好的故障切换(failover)和可用性,确保这不会成为你公司的问题。在市场持续低估推理需求、以这种速度增长的当下,这件事价值极大。

如果这个增速再持续四年,增长总量会非常疯狂——当然经济总有个上限。如果增速不再是每年十倍、十二倍、十五倍,我也能看到中小型企业 SaaS(SMB SaaS)成为我们的增长来源。

Value 价值视角

巴菲特与芒格历来偏爱“收费站”式生意:交易量越大抽得越多,资本开支轻,还有网络效应护体。OpenRouter 正是智能时代的收费站雏形——年化收入约 1.4 亿美元却获得百亿美元量级的报价,市场买的正是这个结构。

但收费站模式的关键变量,是费率能否扛住“绕路”冲动,这正是巴菲特检验定价权的方式。Harry 的追问(客户做大后自建路由)不是假设而是必然;OpenRouter 用企业版承诺消费、自带密钥免抽成主动拆雷,本质是把“按抽成收费”改写成“按确定性收费”——管理层对定价权脆弱性的清醒程度,是这门生意长期价值的重要正面信号。

杰文斯悖论与数据代表性之争

Harry: 我们目睹了 token 价格在十八个月里跌了九成。token 降价对你的生意是利好还是利空?毕竟你们按消费抽成——价格下来了、花钱更有效率了,表面看你们能抽的饼变小了。

Alex: 很多人都在谈杰文斯悖论(Jevons paradox):价格降十倍,用量的增长会超过十倍。但一直没人把它建模清楚,我们手上有不少能印证它的鲜活案例。

Tips 知识科普

杰文斯悖论(Jevons paradox)出自英国经济学家威廉·斯坦利·杰文斯 1865 年的《煤炭问题》:蒸汽机效率大幅提升后,英国的煤炭消耗不降反升——效率降低了使用成本,反而打开了更多应用场景。

云计算时代它已经重演过一次:AWS 连年降价,算力支出总额却持续膨胀。Alex 此处的贡献,在于给出了 AI 推理侧的干净实证——前提是“用量弹性大于价格弹性”持续成立。

比如 OpenRouter 上的 GPT 5.6 Luna:OpenAI 先把价格砍到五分之一,又配合我们再降一半——等于两周内 Luna 在 OpenRouter 上累计降了十倍。你猜用量涨了多少?十三倍。这几乎是教科书级的杰文斯悖论:价格降十倍,用量涨得比十倍还多一点。

Highlights 高光金句

“等于两周内 Luna 在 OpenRouter 上累计降了十倍。你猜用量涨了多少?十三倍。” "So in total, the price of Luna has dropped 10x on Open Router over the last two weeks. Guess how much usage has grown? 13x."

▍点拨:对“按消费抽成”的生意,这组数字直接反驳了“降价等于蛋糕缩小”的直觉——单价降十倍,流水反而涨了三成。但注意这是单模型、两周窗口的样本,且叠加 DeepSeek 与 GLM 同期降价抢量的背景;把它外推为普遍规律之前,还要看更多模型、更长周期的复现。

而且用量很稳:冲到十三倍后走平,随后按达到十三倍之前的增速继续涨。这个案例的干扰变量很少——虽然同期正好赶上 DeepSeek 发布新品、价格极优,GLM 的价格也很好。

现在 Luna 在 OpenRouter 上的用量已经超过了 GLM——GLM 曾经是 token 用量前三四的模型。这是 OpenAI 的模型很久很久以来第一次回到我们平台 token 用量前五。这一步棋走得又大又有意思。

Facts 时空复盘

文中的降价曲线与公开数据互相印证:2023 年 GPT-4 发布时,旗舰级推理每百万 token 要价数十美元;到 2026 年,同等能力已降至美分级甚至更低,三年降幅超过两个数量级——“十八个月跌九成”并非夸张。

需求侧的弹性同样成立:截至 2026 年 9 月,OpenRouter 年化收入约 1.4 亿至 1.6 亿美元,较 2025 年底的约 5000 万美元增长近两倍。单价持续下行而总流水高速扩张,正是杰文斯悖论在平台层面的宏观复现。

Harry: 你们的 token 用量数据对整个市场有多强的代表性?我记得你们的份额大概是全市场的百分之一点五到百分之二。很多人听我说“OpenRouter 上排名前五的模型全是中国模型”时会反驳:Harry,无意冒犯,但 OpenRouter 代表不了市场——用前沿模型的人都直接走官方 API,根本不进你的统计。你们的排名在多大程度上反映真实的 token 用量?

Alex: 问得好。我们会通过自己调研、参考别人的调研来估算偏差有多大。我们确实有样本偏倚:用户天然偏向认同我们“未来是多模型”这个论点、想要多个模型的公司。

市面上至今仍有公司说“我们是 OpenAI 店,只用 OpenAI 模型”——虽然现在我已经很少碰到了。这类公司我们完全观察不到,而他们主要扎堆在云大厂、OpenAI、Anthropic 和 Gemini 那边,所以我们确实可能低估了前沿模型的份额。

但随着时间推移,我们的论点正在成为越来越多公司的共识;当他们说出“我们也得用用别的模型”的那一刻,我们的数据就更具代表性了。随着规模扩大,数据总体也会越来越有代表性。我希望它只会越来越好。

企业更怕的是前沿模型厂商,不是中国

Harry: 亚历克斯·卡普(Alex Karp)在 CNBC 上以他一贯激情四射的方式说,企业很害怕和前沿模型厂商合作。你同意吗?

Alex: 我在客户那里没看到他说的那种恐慌,但确实有一些不安——尤其是 Claude Design 发布、矛头指向 Figma 那会儿,那一波我确实看到了。

这背后有真实的担忧。Figma 的情况比较特殊,但如果一家创业公司只是给智能套一层“市场进入”(go-to-market)的壳——比如“我们把 AI 带进某个行业,靠做好集成、定制系统提示词(system prompt)来落地”——只要模型实验室不在乎那个市场,你就没事,而不被在乎的市场会有很多。

但模型实验室早晚有动机杀进来。动机之一是:让他们在乎的公司里的更多团队依赖上自己。我认为这就是 Claude Design 的战略逻辑——它对 Anthropic 的收入贡献可能微不足道,但能让设计团队真正在意 Anthropic 的模型;这样,Anthropic 想要的那些公司里,就又多了一个铁了心要用 Anthropic 的团队。

所以,如果你的产品是服务于某个团队的,而这个团队恰好成了模型实验室争夺重点公司的战略抓手——那才是我眼中最现实的近期威胁。

Harry: 你觉得 Claude Design 会对 Figma 的生意产生实质冲击吗?我今天聊的很多创始人都在从 Figma 切到 Claude Design,正在蚕食 Figma 的用量。你认为这会发生吗?

Alex: 我看到很多设计师试了 Claude Design,包括我们自己的团队。但到目前为止,我还没听到“用了就回不去”的故事。说实话,我聊过的设计师不多,也确实没听到多少关于 Claude Design 的讨论。而且单看 Figma 的数字,相当好——他们的财报非常亮眼。

Harry: 这就是你不想上市的原因啊,老兄。你看 Figma,那么好的数字,股价照样跌。我心想:可怜的 Dylan(译者注:Figma CEO 迪伦·菲尔德,Dylan Field),这算什么事?

Alex: 是啊,太魔幻了。我当时就是:真的假的?至于吗。

每月七十个新模型:新实验室浪潮才刚开始

Harry: 回到模型本身,回到企业愿不愿意和前沿模型厂商合作这个话题。现在的模型迭代速度感觉快得惊人——你觉得未来一年、两年、三年,这个速度能保持吗?

Alex: 你指前沿模型还是所有模型?

Harry: 所有模型,前沿和开放权重都算。现在每天都有两三个、三四个新模型冒出来。

Alex: 光七月一个月,我们就上线了七十个模型——平均每十小时一个。

还有一些智能体实验室(agent lab)正在起步,它们最终大概率都会自己造模型:谷歌的杰夫·迪恩(Jeff Dean)正在创办一家智能体实验室。以做智能体闻名的公司,都有非常明确的动机造自己的模型、再通过智能体把它分发出去。这股趋势我们才刚看到开头:Cognition 有了自己的模型,Cursor 有了自己的模型。Lovable 有了吗?至少公开层面还没有。

所以智能体实验室会加入造模型的行列。再加上几股力量:英伟达这样的 GPU 厂商希望在领域里制造更多竞争和多样性;我们这样的平台;还有愿意尝新、想用某种“神经异类”方式提升智能的投资人——这些都是足够强的动机,会激励更多创始人创办新型实验室(neolab)。如果美国开放权重模型能起势,又会给这些新实验室提供一个非中国的训练基座,反过来催生更多美国新实验室。

中国开源的领先、责任与护栏

Harry: 我们应该为中国开源模型的速度和质量感到担忧吗?

Alex: 应该。我们落后了,美国还非常、非常落后。不过情况在好转——有 Poolside,有 Thinking Machines,还有 RC(译者注:转录如此,疑为某美国开放模型实验室名的误听)。

Facts 时空复盘

“美国非常落后”的判断与 2026 年 9 月的公开格局一致:自 2025 年 1 月 DeepSeek R1 以极低成本逼近前沿、引发美股震荡以来,Qwen、GLM、Kimi 系列在 LMArena 等榜单的开放权重分区持续霸榜;Meta 的 Llama 声势回落后转向 Muse 另起炉灶,美国开放权重阵营至今没有拿出同等级别的回应。

Alex 点名的“美国希望”里,Poolside 与 Thinking Machines 确已发布模型但体量有限;“RC”在公开信息中查无对应实验室,更可能是转录误听——这个细节本身,也折射出美国开放模型阵营的单薄。

Harry: 你对此有责任感吗?我的意思是:你是做路由的,你可能把一家公司路由到一个中国模型上——谁知道呢?人们担心后门、担心执政党因素,而你可能就是那个把模型递到他们手上的人。对此你有责任感吗?

Alex: 我们确实有责任为所有这些模型提供安全的访问通道——客户信任是我们的第一要务。如果某个模型被普遍认为不安全,我们会把它下架。当然,任何模型都有被滥用的方式;我们的理念是用技术把它管起来,并和模型实验室合作,搞清楚他们在自己一侧是怎么做的,以便我们做到行业最优甚至更好。

我们花了海量时间,确保我们的安全实践与实验室侧看到的最佳实践对齐甚至更好——因为我们是人们探索和首次接触所有模型的入口,天然适合成为在全公司范围部署安全措施的枢纽。

比如我们提供提示词注入(prompt injection)防护:一键开启,立刻标记疑似注入的提示词;还有个人身份信息(PII)自动脱敏。点一下,就能给全公司的推理流量加一层安全。我们做这些,就是为了让企业敢于安全地部署新模型、让员工敢于放心试用。

某种意义上,我把这些模型看作互联网:你不能因为互联网上有坏东西,就在公司里禁掉互联网。你可以也应该建护栏(guardrails)——而且要用 AI 去建尽可能好的护栏。

Harry: 我认同。但你真的知道月之暗面或者阿里的通义(Qwen)内部在发生什么吗?这些都是藏在中国腹地、极度神秘的组织。

Alex: 我没法假装知道他们内部在做什么。但我们是一家美国公司,会遵循美国的最佳实践,确保自己没在做不负责任的事。

Harry: 你觉得美国公司更紧张哪一个——前沿模型还是中国模型?

Alex: 通常更紧张前沿模型。一部分原因是围绕数据政策有太多困惑:我发出去的提示词到底经历了什么?存在哪里?被谁看?

而且你不能把前沿模型跑在自己的机器上,也不能跑在自己选的服务商那里。这立刻给企业制造了巨大的不确定性——一种他们能类比感知的不确定性:这和“跑在自建机房还是跑在自己的 VPC 里、谁能看到数据”是同一类问题。

“我们也被黑过”与 Kimi 的真实水位

Harry: 但这多魔幻啊:他们更紧张的是总部就在硅谷的美国公司——你能看见、能摸到、能见到他们的总部和领导人。我们活在一个多么奇怪的世界上。

Alex: 是挺奇怪的,尤其是眼下在网络安全姿态(cyber posture)上最高调的恰恰是前沿模型厂商。

Harry: 你怎么看每家公司争先恐后的那种姿态——“哈哈,我们也被黑过”?先是 OpenAI,然后是 Anthropic,接着 xAI 也跑出来说(译者注:原文 Zark,疑为 xAI 或扎克伯格的误听):我可不想错过这场派对,我们也中招了。

Alex: 我觉得他们必须讲。正确的做法是:发生涉及自家模型的网络安全事件就公开,捂盖子是行不通的,长期看一定行不通。

表面上看,他们确实都像在炫耀。但如果你处在他们的位置,模型出了事,要在公开与不公开之间做选择——我认为无论外界会怎么编排,正确的选择都是公开。所以我怀疑他们并不是真的在掂量什么“重罪席”之类的东西(译者注:原文 the felony bench,听写存疑,语义不明)。

Harry: 最近大出风头的 Kimi 新模型有多重要?有大家说的那么重要吗?

Alex: 它相当好。网络攻防能力上,它还达不到前沿模型的水平;长程任务(long-horizon task)上,我觉得也还落后前沿模型一点。但 GLM 5.2 是开放权重模型迈出的一大步,Kimi 这一步更像是月之暗面追上了那个台阶——我大致是这么看的。

Kimi 还是个很好的“写作者”,文风和语气都很在线。相比之下,一些前沿模型在编码能力变强的同时会出现“文风退化”——我看着输出直呼受不了:你提的四个论点里三个是对的、一个是转折点,然后“哒哒哒哒,重点来了”——有时候真的没法读。这些问题是可以修的,但 Kimi 的文笔一直挺有意思。

中美开源鸿沟与防火墙悖论

Harry: 十二个月后,美国开源和中国开源之间的鸿沟会比今天更大还是更小?我的担忧是更大。

因为当 DeepSeek 成为中国的国家冠军,习近平就会说:这是我们押注的 AI 赛马,我会把全部资金和资源集中在它身后,把这个生态补到底,这就是赢家。然后又一家月之暗面冒出来——突然之间,所有监管让路,所有政策开绿灯,所有资金到位,一路放行,你可以自由奔跑。为了抵达终点,他们几乎不受约束(译者注:原文 unabridged,疑为 unbridled 之误)。

而 OpenAI、Anthropic 和所有其他美国厂商——尤其是开源的——你去试试为一家美国开源模型公司融几十亿美元?难,真的很难。不是不可能,但更难:商业模式存疑,AI 研究贵得离谱,还要和 OpenAI、Anthropic 正面竞争。

我认为双方所处的竞争格局,意味着中国开源厂商天然占优——很遗憾。他们有非常、非常优秀的研究者,而美国人严重低估了这一点。

我确实认为他们会担心自家模型的网络攻防能力,也确实非常在意对模型的审查、在意模型能向人们提供什么信息。今天人们抱怨美国模型因为网络安全的理由审查得更多,但我不确定这永远成立。随着中国模型对中国越来越重要,他们会怎么做?会拆掉防火长城吗?会放弃给模型加防火墙吗?

我对中国了解不多,但有一件事挺奇怪:他们似乎不太在意模型的边界……我从没见过有人认真梳理过——用 DeepSeek 能做什么、而在中国境内的互联网上做不了什么?你能接触到什么信息?我从没见过一篇真正的深度调查:DeepSeek 到底越过防火墙多远?如果防火墙对中国很重要、十年后还重要,那一定有什么东西会改变。

Alex: 有意思的是:中国模型在中国境外的能力显然极其强大;而在中国境内,它们的能力其实相当受限——护栏严得惊人,几乎是禁止性的。

Highlights 高光金句

“中国模型在中国境外的能力显然极其强大;而在中国境内,它们的能力其实相当受限。” "...the abilities of the Chinese models outside of China is immense. The abilities of the Chinese models inside China is actually relatively limited."

▍点拨:一句话点破“开放权重”与“开放信息”的区别:权重可以在全球自由下载,信息服务却在境内被护栏锁死——连星巴克几点开门都答不出。这也意味着,用境外体验去推断这些模型的“真实能力上限”会产生系统性偏差,偏差方向取决于你问的是哪类问题。

Harry: 太讽刺了:技术上碾压我们,自己国内用起来却一塌糊涂,烂透了。我的老朋友杰森·莱姆金(Jason Lemkin)——SaaStr 的创始人——刚从中国回来就跟我吐槽:他在 DeepSeek 上连“星巴克几点开门”都查不出来,压根不给答,直接“不允许”。

Alex: 离谱,哇。

忠诚度、迁移成本与记忆住在哪一层

Harry: 最基础、最初级的请求都做不到。聊了这么多模型,我想到的一个问题是忠诚度——你坐在生态系统里一个能看见一切的绝佳位置上:今天开发者对模型还有忠诚度可言吗?

Alex: 说实话,确实有一些。我们努力把迁移成本降到接近零,让新模型一出来大家就能轻松试用。但我们也测量每个模型的留存和流失,模型实验室要数据我们也会给:我的新模型发布后,是哪些模型给它导的流量?用户离开时,又流向了哪些模型?这些数据我们很快会向全世界更充分地开放。

在流失数据里,我们确实看到一类开发者:明明有更好的、更适合他们场景的模型,却一直死守原来的模型。我想这背后大概有几个根因。

一是“我的应用能跑,我不想弄坏它”:客服机器人万一开始说些我意料之外的怪话,何必给自己添堵?我已经做了这么多优化,外面已经围了一圈护栏。

二是新模型不一定让你的成本更优。实际发生的一般规律是:现有模型的价格随时间下降;实验室有新突破时,智能水平跳升,价格曲线也会跟着跳一下,然后再慢慢往下走。所以切换到最新模型——哪怕是开放权重的——未必是最划算的选择。

第三个原因更根本:对输出的信任。如果我用一个模型干活、喜欢它的说话方式,我心里大概有一套自己的评测——很多人都有这种“个人评测”(personal eval),就是随手丢给模型的测试题。新模型在这套随堂测上表现不好,他们就会想:挺好,反正我本来也喜欢 Kimi K2.6。

Harry: 以前人们以为记忆(memory)会是留住用户的机制:OpenAI 记得我所有的历史提示词,知道我住在伦敦、做播客等等等等,理论上它会因此成为“更适合我”的模型。记忆不再是留存机制了吗?

Alex: 记忆这个议题非常有意思。我一直认为它是留存机制,问题在于它住在哪一层:模型层?推理服务商层?应用层?还是基础设施层、路由层?

我的猜测是:每一层都会试图以不同方式占有记忆,而且把记忆放在每一层各有优势。放在应用层,记忆拥有最强的应用上下文,而且与模型无关(model agnostic);放在模型层,记忆在个性化基准上可能表现最好,也许有最高的终极智能。模型实验室一定会在记忆上发力。

更终极的问题是:有没有好的组合方式?模型里的记忆和基础设施层、应用层的记忆能不能同时用?会不会把模型搞糊涂?现在没人知道。

但我确定一点:任何一层都不可能独占全部有价值的记忆,因为应用掌握着模型实验室没有的重要上下文。模型实验室想做成这件事,就得拿出激励,让应用愿意把那些上下文交出来。

harness 与 app 之争

Harry: 说到应用和模型套件:Claude Code、Cursor 这些把模型和 harness(智能体运行框架)打包在一起的东西——当智能体和 harness 合体时,路由器还有独立存在的窗口吗?会不会还没独立就被吞进智能体框架里了?

Alex: harness 这个话题很有意思。我们早期的一个押注就是:大多数应用低估了用户“自己选模型”的欲望。2023、2024 年那阵,很多应用甚至不告诉你底下跑的是哪个模型——他们觉得没人关心,用户“只要 AI 就行”。

我们当时的一个强信念是:不,用户会想用特定的模型,会在意自己在跟谁对话——就像我解决问题时想知道电话那头是哪个员工,模型也会是这样。这个判断已经被验证:连 Notion 这种你以为会想把模型彻底藏起来的应用,现在都可以让你选择对话的模型。

harness 也经历了类似的过程:开发者开始对不同的 harness 产生亲近感,因为它本质上是一种用户体验。这是我认为“harness 会一直存在”的最有力论据——而不是因为它们和模型捆绑销售。

事实上,模型越强就越“足智多谋”,塞在系统提示词里的那堆杂七杂八的东西反而成了累赘。Anthropic 发过一篇很好的文章:他们从系统提示词里删掉一些东西后,与用户提示词的矛盾变少了,模型表现反而更好。我们现在看到很多 harness 在为配合最新前沿模型而删代码。

但我不认为这说明 harness 不行。恰恰相反,未来会有更多 harness 出现——它是在模型之上构建用户体验的方式,是非模型实验室的开发者拥有用户关系的方式。对经济体来说,这一层的价值不可估量。

Harry: 这话说了我要被喷:harness 和 app 到底有什么区别?感觉就是个文字游戏——人人都在 harness、harness,我就想问:那不就是个 app 吗?喂?

Alex: harness 相比 app 的好处是可组合性(composability)更强:我可以让一个 harness 调另一个 harness,让它在云端的沙箱里再拉起一个 harness。

Harry: API 当年不就是这么赋能 app 的吗?

Alex: 是,但用 harness 做组合更可靠、更确定,用户也更容易看懂——因为 harness 都基于 Unix,而模型对 Unix、对 bash 命令的训练极其充分。

反过来,你让我指挥一个 harness 去编排云端的某个 app,问题就多了:这 app 怎么登录?要你的密码吗?是不是得拉起一个虚拟浏览器?过程会很慢。它得自己琢磨:好,浏览器起来了;现在需要密码;我得找到输入框在哪;这 app 里多半有个 API,得翻文档……好,搞定了。

围绕 app 做组合,“未知中的未知”(unknown unknowns)太多了;围绕 harness 做组合,几乎没有。所以 harness 给开发者的灵活性更大,而且是可检视的灵活性:API 调用你只能看着一堆代码在屏幕上飞;harness 呢,我可以跳进去看看里面在干嘛,还能用自然语言聊。它对用户友好得多。

Muse、Arena 与模型层的公用事业化

Harry: 我们看到 Meta 和 Muse 确实是扎克伯格(Zuck)的心头好,亚历克斯·王(Alex Wang)也越来越多地站到台前。Meta 交出的 Muse,让你印象深刻吗?

Alex: 他们干得不错。从零搭建一个全新的模型实验室需要时间,而且肯定有一堆组织债(organizational debt)要还。

Harry: 你觉得他们会成为真正的挑战者吗?

Alex: 会。他们有资源,也能围绕模型做出一些模型实验室不太有兴趣做的差异化竞争——比如有社交网络、有对“人”的关注,这对品牌是种加成,Grok 和 SpaceX AI 大概也有类似牌面。

但他们需要找到自己的生态位。我觉得大家还没搞懂什么时候该用 Muse Spark——什么场景用它、它的核心优势是什么。他们刚发布了一个编程 harness,眼下想做的是一个通用能力模型。我预期未来某个时刻他们会站出来说:看,我们在这件事上强得多。那个时刻对他们至关重要。

Harry: 有意思。Muse 其实给我印象挺深的。你知道我现在用什么吗?算是给咱们共同朋友打个广告——阿纳斯塔西奥斯(Anastasios)他们的 Arena(译者注:即 LMArena 模型竞技场)。体验很奇妙:我把提示词丢进 Arena,它返回一堆不同模型的选项,前几天还出来一个叫 Pergamum 的(译者注:冷僻模型名,转录如此)。

当时返回的是 Kimi 和 Pergamum 这些,一次给你四个不同选项。它把我带到我从来不会主动去用的模型面前——其实 Muse 也冒出来过几次,表现相当惊艳。我太爱这种模型发现机制了:说实话,老兄,搁以前我根本不会去碰 Kimi,我只会直接打开 ChatGPT。不过这事基本印证了一个观点:模型层正在变成一个公用事业层(utility layer)。

Alex: 此话怎讲?

Harry: 就是我对它们毫无忠诚可言,也没有品牌归属感。我上 Arena 就是一句:把你们的货都亮出来,给我看结果。我不在乎它是 Kimi、Muse、Claude 还是 Sonnet——你懂我意思吧?我只想看你有什么牌,然后挑最好的,我宁愿四个并行跑。

你信不信这种架构:一个前沿模型带四个开放模型?前沿模型也许 IQ 一百六,开放模型也许只有一百二,但这会成为我们日常使用的模型结构。

Highlights 高光金句

“我对它们毫无忠诚可言,也没有品牌归属感。我上 Arena 就是一句:把你们的货都亮出来,给我看结果。” "Well, actually, I have no loyalty to them. I have no affiliation with brand. I go to Arena, and I want to see what you got for me. Show me the results."

▍点拨:来自资深科技播客主持人的用户自白,比任何行业报告都更能说明模型层的品牌溢价正在蒸发。当“货比四家、并行开跑”成为用户习惯,入口和评测权就从模型厂商手里滑向聚合层——这正是 OpenRouter 与 Arena 共同的立身之本,也是模型厂商最不愿看到的权力转移。

Alex: 我完全认为这是一种所有人都该探索的架构,我们也一直在帮很多开发者落地它。

你可以设一组子智能体(subagent)——我们有一个子智能体服务工具,专门调校得极擅长通用化地使用模型——再设一个编排模型(orchestrator model),需要完成特定任务时就把子智能体叫出来。这些子智能体成本极低,专注于确定性任务。

这正是开放权重模型相对前沿模型的强项:当任务是确定性的——你知道输出的形状、知道问题的类型,而且是已经被解决过的问题类型,比如文本分类——你就该毫不犹豫地用 OpenRouter 上的低成本模型,然后让编排模型读取结果,继续去做它那个未知的、非确定性的任务。

重振美国开源:蒸馏与算力

Harry: 假如我想打造一个开放的美国生态——更多了不起的美国开放模型——并且让你来当这个项目的负责人。你会怎么激励美国开放生态更凶猛地与中国竞争?

Alex: 我想我会先多和现在的美国实验室聊聊,搞清楚“蒸馏(distillation)中国模型”对他们来说是什么样、效果如何。蒸馏中国模型大概能走出很远。

开放权重模型、中国模型的好处是大多允许蒸馏——你可以拿这些模型的输出,在自己搭建的模型之上做强化学习。这是 AI 行业非常重要、所有实验室都在做的常规操作。而且蒸馏时你能看到输出,可以检查它们是否对齐:如果开放权重模型里有什么让你担心、与你想造的模型的“声音”或“宪法”(constitution)不对齐的东西,你在做这些强化学习展开(RL rollout)时,抓住它的机会大得多。

另一件要搞定的是算力问题。算力是我们相对中国仍有的一大优势,而这些新实验室需要机会。在所有国家,都该有一条更顺畅的路把算力送到对的人手里——尤其如果我们要建一个有竞争力的美国新实验室体系的话。英伟达在这方面做得不错,但还有谷歌的 TPU、亚马逊的 Trainium。我会和所有硬件公司合作,也包括那些新兴芯片公司(Neo chips,译者注:转录如此,疑为新兴 AI 芯片公司的统称)。

我不认为算力优势能维持太久:DeepSeek 和字节跳动都在大举自研芯片——出口管制逼得他们不得不做。这是他们赢得 AI 竞赛的头号问题,也是习近平在这场竞赛里最棘手的难题:如果他们四周能建好一座桥,我觉得六个月也能捣鼓出一颗芯片。

Harry: 是啊,在芯片战里保持领先对美国至关重要。那蒸馏到底算不算错?它是造模型的技术,但人们提起它总带着嘲讽和不屑。

Alex: 蒸馏就是蒸馏,它是造模型的一种技术。闭源实验室也蒸馏——Sonnet 就是 Opus 的部分蒸馏版本——这就是从大模型造小模型的方法,也是在生态里发现好东西时教给模型的标准手段。

我们确实认为,实验室有权在服务条款里禁止蒸馏,公司也有权切断想造竞品模型者的访问。但如果你只是想造一个专注单一用途、不构成竞争的小模型,据我所知多数前沿实验室并不禁止。允许的和不允许的,各自都会有市场。我们要做的,是帮助两边都守住自己的服务条款。

Tips 知识科普

知识蒸馏(knowledge distillation)由 Hinton 等人 2015 年系统化:用大模型(教师)的输出分布训练小模型(学生),学生学到的不仅是标准答案,还有教师“怎么想”的暗知识。它是业界压缩模型的标准工艺——正如 Alex 所说,Sonnet 之于 Opus 即属此类。

争议在于蒸馏对象是否授权:OpenAI 曾公开指责 DeepSeek 违规蒸馏其模型,而 DeepSeek 等开放权重实验室则在协议中明确允许。同一种技术,一边是服务条款问题,一边是生态武器——Alex 的“帮两边都守住条款”,正是路由层的中立价值所在。

正面回应 Stripe 收购

Harry: 快问快答之前,我必须问一个问题——不问我会被听众撕了。有报道说你们正以 100 亿美元的价格卖给 Stripe。这事会成吗?

Alex: 我没法评论。但无论发生什么,我们都会把愿景执行到底。

我们在做的事对整个生态至关重要:我们相信 AI 的安全访问不该由某一家垄断接管,而应该有一个所有人都能探索的、生机勃勃的模型生态;当新的服务商、新的服务工具、新的推理周边技术上线时,能有一种极其简单的方式发现它们,并把它们和你现有的 AI 体系连接起来。

Facts 时空复盘

本期发布于 2026 年 8 月 10 日,Harry 开场那句“几周后我们再跟进”一语成谶:8 月 16 日 Bloomberg 报道双方已达成协议,8 月 19 日 OpenRouter 宣布加入 Stripe。据报道作价超过 75 亿美元(另有 80 亿美元以上口径)、以股票为主——低于传闻的 100 亿美元,但仍是三个月前 13 亿美元 B 轮估值的约六倍,也是 Stripe 史上最大收购。

Alex 在录制时的“不予置评+愿景照旧”是标准的交易静默期话术;而公告中“使命与团队不变”的承诺,与他本期反复强调的“多模型生态中立性”能否在 Stripe 体系内延续,是这笔交易留给行业的真正悬念。

Harry: 我换位想了一下这种处境:换作是我,反应大概是——我持有公司 22% 的股份,100 亿美元就是 22 亿美元,哦豁,我现在是风险投资家了。要做到不这么想,难吗?

Alex: 我真的不怎么想这件事。

Harry: 真不想?

Alex: 我个人花不了多少钱。我思考个人资本用途时,真正想做的是帮人们去解决那些天生不适合风险投资的问题——它们处在灰色地带:人们需要解决,但因为不附带商业模式,很难拿到钱。

现在非营利领域有些很酷的机会:你可以用 AI 审阅比以往多得多的数据。我还没准备好公开细说,但我确实想做点事,帮助研究者攻关这类问题并获得资助。

一个很酷的例子是戴维·菲亚尔科夫(David Fialkow)——General Catalyst 的联合创始人:他专门找那些拿不到投资、但极其重要的故事,出资把它们拍成电影。比如《异见者》(The Dissident),讲的显然是卡舒吉(Khashoggi)遇害的故事;还有《伊卡洛斯》(Icarus),讲的是俄罗斯兴奋剂丑闻。这些电影因为他的资助才得以面世——题材太政治敏感,没人敢投。他说:我要让这些“被禁的故事”被讲出来。

快问快答:被低估的模型、新实验室死亡率与员工成本

Harry: 对,就是这种感觉,我太喜欢这套东西了。他是个了不起的人。好了,准备好进入快问快答了吗?

Alex: 来吧。

Harry: 今天 OpenRouter 上最被低估的模型是什么?

Alex: 好问题。首先,Poolside 的模型很棒——我的快问快答答案就是它了:一家新的美国实验室,在做小巧而高效的编程模型,还在打造很多好用的访问工具。团队很棒。

Harry: 未来三年,七成的新型实验室(neolab)会死掉。同意还是反对?

Alex: 反对,七成太高了——本来也没多少家新实验室。如果“被模型实验室收购”也算死掉,我确实觉得可能会有一些整合;但就算算上整合,我也只给到五成。

Harry: 你觉得达里奥(Dario)(译者注:Anthropic CEO 达里奥·阿莫迪)在 AI 领域发声时,应该少点消极、多点积极吗?

Alex: 我觉得需要一个对未来极度偏执、居安思危的人。我个人很欣赏 Anthropic 的偏执。

当然,有些地方我希望别的模型实验室不要觉得自己被挤下牌桌。但我是神经多样性的坚定信徒,而 Anthropic 正是这幅神经多样性版图上极重要的一块。如果没有一个人极度偏执,就没有人发出那个声音。所以我很感激他们在做这件事。

Harry: 坐在你这个能看到所有人用量的位置上,最疯狂、但大家讨论太少的一件事是什么?

Alex: 很多公司显然在为成本管理抓狂:他们为推理账单发愁,又不知道该怎么思考这件事。这是一种全新的经营方式、全新的运营费用(OPEX)思路。

过去算员工成本的方式是:发一份工资,然后基本忘掉它——总归有人知道每个人挣多少,但那是个静态数字,也许每个季度绩效考核后调一次。而现在,每个员工的成本是动态的、各不相同的。

Highlights 高光金句

“而现在,每个员工的成本是动态的、各不相同的。” "Really, your employees all cost totally dynamic different amounts now."

▍点拨:工资是静态合约,token 是变动成本——“人+AI”的混合成本结构,第一次让“某个员工值多少钱”变成可按月波动的经营指标。这既是财务精细化,也是管理哲学的转向:从“限制用量”转向“按投入产出比管理智能消费”。

很多公司现在把“选模型”的责任压在员工身上。我认为未来它很可能会进一步下沉到员工层面:员工自己判断哪些工具和模型最适合自己的任务,然后公司来算——因为你做的这些选择,你这个人值多少钱。你作为员工的成本将是一个动态数字,取决于你在贵模型和便宜模型之间做选择的效率。

我给公司的建议是:照常做管理工作,让经理评估员工的绩效和产出,但同时把员工成本并排放在一起,画出两个象限——“值得庆祝的象限”:活儿干得好,成本又划算;“值得警惕的象限”:活儿干得一般,成本还完全失控,AI 狂热症爆表。然后就去处理那个警惕象限。

所以我认为大家讨论太少的是:AI 时代该如何看待员工成本——它应该是一个动态数字,而不是只有少数几个人知道、然后就此被遗忘的静态数字。

Harry: 精彩。但你能想象走到一个人面前说“不好意思,上个月你值十万,现在你值五万”吗?我觉得这对规划和个人都太……

Alex: 但员工自己掌控着自己的成本,这才是关键:每个人都能影响自己的成本数字。于是你开始思考:我作为员工有多优秀?效率又有多高?

Inverse 反向思考

“员工成本动态化”听上去是精细化管理的胜利,但它会撞上古德哈特定律:一旦“你的模型账单”成为考核指标,员工会为了压数字而少用贵模型、压缩探索性使用——长期看,省下的推理费可能远小于被扼杀的产出。

更深一层的代价在心理契约:“上个月你值十万、这个月值五万”的叙事,在劳动关系和留才上是破坏性极强的信号。Harry 的迟疑不是多愁善感——把人的价值与 token 消耗直接挂钩,实施成本可能远超它优化掉的那点运营费用。

最兴奋的两件事

Harry: 最后一个问题:看今天的版图,值得兴奋的事情太多了。如果只挑一件,你最兴奋的是什么?

Alex: 想到两件。一是罕见病研究——这一直是受智能瓶颈、说到底是受推理瓶颈限制的领域:它要做的就是海量试错,看哪个想法行得通。

二是众包式的城市生活改善。比如有人突发奇想,想找全美国、全英国的每一根铅水管,而且已经有了一套方法,只是需要把它做成熟、做压力测试——现在可以用 AI 来做。我们也许就此解决一些大家早已放弃的怪问题,因为你需要一个不知从哪冒出来的疯狂点子。绝妙的想法大致均匀地分布在全世界,可以来自任何地方——现在你只是给了它们真正落地的杠杆。所以我很兴奋的是:我们能给城市、乃至乡村的生活质量带来那种普惠式的改善。

Harry: Alex,老兄,这期我想做很久了,也很高兴是当面录的——之前还担心得远程,当面聊好太多了。你表现得棒极了,太感谢你能来。

Alex: 彼此彼此,聊得痛快。

Takeaway 行动指南

本期对话收敛出的关键判断与行动含义:

  1. 没人能通吃模型市场,“多模型”不是策略选项而是默认架构。 把模型选型做成持续流程而非一次性采购:给团队留出低成本试用新模型的通道,核心工作流之外的长尾需求默认走聚合层。
  2. token 降价不是威胁而是引擎,用量弹性大于价格弹性。 按“用量必然超预期”规划推理预算与容量:把故障切换、多供应商冗余前置建设,而不是等账单失控再补。
  3. 企业的真实风险来自前沿实验室的战略下探,而非中国模型。 审视自家产品是否建在模型实验室“志在必得”的团队与场景上(Claude Design 之于设计团队就是范本),并用多模型路由降低对任何单一供应商的数据与依赖敞口。
  4. 确定性任务用便宜模型,不确定性任务用强模型——编排架构是当下的性价比最优解。 一个前沿编排模型带若干低成本子智能体,先把分类、抽取等确定性负载迁到开放模型上。
  5. 员工成本正从静态工资变成动态的“人+模型”账单。 把模型使用效率纳入绩效视野,用“产出—成本”象限识别高效与失控,但警惕把 token 消耗直接变成考核指标。