洞见·20VC·2026.07.25

Mercor CPO Osvald Nitski:开源杀不死数据商,价值永远在能力前沿

Mercor CPO Osvald Nitski:开源杀不死数据商,数据价值永远在能力前沿;大企业对前沿模型的戒心、AI ROI 之问、产品经理的护城河是判断力。

Overview 背景概览

本文译自播客20VC,发布于 2026 年 7 月 25 日;主持人哈里·斯特宾斯(Harry Stebbings),对话 Mercor 首席产品官奥斯瓦尔德·尼茨基(Osvald Nitski)。

这是一场 Mercor 的人此前从未公开进行过的深谈:如果前沿模型真的把数据供应商的活也干了,会怎样?合成数据会不会蚕食这门生意?开源到底是敌是友——毕竟闭源前沿模型恰恰是他们最大的客户。Osvald 还给出了 Mercor 通向 2000 亿美元的多头剧本,以及为什么机器人的拐点更像 Waymo 时刻而不是 ChatGPT 时刻。

▍嘉宾:奥斯瓦尔德·尼茨基 (Osvald Nitski)

奥斯瓦尔德·尼茨基是 Mercor 的首席产品官。爱沙尼亚裔,在加拿大长大、多伦多读大学,早年听从“去小公司、去创业公司、搬去旧金山”的建议移居旧金山,职业履历集中在超高速增长公司。他加入 Mercor 以来公司员工增长超过 10 倍;作为 CPO 他统管两大产品域——匹配专家与任务的集市(Marketplace)和代号 Studio 的标注与评估平台,并主导了 RL 环境这一增长最快数据品类的交付爬坡。

▍关于 Mercor

Mercor 是一家 AI 训练与专家数据集市公司,CEO 为联合创始人布兰登·富迪(Brendan Foody)。

  • 核心模式:为前沿实验室和企业匹配医生、律师等各领域顶尖专家,交付评估集(eval)与训练数据集;合作分纯人才(talent only)与托管服务(managed service)两种模式,增长最快的品类是 RL 环境——高保真应用仿真加任务数据。
  • 增长与估值:2025 年 9 月完成 3.5 亿美元 C 轮、估值 100 亿美元;2026 年 6 月 ARR 突破 20 亿美元;2026 年 7 月起据彭博等报道洽谈约 5 亿美元、200 亿美元估值的新一轮融资,8 月报道英伟达拟参投、General Catalyst 拟领投,截至 2026 年 9 月尚未官宣交割。员工约 500 人。
  • 定价位置:数据采购直接挂钩客户的模型能力与收入——“花在 Mercor 上的钱直接转化为客户的收入”,这是实验室不砍价的原因。

开源会蚕食数据商吗——数据的价值永远在能力前沿

Harry: 这里是 20 Product,我是哈里·斯特宾斯(Harry Stebbings)(译者注:本期音频自报栏目名为 20 Product,实际归于 20VC 主节目)。今天坐上热点席的是 Mercor 首席产品官奥斯瓦尔德·尼茨基(Osvald Nitski)。

今天是一场非常坦诚的对话,以我认为此前从未有 Mercor 的人公开聊过的方式展开:如果前沿模型真的做到了数据供应商在做的事,会怎样?合成数据会不会蚕食他们的生意?开源对数据供应商是助力还是杀伤——毕竟他们最大的客户恰恰就是闭源前沿模型?这些以及更多内容,尽在今天与 Osvald 的对话中。

Harry: Osvald,你能来真是太好了。我从布兰登·富迪(Brendan Foody)(译者注:Mercor 联合创始人兼 CEO)那里听到太多关于你的好评,谢谢你促成这期节目。

Osvald: 谢谢邀请,我特别期待。

Harry: 我最近满眼看到的都是开源、开源、开源。人人都在说,我们会看到从闭源前沿模型向开源的大迁移。Kimi 最近刚发了新模型。说实话我也不确定——开源会不会蚕食 Mercor 的核心业务?

Osvald: 我不会说开源模型的进步在蚕食我们的核心业务,因为数据的价值集中在模型性能的最前沿。我们的每个客户都有自己独特的目标,采购评估集(eval)和训练数据集来补齐当前模型能力的短板。

开源模型只是抬高了大家兴趣的起点。只要客户还有想要变强的新能力,我们的生意就会继续增长。开源模型只意味着一件事:凡是 Kimi K3 已经会做的事,没人再为它花钱。

Highlights 高光金句

“开源模型只意味着一件事:凡是 Kimi K3 已经会做的事,没人再为它花钱。” "Open source models just mean that nobody is buying anything that Kimi K3 can already do."

▍点拨:开源把“已解决的问题”打成免费商品,数据商的定价权反而更纯粹地收拢到能力前沿——地板抬得越高,客户愿意付费的“天花板差距”就露得越清楚。这句话是本期全部论点的地基。

Harry: 那如果 90% 的企业工作流都能用开源模型完成——越来越多的人说是可以的——而那剩下的 10% 才是你服务客户、提供数据的地方。可能是我天真:随着那 10% 的前沿越推越远,你要做出巨额收入会不会越来越难?

Osvald: 我不太相信 90% 的企业工作流现在就能被开源模型或前沿模型处理。我们觉得这类测算是基于现有需求,或是当前模型用户脑子里最先想到的那些用法。

但还有一整类潜在需求,是人们根本还没尝试用模型去做的事。最典型的是长周期任务(long horizon tasks),比如部署一个采购智能体,把采购团队的工作全自动跑上几个月,你每周只看它一次。

当有人说“企业工作流已经被搞定了”的时候,这类需求根本没被算进去,因为还没人在做。支撑这类场景的数据市场正在增长,我们看到很多领先者都在往这个方向走。

Harry: 好,很多领先者在往那边走,发现了从没想过存在的新能力。但我们再看看亚历克斯·卡普(Alex Karp)——我觉得他那场表现算相当克制了,平时他蹦跶得欢得多,不过还是挺有激情。他谈到大企业对数据、对把数据分享给前沿模型厂商的那种强烈怀疑。你在大企业与前沿模型公司的合作中,看到多大程度的怀疑和恐惧?

Osvald: 我们看到它取决于具体的工作流,以及它对公司业务有多核心。像 HR、采购这种每家公司都要做的通用事务,敏感性低一些,企业更愿意把这些工作流放到专有模型上。

真正敏感的是公司的核心业务——那些对它的生死至关重要、让它区别于竞争对手的东西。你可以想象成律所真正提供的法律服务本身:它实际在写的备忘录是什么?它给客户提的建议是什么?

Harry: 是不是只有我看到了这里的讽刺——我们把最敏感的数据放在开源模型上,而且很可能是中国模型,反而把 HR 和采购数据放在闭源模型上?是我蠢吗?

Osvald: 这取决于你把开源模型跑在哪儿,跑在哪儿决定了这是不是个坏主意。开放权重模型(open weights)的美妙之处在于,推理可以在多个地方发生。你可能会用错它们,但你拥有更多控制权。

90/10 是个错误框架

Harry: 那这个分布你怎么看?你认为哪里不准确?你说你不太信 90/10 这个说法,你觉得更准确的图景是什么?

Osvald: 在我们的 APEX 基准(APEX benchmarks)里,长周期工作流上顶尖模型的得分正在接近 50% 左右。但有一类工作流是“够用即可”型的——做完就完了,比如更新 CRM,你不可能在这种事上再好出多少。

还有一类工作流,根本不该用“模型能不能做”这种二元框架去想,比如法律论证,某种程度上还有医疗建议——这些事永远可以做得更好。在这些场景里,百分比框架完全是错的,我们应该更多地思考连续的、没有上限的奖励。

Tips 知识科普

APEX 是 Mercor 自建的模型评估基准(AI Productivity Index),用真实的高经济价值专业工作——法律、医疗、咨询、软件工程等长周期任务——衡量前沿模型的实际产出能力,而不是传统学术基准的选择题式测试。Osvald 说的“顶尖模型得分接近 50%”指的就是这类长周期工作流的完成度:最值钱的活,模型眼下还只能干好一半。

Harry: 说到“可以做得更好”,我前几天请了 Fireworks 的创始人林乔(Lin Qiao)上节目。她说:正因如此,每家公司都会有自己的专用模型。因为永远可以更好,而且完全取决于公司——这家想抓增长,那家想抓利润率,还有一家,比如说在欧洲的,想抓工作与生活的平衡。所以每家公司都需要自己专用的模型。你认同每家公司都会有专用模型吗?还是说这有点替 Fireworks 自己站台的味道?

Osvald: 我认同。当然这也有替 Mercor 站台的成分——我们认为每个专用模型都需要企业专属的评估与训练数据,来告诉模型在它的场景里该怎么表现。

这个市场的多样性和规模,取决于客户能从专用模型里获得多少价值。有些场景的投资回报率(ROI)是完全站得住脚的,而且我认为这类场景会随时间增多。我们确实相信这个未来。

AI 的 ROI 之问:从薪资的 3.8% 到 100%

Harry: 说回来,卡普在那场访谈里的第二点是 ROI 存疑。你刚才提到 ROI 这个词,让我想起来了。这个问题很现实——企业可能对自己拿到的 ROI 心里没底。你认为今天的 AI 存在企业级 ROI 问题吗?

Osvald: 我不认为现在存在 ROI 问题。我们正处在一个探索和实验期,大家对“把 ROI 算明白”这件事更有容忍度、更有耐心。关于 token 价格走向、性能走向,有各种各样的预测。

现在确实开始看到一些地方在收紧开支。但我认为我们身处的范式仍然是“先看看再说”,因为变化太快,ROI 的算法本身还可能剧烈改变。

Harry: 这事我想从两个方向聊,先走第一个。ClickHouse 联合创始人兼 CEO 亚伦·卡茨(Aaron Katz)说他的开销是预算的 6 倍,而且就该如此,因为必须站在前沿。然后你又看到 Uber、微软,还有——我记得是 Grok 或者 X,反正是埃隆·马斯克(Elon Musk)的某家公司——在给每个员工定 token 预算。你觉得穿越这个周期的正确姿势是什么?如果我是一个在听的创始人,你会建议我怎么权衡性能与预算?

Osvald: 这完全取决于使用场景。我基本只在超高速增长的公司干过,那里增长高于一切——只要单位经济模型(unit economics)成立,为增长花钱的意愿就很高。

你给软件工程师买编程智能体的开销,不算业务的销售成本——就算很高,它带来的也可能是复利收益。但如果你看一个客服智能体,token 开销巨大,而从被服务客户身上赚到的收入远低于 token 开销,那你的处境肯定很糟。

不过我的经验都在成长期公司。对很多创始人来说,如果 token 开销花在增长上、花在提升人效上,那就是你创业期为承接海量需求必须付的成本。

Harry: Salesforce 的马克·贝尼奥夫(Marc Benioff)说他每年在 Anthropic 上花 3 亿美元,按平均薪资摊下来,大约相当于开发人员薪资的 3.8%。你觉得这会是以后的通行比率吗?会涨到 20% 吗?还是 100%?或者反而低得多?

Osvald: 我希望我们能走向一个把 token 开销所驱动的业务成果核算得更清楚的未来。即便在 Salesforce 这个体量的公司,不同团队也该有不同的开销画像:解决方案工程、前置部署这类团队要按单位经济模型算账,而研发团队可以有更高的开销容忍度。

所以在大公司,你得想清楚组织里哪些部分在做什么、不同领域该给多少容忍度。宏观上,我认为这个百分比会随时间上升,超过 3%。

Harry: 想听个好玩的吗?富迪在节目上说这个比例会冲到 100%,还说你们今天在 token 上的花费已经超过工资了。

Osvald: 对,是真的。100% 听着合理。我说过,我只在超高速增长的公司工作过,Mercor 就是这样的公司,而且随着增长天天提速,这一点还在不断强化。

对我们来说这说得通,因为需求太高了。我加入以来公司人数涨了 10 倍以上,收入也同步增长。我们就是在一场停不下来的赛跑里,去满足客户贪得无厌的需求。我们的问题是:花钱的速度赶不上需求涌来的速度。

Facts 时空复盘

“token 开销超过工资”在当时听着激进,两个月后就得到了资本市场的呼应:2026 年 7 月起,Mercor 被报道洽谈约 5 亿美元、200 亿美元估值的新一轮融资——较 2025 年 9 月 C 轮的 100 亿美元翻倍;8 月的报道进一步指英伟达拟参投、老股东 General Catalyst 拟领投。截至 2026 年 9 月,该轮尚未官宣交割。看客质疑“这不是真正的收入”与一级市场用脚投票形成的对照,本身就是本期最好的注脚。

AI 时代的产品管理:压缩表面积,判断力为王

Harry: 那我们是不是就用快 10 倍的速度做 10 倍多的产品?帮我理解一下:产品工程团队会变得更小吗?还是就是做得比以前多得多?你怎么想这个问题?

Osvald: 我认为这个范式让产品经理的工作难了很多,因为我们恰恰不想做出 10 倍的产品表面积——那会把一切搞得无比混乱。确实有些时刻产品表面积会疯涨,大家觉得“这些功能我很快就能做出来”,随手就推几千行的 PR。

但我们一直在打一场仗:简化产品表面积,找到最具扩展性的交互和工作流。所以产品团队的趋势是不断压缩表面积、做简化。

同时 PM 对工程师的比例在提高,因为工程不再是瓶颈——理解用户的工作流、理解用户的需求、判断什么产品真正带来收入,成了我们承接更多需求的新瓶颈。

Harry: 如果对比前 AI 时代,在这个新世界里,成为一个优秀 PM 的门槛发生了什么变化?

Osvald: 两大变化。第一,你不再需要学那么多工具,会用编程智能体就行,几个工具能干所有事。比如 Figma,我们正越来越多地弃用它,转向 Claude Design——工具多样性在降低。

第二,所有人都必须大幅升级,更多地思考业务影响。所有的工作都在往更高层级走:细枝末节被极快地解决掉,Mercor 的每个 PM 都必须反复想——我把时间花在这件事上对吗?

现在做事可以非常快,技能层面的问题几乎消失了。所以现在拼的全是判断力:我做的事,是不是业务价值最大的那件?

护栏:我们本该更早学会说“不”

Harry: 我得问一句。你刚才说,核心工作是保持简洁、决定做什么和不做什么。你在产品上做过什么事,事后看来希望当初没做?学到了什么?

Osvald: 今年有件很有意思的事。我们的标注平台服务很多不同的工作流。对人类数据的需求太大、太异质,而我们的交付团队又太擅长交付和销售项目,结果我们支持了——我觉得是——过多的人类数据项目类型。

我们做了一个极其灵活的工具,能支持客户想做的各种研究实验。数据形态从生成式 AI 时代的 InstructGPT 起已经变了很多轮:从监督微调(SFT)到偏好排序,再到各种环境类项目。还有很多多模态项目,格式完全不同,标注工具都得支持,工作流也各异。

客户什么要求都提,我们试图满足所有需求,做了一个灵活性拉满的工具,上面同时跑着几百个不同的项目——管理起来就是一片混乱。

我们本该更早做的是:给支持的服务类型装上护栏,跟运营团队更紧密地对齐最佳实践。客户什么都会要——我们能做,但就该做吗?如果某些工作流没有持久需求,也许就不值得投入。装护栏、收窄服务范围,是我们本该早得多就做的事。

Value 价值视角

用芒格的框架看,“客户什么都会要——我们能做,但就该做吗”是资本配置纪律的朴素版本。高增长公司最常见的死法是被销售牵着铺满低质量收入:每个定制工作流都吃掉运营带宽、摊薄产品聚焦。Mercor 产品团队主动给服务类型装护栏,本质是把“说不”制度化——能拒绝收入的生意,才守得住定价权和复杂度。

Harry: 你怎么判断什么是持久需求?

Osvald: 这正是 Mercor 成为超高速增长公司的原因——我们和整个市场、整个生态贴得极近。我认为这靠的是领导层的判断。很难说一两年后数据会长什么样,最好的办法是和形形色色的实验室负责人保持高频接触,不断验证假设。富迪做得很好,我们运营团队也做得很好。但说到底,它就是一种猜。

Harry: 哪家实验室的数据团队最先进、最成熟?

Osvald: 客户细节我不能多聊,但大家都非常强。每家都很成熟,每家都在不同方面让我叹服。这问题太不公平了。

Harry: 好吧,完全同意。那另一个该问的问题是:哪家最差?——开玩笑的。我真正想问的是:你刚才还提到一个点,我不意外但觉得很有意思,就是弃用 Figma。能展开讲讲吗?我听到越来越多公司在做同样的事。作为今天的产品负责人,你怎么看这个趋势?当时是怎么考虑的?

Osvald: 说实话,我让团队自己选择最顺手的工具。而我观察到几乎是普遍趋势:Claude Design 做得很好,大家真的爱用,上手容易,团队自然就迁移过去了。工具少一点、少管些许可证也省心。

而且 Claude 在不断推出各种好用的新功能,大家就被吸过去了。再说,采购团队也不用再挨个给人发 Figma 许可证,摩擦小了一截。

FDE 与服务化潮:短期的未来

Harry: 前面聊过企业 ROI。我们看到微软成立了服务部门,Palantir 显然在狂飙,服务正变成每个人生意里越来越大的一块。这就是 AI 企业级落地的未来吗?你怎么看部署环节中服务业务的惊人崛起?

Osvald: 我有个可能有点反主流的观点:我认为这是短期的未来。现在,懂得怎么用 AI 的知识集中在旧金山的一小撮人身上——他们真的懂怎么部署智能体、评估智能体、以 AI 优先的方式做工程和其他职能。这些知识还没有扩散到全行业,但迟早会。

到那一天,你可能就不再需要团队上门帮每家企业搭建 AI 智能体了,它会变成一种类似软件工程师的常规岗位。所以短期内,服务让落地成为可能;长期看,产品会越来越强,自己就能完成这些事。

Harry: Factory 的马坦(Matan)跟我说过:服务嘛,不过是烂产品的借口。

Osvald: 我认为这是个知识扩散问题。他说的算一种视角,另一个角度是:为什么不直接招个人在自己公司里做智能体部署?我的回答是——这种技能市面上还没有。

人才储备不够,不是每家企业此刻都能拥有自己的专家。但长期会改变,我觉得这是个十年尺度的变化。

Harry: 但优秀的工程师真的愿意做前置部署工程师(FDE)吗?优秀的工程师诶。

Osvald: 优秀工程师有很多种,成为优秀工程师的路径也有很多种。其中一种是:做出色的沟通者,直击问题本源,化繁为简。这类工程师非常适合做 FDE,也非常适合最终成为创始人。

这是一种极有价值的人才画像,正是大家招 FDE 时在找的人。这也是我们日常在找的画像——所以我们才有这么多校友出去创业。

Harry: 你觉得这是好事吗?我跟富迪也聊过——“Mercor 黑帮”成形是件好事吗?毕竟你也想留住人才。

Osvald: 我很自豪:在跟我最亲密共事的团队里,我经历的流失只有“出去创业”这一种,而且还不少。比起跳槽去别家,因为创业而失去一个人,好太多了。

从个人情感上说这很有意思——我喜欢这些人,祝他们顺利,真心乐见其成。当然,这也让管理工作难了很多:我们这儿高自主性、野心勃勃的人太多了。难是难,但我喜欢。我宁愿待在这样的环境里,也不愿待在那种人人“哎呀我不想干活”的温吞环境里。

Tips 知识科普

“黑帮”(Mafia)这个典故源自“PayPal 黑帮”——一群从 PayPal 离职后创办或执掌了特斯拉、LinkedIn、YouTube、Palantir 等公司的前员工。Harry 问“Mercor 黑帮成形是好事吗”,实质在问高强度人才密度公司的副产品:校友网络会反哺招聘与声誉,但顶级人才持续失血去创业,也是真实的组织成本。Osvald 的答案很明确:因创业流失,好过往别处跳槽。

招聘新规则:别把决策外包给模型

Harry: 难怪你离开了欧洲。在后 AI 时代的新世界里,招聘发生了什么变化?看看你今天招进团队的人——尤其是产品岗——有什么是你今天会问、会看重,而以前不会的?

Osvald: 接着前面“每个人都要升级、更贴近业务影响”那点说,我们的招聘确实偏向更资深的候选人——他们更擅长理解什么在推动业务前进,能真正吃透我们怎么运营、怎么创造更多收入、怎么把服务交付得更好、怎么让客户满意。我发现资深候选人领会这些要快得多。

而且像前面说的,那些更偏初级的考察点——“会不会用这个工具”“能不能干这些杂活”——越来越不重要了。所以我们的招聘整体偏向资深候选人。

Harry: 你知道我担心什么吗?我怕你们正好掉进那个经典的——恕我直言——高增长公司的“创始人模式”陷阱:VC 走进来说“你得从 Facebook 挖这个人”,你招来一个完全贴合那套画像的资深老炮。然后从来没有成功过。从来没有。

Osvald: 我们不是那种做法——“资深”是个光谱。我不是说我们在招以前坐高管位子的人。我们是把每个岗位都当高管搜寻(executive search)来做:找到那个正好处在甜蜜点的人——仍然有饥饿感,已经干过几年我们要他干的活,正好进入自己的巅峰期。

Harry: 你觉得人什么时候进入巅峰期?

Osvald: 我认为是 25 到 35 岁。

Harry: 我刚满 30,正好卡在正中间。时机完美。说回面试——你们在带回家作业(take-home assignment)里考察的东西,变了吗?

Osvald: 我们已经基本放弃了传统的带回家作业。现在只保留一个:给你一段时间,你自己去用智能体做出一个成果给我看。跑一次,你就知道这个人是否具备 AI 流利度(AI fluent)。之后我们更多转向白板面试(whiteboarding),因为我们想避免——

Harry: 我插一句确认下流程:先有一轮确认这个人熟不熟 AI 工具,好,过关了;然后你说“进我房间,这儿有块白板”。接下来呢?你想看到什么?什么会让你眼前一亮?

Osvald: 我们非常看重:能不能设计好的实验、懂不懂统计、有没有好的判断力,再加上系统设计(systems design)。原因是,这些技能实在太容易——

Harry: 实在抱歉,打断一下。设计好的实验、系统设计——这听着有点空。具体到底是什么意思?

Osvald: 我们会让候选人——我不想透露太多面试细节,但作为产品团队,我们要跑大量实验,必须确保团队知道怎么设计一个真正带来信息量的实验,而不是做个完全走过场的样子。

有了 AI 工具,把大量思考和判断外包出去太容易了。我们要确认的是:这个人仍然保有判断力,知道自己在做什么,而不是只会复述 Claude 吐出来的东西。

Harry: 这太有意思了,我完全同意。我在自己团队里就是这样:我们做内容脚本、做短视频,我的采访问题全部自己写,绝不用 AI——我很担心,因为你会失去那块肌肉。请教一下:在这么多人已经对 AI 上瘾的情况下,你怎么保住思考、保住创造力?

Osvald: 我跟团队说,这有点像手机——它会烧坏你的大脑,把脑子搅成一团浆糊。但我也爱用手机,天天用。你得自己找到那条边界:什么时候刷短视频合适,什么时候不合适——开会的时候就别刷。

在工作上,我认为那条边界画在“判断与决策”和“执行”之间。我非常小心,永远不把判断和决策委托给模型——它会让你以为它在做对的事,但你必须对它们保持偏执,每件事都要复核。

我跟团队说的是:不要把决策——你真正的本职工作——委托给模型,否则你会失去那种能力,然后陷入 AI 妄想症(psychosis),再然后,恶果就会体现在结果上。

Highlights 高光金句

“不要把决策——你真正的本职工作——委托给模型,否则你会失去那种能力,然后陷入 AI 妄想症。” "...don't delegate your decision making, like your actual job to a model because you're going to lose that ability and then you're going to get psychosis."

▍点拨:Osvald 把边界划在“判断与决策”和“执行”之间——执行可以外包,判断不行。Mercor 的面试改革(白板 + 实验设计)正是把这条边界制度化:AI 流利度用一次智能体作业筛掉,剩下的全在考判断力。对知识工作者,这大概是本期最可直接抄走的一条。

Harry: 回头看你们跑过的那些实验,数据和结果相关吗?我常拿投资打比方:有时候我什么尽调都不做,反而大赚;有时候做足了功课,却做出把钱亏光的烂投资。投入和产出相关吗?

Osvald: 不一定。我们跑很多实验,有时相关,有时不相关。我们想要的是更多真正跑出好结果、推动业务前进的实验。

团队的核心工作就是找到该跑哪些实验,并把叙事立起来:产品的这些改动确实正面影响了业务。一周一周、一月一月,结果会波动,但我们努力让趋势朝正确方向走;团队也会越来越懂产品的规律、越来越懂用户,持续改进。

pod 制团队与周五下午的周会

Harry: 说到产品和工程跑实验、跑好实验,你们今天是怎么搭团队结构的?例会开起来是什么样?

Osvald: 我们有几个做实验的组,主要对应两大产品域。一个是集市(marketplace),负责把专家匹配到任务;另一个是标注与评估平台——专家登录进来做评估集或训练数据集的标注,运营团队登录进来跑项目,客户登录进来查看数据、跑评估。

标注平台我们内部叫 Studio,集市就叫 Marketplace。这两个组各自相对独立,专注把自己的产品做得更好。

人类数据业务有两种主要合作模式。一种是纯人才模式(talent only):我们把专家派给客户,客户自己跑项目——比如实验室需要一位医生或律师,我们只负责找到最合适的人,薪酬、绩效管理、项目执行都归客户。

另一种是托管服务(managed service):我们直接交付数据。纯人才模式只走集市;托管服务则先用集市把专家送进标注平台,我们跑完项目,把完整数据集交给客户。

Harry: 懂了。这是两个独立的产品团队?

Osvald: 两个独立的产品团队。

Harry: 产品团队多大?

Osvald: 每个产品域两三名 PM 左右,各配专属的数据科学家;设计团队只有几个人,在两个产品域之间灵活调配。

Harry: 也就是四五个人一个小组(pod)?这些比例会随时间变化吗?PM、设计之间的配比会保持现状吗?

Osvald: 我认为 PM 对工程师的比例会随时间变化——每个 PM 对应的工程师会更少,因为编程智能体越来越强,工程速度在提升。瓶颈会变成理解业务需求、理解用户需求,这更是 PM 的活。

作为超高速增长公司,我们必须非常小心地让各团队同速扩张——过去一年人数涨了 10 倍以上,不能让某一侧长得比另一侧快太多。但趋势确实是 PM 占比越来越高。

Harry: 说到跑好实验、把流程拧紧,落到例会上是什么样?你们有每周产品会——今天安排产品例会节奏的正确方式是什么?会该怎么开?

Osvald: 我们把它拆成几层。每个产品域内有全体周会,产品、工程和很多其他相关方都参加。产品域下面再拆成小组:比如一个产品域有三名 PM,各自带一个 pod,负责产品中可以天然切分出来的部分。

拿集市来说,它天然分成面向专家的一侧和面向招聘经理的一侧,这就是两个 pod;里面还有别的 pod,比如管理专家体验、确保客服顺畅、保证与专家协作不出任何岔子。每个 pod 自己做迭代规划(sprint planning),然后在产品域周会上汇合。

我们努力保持高效,同时维持 pod 之间的充分透明——大家的路线图必须对齐。但周会是必须的,这是维持问责的方式。会放在周五、时间安排得晚一点,确保没人提前开溜过周末。

Harry: 有什么是你们产品会上没做、但应该做的?

Osvald: 好问题。因产品域而异——集市和标注平台面临的挑战不太一样。快速增长期最主要的挑战是:从其他团队获得恰到好处的沟通和反馈。

集市团队和 Studio 团队需要互通信息——经常是一边出了问题,症状却在另一边冒出来:一个产品上的毛病,莫名其妙影响到另一个产品上的专家体验。人数和团队膨胀得太快,沟通渠道呈爆炸式增长。

所以我们需要更多跨产品域的协作,同时还得保持高效——团队一大,这真的很难,因为节点一直在变多、一直在动。

供给侧的秘密、利润率与“这不是收入”

Harry: 集市供给侧能这么高效地扩起来,秘诀是什么?你们怎么做到的?

Osvald: 我大概会归因为三件事。第一是极致的专家体验:专家按时拿到钱、拿得多、规则透明。每个涉及专家体验的人都真心在乎他们顺不顺利、工作体不体面、报酬公不公平。

这是好的转介绍机制的前提——没人会把朋友同事推荐去一个烂活儿。人人都在乎专家体验,自然就驱动了强大的转介绍。

此外,我们有一支出色的寻源(sourcing)团队,能在世界各个角落找到身怀特定技能的人——某个技能的需求突然出现尖峰时,他们能帮我们补上缺口。

Harry: 专家们是不是都只看钱——谁给得多就去谁那儿?我听说 Mercor 给钱最多。

Osvald: 我不会把这叫短视——我们自己也要留住顶尖专家。单个项目给再高的钱,也留不住人。据我所知,这个领域有不少竞争对手会搞疯狂的短期冲刺奖金之类的玩法,但那远不如“极好的整体体验”让人愿意回来。

所谓体验是:有充足的活、看得见接下来有什么活、感觉自己的技能在成长、能在几个任务之间挑着做、做的是有趣的工作、项目负责人沟通顺畅。在网上接活本来就是件很陌生的事——注册完甩给你一份 100 页的作业说明文档,这种体验太劝退了,这也是体验的一部分。

真正让人保持兴趣的是:你知道自己会因为一份能长期做的事,长期拿到高报酬。

Harry: 你们的利润率随时间改善了吗?还是说考虑到业务的复杂度,利润率基本是固定的?

Osvald: 利润率在这门生意里是个有意思的话题。作为产品团队,我们思考的是怎么给客户交付最大价值——这和怎么给项目定价是两回事。

有些环节可以用自动质检和合成数据来改进交付,有些环节可以通过调整项目人员配置来改变服务成本。所有这些,产品团队的出发点是:给客户最好的价值,给专家最好的体验。

利润率是事后根据成本核算出来的。现在很多项目的成本,主要由专家薪酬和花在合成数据、自动质检上的 LLM 开销构成。

Harry: 外面一堆看客起哄“这不算真正的收入”——朝你扔花生的那种。这会让你恼火吗?有没有什么大家一直没看明白、你觉得该说透但没人说的东西?

Osvald: 不恼火。因为我们每周结束的时候,银行里又多了几百万美元。我在别的公司见过各种有趣的财务工程和会计玩法,人们可以造出五花八门的指标。

但我们每周结束时账上都多出一大笔钱——生意非常健康,我们花钱的速度都赶不上进账。别人爱怎么叫随他们,现金流是疯狂的。

Inverse 反向思考

但看客的质疑并非全无道理。“每周账上多几百万”是现金流口径,不等于确认收入的利润率:人力交付型收入天然带着毛利率天花板,专家薪酬是主要成本且随技能门槛上升,高增长还可以掩盖应收、预付与人力错配。这门生意真正的考验不在银行余额,而在利润率曲线能否随产品化(自助式、AI 项目经理)抬升——这正是 Osvald 自己说的下沉市场赌注。

收入集中度:向下沉市场走

Harry: 收入集中度这么高,要紧吗?前沿模型厂商是你们目前最大的客户,有人会说这集中度太高了。你怎么看?

Osvald: 我从它对产品团队的影响这个角度回答。我们最大的挑战是往下沉市场走,让每一家企业都能高效地跑用于评估和训练的人类数据项目——这肯定会分散我们的收入,因为企业远比实验室多。

这是更难做的产品,也正是我们带产品、带公司走的方向:自助式服务、高效跑项目、配上 AI 项目经理,让小客户也能轻松做这件事。为实验室跑人类数据项目极其困难,那是白手套式(white glove)的服务,运营团队要投入大量人力。

随着产品和流程把这件事做得越来越高效,我们就能为更多客户做更小、更异质的项目。这是我们一直在走的方向,集中度已经在下降;随着每家企业都开始为自己的专有场景产生人类数据需求,我们会继续走下去。

Value 价值视角

巴菲特视角下,客户高度集中是经典的脆弱点——但评判关键在转换成本与定价权。实验室更换数据供应商要重建评估集对齐与交付磨合,黏性不低;更难得的是管理层清醒:不把头部实验室的收入当护城河,而是主动用产品化把同一能力卖给成千上万的企业客户。集中度是现状,下沉是解法,这个次序是对的。

Harry: 难在哪?是把它做得足够简单难,还是解释清楚难?把这件事民主化的挑战到底是什么?

Osvald: 跑人类数据项目本身就是难。有海量信息需要从客户、甚至客户的终端用户那里传递给专家,而且每个边角案例(edge case)都重要。

人们会想写一份“数据点该怎么标”的指南,但专家总会遇到新的边角案例冒出来——而你怎么处理这个边角案例,影响很大。做人类数据项目,本质上就是不断把边角案例浮出水面的过程。

这需要客户(有时还包括客户的客户、领域里的其他专家)和做标注的专家之间以快到离谱的速度对齐,还需要运营团队保持极度的偏执:确保每个数据点都完美、符合客户的指南、项目按时推进、所有瓶颈都被清掉。

这是运营强度极高的过程,因为它天然要处理没见过的、超出模型能力边界的事。而且数据形态变化非常快:从监督微调到偏好排序,到基于评分准则(rubric)的标注,再到现在跨一大堆模态的 RL 环境。每个项目内部、项目之间都有大量复杂度。

所以我会归结为两点:对偏执的需求,和对极其清晰沟通的需求。

RL 环境与“创始人作坊”

Harry: 哪种数据类型今天需求还不大,但你认为明年会爆?

Osvald: 我们增长最快的数据类型是环境(environments)。你可能在 Twitter 上刷到过很多关于 RL 环境的讨论——这词有点被炒热了,每家公司的定义都不太一样。但我们无疑是这个品类的领导者。

我们对它的理解是:把你希望智能体学会使用的应用做成仿真,再配上一个丰富的初始状态——我们叫它“世界”(the world),基本复刻你笔记本电脑上会有的所有数据;然后设计任务,训练智能体用这些工具完成有用的事。

这个标注过程挺复杂:智能体要和这个模拟世界交互,而初始状态可能有几百上千个文件。这里的转变在于:智能体被评估和训练所用的数据,看起来和它们上线后真实面对的环境接近得多。

想让模型学会用 Salesforce,你就需要一个行为与 Salesforce 完全一致的高保真模拟环境来做评估和训练。搭这套东西很复杂——就像当年 InstructGPT 刚出来时监督微调很难搭、偏好排序也很难搭一样。这就是当下的前沿,各家实验室都在攻关。最终它会顺滑到企业也能自己上手。

Harry: 实验室在数据采购上对价格敏感吗?

Osvald: 你说的数据采购是指——

Harry: 我是说,他们跟你做项目的时候砍价吗?会讨价还价说“Surge 的埃德温·陈(Edwin Chen)给了我九折,你也得给我”?还是直接“把数据给我就行”?

Osvald: 谈判和采购团队想拿到更好条件,这种成分永远都有。但我们选了门好生意:我们的工作直接影响客户的业务成果。

我们的处境很好——如果你在实验室里做评估集,评的就是客户想做的事,你只要做得更好,就能赚更多钱;如果他们买训练集,那就是在爬坡优化那个代表客户需求的评估集。

所以只要花在数据上的钱小于由此带来的收入,他们就乐意把杠杆拉满——人们想越拉越狠,因为花在 Mercor 上的钱,直接转化为客户更多的收入。

Highlights 高光金句

“只要花在数据上的钱小于由此带来的收入,他们就乐意把杠杆拉满。” "...as long as like the amount of money they're spending on data is less than the revenue that they're going to get, they're happy to crank the lever."

▍点拨:这是供应商能占据的最好定价位置——客户采购的不是成本,而是产能。当开销直接挂钩客户的收入函数,谈判就从“砍价”变成“你能交付多少”。这解释了为什么实验室对数据价格不敏感,也解释了 Mercor 的议价底气。

Harry: 你觉得未来会是一个拆散(unbundled)的数据供应商世界吗?我是做风投的,见过太多人跑来跟我说“我们就像 Mercor,但只做家用机器人”。我心想:行吧,挺好,懂了。但你真的觉得会出现那种垂直化的数据供应商世界吗——每个细分赛道里上千家玩家?

Osvald: 某种程度上,我们已经在这个世界里了——只是小玩家并不总能成功。我的描述是:我们面对的是一个“创始人自己动手做标注”的作坊式行业。

随着模型越来越强、标注的技能门槛越来越高,出现了一批创始人亲自下场造数据的小创业公司。实验室爱死这个了,因为这完全是错误定价:这些人融了一大笔钱、有的是现金可烧,跑到实验室门口说“求你把生意给我做”。

他们是聪明人、是创始人、以前也是很强的技术员工,但项目是他们自己在跑、标注是他们自己在做。这本质上是 VC 补贴的活儿,实验室当然喜欢。

问题在于规模做不起来——超出一个创始人或几个全职员工能做的数据量就不行了。这就是我们的处境:要跟“创始人领队做标注”竞争,其中有些人甚至把它当现金流生意做,赚了钱自己揣兜。但它扩展不了。

供应商和客户都清楚:当你想把吞吐量和项目数放大 10 倍时,这套玩不转。不过它确实预示了这个领域的方向:我们需要更高技能的专家,需要世界上最优秀的人来做标注。

Inverse 反向思考

“作坊扩展不了”的安慰可能低估了威胁。VC 补贴的创始人作坊不需要赚钱,就足以压低实验室的采购价格预期——实验室明知它不扩展,也乐得用它压价。Mercor 的真实风险未必是丢订单,而是整个品类的价格锚被补贴型对手慢慢打穿;对手亏钱做的事,照样能伤到你的毛利。

Harry: 别笑,我是有点 ego。我喜欢觉得自己是那片特别的雪花。我的意思是:当 Meta、OpenAI 或者任何大公司同时从好几家手里买数据时,我会觉得——你这是花心,是劈腿,背叛了我。你介意吗?你们会监控预算吗——客户花在你们身上的预算占比,对比其他供应商?

Osvald: 当然,我们做大量竞争情报。客户喜欢我们,所以经常主动跟我们分享信息。但大家的目标都是让模型变得更好,所以我们欢迎这种竞争压力——它告诉我们该往哪儿走。

如果有人在某件事上做得比我们好,我们想听,然后做得比他们更好。供应商之间同场比测(bake-off)是健康的,逼我们把服务做得更好。我们会盯紧这件事:要知道谁比我们强,然后超过他们。只要最后是 Mercor 在赢,这完全是件健康的事。

Anthropic 会吞掉一切吗——黑客事件与网络安全

Harry: 前面说到了“前沿”。我是 Legora 的投资人(译者注:Legora 是一家法律 AI 公司),人人都跟我说:“不,你真正的竞争对手其实是 Anthropic。”我就说:如果 Anthropic 跑去抢法律业务、去赢 Cooley 和 Goodwin 这样的客户(译者注:两家均为美国知名律所),那这个世界肯定是哪儿出问题了——他们应该去攻克癌症和气候变化才对。

我这句话在多大程度上是对的?我该怎么平衡“Anthropic 会杀向 Legora、杀向 Figma”和“Anthropic 同时在攻克人类今天面临的前沿难题”这两件事?

Osvald: 好问题。我会看看其他大公司的先例——Google、微软,巧的是也都号称要解决气候变化和癌症,但那不是他们的主业。他们把手伸进了很多领域,但竞争者照样涌现。

你还记得 Google+ 吧?它哪儿也没去成。它刚出来的时候可能吓到了一些人。你可能也记得 Threads——我不知道它现在怎么样了。

Harry: 据他们市场团队说,4 亿用户。

Osvald: 挺有意思。我就不多评论了,因为我——

Harry: 多迷人啊。真想看看它的互动率。

Osvald: 我是真的对此一无所知。不过话说回来,看先例的话:大公司经常想下新注、做多元化,但会输给对市场极度专注的公司。

走着瞧吧。但我会想:Google 和微软的历史或许有可学之处——业务单元一大堆、动作一大堆,但驱动全部收入的始终是核心业务。

Facts 时空复盘

Harry 的担心在节目播出前后部分成真:Anthropic 于 2026 年 4 月推出 Claude Design(正面对上了 Figma 的领地),5 月又发布 Claude for Legal——12 个执业领域插件、20 多个 MCP 连接器,直接对接 Westlaw、Harvey 等法律科技基础设施,企业收入占比已远超同行。不过 Osvald 的另一半论据也还站着:这些垂直产品迄今并未压垮 Legora、Figma 等专注者,“大公司多元化输给专注者”的历史规律是否重演,仍是开放问题。

Harry: 你知道,我很爱富迪。那次黑客事件发生的时候我还给他发了短信(译者注:指 Mercor 此前遭遇的安全入侵事件)。被黑客搞的时候很难办——你不知道说什么好,只能说“我挺你”,竖个大拇指。那一刻我感觉自己真是个典型的 VC:“我挺你,祝好运”——屁用没有。

我的问题是:那件事怎么改变了你的产品心态和产品方法?那段日子很难熬,我记得你顶着巨大的压力。说真的,我为此感到抱歉——经历那种事太可怕了。它怎么改变了你的产品观?

Osvald: 我不是安全专家,但我们招了很多安全专家,而我听他们的。主要的变化就是:更大的投入,以及向我们招进门的专家们学习。

Harry: 我们是不是正在进入网络安全的黄金时代?我的意思是:海量 AI 生成代码正在涌现,很多都有漏洞;Lovable、Replit,随便你点名,都在产出天文数字的代码量。威胁的增速会比我们预想的大得多吗?

Osvald: 很可能,是的。我们看得最清楚的一点是:安全是个很有意思的数据类型,因为它是对抗性的——网络攻防上可能出现 AlphaGo 式的局面,奖励没有上限、性能没有上限,领域一直在动。

我们最喜欢这类东西,因为从数据角度看它像一场博弈。我们看到对网络防御能力的需求在非常快地增长,数据类型也非常有意思。而这就是一个例子,说明有些事的“够用”根本——

Harry: 等等,帮我理解一下。围绕安全,人们想要什么样的数据——那些在这波需求爆发之前没人想要的?

Osvald: 我得小心,不能透露太多客户工作的细节。这个品类增长非常快。安全工作的一大本质是它的对抗性——它不是“更新一下 CRM 就完事”那种够用即可型的活。

攻防能力之间永远在玩猫鼠游戏。回到我们之前聊的“90% 的企业工作流已经能被完成”——安全领域永远不会有那个 90%,因为球门永远在移动。

所以安全这个品类在整体增长,而其数据类型的本质就是无上限、持续演化、目标不断移动的对抗博弈。

旧金山人才战争与混蛋政策

Harry: 再帮个忙。你是爱沙尼亚裔。我常跟欧洲创始人说:旧金山是创业最烂的地方——招不到人、招不起人、也留不住人。旧金山的人才战争真有看上去那么残酷吗?

Osvald: 挺残酷的。招人难,留人难,都难。我觉得比以前更难。但你在火箭上的时候,这些都容易——坐在火箭上招人总是容易的,难的是想清楚该招谁。

Harry: 你招错人的时候,回头看,有什么是你当时没看见、希望自己看见了的?

Osvald: 自主性(agency)和主人翁意识(ownership)在面试里真的很难评估。

Harry: 假设我才华横溢——超级有才——但有点混蛋。不是彻头彻尾的混蛋,就是有点浑。你能接受吗?

Osvald: 如果你确实超级有才,能。这里的公司文化是高自主性、高绩效、高主人翁意识。性格是可以改的——你可以学会更好地与人相处。

我们在乎的是成长,我们想招“真在乎”的人。让一个人变得在乎,比让他跟同事磨合顺畅要难教得多——后者简单,喝几次酒就磨合好了。可以容忍几个混蛋,多喝几轮就没事了。

而且,如果你招了好几个混蛋,他们可以互相作伴。没事的,自成一圈。

Harry: 你可没招多少混蛋。

Osvald: 对,我自己倒可以算——

Harry: 还有,欢乐时光(happy hour)?真的假的?

Osvald: 其实我们最近刚办了一次很棒的团建,和标注团队去了加拿大的托菲诺(Tofino)——在加拿大西海岸,是唯一能冲浪的地方。我们去了漂浮桑拿,玩得特别开心。

我觉得这对团队真的很好,钱花得很值,人人都喜欢。我认为做这种让大家动起来的户外活动是好的。

快问快答与 2000 亿美元 bull case

Harry: 准备好快问快答了吗,兄弟?过去 12 个月,你在哪件事上改变想法最大?

Osvald: 老实说,可能是环境——RL 环境这个市场。去年我们刚开始做的时候,交付太复杂、太难跑通,我以为这事成不了,以为它扩展不起来。结果它跑通了。我挺意外的。

Harry: 是什么变了?

Osvald: 需求实在太高,而我们就是把它跑通了。我们试了非常多种方法,才让环境真正提升模型性能。就是一直死磕,最后成了。

Harry: 假如我是你弟弟,今天在大学读计算机。你把我摁下来说:“老弟,你得知道这件事。”我该知道什么?

Osvald: 尽早去实习,真正的实习——因为学校里学的东西,大概率很快就过时。

Harry: 该去哪儿实习?我知道这问题听着蠢——我该自己创业?去高速增长的公司?还是去那种“屋里有成年人”的成熟大公司?

Osvald: 也许我有偏见,但:去旧金山的高速增长公司。不需要“屋里有成年人”,但要在前沿上——那才预示着这个领域往哪儿走。规模比 10 人大一点、别太早期,这样能过滤掉那些可能哪儿也去不了的公司。

Harry: 那你说,我是不是已经错过了——错过你们了?错过 Mercor 了?

Osvald: 不。我们仍然像创业公司一样运转。

Harry: 你们现在多少人?

Osvald: 大概 500 人。文化上我们是创业公司:偏执、全员坐班、行动快。我们想尽可能久地保住这种状态。

Harry: 你最尊敬哪家竞争对手?为什么是他们?

Osvald: 我不怎么想竞争对手。他们都差不多——都落后我们一截。我们努力不去想他们,把心思放在客户身上。我非常尊敬我们的客户,热爱他们做的工作。

竞争对手的动向我们也盯,但每次我点开他们的网站,他们做的东西都是我们一周或一个月前做过的:我们发篇博客,一周后有人发一模一样的;我们改一下官网,有人跟着改一模一样的。所以我把更多时间花在——

Harry: 这话你对 Surge 也敢说吗?

Osvald: 这种事发生过。他们确实有点“野”。

说实话,我没花多少时间想他们,我更多在想客户。我们观察过:他们确实不太一样,不太抄我们,和这个领域里其他玩家相比显得有点独特。说不清为什么——他们非常神秘。

Harry: 请你描绘一下 Mercor 成为 2000 亿美元公司的多头剧本(bull case)。

Osvald: 当然。表面上看我们卖的是服务——我们基本是一家技术赋能的服务公司。而我们的服务对客户极其有价值:主要通过更强的模型能力,直接驱动他们的收入增长。

评估和训练数据是当下模型性能的首要瓶颈。如果每家企业都需要专有的专用模型,那么即便能力开始饱和,评估集既是“你到底想要什么”的产品需求文档(PRD),又是持续优化性能的优化目标。

Highlights 高光金句

“评估和训练数据是当下模型性能的首要瓶颈。” "Evals and training data are the primary bottleneck to model performance right now."

▍点拨:这句话是整个 2000 亿剧本的地基:如果瓶颈在算力或算法,Mercor 只是个普通外包商;如果瓶颈在数据与评估,它就是前沿竞赛的“卖铲人”。听的时候记得立场——说这话的人正是卖铲的,但 ARR 曲线确实站在他这边。

只要更强的模型对经济有价值,对评估集和训练集的需求就会一直在。如果我们能让这个过程越来越快,就能承接不断增长的人类数据需求。此外,我们还有一条不断壮大的企业级智能体部署业务线。

Inverse 反向思考

反过来看,2000 亿剧本的三块积木各有裂缝:“每家企业都需要专有模型”若被通用模型的长上下文与工具调用吸收,评估集需求会变平;“数据是首要瓶颈”若被合成数据与自博弈(self-play)绕开,人类数据的溢价会缩水;企业级智能体部署更是公认的服务泥潭。三个假设都不必全错,错一个半,估值锚就要重画。

机器人:更像 Waymo 时刻,而非 ChatGPT 时刻

Harry: 今天没有、但三年后会很重要的收入线是什么?

Osvald: 我认为真实世界的物理数据会在未来三年显著增长。机器人对我们是个有意思的领域。机器人的数据市场相对生成式 AI、相对自动驾驶都还很稚嫩,我们认为它会长大很多。

Harry: 你们会赶在需求之前先扩供给吗?

Osvald: 我们有时会留住杰出人才,去做未来可能有价值的事;也会在需求低谷时做一些现货式(off-the-shelf)的数据集——先把供给用起来,日后再转卖。这种意义上,会。除此之外,不会。

Harry: 你收到过的最好的一条建议是什么?

Osvald: 很多人劝过我:去小公司,去创业公司,搬去旧金山。我在加拿大长大,在多伦多上大学,后来我照做了。这个建议很棒,我很喜欢在这儿的生活。

我喜欢小公司,喜欢高速增长的公司。这段经历超级好玩,对我的职业生涯也极好。

Harry: 最后一个问题:有什么事让你最兴奋,而你认为讨论的人还不够多?

Osvald: 可能和前面是同一个答案:三年尺度上的机器人机会。Twitter 上和某些圈子里确实有很多关于机器人的讨论——

Harry: 抱歉兄弟,你得帮帮我——我在这儿就要惹祸了。现在是周五下午,过了六点,管他呢,我想说啥说啥。我不理解机器人,真的不理解。

每次看机器人演示,都是个走路都磕绊的玩意儿在屋里挪;看完它花 15 分钟从冰箱里拿出一瓶水,结果——富迪一直就在隔壁房间里遥控。我就想:你逗我呢?我家厨房里杵着这么个二货,花 15 分钟拿瓶水,结果是富迪在我后屋里操作的?这就是我们现在的水平。我到底没看懂什么?帮我兴奋起来。

Osvald: 我理解。但你回想十年前:自动驾驶汽车上也一直坐着人。你会看到测试车队在旧金山满街跑,里面一直坐着安全员,一坐就是好几年。而现在我坐 Waymo 比坐 Uber 还多。

Harry: 真替你高兴。欢迎来伦敦——我们这儿的车里还都坐着人。说真的我爱听,但它只在一个城市跑,处理不了模糊性很强的路况,还是挺小众的。

Osvald: 但至少在旧金山、奥斯汀、菲尼克斯,它进步飞快。是的,分布确实不均,但在旧金山这是一项不可思议的服务,这儿的人用得很多。

技术上它是成立的——规模化或许有监管之类的挑战,但那是另一回事。

Facts 时空复盘

截至 2026 年 9 月,Waymo 已在美国十余座城市运营完全无人驾驶的商业化服务,周订单量从 2025 年的约 25 万单翻倍至 50 万单量级;伦敦正在按英国《自动驾驶汽车法》框架进行带安全员的测试,目标 2026 年第四季度商业化,东京也在路线图上。Harry 调侃的“伦敦车里还坐着人”即将过期——但“一城一城攻克”的物理扩张节奏,恰恰印证了 Osvald 的 Waymo 时刻论。

Harry: 但你认为机器人会迎来它的“ChatGPT 时刻”,带来使用和采纳的拐点?

Osvald: 会,但我认为它的展开方式可能更像自动驾驶汽车:物理世界的规模化远比软件难。所以它可能更像“Waymo 无人出租车上路”那样的时刻,而不是 ChatGPT 那样的时刻。但进步会实实在在地到来。

Highlights 高光金句

“它可能更像 Waymo 无人出租车上路那样的时刻,而不是 ChatGPT 那样的时刻。” "...it might be more of a more of like a Waymo robo taxi cruise type moment than a chat GPT moment."

▍点拨:ChatGPT 时刻是软件分发逻辑——一夜之间全球可用;Waymo 时刻是物理基础设施逻辑——一城一城攻克、监管逐一谈判。机器人的采纳曲线将由制造、运维与监管的速度决定,而不是模型能力突变的速度。期待“一夜爆发”的人会失望,期待“某天回头发现已满街都是”的人会被证明是对的。

Harry: 你太棒了。非常感谢你忍受了这场极其散漫、结构稀烂——但精彩——的对话,我真的非常感激你的包容。

Osvald: 谢谢邀请,聊得特别开心。

Takeaway 行动指南

本期对话收敛出以下七个关键判断:

  1. 开源抬高的只是地板,付费的永远是天花板。 别把开源模型的进步当成需求萎缩——它只是清空了低端市场。判断一门 to-B 生意的位置,先看它离能力前沿有多近。
  2. “够用即可”和“无上限奖励”要分开算账。 更新 CRM 这类活,90% 的完成率就是终点;法律、医疗、安全这类活,永远能更好、永远有人付费。选赛道时先问:这件事的价值有没有上限?
  3. 别把判断和决策外包给模型。 执行可以委托,判断不行——失去判断力的肌肉,恶果会体现在结果里。团队层面可以把这条边界制度化:考核实验设计与判断力,而不只是 AI 流利度。
  4. 产品团队的新瓶颈不是工程,而是“知道该做什么”。 工程提速后,压缩产品表面积、拒绝无持久需求的功能,比堆功能更难也更值钱——PM 与工程师的比例会持续上升。
  5. 服务化是知识扩散的过渡形态,不是终局。 FDE 与 AI 服务潮赚的是“会用 AI 的人还太少”的钱;押注它的人要同时押注产品化,否则知识扩散完成之日就是毛利收缩之时。
  6. 收入集中度靠产品化下沉化解,不靠祈祷。 把服务头部客户的能力封装成自助产品卖给长尾企业,既分散集中度,也打开第二增长曲线。
  7. 物理世界的拐点是 Waymo 时刻,不是 ChatGPT 时刻。 评估机器人等硬科技机会时,用“一城一城攻克”的节奏校准预期,盯制造、运维与监管三个变量,而不是等一次爆炸式发布。