洞见·20VC·2026.06.08

Nebius 联合创始人 Roman Chernin:AI 基建不是泡沫,规模化应用才刚开始

对话 Nebius 联合创始人 Roman Chernin:AI 基础设施为何不是泡沫、开源与专用模型对 OpenAI 和 Anthropic 的真实影响、算力需求的价格弹性、Nebius 的四层产品栈,以及与 NVIDIA 的权力关系和利奥·阿申布伦纳重仓后的内部反应。

Overview 背景概览

本文译自20VC 播客,发布于 2026 年 6 月 8 日;主持人哈里·斯泰宾斯(Harry Stebbings),对话 Nebius 联合创始人罗曼·切尔宁(Roman Chernin)。

当市场争论 AI 基础设施是不是泡沫时,Roman 的答法很务实:先定义什么叫泡沫——真正规模化跑通的 AI 应用才刚出现第一个,任何大公司的 AI 采用都还在第一个百分位。他给 Nebius 画的路线,是沿技术栈一层层向上爬:从按兆瓦卖的裸金属,到按 GPU 小时卖的托管云,再到按 token 卖的托管推理,终点是让开发者不用再思考模型的智能体优化层。至于与 NVIDIA 的权力关系、巨额资本开支怎么花、以及顶级投资人重仓之后内部为什么没人开香槟——他的答案都是同一句糙话。

▍嘉宾:罗曼·切尔宁(Roman Chernin)

Nebius 联合创始人兼首席商务官(CBO),常驻以色列,两个十几岁女儿的父亲。他的职业轨迹几乎就是 Nebius 这家公司前身的缩影:

  • Yandex 岁月:在 Yandex 任职多年,是其云计算业务(Yandex Cloud)的核心建设与商业化负责人之一。
  • 分拆与再造:2024 年 Yandex 出售俄罗斯业务后,与 CEO 阿卡迪·沃洛日(Arkady Volozh)及原班国际团队把保留业务重组为 Nebius,全面转向 AI 基础设施。
  • 本期定位:负责商业化与客户战略——从微软、Meta 级裸金属大单到 TokenFactory 托管推理,都是他口中“沿技术栈向上走”的主战场。

▍关于 Nebius

Nebius 是从 Yandex 分拆而来的 AI 基础设施公司(NeoCloud),在纳斯达克上市,由 Yandex 创始人阿卡迪·沃洛日出任 CEO。

  • 起源:2024 年 Yandex NV 出售俄罗斯业务后,保留的国际业务(欧洲数据中心与云平台)重组为 Nebius,全部押注 AI 算力。
  • 商业模式:全栈 AI 云——自建数据中心与 GPU 集群,向上依次为裸金属大单、多租户托管云与 TokenFactory 托管推理。
  • 规模与订单:2025 年下半年与微软签下最高约 194 亿美元、与 Meta 约 30 亿美元的多年期算力合同,NVIDIA 为股东;录制时市值约 660 亿美元,当年资本开支 200 至 250 亿美元。

现在是不是 AI 基础设施泡沫时刻?

Harry: AI 基础设施竞赛已经打响,资本开支(CapEx)达到历史峰值。而这场竞赛的中心,正是 Nebius。今天请到的是 Nebius 的联合创始人——这家公司已经做到 660 亿美元市值,与全球最大的几家超大规模云厂商(hyperscaler)正面交锋。当下全球最著名的投资人之一利奥·阿申布伦纳(Leo Aschenbrenner),刚刚把它买成自己的最大持仓之一。

今天,我们就和这家全球最热公司之一的联合创始人一起,揭开 AI 基础设施泡沫之争,以及更多话题。热烈欢迎罗曼·切尔宁(Roman Chernin)。不过在进入正题之前,

Harry: 目的地已到。Roman,这期我太期待了。过去这几年,Nebius 是我们见过的最不可思议的故事之一;而未来几年,恐怕还要更精彩。谢谢你答应来做这期节目。

Roman: 谢谢邀请,很高兴来。

Harry: 先从一个很多人最关心的问题开始:AI 基础设施现在到底走到拐点(inflection point)的什么位置了?看着资本一波波砸进去,有人喊泡沫,有人说这才刚起步。你怎么看——我们现在是不是正处在一个 AI 基础设施泡沫时刻?

Roman: 我不认为是泡沫。先定义一下什么叫泡沫。我是否相信我们还需要再建十倍、百倍的设施?我相当相信。我当然可能有立场偏差——如果不信,我也不会干这行。我认为我们正站在一个美妙时刻的起点,黄仁勋(Jensen Huang)称之为“有用的 AI”(useful AI),真正的规模化采用才刚刚开始。

说实话,在那么多应用场景里,目前真正跑通的只有一个。就是人人都在谈的编程(coding)——它也是几个月前才真正开始好用的。把时间轴摆出来看:距离第一个真正规模化跑通的场景出现,才过去几个月,我们才刚看到它到处落地。接下来显然还会有更多、更多的场景,采用率也会高得多。

你随便挑一家今天的公司——抛开那些跑得最快的初创公司不谈(开场前我们还在聊,谁跑得够快、谁不够快)——去看它的 AI 采用情况,你会发现它只在 1% 的业务量、1% 的场景里用上了 AI。哪怕是技术相当先进的大公司,也才刚刚起步。所以我判断一切都刚开始。就算你不信马斯克(Musk)关于未来和太空的那套说法,单看企业采用的现实进展,这也只是头几步。

Facts 时空复盘(AI 泡沫论的最新交锋)

Roman 录制本期时的判断是“不是泡沫、采用才刚开始”。截至 2026 年 9 月,这场争论仍未分出胜负,但两边的证据都在变厚。 支持他的一侧:NeoCloud 的订单簿持续变长——Nebius 与微软、Meta 的多年期合同是真实付费需求,超大规模云厂商的资本开支指引仍在高位;编程之后,医疗、金融等垂直场景确实开始出现规模化苗头。 反方一侧:市场对 AI 资本开支回报率的审视明显变严,循环投资与 GPU 折旧问题被反复拷问,高杠杆同业(如 CoreWeave)的股价波动远大于需求本身的变化。“需求是真的”与“每一美元资本开支都能赚回合理回报”是两件事——前者的证据越来越硬,后者仍无答案。

开源模型为什么伤不到 OpenAI 和 Anthropic

Harry: 这一点我们完全一致——但如果我只会说“我同意”,这期就太无聊了。顺着编程场景跑通这六到十二个月往下问:有一种观点认为,很多企业很快会转向本地托管的开源模型,因为成本对它们来说太重了,这个转变很快会发生。如果真如此,无论对 OpenAI、Anthropic 这类模型提供方,还是对 Nebius,都是伤害。为什么这个判断是错的?

Roman: 首先,我不认为这是未来的事——它已经发生了。我们到处都能看到:当客户或产品开发者做到一定规模,就会开始想办法改善经济性、加速增长,这时很多人开始寻找替代模型。今天最好的开发方式,显然还是建立在 OpenAI、Anthropic、Google 这些优秀提供方的前沿模型(frontier model)上——它们确实给你全世界最强的能力,这是事实。

但当你跑通了场景、看到采用率起来、看到客户数据飞轮转起来之后,你可能会找到更便宜——甚至不是更便宜,而是质量更高的方式,来服务同一个场景。你不一定需要全世界最强的通用模型,你可以造一个专用模型,在你的特定场景里效果反而更好。这就是从闭源前沿模型转向开源模型的路径。这类模型最重要的特质不只是开源,而是可微调、可训练——你可以拿来做后训练(post-training),做出在你的场景里表现更好的专用模型。这样的例子,我们在全世界、各个场景里都看得到。

Harry: 但这为什么不伤 Anthropic 和 OpenAI?

Roman: 因为在现实中,它们会向下一个前沿推进。回到刚才那点:世界上还有太多未被解决的任务,而且这些任务未必有预算上限。我们一次次看到——一年前的 DeepSeek 是如此,现在仍在继续——每当我们找到更高效解决某类任务的方法,就会同时开始解决更复杂的任务。这是一段没有终点的旅程。

你一直在推前沿,前沿之外永远有更复杂的任务等着你去搞明白;搞明白之后,再回过头把价格降下来、把质量提上去。未解决的任务实在太多,Anthropic、OpenAI 和所有前沿模型面前的市场还远未被覆盖,它们会继续指数级增长。

Harry: 你真信这套吗?这些公司的估值很多已经完美定价到万亿美元级别。如果它们创造的价值不断被侵蚀,就得不停玩“跳蛙”游戏——从一个价值点跳到下一个,而开源模型在后面一路啃食。那你得源源不断找到新问题,兄弟,这日子可不好过。

Roman: 其实大多数人担心的反而是另一头:开源生态和专用模型环境够不够强,能不能把这一层做起来?我认为我们还处在采用的极早期,未解决的问题太多,这只是蛋糕总量的问题。未来的蛋糕足够大,容得下前沿能力,容得下为特定场景深度调优的模型,也容得下整个开源与专用模型的世界——当我们清楚自己要什么时,可以在它们之上构建,拿到经济性和性能上的双重优势。你刚才说,每当更便宜的模型出现,现有业务就会被冲击。

我最爱讲的一件轶事,大概在 15 个月前——就是那个 DeepSeek 时刻。如果你记得,2025 年 2 月还是 3 月,Nebius 的股价一周左右跌了 40%。轶事在于:同一个星期,我们的销售反而创下了公司历史最好纪录。

市场上的人在恐慌,觉得 AI 便宜成这样,Nebius 这种基础设施公司就没用了、是不是泡沫要破了;但同一周,我们拿到了史上最好的商业成绩——因为无数人想明白了:可以用 DeepSeek 在生产环境里跑推理,而且经济性算得过来账。也正是在那段时间,Cursor 开始起飞——我记得他们是第一批真正把这类模型为编程场景调优、并因此受益的公司。

每当智能变得更便宜——同样一单位智能变得更便宜——我们并不会减少消耗,而是增加消耗:同样的预算,可以解决更复杂的任务;或者,那些早就知道能解决、但一直算不过账的任务,终于变得经济可行、可以放量了。观察这种经济性改善带来的连锁反应,实在很有意思。

Highlights 高光金句

“每当智能变得更便宜——同样一单位智能变得更便宜——我们并不会减少消耗,而是增加消耗。” "Every time we got intelligence cheaper, the same unit of intelligence cheaper, we are not reducing the consumption, but we are increasing the consumption because we can just solve more complex tasks..."

▍点拨:这是全片的理论题眼。传统技术通缩叙事里,成本下降利空供给方;而杰文斯逻辑下,成本下降是需求放大器——DeepSeek 暴跌周销售创纪录就是实证。理解这一点,才能理解为什么“模型越来越便宜”和“算力越来越抢手”可以同时为真。

Nebius 的四层产品栈:从兆瓦到 token

Harry: 顺着杰文斯悖论(Jevons paradox)——产出越多、需求反而越多——往下问:今天你在哪些地方动得不够快、希望更快?

Tips 知识科普(杰文斯悖论)

杰文斯悖论来自 19 世纪英国经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)的《煤炭问题》:蒸汽机效率越高,单位功用的煤耗越低,但煤炭总消耗量反而上升——效率提升降低使用成本,解锁大量原本不经济的用途,总需求被放大。 套用到 AI:token 成本下降未必减少算力总消耗,反而可能把更多场景拉进“算得过来账”的区间,推高总需求。Roman 的 DeepSeek 轶事(股价暴跌那一周销售创纪录)正是这个悖论的当代注脚。

Roman: 所有地方。我们谈公司怎么建,会讲四个维度。第一个是产能(capacity):部署多少兆瓦、吉瓦和 GPU。我们是基础设施公司,必须足够大——不够大,就没有人需要我们存在。这是物理世界的扩张。团队做得极好,但永远不够快,你总想更快。而现实世界有一堆麻烦拖住你:新建一个数据中心,要走完供应链和监管审批,还要应付火灾、水患这些现实世界里会发生的一切。

第二个维度是产品。你要足够快,才能接住市场上涌现的新型负载、新型客户。回想一下:这个行业在 AI 征程上,最早的客户是造模型的人——OpenAI 这类公司、超大规模云厂商、大型实验室。它们对基础设施提供方的要求几乎是裸算力,就是纯粹的基础设施。市场上有很多这样的大额裸金属(bare metal)交易,我们也做。但这只是我们建的第一层:可规模化的物理基础设施,供 Meta、微软(Microsoft)这类客户在我们这里大规模使用。

第二层我们叫多租户云(multi-tenant cloud),仍然面向研究密集型团队,但数量是几百上千个团队——它们不想碰物理基础设施,只想用托管好的基础设施,也就是云计算语境里经典的基础设施即服务(IaaS):存储、计算、网络都虚拟化好,配上 API、可观测性和安全,一个正常团队对云的一切期待都在。你登录进来,集群就给你配好了,可以开始训练或者跑推理;应用和工作流自己管,基础设施交给我们。

注意计量单位的变化:第一层谈的是兆瓦——你看那些大交易的公告,谁和 Meta、微软、OpenAI 签了大单,说的都是交付多少兆瓦算力。到了托管云这层,大家谈的是 GPU 小时,这是你卖的关键单位——连存储、配套服务一起,但买的本质上还是托管算力。

再往上一层,是我们在做的托管推理(managed inference)。到了这层,客户不想再用 GPU 小时思考问题,不想研究 B200、H200、B300 哪个更适合自己的负载,不想自己部署 vLLM 或 SGLang 这些推理引擎、自己做全部优化。这就是我们的产品 TokenFactory 所在的位置。

这是一个托管推理平台。它面对的又是一类新客户——我们称之为垂直 AI 公司或企业客户:真正做产品的人,他们不做模型,而是在模型之上做产品。这也回应你刚才说的专用与开源模型问题:当他们需要从 Anthropic 迁出、或者想让用的模型更多元时,就需要这一层。计量单位又变了——现在谈的是 token。你不再为 GPU 小时付费,而是消耗 token,专心做应用,不用想底下的集群。这是我们现在所在的位置。

但我认为这还不是终点。现在大家在造智能体(agentic)应用、智能体工作流。当你做一个端到端智能体时,你甚至可能不用想具体用哪个模型、生成多少 token——你要的是整个任务被高效执行、产出预期结果。

平台能施展的魔法,是替你思考:这次调用用哪个模型更好?需要上更聪明的模型吗?还是在同样的推理预算下,调两个更轻的模型、拿到“没那么聪明”的 token,再让一个裁判模型(judge model)选出最好的结果?上下文该开多大?诸如此类。这就是再往上的一层:开发者甚至不用关心 token 的类型,只关心任务的端到端执行。

Harry: 那第四层就是 OpenRouter 的直接对手了。

Roman: 我们想在那一层带来的,和底下几层一样,是优化引擎。你可以用各种开源或自研工具搭智能体,但当你要把它规模化,就会开始考虑经济性、可靠执行、可重复执行。这时问题就不只是选模型、不只是结果好坏,而是系统问题——你得让它可靠、可重复,还得算得过账。这大概就是 Nebius 能创造价值的地方。

同样道理:我们不教客户怎么做应用,我们只说——如果你需要这个模型以这样的经济性为你工作,我们帮你优化。智能体这层也一样:如果你需要这个智能体端到端跑在既定预算、既定质量内,或许我们能帮你优化。再说明一下,这部分是对未来的推测性思考,不是我们手上已有的东西。但我们看到客户在往这个方向演化,也就看到了下一代产品层可能出现的位置。

产能乘以 10 能卖掉吗:客户组合与价格弹性

Harry: 我很喜欢这个框架,笔记也记了一大堆,想把你说的四根支柱逐一过一遍。第一根是产能。如果今天的产能乘以 10,会有什么不同?你能一夜之间卖掉吗?

Roman: 好问题。一夜卖光不至于,但我们确定有那样的需求。对我们而言,关键问题不是有没有需求,而是怎么搭建需求组合。这个市场上的客户足够多,你可以在其中做平衡。还是回到那四层产品:你可以卖裸金属、卖托管基础设施、卖推理,未来也许还能卖新的产品层。我们想做的,是搭建一个相当多元的客户组合。

我们相信,沿技术栈越往上走,能为客户创造的价值越大,能服务的客户群也越大。裸金属这层,全世界能服务的客户大概只有十几家;托管基础设施这层有几百家;推理这层有几千家;到了智能体这层,会有数以万计的新开发者涌进来。

Harry: 客户组合这点说得很好。落到产能上,你希望客户大到足够有意义,但又不能大到让整个生意吊在它身上。带着这种两难的自觉,Meta 或微软这个级别的客户,你能接受的收入集中度是多少?

Roman: 好问题。我甚至想说,这是我们这门生意——不止 Nebius,而是整个品类——的核心问题。我们一直公开讲、对投资人和客户也讲:Nebius 的长期战略,是服务尽可能多元的客户组合。所以我们尽全力拓展客户数量、搭建平台。

现实是,要服务 Meta、微软这个级别的全球十几家客户——它们技术极强,自己有完整的软件栈,字面意义上只需要物理基础设施,把自己的全套东西搬进来、部署在你的设施上跑——你在物理基础设施之上能提供的附加价值微乎其微。顺便说一句,要满足它们对物理基础设施的要求本身就是巨大的挑战:你可以想象它们有多苛刻,需要的是世界上现存最大规模的基础设施。有人说这是大宗商品(commodity),但在那个规模上根本不是——到了真正的规模,没有什么是大宗的。

回到你的问题:这类客户的总量很小,而且服务它们未必需要全栈软件。所以从 Nebius 创立第零天起,我们就有意打造这套软件栈,因为我们认定这对公司更有利——说点情怀层面的话:这个世界上应该有一家厂商,不只在物理基础设施层、而且在更高的层面上支撑客户。

Harry: 从长期保护生意的角度看,你是不是必须建全栈?否则你就成了这些巨头的产能供应商——钱是赚得盆满钵满,但客户极度集中、业务极度垂直。

Roman: 是的,我也这么想。当然,我们不知道世界最终会走向哪里。在一个需求近乎无限的世界里,哪怕中长期只靠卖这类裸金属合同,你也未必活不下去。但当需求侧的选择足够多,你甚至可以挑客户——挑那些更看重我们所建平台的客户合作。世界上的客户各不相同:有人执着价格,有人执着质量,有人真心想要更先进的平台,因为他们想专注在自己的平台或产品上,不想在基础设施上花精力。

Value 价值视角(客户集中度与转换成本)

用巴菲特的框架看,Nebius 面临的结构性问题是:裸金属层的客户(微软、Meta 级)议价权极致强大、自带全部软件栈,这层生意的长期利润率注定被压向资本成本——这正是芒格所说的“大宗商品化”陷阱,规模再大也只是更大的大宗商品。 Roman 的解法是沿技术栈向上爬:托管云客户有平台依赖,托管推理客户有模型调优与数据飞轮依赖,转换成本逐层抬升。这个方向价值投资者会认可——好生意是客户“想走但走不掉”。但追问也要到底:平台层的定价权是真实护城河,还是又一个会被下一代开源工具抹平的中间层?这是评估 NeoCloud 这门生意时最该盯的问题。

Harry: 在进入第二根支柱“产品”之前,再在产能上停一下。今天产能供给不足,如果你把价格翻倍,需求会有任何变化吗?

Roman: 这问题很难答。几个月前我们其实刚涨过价,供给端的管线压力依然实打实存在。我们也不知道平衡点在哪,原因如下:这不只是我们贪心、想趁短缺多收钱——某种程度上市场确实是这样,人们需要算力来建设。但存在一个临界点:训练那边还好,训练更像一次性成本;而如果你相信行业正在转向推理、推理就是服务客户的成本,那么价格超过某个水平,客户产品的经济性就不成立了。客户产品的经济性成立,他们才能增长,我们才能跟着增长。

所以这不是简单的供需关系加上完全弹性的价格。价格在一定范围内是弹性的,但我们也想做得有意义、替客户着想。而且成本不只是 GPU 小时价格,还包括你做的所有优化——我们叫它总拥有成本(TCO)。这也是我们建软件平台的部分原因。抱歉,又绕回产品了——你想聊产能,但人们对产能太执着了,尤其执着于产能的名义价格。GPU 小时你可以标 3 美元、4 美元、5 美元,取决于场景和平台质量,客户真实成本的结果可以完全不同。

设施能连续跑多久?有效不中断时间有多长?谈推理的话,你能榨出多少 token?我们看到各种优化手段,能把 token 成本拉低一个数量级。人人都在谈某块 GPU 的价格,但如果你把模型侧的事情做对,成本可以成倍数地改变。这一切都该作为一个系统协同工作——只做裸基础设施,你能管的只有价格;建平台、给客户提供高水平服务,你能从整个成本结构里榨出多得多的经济性。

和 CoreWeave 比,差别在全栈

Harry: 那进到第二层——从产能往 GPU 小时、往多租户云这个产品本身走一步。在这一层,你问自己的核心问题是什么?如果第一层的问题是接受多高的收入集中度,那这一层的大问题是什么?

Roman: 客户需要什么?你访谈过那么多产品创始人,答案都一样:客户到底需要什么?客户的需求如何演化?需求在往哪走?我们看到从训练到推理的迁移,看到从“用模型”到“造智能体”的迁移,也看到算力消耗从以 AI 实验室为主、转向企业入场。

想保持相关性,就得始终跟着这些变化走。这就是我们在产品上问自己的主问题:客户需要什么?Nebius 的价值是什么、该创造什么?因为我们终究是小公司,不可能什么都建。必须非常精确地知道,什么事我们比别人做得好、价值应该聚焦在哪——始终盯着客户的演化来校准。

Harry: 客户需求里有哪些变化,是你看到了、但公开讨论里没怎么被谈到的?

Roman: 人人都在谈从训练到推理的迁移,我觉得那是十万英尺高空的视角。这个迁移的实际含义是:人们在造具体的产品,产品里有自己的经济性、自己的增长轨迹——不是“同一块 GPU 换了个用途”那么简单。它带来的是新需求:你得建推理平台;你不只要帮客户跑推理,还要管推理用的模型从哪来。

现在人人都在拿开源模型做微调、做强化学习(RL),我们怎么帮上忙?模型跑起来之后会产生大量数据,客户跑应用、跑推理时要收集数据、创造数据,再用它改进模型或应用——这又怎么帮?大家爱用飞轮来比喻:跑推理、产生数据、观测数据、改进模型,终端产品的质量持续提升。这里面有大量工作,既有系统层面的,也有所谓 AI 魔法层面的。

最让我着迷的是:建造的门槛在降低。越来越多“建造者”型客户进入市场,他们未必是 AI 研究员,也未必是推理工程师。Nebius 这类公司能创造的价值,就是降低“造出真正可用的 AI 产品”的门槛——把基础设施的复杂性、AI 的部分复杂性(比如怎么调模型、怎么优化推理这种研究密集的活)从开发者面前藏起来,让他们只管专注自己的客户和场景。顺带说一句,Anthropic、OpenAI 的闭源生态,走的也是这个路子。

Harry: 你提到了差异化,这是开录前我和合伙人就说好必须要谈的点,就在这几层之内。你已经详细讲了产品建设、讲了在产能之下建产品的重要性。但当人们把你和其他新云(NeoCloud)放在一起比——比如你和 CoreWeave:你们都跑 GPU,都和 NVIDIA 关系深厚,客户名单里都有 Meta。差别到底在哪?

Roman: 我不喜欢和别人比。但我们的建设原则是全栈——我们叫全栈整合(full stack integration)。你可以把它拆成“向下全栈”和“向上全栈”。向下全栈,是我们在物理世界扎得极深:自建数据中心、自建机架和服务器、自建平台。掌控下游这些环节,你就能跑得更快、挤出更多成本,给客户更经济可行的方案。

向上垂直整合,就是刚才谈的产品:怎么跟上客户需求和客户分层的演化,不被“只需要基础设施”的那小撮客户锁死,而是真正服务企业客户和产品公司,在他们需要我们的地方接住他们。我认为这就是我们不同的地方。落到结果上,就是更低的业务集中度、更多元的客户组合——我们相信这是进军企业市场的更好站位,而长期看,大量需求会从企业市场来。

眼下我们的客群主要是 AI 原生公司服务 AI 原生公司。但外面有一个巨大的存量企业市场,总得有人去服务。它们不会买裸算力——它们要平台、要工具,要我们尊重它们的遗留系统,能在更复杂的环境里协作。它们不灵活,有数据要迁移,有系统要集成。这才是大棋局,也是我们主攻的方向。

Inverse 反向思考(全栈整合的隐形账单)

“向下全栈”听起来全是好处:掌控物理层、跑得更快、成本更低。但它的另一面是资产负担全在自己表上——数据中心、机架、服务器全部自持,资产周转慢、折旧刚性强;需求节奏一旦放缓或 GPU 代际跳变,整合越深,转身越难。CoreWeave 已经用高杠杆演示过这种模式的脆弱一面。 “向上全栈”同样不是没有代价:每往上做一层,就离客户的业务更近一步,也就更直接地与客户及其自研团队竞争。平台层做得越重,“中立的基础设施供应商”这个角色就越难维持。

TokenFactory:让开源模型变成生产级服务

Harry: 你提到四支柱的第三层是托管推理。对不了解的人,你怎么看这一层?会怎么向他们解释?

Roman: 很简单。你在某个东西上做了你的产品——你现在用什么 vibe code?

Harry: 我其实是 OpenAI 加 Codex 那派的。

Roman: OpenAI,行,也够用。你用 OpenAI 做出了很棒的产品,跑通了场景、开始增长、势头喜人。唯一的问题可能是:毛利不够了,或者你想更激进地用自己的数据去调教模型行为——而这在闭源生态里做不到。

于是你上网一查,发现有很多优秀的开源模型,基准测试上已经逼近 OpenAI。你心想:太好了,推理成本能便宜 10 倍,还能自己调模型、用自己的数据,产品会更好、增长会更快。

然后你就动手了:从 Hugging Face 上把权重拉下来,找个 vLLM、SGLang 之类的引擎跑起来——结果跑不动。因为要真正榨出你预期的价值,你得做优化、得以正确的方式部署;而且不是一块 GPU、一台主机出 token 就行——你已经是大产品了,跑在成百上千块 GPU 上,需要整套编排、缓存、可观测性。客户还会追着问你:这功能到底怎么运作的?

Tips 知识科普(vLLM、SGLang 与投机解码)

vLLM 和 SGLang 是两大主流开源推理引擎,解决的是“把模型权重变成高吞吐 token 服务”的工程问题:连续批处理、KV 缓存管理、量化、张量并行等。二者迭代极快,几乎每月都有显著版本——企业自建推理栈,意味着要长期供养一支跟得上这个节奏的团队。 投机解码(speculative decoding)是 Roman 提到的降本手段之一:用一个小的“草稿模型”先快速猜出候选 token,再由大模型一次性校验,等效于用大模型的并行能力换取生成速度,在质量不变的前提下压低单位 token 成本。

而这些,你在 OpenAI 那边是现成的——它对你就是生产级服务,你根本不用想基础设施,订个套餐、按用量付费、拿结果。所以这时你就需要 TokenFactory 这样的产品:它给你基于开源或专用模型的托管推理。你可以跑现成的原版开源模型,也可以调好自己的模型、部署自己的权重,剩下的一切交给我们——全套优化技术替你上、更好的经济性替你管、可靠性有保证,你不用再愁下一批 100 块 GPU 去哪找。这就是托管服务。用 TokenFactory,你可以在 60 个开源模型上跑。

Harry: 你之前说过,靠优化能把推理成本最多砍掉 70%。我能问个笨问题吗:一个 token 到底是怎么变便宜的?

Roman: 这也不是什么魔法。你拿一个基线模型,针对你的具体场景做优化:可以做蒸馏,得到一个质量不变的小模型;可以做投机解码(speculative decoding);可以优化缓存,诸如此类。本质上,你是从一个模型出发,为你的场景、你的需求,建出一个经济性最优的系统。

还有一点对客户很重要:模型每周每月都在换。就在今天,MiniMax 发了新模型,NVIDIA 的 Nemotron Ultra 也官宣了。这种事每隔几周就发生一次,新模型在某些基准上更强、另一些未必。你需要灵活性,需要有人支持你试验、在新模型一上线就把最适合你场景的那个用起来。我们这样的平台,把换模型、跑基准这些活全部替你抽象掉:你可以确信,每次有新东西出来,平台上就有;你可以测,对你的场景更好就切换——整个过程平滑透明。

冷启动之后,企业 AI 采用会指数级起飞

Harry: 模型开发的节奏能持续吗?你说每隔几周——恕我直言,我看是每隔几天。五年后还会是这个迭代速度吗?

Roman: 我不知道。我觉得有很大概率,我们会继续看到大量细分模型涌现并改进。我还是那个判断:我们离那堵墙还远,模型改进会持续发生。我们还看到更多新模态、更多专用模型入场——大家都在谈前沿大语言模型,但外面还有一整个世界:生命科学模型、机器人、世界模型、视频模型、图像模型,各有各的场景。高度优化的细分场景小模型也越来越多。

就在今天早上,我在以色列还聊了一个团队,他们在做网络防御基础模型——专门优化来构建网络防御智能体的模型。他们也不是从零开始:拿一个开源基础模型,然后针对这个场景训练,按网络防御场景要求的质量和延迟做优化。我认为这类东西会越来越多:大量专用后训练模型涌现,而它们同样需要优化过的推理、需要配套优化过的基础设施,客户才用得起。

Harry: 在 token 成本和用量上,有什么是你看到了、但大家谈得太少的?最近有什么震到你的事?

Roman: 大家谈的还是同一件事:增长有多快。我们看着 Anthropic、Cursor、Cognition 这些编程类公司的轨迹往上冲,现在其他垂直领域也开始出现了——医疗的例子、金融的场景。我觉得相当惊人。更有意思的是看那些非 AI 原生公司怎么动。

举个客户的例子:Revolut。我们刚开始合作时,他们推理预算的 99% 都在闭源模型、在 OpenAI 上。他们逐步攻坚一些场景,但有些场景经济性不成立——在那些想做的场景里,AI 实际上替代不了人、也增强不了人。于是他们开始往开源模型迁移,但动得不快,因为得先花时间在公司内部建整套引擎——而且首先建的是评估(evaluation)体系。

我认为人们低估了这件事:作为一个公司、一个团队,要先建好“改进与实验引擎”这个地基,搞清楚什么对自己是好的。你跑通了一个场景、它有效,但你想换模型——怎么知道不会把质量搞砸?你需要指标,需要评估机制,需要为 AI 开发建好 CI/CD 流程。我们看到很多像 Revolut 这样的客户,都得先做这些地基性投入,先搞明白怎么演进模型、怎么安全地把模型接进生产流程。

但这些地基问题一旦解决,他们就开始指数级增长。别低估这类客户建起“快速交付系统”之后的增速——快速交付意味着他们知道怎么演进、怎么做决策。我们在很多客户身上都看到这个规律:先有一段地基投入期、一个冷启动问题——怎么开始交付;一旦解决,增长就是指数级的。从外部看,你会觉得“他们没动静啊,起步小、节奏慢”,但只要团队够强,地基一铺好,增长随即起飞。

我认为接下来会看到大量企业爆发式增长——尤其是那些数字原生、云原生的公司,Revolut、Shopify、Prosus、Booking.com 这类。等它们解决了冷启动、建好交付系统,AI 采用率会疯涨。

Harry: 你觉得三年后 Revolut 付给你们的钱会多多少?

Roman: 不知道,真的不知道,这个我就不说了。但我可以说的是:总体上,他们就在这条增长曲线上。我们都看到 AI 公司公布 ARR 增速,对吧?对 Revolut 这种公司来说,那不是 ARR,是预算。但我认为,最先进的那些公司,AI 预算的增长轨迹和 AI 原生公司是一样的——而且不是那种虚假的刷 token 竞赛,我们看到的是他们在生产负载里的真实用法。AI 原生公司说自己的 AI 消耗随 ARR 同步增长,Revolut 这类公司也走在同一条指数曲线上。

Harry: 谁跟我说开源能真正威胁最大的模型提供方,我都会反驳。我说,听着,大企业要的是可靠性、安全性,最重要的是省事——它们不想折腾水面之下的那堆架构。而你现在告诉我的是:你能把这一切都给到它们,让它们从这些提供方手里迁出来,体验还更便宜更好,因为你把管道工活全包了。

Roman: 对,但我的意思是:闭源与开源之争,关键不在可靠不可靠。如你所说,Nebius 这类公司的工作,就是让你用替代模型时也不用想管道工活。但真正的分野在能力。闭源前沿模型非常强,而且会变得更强,会解决很多我们今天还解决不了的问题。我们想解决的场景如此多样,市场自然容得下:全世界最聪明的模型、全世界最快的模型、介于两者之间“够聪明也够便宜”的模型。作为客户,你按任务挑对应的 token 来源就行。

回到智能体那层:也许未来连“这次调哪个模型”都不是客户的活了,会有一个熟悉底下所有模型能力的引擎替你调度。就像你今天用 OpenAI 的深度研究(Deep Research):你不会去想它该循环几轮、什么时候调 LLM、什么时候调搜索、该用哪个提示词——你给个任务,背后的推理引擎决定怎么跑,你拿结果。我认为大量企业场景、大量智能体任务,最终都会以这种方式被解决:开发者不该再去编排这些 token 和模型,而是专注客户需求。

届时所有模型都有位置——最聪明的解决最复杂的智能问题,最快的做快速迭代。我们甚至还没谈那些模态、物理 AI 世界需要什么。所以再说一次我的观点:蛋糕足够大,不同模型各得其所。我们作为基础设施公司要做的,就是让开发者舒舒服服用上这些能力。因为你说得对——这不只是模型能力的问题,而是把管道工活拿掉,让模型跑起来、优化好、可靠地跑。

Facts 时空复盘(开源对前沿模型的侵蚀实况)

Roman 的核心论点是“蛋糕够大,开源不伤前沿”。对照截至 2026 年 9 月的公开信息:开源权重模型(DeepSeek、Qwen、MiniMax、Kimi 等)与前沿的差距确实在持续收窄,企业级“开源加托管推理”的采用明显提速——他描述的 Revolut 路径已经成为常见打法。 但前沿实验室的收入增长尚未出现被开源侵蚀的公开证据:OpenAI 与 Anthropic 的收入仍在高速爬坡,编程类应用(Cursor、Cognition 等)的爆发同时发生在两边。到目前为止,现实更接近 Roman 的“蛋糕论”而非 Harry 担心的“跳蛙困境”——不过这也同时意味着,前沿实验室“必须持续找到新问题”的生存方式从未改变。

主权模型之争:该操心的不是兆瓦,是建设者

Harry: 看模型的大爆发和专用化——照你说的,会有那么多模型被造出来、覆盖那么多场景。遗憾的是有一点很清楚:欧洲的模型建设,远赶不上美国和中国。各国拥有自己的主权模型,你觉得有多重要?

Roman: 好问题。但看起来世界已经分裂了——我们可能不喜欢,但事实如此。让世界大部分地区都能用上“足够好”的基础模型,这件事很重要。在欧洲,我们应该思考的是怎么让这里有足够的能力可用。过去几年围绕主权、围绕主权 AI(sovereign AI)议程的讨论很多,我觉得那些讨论太集中在兆瓦和电力上,而不是建设者(builder)那一层。

兆瓦会来的。我们在 Nebius 一直讲:只要有需求,我们这样的公司就会把基础设施建起来。而需求来自建设者。欧洲真正该操心的,是长出更多 Lovable、Black Forest Labs、Mistral 这样的好公司,有足够多投研究的人、投产品的人。他们会创造足够的需求,飞轮会重新转起来,足够好的模型自然会来。这才是我们该上心的事。

Harry: 今天最有意思的投资方向是哪?给你四个选项:基础设施、横向模型、垂直模型、应用层。

Roman: 我们自己建基础设施,在这个位置待得很舒服。放在今天的世界里,这是个好位置——尽管某种程度上,我们建的是“最容易”的部分。不是说执行不复杂,而是我们大致知道世界需要什么,客户也在帮我们搞清楚需要什么。

我认为这个行业最了不起的人,是那些冒险去造终端用户产品的人。在我看来,真正驱动增长的主要是他们——冒着“造出来的东西别人要不要”这种真正风险的人。他们才是这段 AI 征程的英雄。

Highlights 高光金句

“这个行业最了不起的人,是那些冒险去造终端用户产品的人。” "I think the most amazing people in this industry are those who take a risk to go and build end user products."

▍点拨:基础设施供应商把“英雄”的称号让给应用层,不是客套——Roman 的全部商业逻辑(需求来自建设者、飞轮来自产品)都建立在应用层繁荣之上。这也提醒读者:算力叙事与算力股的估值,最终都要由应用层的真实收入来兑付。

谁对 NVIDIA 有议价权?把你该干的活干好

Harry: 说到 AI 征程的英雄——你刚才也提到,我很幸运访谈过一些大人物,每期节目开录前我都会去找他们聊。这几轮聊下来,有一个主题反复出现:和 NVIDIA 的关系。如果一段“婚姻”里一方权力远大于另一方,那还叫婚姻吗?面对权力这么大的 NVIDIA,你怎么看待这段关系里的权力结构?

Roman: 谁对 NVIDIA 有议价权?我们的看法很简单:建自己要建的东西,做好自己的产品,讲好自己的故事,剩下的自然水到渠成。NVIDIA 最有意思的一点是,它在很大程度上仍然是一家工程师驱动的公司。赢得 NVIDIA 尊重的最好方式——这是我的解读,他们可能不这么看——是让 NVIDIA 的工程师尊重你的工程师,这才是关系的正确地基。

我们一次又一次证明了自己知道在造什么,我们有一支很强的工程团队,他们看得见,也认这个。硬件层、软件层、推理平台层,我们有大量工程师对工程师的关系。NVIDIA 的工程师越看得起你,能结成的关系与伙伴关系就越好。也许我们这么想是错的,但这是我们能看到、也能走的正路。我们就专注做合理的事、专注长期价值——这话听起来虚,人人都会讲,但说到底:把你该干的活干好,就这么简单。

Highlights 高光金句

“专注做合理的事、专注长期价值——这话听起来虚,人人都会讲,但说到底:把你该干的活干好。” "It sounds like fluffy, everybody say it. But do your fucking job at the end of the day, right?"

▍点拨:面对“谁对 NVIDIA 有议价权”这种权力结构问题,Roman 没给任何博弈论,只给了一句糙话。在供应商对单一大客户的真实关系里,“让对方工程师尊重你的工程师”确实是少数可以积累的资产——它买不来,只能一次次交付出来。

Harry: 这期标题有了:Roman——把你该干的活干好。

Roman: 不然还能怎么办?我们处在这样一场竞赛里,能做的就是把自己的活干到最好。把你该干的活干好。

Harry: 这话很糙,但我喜欢。那说正经的:今天“把你该干的活干好”里,最难的部分是什么?

Roman: 四个维度。建规模、建产品——这两个我们讨论过了。第三个是客户。我们是“在场”的生意,我们爱说一句话:云是售后型生意(post-sales business)。你卖的那一刻,卖出的是承诺;接下来你得让客户满意。服务客户、覆盖客户、维持一支强的客户侧工程团队——前置部署工程师(FDE)团队,这是第三维。去见你的客户,确保他们认识你、你认识他们。

第四个维度,最无聊也最刺激的,是资本。我们玩的是资本密集的游戏,对手是全世界资本最雄厚的公司。

资本帮不上六个月的忙,瓶颈要放在时间跨度里看

Harry: 如果我给你无限预算,你会有什么不同的做法?

Roman: 建得更快。这问题太简单了。

Harry: 建什么更快?

Roman: 数据中心,然后用 GPU 把它们填满——就是建得更快。我们今年的资本开支计划是 200 到 250 亿美元,超大规模云厂商对手比我们大 8 到 10 倍。如果资本大 10 倍,我就建更多数据中心、更快填满 GPU、服务更多客户。这就回到了开头的问题:如果有 10 倍供给怎么办?我会跑得更快。

Value 价值视角(资本密集生意的回报算术)

巴菲特对“需要持续巨额再投资才能维持增长”的生意向来警惕:收入增速再漂亮,如果每一块钱增长都要再投一块二,股东最终拿到的是折旧单而不是利润。GPU 三五年一代的迭代节奏,让 AI 基建的折旧风险比普通重资产更尖锐——今天抢建的产能,可能是明天的落后资产。 缓释因素也存在:Roman 的分阶段打法(先锁定电力与土地、再建数据中心、最后填 GPU)本质是按资本效率排序的风险管理;电力和土地的稀缺性,使先发的产能组合具备卡位价值。这门生意最终值不值,取决于一个尚未揭晓的数字:增量资本回报率能否长期跑赢资本成本。

Harry: 加文·贝克(Gavin Baker)有个说法我觉得挺聪明:许可审批、监管和数据中心的建设延迟,其实反而帮了忙。因为如果今天让你把数据中心乘 10 倍建出来,反而会造出供给过剩(glut)。

Roman: 对,这问题问得好。投资人有时也会问我们:主要瓶颈是什么?答案是:一切都是瓶颈,得放在时间跨度里看。

未来六个月,资本帮不上忙——六个月太短,你手上有什么就是什么,你得交付。未来十二个月,有些东西可以加速,但主要卡在产能约束上,靠资本或执行力能抢出一些进度。放到二十四个月,你能解锁的东西就太多了。而且要理解:我们建的不是一个数据中心,而是一个产能组合。执行力越强、资本越多,能并行推进的事就越多。

Highlights 高光金句

“未来六个月,资本帮不上忙——六个月太短,你手上有什么就是什么,你得交付。” "In the next six months, the capital cannot help. Six months is too short time. You have what you have. You need to deliver."

▍点拨:这句话是“给你无限预算你会干嘛”这类问题的解毒剂。资本在不同时间跨度上的作用完全不同:六个月看交付纪律、十二个月看产能约束、二十四个月资本才成为主变量。用它去套任何“砸钱就能赢”的叙事,大部分会现形。

所以我们才是现在这个打法:先锁定电力和土地,再建数据中心,再填 GPU。每个下一阶段都要更多资本,但我们尽量把活做在前面——确保进入下一阶段时,电力早已锁定;等有钱部署 GPU 时,数据中心已经在运转。这是分阶段的投资节奏。所以显然,资本越多跑得越快——六个月看不出差别,十八、二十四个月就是天壤之别。

Harry: 再聊一个。看数据中心建设这件事:公众对 AI 的抵触情绪越来越重。埃里克·施密特(Eric Schmidt)被嘘下台——不是因为内容,而是因为 AI 这个议题本身。公众对数据中心的反感也在升温,我记得现在走规划审批的项目,100 个里有 40 个建不成。你们内部怎么看、怎么消化这件事?

Roman: 这就是我们必须在其中工作的环境。这件事有两面。务实的一面是生意:如前面所说,我们把建设当作项目组合来管理,必须确保整体超额认购——一个数据中心延期,照样能给客户交够产能。而且多数客户不锁定单一物理位置,这是云,我们可以在不同地方建,把工作负载引到有产能的地方。这是务实面。

另一面,我们清楚看到:社区和地方政府要求我们这样的公司和他们紧密合作,解释、展示我们在做什么,回应并解决他们的顾虑。这就是现实。可以类比 Uber 当年的扩张:很多地方都出现反弹——“这个新东西是什么?动得太快了,我们没料到”。你只能去做工作、去解释。和那些开始依赖你的新社区打交道,本就是你职责的一部分。他们有顾虑:有些只是不了解,有些是合理的、你可以解决。还是那句:把你该干的活干好。

Harry: 你觉得到目前为止,这活你们干得好吗?

Roman: 我们这家公司骨子里总觉得自己做得不够。我觉得在已开建的地方,进展是实打实的。历史上我们的经验更多在欧洲;中期新建产能大概 70% 到 75% 在美国,所以我们在美国铺了大量本地团队,专门和当地社区沟通。我们尽力做到最好——当然永远要做得更好,但我们在往前走。

太空数据中心、快问快答与最大的威胁

Harry: 再帮我解一题。刚才聊到太空时我们都笑了。在地球上建数据中心已经是后勤噩梦,那在太空建数据中心呢?我热爱技术、我是乐观派——但那是不是纯属疯了?

Roman: 我觉得我们今天看到的一切都很疯狂。我的看法很简单:那么多聪明人在努力让它发生,我凭什么不信它会成?三年内太空算力超过地球?也许三年不至于。但我足够谦卑:这么多聪明人在解这道题、在把算力送上太空,我有什么理由悲观。当然,挑战还很多,很多事情要搞明白。

可是想想:哪怕三年前,有人告诉你我们会建起多吉瓦级的数据中心、建成大型互联算力集群,你信吗?反正我当初不会这么想。而今天我们就在这儿,这已经成了日常。

Harry: 来个快问快答:我说一句短的,你给第一反应。今天不存在、五年后会非常普遍的职业是什么?

Roman: 太空数据中心技师?

Harry: 不对,那活多半是机器人干。

Roman: 说正经的。有件事显然正在发生:我们在把“开发者”这个身份民主化——现在人人都能当开发者。我说的开发者,是指能把想法变成数字资产的人。我希望这种“建造的民主化”、让每个人都成为建造者,能打开大量我们今天想象不到的机会。

当几百万、几千万新的人获得“轻松把想法变成可用之物”的能力,我们会看到大量新生意、新想法活生生冒出来,它们会创造出许多今天压根不存在的新工作。这就是建造民主化的二阶效应(second order)。

同样既是机会也是风险的,是教育会怎么变。当人人都能调用智能,人们还该学什么?肯定不用再背事实了——一切都触手可及,知识就在那里。可人不再需要那么多思考时,你怎么训练人思考?很多职业不再稳定,你怎么教人持续变化?怎么帮人在变动的环境里找到自己、不断学习新概念?这里既有大把新机会,也藏着不小的风险。

Inverse 反向思考(建造民主化的另一面)

“人人都能当建造者”的乐观叙事有一个被忽略的推论:当应用的建造成本趋近于零,应用本身的价值也趋近于零。门槛降低对建造者是红利,对“被造出来的产品”是通胀——分发、注意力和信任会成为新的稀缺资源,而这些恰恰不在开发者的掌控之中。 给女儿的建议(同理心加创造力)也存在幸存者偏差:软技能是历史上最难规模化培养、最难被招聘市场定价的能力。当全社会同时被告知“去学软技能”,它的溢价又能维持多久?这不是说建议错了,而是说它可能比“学数学和工程”更难执行。

Harry: 你提过有两个十几岁的女儿。未来十年她们要进入职场,你给她们什么建议?

Roman: 我原话这么告诉她们:我不知道未来需要什么,但我确信有两样东西一定有用。一是带着同理心与人沟通的能力——理解人、和人交流、有共情。二是创造力,所有的艺术——我希望艺术会以某种方式继续存在。

十年前我以为最重要的是数学和工程,现在完全不这么想了。我很欣慰,两个女儿的软技能比我小时候强得多:会和人沟通、理解人、有同理心,还有创造力——敢试新东西、能创造。这两样如果你能帮孩子养成,十年后她们会是抢手的人。

Harry: 创造力怎么教是另一个问题,但我完全同意。帮我补完这句话:Nebius 最大的威胁不是竞争,而是……

Roman: 而是集中化(consolidation)。我认为 Nebius 这门生意的主要威胁,是世界变得过度集中。我们努力多元化:服务不同客户、解决不同问题、覆盖不同层。如果最后世界变成——我不知道——三五个超级模型、超级公司、超级帝国控制一切,那 Nebius 这类公司就只剩一个用途:在物理层帮它们满足需求。

所以总体上,集中化是我们的主要威胁。世界越民主化、越多元,市场就越需要我们这种公司。

Harry: 你觉得这事概率大吗?我们看到的可是价值在向越来越少的玩家集中——恰恰是多元化的反面。

Roman: 我希望不会发生。作为生意,多元化对我们更好;作为人,对你我也一样——世界最好在不同维度上保持多元。我对此是乐观的:想独立造点什么的人太多了,有太多人有这种“去试、去造”的内在冲动。这种冲动会自发形成压力,自发造出一个更多元的世界。希望如此。

Leo 重仓之后:背书是信用,交付是本分

Harry: 倒数第二个。Leo Aschenbrenner 现在是红人投资人,信徒一大堆。他最近披露了一笔对他来说的重仓:持有你们 5.3% 的股份,我记得占他组合的 15%。你们内部什么反应?是不是“Leo 牛逼”?

Roman: 说没注意到,那是假话——显然所有人都注意到了,股价应声跳涨,满世界都是新闻。我们把它当作对我们所做之事的背书。但你拿到这份背书之后,要对自己说:好,这些人还是在给你信用,赌你能执行。

我反复回到那句话:我们做的是售后型生意。每签一单、每有一个人投我们,都是给我们一次交付的信用和机会——然后你就回工位上,交付。这个市场情绪浓度太高,更得让自己贴着地面:记住,所有这些增长、所有客户给你的信用,本质都是交付的机会——去干活。

Facts 时空复盘(Leo 的持仓与后续)

Leo Aschenbrenner 是前 OpenAI 超级对齐(superalignment)团队成员,凭《Situational Awareness》系列长文火遍投资圈,随后创立同名基金。他在 2026 年披露的 Nebius 持仓(约 5.3%)是该基金最重的公开押注之一——对一家从 Yandex 分拆、上市不到两年的公司来说,这是“聪明钱”给出的最强背书之一。 截至 2026 年 9 月,Nebius 仍是公开市场上最受关注的 AI 基础设施纯标的之一,股价维持在本期录制时的高位区间(公开行情口径)。Roman 的反应值得记录:他把这份背书定义为“交付的信用”而非胜利——与他在 DeepSeek 暴跌周创造销售纪录时的说法一脉相承。

Harry: 你太以色列人了。美国人这会儿早喊“冲啊”了,你却是“不,接着干活”。

Roman: 这一点上我更像个俄罗斯人。俄罗斯人骨子里讲究极度务实,而且总是一副“随时要出事”的表情——你得准备着,永远准备着。这一点很大程度上来自我们的 CEO 兼创始人阿卡迪·沃洛日(Arkady Volozh):每天醒来,就是新的一天、新的客户,你得交付,没有任何东西是保证的,你只能专注在活上。

我清楚团队为了“让一切运转”投入了多少,清楚有多少事情系于每一天的投入,也清楚市场跑得有多快。想保持相关性,你就得继续以市场的速度跑。说点温情的话:我们其实该多庆祝一点,只是没时间。借这个机会给团队致敬——我觉得我们庆祝得太少了。我们不放松,这没错,但确实该多庆祝一点,给团队更多认可:已经做成的事情有那么多,过去不容易,现在不容易,将来也不会容易。

但不能停,我们不能停。就像鲨鱼——动起来才是活着,就是那个著名的说法。所以我们必须动。

Highlights 高光金句

“就像鲨鱼——动起来才是活着。” "...it's like a shark. You are alive when you move, right?"

▍点拨:从“该不该多庆祝”滑到“不能停”,Roman 无意间道出了高增长基础设施公司的组织宿命:产能、产品、资本三条线都按季度被重估,停下来庆祝的机会成本是真实的。这也是他全程反复强调“交付”的情感底色。

Harry: 就聊到这。太感谢你能来,还包容我这些东拉西扯的问题。你太棒了,Roman,这期分量十足。

Roman: 谢谢,谢谢,你过奖了。

Harry: 不过在和大家道别之前,

Takeaway 行动指南

这场对话表面上是泡沫之辩,实际给出的是一套判断 AI 基础设施生意的操作框架。以下六个判断可以直接拿走:

  1. AI 基础设施不是泡沫,因为采用率还在第一个百分位。 判断这个行业的冷热,别盯资本开支总量,盯“规模化跑通的场景数量”这个先行指标——编程只是第一个,场景数量的加速度才是需求真实性的证据。
  2. 智能变便宜不会减少消耗,只会扩大消耗。 评估任何“模型降价冲击论”时先问一句:它解锁了哪些原本算不过账的任务?能把新任务拉进经济可行区间的降价,对算力需求是利好而非利空。
  3. 沿技术栈往上走,客户基数和价值一起变大。 裸金属层全世界只有十几家客户,托管推理层有几千家——产品分层本质是在选择客户基数与转换成本,做基础设施生意要想清楚自己站在哪一层、往哪一层爬。
  4. 云是售后型生意:卖出的是承诺,签下的是交付义务。 把客户成功与前置部署工程师当作核心资产来投入,而不是成本中心——大单签下的那一刻,真正的工作才刚开始。
  5. 资本不是万能药,瓶颈要放在时间跨度里管理。 六个月看交付、十二个月看产能、二十四个月看资本;按“先锁定电力土地、再建数据中心、最后填 GPU”的顺序排布投资节奏,比一味加码更重要。
  6. 最大的威胁不是竞争,而是集中化。 对生态位型公司而言,客户与模型层的多元化程度就是生存土壤的肥力——跟踪行业集中度的变化,比跟踪单个竞争对手的动作更有预警价值。