Fireworks 创始人 Lin Qiao:未来不是一个 AGI,而是百万个专用模型
Fireworks 创始人 Lin Qiao:当所有人追训练时为何押注推理,token 成本三年降十倍、用量涨百倍,为什么未来不是一个 AGI 而是百万个专用模型。
本文译自播客20VC,发布于 2026 年 7 月 20 日;主持人 Harry Stebbings,对话 Fireworks AI 联合创始人兼 CEO 乔琳(Lin Qiao)。
当所有人涌向模型训练时,乔琳把公司押在了推理上——更准确地说,押在“专用智能”上。她在这期里抛出三个互相咬合的判断:未来不属于一个 AGI,而属于百万个专用模型;token 成本三年降 10 倍、用量涨 100 倍;每一家公司都将拥有自己的智能,不是可选项,而是必需品。至于“扩张到破产”这个新词为什么让 CFO 夜不能寐,答案在正文里。
▍嘉宾:乔琳(Lin Qiao)
乔琳是 Fireworks AI 联合创始人兼 CEO,AI 基础设施领域最受尊敬的工程师出身的创业者之一:
- 技术根基:第一代移民,2000 年赴美,博士攻读计算机科学分布式系统方向、专攻数据库
- 创业前夜:先后在研究院与领英(LinkedIn)构建数据系统与产品,2015 年本已准备创业,自认“带人”的能力不足而按下暂停键
- Meta 七年:加入当时如日中天的 Facebook 一待七年,成为 PyTorch 创始团队成员、负责 AI 基础设施
- 48 岁创业:2022 年与六位联合创始人在加州创立 Fireworks AI,押注当时无人关注的推理赛道
- 投资人视角:Harry 称这是其十年投资生涯最容易的决定之一——15 分钟见面即开出 1000 万美元支票
▍关于 Fireworks AI
Fireworks AI 是一家专用智能平台公司:不卖通用 API,而是帮企业在开放权重模型上做定制微调,并针对各自负载优化推理部署(“one size fits one”)。
- 规模:每天处理超 40 万亿 token,大部分流量来自定制模型;本期录制时 ARR 8 亿美元、员工约 200 人;2026 年 7 月年化营收达 10 亿美元,同月完成 15 亿美元 D 轮融资、估值 175 亿美元
- 客户:从 Cursor 等主要编码公司起家,扩展到法律、金融、客服、招聘等“协同工作”类应用,盖可、第一资本等传统企业主动上门
- 后续进展:2026 年 9 月完成员工股份出售,估值与 D 轮持平;据报道正洽谈新一轮融资,目标估值 300 亿美元
15 分钟聊出的 1000 万美元支票
Harry: 这里是 20VC,我是 Harry Stebbings。今天坐上热席的是一位我只谈了 15 分钟就开出 1000 万美元支票的创始人——乔琳(Lin Qiao),Fireworks 创始人。这是我十年投资生涯里最容易的投资决定之一。
第一,团队是世界顶级,而且他们共事多年。第二,推理市场。它正在疯狂增长,将成为全球最大的市场之一。第三,业务进展。说实话我为此挨过骂——人人都说,“Harry,别再说 triple, triple, double, double 了,那套已经过时了。”可事实就是这样,这就是残酷的现实:当你能投到一家四年做到 10 亿美元 ARR 的公司,你就该投。
第四,招人能力。最优秀的创始人能把世界上最好的人招进来。Lin 刚刚请来了乔治·胡(George Hu)——前 Salesforce 总裁。第五,上行空间。这家公司能赚多少钱?如果你相信 AI 会改变我们的生活方式,相信我们会活在一个多模型并存的世界——有通用模型也有专用模型——那么说实话,Fireworks 可以是一家 5000 亿美元的公司。我不知道你怎么想,但这趟列车正在离站。
Harry: 各位,目的地到了。Lin,我太期待这期了,听到了太多关于你的好评。我刚和你的联合创始人迪马(Dima)通过电话,还聊过林君叡(Alfred Lin)、Sonia、Matt Miller 等等。谢谢你来做客。
我听说埃里克·维什里亚(Eric Vishria)有条规矩:不投大公司出来的总监。但他在你身上破了例,这很不寻常。
Lin: 我也这么觉得。说个好玩的:我们握手敲定之后,他专门打来电话,说他跟一位顾问聊过,顾问追问他:你见过几个大公司高管创业成功的?寥寥无几。他把这个转告给我,我吓了一跳——这是要反悔吗?当然不是。但从那以后我们合作得非常紧密。Eric 是最好的投资人之一。
Harry: 你创业的时候已经 48 岁了?在这个大家追捧 15 岁创业的时代,这算很晚了。作为一个 48 岁的创始人,你怎么看这件事?
Lin: 我没认真想过这个问题。我一直想拥有一家自己的科技公司,其实 2015 年就想创业了。我是第一代移民,2000 年来的美国,博士读的是计算机科学的分布式系统方向,专攻数据库。数据库是一个非常讲究权衡的系统,要同时优化很多目标。进研究院之后,数据处理链路的每个环节我几乎都摸过。
后来我去了领英(LinkedIn),更进一步,去做能真正驱动业务影响的系统和产品。那时我觉得自己准备好了:技术都懂,知道要做什么产品,商业计划书有了,连想拉谁一起创业的名单都列好了。
但我认真想了想,还是按下了暂停——因为我觉得自己还不具备“带人”的能力。创业不只是产品和技术,归根结底是人。我决定去一个能让我学到最多“带人”本事的地方。当时最好的选择是 Facebook——硅谷正在升起的新星。我暗自计划学一年就出来自己干,结果一待就是七年。
专用智能:智能的前沿在私有数据里
Harry: 做 Fireworks 的时候,你在推理上看到了全世界还没关注的东西——当时所有人都盯着训练。先帮听众理解一下这个技术栈:你下面是英伟达(NVIDIA)这类芯片厂商,上面是模型厂商,你坐在中间。为什么这一层有价值,而不是大宗商品?
Lin: 这个问题问得好。但先反问一句:为什么要费劲做专用智能(specialized intelligence)?直接用通用智能不就行了?在前沿实验室提供的 API 上面搭东西,要操心的事少得多,不是吗?
我的论证是这样的。如果你认为智能是数据的衍生品,那么绝大多数数据其实根本没被用来训练通用智能模型。训练数据来自公开互联网和标注数据,而公开互联网只占全世界数据的一小部分。世界上大部分数据是私有的,锁在应用里、锁在企业里,永远不会与任何人共享——那是公司的专有 IP。
这么一看就有意思了:大部分数据没有被激活,没有产生任何智能。我们相信的就是激活这些数据;我们相信智能的前沿其实落在私有智能、专用智能这一侧。这就是 Fireworks 从一开始就在做的事——驱动这部分价值。
Harry: 我完全理解你说的企业私有数据的价值,也有太多问题想问。但这不正是 Anthropic 企业业务的前提吗?他们做 Claude Cowork,做各种相邻的延伸产品。达里奥·阿莫迪(Dario Amodei)不会说,这正是他们要抢的方向吗?
Lin: 有意思。在我看来,Anthropic 是一家彻底信仰 AGI 的公司。AGI 的定义是:存在一个模型,能用最好的方式解决所有问题。照这个定义,你就不需要专用化——那一个模型足够聪明,对每个行业、每份工作都无所不知,那还折腾什么专用化呢?
所以这件事本身就证明:我们并不生活在一个由单一原则统治的世界,而是生活在一个充分多元的世界。举个例子:不同地区有不同的价值体系、不同的政策、不同的经商方式、不同的生活方式——那是品味、选择和判断的总和。
我认为这正是人之所以为人。我们不是机器人。如果未来的世界由单一标准统治、由一家公司的品味规定一切,那我们就把自己变成了一支机器人大军。那对我来说非常压抑。
把智人(Homo sapiens)和其他物种区分开的,是创造力,是追求新事物、发现新生活方式的深层渴望。这部分是无法复制的。这是我的根本信念,也是硅谷乃至全世界之所以不断有人创造新生意的原因。
Lin: GTC 主题演讲之后,我和黄仁勋(Jensen Huang)聊过一次,很有意思。其实我们还录了像。
Harry: 我看了,非常精彩。
Lin: 跟黄仁勋录像其实不叫录像。他就是开始跟我聊天,我都不知道他的团队已经开始录了,我们就一直聊,特别自然。我们聊到专用智能,他跟我说了一句话:Lin,你是对的。世界上不存在“通用的通用公司”——每家公司都建立在一种独特的做事信念之上,否则它就没有存在的理由。
这话听起来顺理成章,但我后来越想越觉得深刻。每家公司都在做某件独特的事,这件事撑起了它存在的意义,并且深深烙进它的产品设计、软件和系统架构里,烙进它的数据、它与用户的互动、它对用户意图的深层理解里。这一切是一家公司存在的根基,坐在外面的另一家公司学不会,也拿不走。
“Lin,你是对的。世界上不存在通用的通用公司——每家公司都建立在一种独特的做事信念之上,否则它就没有存在的理由。” "Lin, you're right. There's no specialized general company. As in every company is built on a special belief of doing things. Otherwise, there's no reason they should exist."
▍点拨:黄仁勋这句话把“公司为什么存在”还原成信念问题——每家公司都把独特的判断烙进产品、数据与用户理解里,这正是外部模型拿不走的东西。它给“专用智能”提供了第一性原理:不是技术选型,而是存在论。
Harry: 帮我理解一下。你知道,我作为播客主持人,专长就是问基础问题,多包涵。那为什么达里奥、萨姆·奥尔特曼(Sam Altman)、拉里·佩奇(Larry Page)和谢尔盖·布林(Sergey Brin)这些人,还要把 AGI 说成必然降临的东西?
Lin: 我觉得他们做的事情很了不起——他们本质上是在铺设输电线,把高质量的智能分发出去,让所有人都能在上面建东西。这就是他们的贡献。没有这层基础设施,我们家里就不会有各种各样的电器。
我很爱我的咖啡机,它是个很特别的牌子。但没有电力,我们就没法做那些有趣的、独特的、编码着我们品味的事。所以基础设施这层非常、非常重要。但问题是:这条输电线会取代我们所做的一切吗?我不认为会。
开源时代,“输电线”还是好生意吗
Harry: 作为投资人,我的问题是:输电线是好生意吗?你刚才提到 PyTorch 和开放生态。过去——我说三个月吧——我们所有人都意识到开源加速得有多快,能力已经追到几乎可比的程度:按查马斯·帕里哈皮蒂亚(Chamath Palihapitiya)的说法,能做到九成的水准,成本效益却高出 15 倍。在开源的世界里,输电线还是好生意吗?
Lin: 说说我对开源的看法。创业早期,我们几个联创之间有过很深的争论:自己训模型,还是在开放模型之上做?当时开放模型还处在婴儿期,选那个方向是个大赌注。但因为 PyTorch 的经历,我们相信开放社区、相信开放性,这是我们行事的基本原则。
开放把控制权交给用户。想想开放模型:模型一旦发布,权重完全归你,想怎么改就怎么改,它就是你的,你可以在上面建任何东西。这和之前的做法根本不同,而我们信它,正是因为我们出身开源。于是我们押了这个方向。
这个赌注收到了回报:过去两年,开放模型和闭源模型的质量都大幅提升,大到两条线都跨过了质量门槛,能解决非常多的问题。在 Fireworks 内部,我们自己的产品 Dogfoot(译者注:原文听写存疑,指 Fireworks 内部产品)就用开放模型驱动招聘流程、候选人搜寻和反馈收集,甚至一部分内部财务流程;写代码也用开放模型帮忙调试。我们内部有一大堆智能体,而且我们非常在意成本。
第二,开放模型跨过门槛之后,驾驭它变得容易得多。能引导一个模型,本身就是智能的一部分。现在的模型智能过了某个门槛,用少量数据——一家公司独有的那一小部分数据——就能驾驭它,然后沿着你的评估指标爬坡(hill climb)。爬坡的终点往往是:用你的数据解决你的独特问题,你比通用模型做得更好。
Harry: 按你说的,九成企业工作流都能用开放模型完成——你们自己内部就这么用。那么前沿模型的用量就没那么大了。既然大头都能走开源,这些公司是不是被严重高估了?
Lin: 我觉得大家开始意识到这一点了。两年前我就在各种场合讲一个现象,这个现象在 SaaS 时代不存在。那时候,产品市场契合(product-market fit,PMF)和可持续的生意几乎是同义词:最难的是找到 PMF,找到之后就全力扩张——因为 CPU 是大宗商品,你脚下的基础设施也几乎是大宗商品,你甚至不用把它算进销货成本(COGS)里。
现在不一样了,PMF 和可持续生意是两个概念。很多创业公司有很好的 PMF,客户愿意付钱、真心喜欢产品,但它们没法扩张——因为一扩张,就可能扩张到破产(scaling to bankruptcy)。你听说过这个词吗?这是真问题。对存量大公司来说,问题更大。
那些数字原生的大公司手握巨大的流量,是十年前创业时代的赢家。一旦它们推出 AI 功能,立刻触达全部客户群——但它们承担不起。CFO 一看成本测算就知道:这笔账怎么都算不平。于是所有创新者都面临同一个困境:我们真想接入这项颠覆性技术,但用不起,必须找到用得起的替代方案。这个替代方案就是:掌控开放权重模型,部署自己的模型。
Harry: 或者看看萨姆·奥尔特曼这几天发布的东西——价格低得多的模型。具体数字我记不清了,大概是便宜一半,甚至降到三分之一。下一步会不会就是前沿模型集体大降价?
“前沿模型公司是否被高估”在节目播出后仍在升级:Anthropic 2026 年 5 月完成 650 亿美元 H 轮、投后估值 9650 亿美元,6 月已向 SEC 秘密递交 S-1 文件,7 月底年化收入达 650 亿美元(5 月时为 470 亿);OpenAI 3 月以 8520 亿美元投后估值完成融资,9 月又传出按 1.2 万亿美元估值再融资。估值争议没有平息,但两家的收入曲线同样陡峭——争论焦点已从“倍数贵不贵”转向“增长能持续多久”。
Lin: 有可能。但两者是完全不同的经营原则。开放权重模型就在那里,获取模型的成本为零——当然有公司花钱训练了这些模型并愿意开放出来,美国就有好几家在做,包括英伟达训练的 Nemotron,我们和他们合作非常紧密。模型一旦发布,用的人几乎不花一分钱。而前沿实验室必须持续投入,把研发成本收回来,这是根本性的成本结构差异。
第二,通用模型你没法定制,只能通过 API 原样使用,毫无控制权。开放模型则完全在你手里:想怎么调就怎么调,想怎么用就怎么用。Fireworks 更进一步——我们是专用智能平台,提供一整套工具,让你轻松为某个具体场景定制模型;调好之后再针对推理部署做优化。
在 Fireworks,我们把每一次模型部署都看作“一对一”(one size fits one):只为你的负载而生,从质量、速度、成本三个维度只为你的负载优化。当你想到生产环境要触达几百万、几千万乃至几十亿用户时,5% 的成本下降都是一笔巨款——何况我们过去常见的是 5 到 10 倍的成本下降。
开放权重“获取成本为零”是这套叙事的支点,但为零的只是权重本身:微调、评估、护栏、合规、运维的成本全部转嫁回采用方。“人人买得起模型”可能变成“人人得养一支机器学习团队”。对 Fireworks 自身也有反噬:开源生态越好,客户绕开平台层自建的诱惑就越大——它最大的盟友也是它最大的替代方案。
中国开源模型与国家安全之辩
Harry: 有个问题我必须问:企业的顾虑里有国家安全这一条。你看 OpenRouter,今天排名前六的模型我记得都是中国模型,质量惊人,迭代速度惊人——但它们是中国模型。面对中国开源的力量,我们要不要严肃对待国家安全问题?
Lin: 这是眼下全行业的大辩论。我的看法是:模型一旦开放,你可以围绕它加上专属于你业务的护栏。其实对任何模型——不管开放还是闭源——都应该加自己的护栏。根本原因在于:模型提供方会把自己的判断、自己的品味注入训练过程,你无法保证它和你的一致。
回到黄仁勋那句话:没有“通用的通用公司”。每家公司都独特,有自己的设计原则、自己的品味、自己要服务的目标人群。正因为这种独特性,一家公司的判断、品味和设计原则,注定和你这家解决特定问题的公司不匹配、不对齐。所以你需要把这些模型调成你的样子。
我真心相信,未来不会是少数几个 AGI 模型统治世界。我真心相信未来是——说出来也许有点吓人,但我认为这是真的——百万个专用模型,每个应用、每个场景一个。
“我真心相信未来是——说出来也许有点吓人,但我认为这是真的——百万个专用模型,每个应用、每个场景一个。” "I really believe the future will be, it may be scary, but I think that's true. It will be millions of specialized models, one per application per use case."
▍点拨:这是全期论点的题眼。注意它的推论:如果模型数量是百万级,价值捕获的主战场就不在“训练出最强模型”,而在定制、部署、路由与运维——也就是 Fireworks 坐的那一层。
Harry: 上周有报道说,中国在考虑限制外界获取他们的开放模型,因为他们看到自己的进展太快、太好了。在美国缺乏自有开放模型的情况下,如果中国真的开始限制,会发生什么?
Lin: 短期冲击会很大。但开放生态的美妙之处在于它不属于单一提供方——所以才叫开放,它总会吸引非常多利益相关方参与进来。从人才密度和资源上看,我相信美国有能力、也应该建起自己的开放体系。我见过这一幕重演:开放系统里百花齐放,这正是它的美。
Harry 说“OpenRouter 前六都是中国模型”,节目后两个月的数据基本坐实了这一印象:OpenRouter 对百万亿 token 调用的分析显示,开源模型份额已达三分之一,前六名一度有五家是中国开源模型;中国生成式 AI 的全球份额一年内从约 1% 升至 15%;Qwen 仅 2026 年前 7 个月在 Hugging Face 的下载量就约 20.6 亿次。企业侧的采用同样落地:中国企业级大模型市场 2026 年初由通义千问以约三成份额领跑。中国开源已从“可选替代”变成“默认选项”之一。
要不要自研模型:Harvey 与 Legora 的分岔
Harry: 说到企业内的智能专用化,举个最典型的例子——我其实不太想举这个,因为我是 Legora 的投资人,而且我大概猜得到你站哪边。法律赛道有两家竞争的公司,Harvey 和 Legora。Harvey 下决心自研模型,Legora 没有。一年前,不自研的公司看起来是对的,因为前沿模型能力涨得太快;现在看起来他们错了。Harvey 和 Legora 这样的公司应该自研模型吗?如果不做,会怎样?
Lin: 我的一个观察是:软件开发、尤其是 SaaS 领域,已经被编码的通用智能显著颠覆了。应用开发的生命周期——从想法到实现再到生产规模——所需的时间和资源大幅坍缩。过去,这需要几十位很强的产品工程师和产品经理,投入好几个季度甚至数年,那是很深的护城河。
今天,一个人、几周时间,就可能把想法做成产品并快速上规模。这是史无前例的。这也重新定义了竞争的位置:单靠应用创意本身很难竞争,因为想法人人都差不多,而实现不再是高门槛。
Harry: 但放到企业部署的真实场景里,真是这样吗?如果你服务的是全球最大的律所,企业销售周期至少是数年级别,要靠多年关系积累;部署又高度定制。这跟 ElevenLabs 那种拿来即用的产品完全是两回事。
Lin: 法律行业尤其难啃,律师通常更保守,对错误零容忍——律师的高薪正来自这里:你必须把案子办得滴水不漏,模型一旦幻觉、给出错误判断,麻烦就大了。所以法律是个很有意思、也很难渗透的领域,这两家公司都做得不错。
但反过来看,两家公司都握有专有知识和信息:怎么构建助手去做案例研究、怎么深入开展法律检索。我对法律的理解很浅,但案件的类型和流派实在太多了。它们处在独特的位置,能把这种深层理解转化为优势——而且它们手里有数据。
这不只是业务防御性的问题。很多时候,这些助手背后有一个编排层(harness),负责决定调用哪个 AI 工具、调什么——这是定制的,调用哪些工具、调得准不准至关重要,甚至这个编排层本身都需要和驱动它的模型协同训练。在工作流层面拥有自己的智能、把业务做到极致——这样的例子比比皆是。
哈维(Harvey)2022 年创立于旧金山,由执业律师 Winston Weinberg 与前 DeepMind 研究员 Gabriel Pereyra 创办,是 OpenAI 创业基金的首批被投企业之一,走“自研加定制法律模型”路线,估值已达数十亿美元;Legora(原名 Leya)2023 年创立于瑞典斯德哥尔摩,主打在律师既有工作流上做编排与协作,不绑定自研模型。两家的路线之争,正是本期“自研还是租用”之问的实体样本。
Harry: 也许关键在于时机。拿编码来说,Cursor 大概是最早开始微调自有模型的先锋之一,现在几乎所有编码公司都在调自己的模型。那模型迭代的速度会慢下来吗?现在几乎每天都有新模型带着新能力出现——Cursor 的新模型很厉害,转眼 Mistral 的新模型又很厉害,然后 Gemini 的新模型又来了。三年后,模型迭代还会这么快吗?模型优势还会这么转瞬即逝吗——今天这家称王,明天那家登顶?
Lin: 模型进展有好几个层次。底层是通用 IQ 的进步,那是阶跃式的——所以发布才有大版本和小版本之分。大版本就是阶跃。比如去年年初的“思考”(thinking)能力:模型不再直接吐答案,而是先自己思考再回答,效果好得多。这是一个阶跃。我们见过很多这样的阶跃,大概每年或每三个季度来一次大跃进。
但与此同时,在这些最好的基座模型之上,我看到专用化正在加速。这很像一棵树:树干上可以长出无数枝叶。基座模型每次阶跃式提升,我们能做的专用化就更多。所以我判断,这个世界的专用化速度会远远超过通用智能的进步速度。
智能会国有化吗?路由层值钱吗
Harry: 聊通用智能这部分——在我们往多模态等更深层话题走之前,先问一个:萨姆提出把 OpenAI 等公司 5% 的股权赠予政府。你觉得模型的发展会不会已经到了对社会太重要的阶段,以至于政府或行政部门会部分持有它们?
Lin: 这个问题很有意思,历史上是有先例的。如果把通用智能模型的基础层看作整个经济运转所依赖的基础设施,那先例就是太平洋煤气电力(PG&E)这类公司拥有电力和天然气网络。
我不愿看到的是只有一家公司拥有智能。这说不通,因为智能有不同的风味:既有普惠每个人的通用智能,也有真正推动历史前进的专用智能——它让我们换种方式思考,创造新的生活方式和商业范式、重塑行业。我不希望这部分死掉,只因为只剩一家公司能做这件事。这没有道理。
Harry: 在多模型百花齐放的图景里,有一个思路是按任务路由:根据模型各自擅长的领域分配任务。照这个逻辑,你会不会自己做一个“全世界的开放路由器”?
Lin: 会。甚至可以说,最好的路由器建造者就是业务方自己,因为他们最懂自己的场景、手里有评估体系。再说一次,我对“前沿”的理解不只是一个模型——前沿可以是你业务专属的路由机制。
你可以按任务拆解:完成这个任务需要一层高智能,那就用最贵的闭源模型来判断最复杂的部分;剩下的子问题交给子智能体,用更小的开放模型解决,而这些小模型还可以进一步定制,贴合你的设计。今天已经有很多人在这么做了。
我们还认为,这里有一个做自动路由系统的空间——它能自我学习,再和自动微调系统复合起来。我们觉得这些都应该是自动的。最终你会看到一个自进化系统:它基于流经你产品的数据持续演化,而产品是活的——你不断部署新功能、和用户互动,整个系统就这样全自动地自我进化。
Harry: 那你认为栈里的路由层有价值吗?如果它能自动化、或者企业自己能建,这层还值钱吗?
Lin: 我绝对认为值钱。
Harry: 你是认真的?如果它能被自动化、公司能自建,那为什么还需要 Requesty 或 OpenRouter 这样的路由产品?
Lin: 可能确实不需要了。但我们还没到那一步。我确信这会是一个创新活跃的地带。
OpenRouter 是 2023 年上线的模型聚合平台,把数百个开放与闭源模型统一在一个 API 之后按量计费,被开发者当作“模型超市”;Requesty 等新一代产品更进一步,按任务类型自动挑选模型并优化成本与质量。这一层的争议在于:当模型能力趋同,路由会不会成为新的流量入口——还是像 CDN 一样最终沦为薄利的基础设施。
与 Cursor 共建:强化学习也能分布式
Harry: 你说 Cursor 是最具创新力的先锋,我完全同意。我录节目之前做了很多功课——听说你们的 CTO 迪马曾在 Cursor 驻场好几个月,帮他们搭强化学习的基础设施。事情必须这么做吗?这种方式能规模化吗?
Lin: 事情是这样的:新技术采纳曲线的早期,尝鲜者都是黑客——黑客在这里不是贬义,他们在某个领域有很深的专业能力,并且想掌控一切。到了采纳曲线后期,技术开始触达大得多的人群,他们没有深厚背景,也不需要那么多控制。所以总是先深控制、后轻控制。我们明确把后期作为终极目标,但理解“如何走到那一步”极其重要。
这就是我们和 Cursor 深度合作的原因。他们是尝试这些想法的先锋,有来自前沿实验室的研究员,想掌控每一个细节。而我们也在一起推边界,做的事情前所未有。
独特之处在哪里?通常训练是资本极密集的事,只有大公司玩得起:砸钱买昂贵的训练集群,芯片全部互联,贵得离谱。有了昂贵的集群,你通常不用太操心效率,专心做研究就行。Cursor 和我们一样是创业公司,两家都对资本极度敏感:既要效率,又不能拖慢研究创新。
于是一起想出了聪明的办法。他们做大规模后训练(post-training),基于强化学习。我们把强化学习拆成两半:一半是训练器(trainer),负责调整模型权重、不断产出新版本;另一半叫强化学习 rollout——把新版本部署出去,让它与合成的或真实的编码环境互动,拿回奖励信号,判断这个版本是好是坏。
过去在大厂,这两半跑在一起:一万、十万张卡用 InfiniBand 互联,极贵、极难找,但跑得快。我们设计了一套全分布式系统,跑在全球五六个数据中心区域,利用分散的 GPU 跑大规模强化学习任务。难点是要在这些区域之间同步模型权重——权重的传输延迟决定奖励信号的新鲜度,太旧就失真,这是个平衡。我们创新出一种快速分发新鲜权重的方法,数值上依然严谨,又不必受昂贵 GPU 集群部署的限制。这些就是我们和 Cursor 一起推边界的成果,支撑了他们最近的模型发布。我们非常自豪。
英伟达的 InfiniBand 方案以超低延迟和 RDMA(远程直接内存访问)著称,是大模型训练集群的主流互联,但交换机与网卡成本高昂、供货紧张;相比之下以太网方案便宜、生态开放,超大规模厂商近年纷纷转向。乔琳所说的“贵得离谱、极难找”指的就是这一层——它正是分布式强化学习要绕开的约束。
Harry: Cursor 是了不起的客户,跟你们一起做出了惊人的进展,也是你们的大客户。SpaceX 收购之后,你怎么看 Cursor 流失的风险?
Lin: 是的,所有人都在担心。从应用创新的角度看,整个行业的格局是:极少数公司真正跑出来了,达到了逃逸速度,但也就那么几家。去年 Cursor 是其中之一。可以说所有模型公司的收入都集中在 Cursor 身上,我们也集中在同一批应用公司身上。
但此后情况变了。我们现在有非常健康、多元的客户基础。去年是编码之年,所有主流编码公司都在我们平台上;今年是协同工作(co-work)之年。协同工作天然比编码更分散:有通用的深度研究类——比如你问“两年后英伟达 GPU 什么价”;更有无数垂直品类——法律(刚聊的两家)、金融、客服、招聘、销售、市场、医疗。这片协同工作的创新应用天地非常广阔,这些公司都做得很好,都是我们的客户。
更有意思的是,消费级公司也开始纷纷研究生成式 AI(GenAI)——比如怎么用新技术改造他们传统的推荐业务。这对我特别有吸引力:我们就在 Meta 干过——全球最大的推荐系统之一,非常期待看到它转化成一种新经济。
Harry: 恕我天真:在推理这个领域,客户是只用你们一家,还是同时用你们和 Together 之类的多家?
Lin: 这个领域的人更倾向于多供应商策略——因为看不清未来,多家分摊更安全。但我们不把自己定位成推理供应商。再说一次,我们交付的是专用智能:帮企业把模型调成自己的。给你个数字:今天我们每天处理超过 40 万亿 token,其中大部分来自定制模型,而不是现成的货架模型。
token 经济学:三年降 10 倍,用量涨 100 倍
Harry: 到明年年底,这个 token 数会是多少?
Lin: 20 到 100 倍都有可能。我们正处在爆发 S 曲线的极早期。
Harry: 20 到 100 倍。如果真是这个量级,那“我们身处资本开支泡沫”的说法就太荒谬了——我们需要的资本开支远比现在讨论的多得多。对吗?
Lin: 对。不过黄仁勋有个“五层 AI 蛋糕”的说法:从上到下依次是应用、模型、基础设施、芯片、能源。卡我们脖子的是蛋糕的下层——供应链,也就是能源和芯片,是物理世界里的制造速度。历史上这些产业都不是为大规模扩张设计的,没人按 100 倍扩张设计过。
我和很多制造商聊过,瓶颈往往卡在最小的零部件上——晶体管。这些不起眼的小零件,能拖住整条服务器产线,而这些服务器是要部署进数据中心、用来生产 token 的。
Harry: 顺着黄仁勋的五层蛋糕问:你必须全栈通吃才能赢、才能减少依赖吗?我们看到 OpenAI 搞出了 Jalapeno(译者注:OpenAI 芯片项目代号,原文听写存疑)——这名字真不怎么样;Anthropic 在跟三星谈自研芯片;DeepSeek 在造自己的芯片;扎克伯格的 Meta 也在造。你必须什么都做吗?
Lin: 这取决于公司哲学。对我们来说,敏捷就是一切,而且做任何东西的权利都要靠自己挣来。专注对我们就是一切——我们要专注在基于自身优势、创造价值最大的地方,同时站在别人的优势之上。
具体来说,我们想在全世界所有可能的 AI 芯片上跑,不想被“自己的数据中心能装多少卡”限制——不管自建还是租用。当然,生意做到足够大之后逻辑会变。我记得 Meta 年轻的时候也不是什么都是自建,等体量大了,自建就合理了——你得先有巨头级的流量,才挣得到自建的权利。如果能省五倍成本,那就该去做。
回到编码行业的例子:Cursor 是第一家很早就决定跟我们合作的公司。我记得他们当时年收入只有几百万美元——那只是两年前,两年里他们涨了一百倍、一千倍。他们很早就选择我们,因为想清楚了:只聚焦产品创新和后来的研究创新,不想碰平台这层。他们知道我们把全部研发都押在这一层,想赢就要找最强的伙伴。这种“专用化”的心态是对的,我们也一样——我们的目标不是拥有整个栈。
Harry: 我再追问一句:为什么黄仁勋的蛋糕跳过了你这一层?他自己在做 Nemotron 模型,为什么不来蚕食你的生意?
Lin: 黄仁勋也没建云啊。照理说他最有资格建一个英伟达云,但他不做云基础设施——别人问过他这个问题,他也说过。他的原则是专注于自己有资格做的事。为什么做模型?纯粹是供应链问题:美国如果没有本土的开放模型,就是个供应链缺口,他去就是为了补上这个缺口。如果有我们这样的公司提供专用智能平台层、不存在缺口,他就不用操心。他只想确保五层蛋糕整个转起来,哪里堵了,他就有兴趣去疏通。
Harry: 你们新一轮的投资人之一马克·贝尼奥夫(Marc Benioff)说过——这期节目播出时这轮应该已经官宣了——Salesforce 花在 Anthropic 和 Claude Code 上的钱,大约相当于开发者薪资的 3.8%。这个类比很有用:如果这就是编码工具的花销占比,它描绘了市场的一边;但如果是 20%,那我们远远低估了这些公司能长多大。往前看一两年,你觉得这个比例会到多少?会因为工具变便宜而下降,还是因为越来越好用而上升?
Lin: 我确实认为 token 成本会大幅下降。迄今为止还没降,原因是供应链约束。但我们活在自由经济里:哪里有短缺,哪里价格就高;价格高就会吸引大批人进场解决问题、带来竞争;竞争拉低成本,最终出现非常经济的解决方案。
这对所有人都是好事:便宜得多的基础设施会召唤更多用量。所以我的预测是:基础设施成本下降,用量因此爆发——这就是我判断明年图景的依据。
乔琳“三年降 10 倍”的方向在节目后被快速验证:2026 年 6 月,DeepSeek、小米、腾讯云等把 API 价格下调超九成;DeepSeek V4 输出价约 0.87 美元/百万 token,第三方同口径评测的完成成本只有同级闭源模型的几十分之一;Gartner 预测到 2030 年推理成本累计下降九成。另一面也已出现:单价降了,账单反而涨——不少团队 token 单价降了四分之三、总账单却翻了数倍,这正是“用量涨 100 倍”的微观写照。
Harry: 对。等你不再把它当回事、像用水电一样用它的时候。那 token 成本到底会降多少?直说——是砍半,还是降到百分之一?
Lin: 有几种思考方式。首先,不是所有 token 都等价。我们应该建立一个最佳实践:按任务评估 token 经济。不同模型吐 token 的方式不同,有的啰嗦得多。一个模型比另一个便宜两倍,但解决同一个任务要多吐两倍的 token,那成本其实一样。
随着模型质量提升,“精确”会成为优化目标之一。第一层优化:解决一个任务应该用更少的 token——办法就是定制模型,让它更准地解你的问题,这就是模型微调。第二层:对模型吐出和处理的每一个 token,我们平台专门优化单位经济。第三层:底层基础设施——GPU、显存等等——今天受供应链硬约束,情况会好转。未来一年到一年半我不认为会大变,但拉长到两三年,会变的,成本会被压缩。
总体上,我能想象未来三年成本降 10 倍——而这 10 倍成本下降会驱动 100 倍的用量增长。
“总体上,我能想象未来三年成本降 10 倍——而这 10 倍成本下降会驱动 100 倍的用量增长。” "So overall, I can imagine 10x cost reduction in the next three years. And this 10x cost reduction will drive 100x usage."
▍点拨:这是杰文斯悖论(Jevons paradox)的 AI 版:效率提升不减少总消耗,反而引爆需求。它也是乔琳回应“资本开支泡沫”论的底牌——如果用量弹性真有 10 倍于成本下降,现在的算力建设不是过剩,而是不足。
质量即溢价:零 KLD 的执念
Harry: 你刚才说到 token 效率、怎么帮客户提效。效率上去了,你们收费也更高。我做功课时对比过竞争对手——Together 是价格杀手,我这话没有贬义:图便宜就去他们那儿。说句尊重双方的实话:要更好的产品质量就来你们这儿,但更贵。这个评价公允吗?
Lin: 我觉得这不是同类相比(apples to apples)。回到我们的业务:大部分流量来自定制模型,我们永远把质量放第一位——模型质量是冲着你的应用、你的具体业务和场景去的。推理交付时同样讲质量。我们在乎质量到什么程度?会做很极端的事。比如训练时有个极难做到的指标叫零 KLD。
KLD 是衡量质量的指标:模型从训练系统搬到推理系统时,我们做到比特级等价——数值完全一致,一个比特的精度都不丢。这非常难。我们之所以死磕,就是因为主业是模型定制加定制模型推理:客户在训练上投的每一美元都要足额兑现。如果训练和推理的边界做不到比特等价,质量就掉了,等于你的训练投资被打了折——为什么要接受这个?质量第一,质量带来溢价。所以我们对大宗商品化、一个模型所有人同样部署的生意不感兴趣。我们只做定制模型、只为你的特定负载做独特部署。
KL 散度(Kullback–Leibler divergence)衡量两个概率分布之间的差异。训练框架与推理引擎在数值实现上常有细微差别(算子精度、浮点取舍),同一个模型搬过去行为就会漂移——在强化学习里,这种漂移会让奖励信号失真。Fireworks 追求的“零 KLD”即训练与推理输出比特级一致,等于保证客户在训练里买到的质量在推理时足额兑现。
Harry: 两个问题。第一,要让定制模型高效落地,是不是必须配前置部署工程师(FDE)模式?
Lin: 事实上我们确实有 FDE 团队,叫应用机器学习工程团队(Applied Machine Learning Engineering),主责就是加速定制部署。而且我们还在做一个智能体,把大量部署工作自动化。
毛利率、折旧与自建数据中心的权衡
Harry: 第二个问题。处在栈的这个位置,复杂度高,毛利结构和传统 SaaS 的 80% 不一样。我不知道你们的确切数字,但你们这一层传统上在 30% 到 40% 区间。这就是新常态吗?
Lin: 我不认为这是新常态——至少对我们是这样,别家我不知道。它反映的是我们处在超高速增长期。这个阶段你有选择:毛利率优化本质是个约束问题——假设我们要做到 70%、80% 的毛利,然后倒推,给业务加各种约束来保证这个数字。而约束通常会拖慢创新。
举个例子:系统开发处在高速扩张期时,我们不想过度建设,因为在大量试错,在验证什么会留下来、什么不会。这个阶段做优化没有意义。等确定了某个系统一定要建、而且要放大一千倍,那时候再往死里优化。
生意也是一样。我们在超高速增长期,如果一心只优化毛利率,绝对做得到,但代价是牺牲增长速度——我们要进更多地域、打更多场景、不断开新产品线,这些都不是做优化的时候。这是我的看法。
Harry: 所以不靠往栈的其他层走,你们也能提升毛利?
Lin: 我们绝对、明确地不会进应用层。至于往下自建数据中心这类事,永远可以摆上桌——问题是时机。
Harry: 不是有句话说:要么早死,要么活得够久、久到自建数据中心?马斯克或扎克伯格现在就在砸钱建最新的数据中心,我记得在加拿大那个是 100 亿美元级别。你想自建数据中心吗?
Lin: 我在 Meta 建过数据中心。那里也有很多创新空间,同样没有放之四海皆准的做法,建 GPU 原生的数据中心很有意思。这是个权衡:从运营角度看,同构部署好得多——同样的芯片、同样的型号(SKU),规模越大越好,上面跑多种负载,可互换、好管理,一套原则一套流程做运维。这又是优化逻辑:体量足够大之后,任何优化都能带来巨大经济回报。
比如英伟达最近收购了一家叫 Groq 的公司——基于大容量 SRAM 的 ASIC 加速器。
Harry: 这期之前我刚好和乔纳森·罗斯(Jonathan Ross)聊过,他非常出色,说是你的铁杆粉丝。
Lin: 我也是他的粉丝。这是绝佳的组合:算力密集(FLOPS-intense)的 GPU 配 SRAM 密集的 ASIC。算力密集适合大模型处理的前半段——预填充(prefill),也就是处理提示词那一段;SRAM 密集适合生成阶段,这是模型架构的天性。两者结合,比在同一种芯片上同构运行要好得多。
但这需要非常独特的系统设计和数据中心部署——注意,这其实是异构的,我刚才说反了:同构才对运营友好,而这是异构。怎么运营好异构设计,需要在数据中心部署上做独特的创新。
Harry: 所以数据中心不是大宗商品:你可以在数据中心部署上做出专长,一家数据中心可以比另一家强,部署有好坏之分?
Lin: 数据中心太复杂了。从头算起:建设、电力接入——得有合规的电力进来——光纤通道、散热,新芯片还需要液冷。把所有这些做对,零件还会坏,坏了怎么换。全是非常深的专业知识,不是开玩笑,不是明天我就能当数据中心运营商——我当不了。
Harry: 恕我直言,这不正是该看多中国的理由吗?尤其在美国,数据中心部署最大的障碍之一是政策、是地方上的法律掣肘。在中国这些都不存在,部署快得多。
Lin: 总体上,中国的实体基础设施建设确实快得惊人。我真的见过一座人行天桥一周内建成,速度非常、非常高。而我家附近一条高速修了一年还没完——两边真是对照鲜明。中国可能得益于人口密度,也确实专攻这类工程。但我们也有这样的专才,只是缺口太大——我听说连电工都严重短缺。这是全球性的供应链约束。
Harry: 那如果进军数据中心这层,毛利会怎么变?能从 30% 提到 50% 吗?还是没那么大影响?
Lin: 现在毛利率怎么算本身就是个有意思的问题,因为硬件的折旧年限发生了巨变。过去稳稳是六年,硬件三年一换代已经算快。现在,单是一家厂商一年内就发三个型号(SKU)。
新模型通常在最新硬件上跑得最好,模型的折旧也很快:每周都有新模型发布,老模型在下一个模型出来之前就到价值顶峰,而新模型喜欢新硬件。把这个节奏推演两年:什么模型会跑在两年前的硬件上?两年前的模型。那些模型还有价值吗?这是我们面对的真实局面——而硬件明明还能用六年。
Harry: 但你的意思是,模型迭代的速度远远甩开了芯片和硬件的速度。
Lin: 模型迭代的速度确实是最快的,但硬件创新本身也在空前加速。每年发三个硬件型号,三年就是九代。你还愿意用落后九代的硬件跑三年前的模型吗?存疑。也许打起仗来它还有价值,但按这个创新节奏,真不好说。折旧周期一变,“自建还是购买”的经济账就变了。又回到我原来的论点:你到底优化增长,还是优化毛利率?全看时机。
用巴菲特的尺子量,Fireworks 有两个早期的好迹象:一是定价权——比 Together 贵还能留住 Cursor,说明定制质量构成了转换成本;二是拒绝用约束换毛利,符合芒格“避免虚假精确”的偏好。但芒格同样会盯住折旧假设:硬件按六年折旧、型号却一年三代,账面毛利可能高估了真实经济性。超线性需求曲线下,“牺牲毛利换增长”是否划算,取决于定制模型这条护城河能否深过 token 通缩的速度。
市场终局与主权模型
Harry: 你自己怎么想这个问题?周日下午坐在扶手椅里琢磨:我们现在优化增长,什么时候转去优化毛利率?
Lin: 我会说两者都要。优化增长需要大量商业规划,前提是 PMF 成立;优化毛利率本质是优化差异化。我想避免的是过度优化毛利率,但持续优化是应该的——也就是持续优化产品差异化,这没有疑问。我们要的是持续走向一个健康的毛利率,让它支撑高速增长。这是个权衡,我们不做妥协——所谓妥协,就是为了毛利率牺牲增长。最极端的“优化”方式就是不增长、闷头把毛利率刷到高位。我知道我们能刷上去,但那是最灾难的结局。
Harry: 有意思。那换个狠的:如果把毛利率从 30% 主动压到 10%,这是个赢家通吃的市场吗?能不能先把所有人的午餐都吃掉,之后再回头优化毛利?
Lin: 赢家不是某个时间点的快照,而是长期状态。我们确实看到一个行业会震荡几轮,然后收敛到几家好公司。拿法律行业来说,我在一个饭局上听到件有意思的事:两年前这个赛道公司一大把,现在基本只剩两家了。这是场长期游戏。
Harry: 那你怎么看你们这个市场成熟后的形态?是像云市场那样——Azure、AWS、GCP 三家并立?还是像 Uber 和 Lyft,一家拿走九成,剩下的抢残羹?
Lin: 我们正处在采纳曲线的一个阶段:越来越多公司开始认真考虑转向专用智能,开始认真想“拥有智能”是不是比“租用智能”更好。回到刚才的优化问题——什么时机合适?我们自己回答的是自建还是外购(build vs. buy),客户回答的是自建还是租用、拥有还是租用。
AI 采纳之旅已经走到这一步:很多公司有了有意义的流量,在把 AI 部署进生产环境,在扩规模——这正是优化登场的时刻。要优化就得有控制权,没有控制权就没有优化的空间;要有控制权,就得基于开放模型构建,把你的数据变成你的智能。这就是我们看到的路线——整个行业很多公司得出了相同结论,都在往这个方向走。
Harry: 说到拥有智能还是租用智能,这个逻辑放到国家层面也成立。我们看到某些前沿模型曾被政府短暂封禁 19 天(译者注:原文为“Fable”,疑为误听,确指不明)。尤其欧洲突然意识到:天哪,我们不能把命脉交到 OpenAI 和 Anthropic 手里——我们的医疗服务架在一个政府说关就关的基础设施上。未来会不会出现主权模型——大国或国家集团各自拥有自己的模型?
Lin: 我确实看到这种可能。把通用智能模型看作电力层、输电线,那每个国家都应该拥有自己的输电线。想想看,输电线被切断、日常的一切停摆——那是非常可怕的时刻。我家里停电我都会抓狂,连不上 Wi-Fi 我都会焦虑。一个国家的运转建立在这条基线之上,重要性不言而喻。
公司也一样:不只是国家要有主权独立,每一家公司都应该有自己的独立性——你不会想让任何单一方有能力切断你。那是极度可怕的时刻。
为什么不碰芯片
Harry: 那我再问个直白的:为什么你愿意考虑进数据中心这层,却不碰芯片?我知道造芯片极难。但怎么突然间人人都像做普通产品一样在造芯?OpenAI、Anthropic、DeepSeek、Meta,全都在自研芯片。
Lin: Meta 造芯已经超过五年了,远不止五年——MTIA 项目 2018 年就启动了,可能更早。Meta 投资 AI 由来已久,早于生成式 AI 时代,他们有巨大的 AI 负载,主攻排序和推荐,过去也造过其他硬件。
规律是:用量过了某个阈值,自建底层供给就在经济账上成立,而且可以冲着你的负载做专用化——把逻辑固化进硬件,这本身就是另一种专用化。这颗芯片为你的特定负载而生。但你最好确定这个负载不会变:硬件一旦流片(tape out),想回头改极难,就算能改也极其昂贵。所以负载稳定了、业务稳定了,才轮到考虑造芯。
我看到的现实是:整个 AI 世界,尤其模型和定制,还高度动态,负载模式高度动态。看看应用层有多少能量——大家在试各种东西,你不知道哪个会起飞,而起飞就是一瞬间的事;起飞之后哪个能持续?只有少数。到那一刻你才看清:哦,这是个稳定模式,可以把它固化进硬件、搬进数据中心。这是一级级往下传导的。
所以对我来说,这是个漏斗问题:我们处在负载成熟度漏斗(maturity funnel)的哪一段?现在还在很早期,早到撑不起一颗耐用的芯片。回头看那些成功的加速器公司——有些非常成功——别忘了,这些 ASIC 公司在生成式 AI 之前就创立了,起初是冲着优化某个负载的论点去的,后来全部转向 AI、想办法适配 AI 负载。
等于说你在 AI 负载浮现之前就下了注,剩下的是运气问题:够不够走运,恰好押中。有人确实押中了——在芯片上放大量 SRAM 的基础设计恰好适合 AI 模型,因为模型吃显存,这真能加速推理执行。所以有些成功了,有些没有。
乔琳自己点破了 ASIC 成功里的运气成分,反向看更冷:一次流片数千万美元、周期以年计,押中的负载若已变化,芯片出厂即成沉没成本。今天“人人造芯”的热潮,三年后可能留下一批专为已死负载设计的硅片。折旧六年与型号一年三代的错配不会消失,只会以减值的形式出现在某张资产负债表上——区别只在记到谁头上。
Harry: 今天最大的瓶颈是什么?我记得 Groq 的乔纳森上节目时说,高带宽内存(HBM)是最大瓶颈,所以价格涨了五倍。你觉得哪个瓶颈被大家谈论得太少?
Lin: 我仍然认为,我们还没有为超大模型准备好的系统。我坚信底层基础设施成本会降,解决任务所需的 token 数也会降——合起来成本会显著下降,未来我们可以到处跑最高智能的模型。但今天没有为这个设计的系统。
比如,今天没有为 10 万亿参数模型设计的好系统。这需要从模型、到定制服务平台层、一直到芯片层——不是单颗芯片,而是芯片集合成的整个系统、作为一个整体包——做非常聪明的协同设计。我觉得这里还有大量创新可做。
8 亿美元 ARR 与超线性需求曲线
Harry: 你们最近宣布 ARR 到了 8 亿美元,了不起的成就,增长快得吓人。今年年底会到多少?
Lin: 我们认为至少能翻倍,到今年年底。
Harry: 哇。你知道我作为风险投资人觉得什么最有意思吗?我投了十年。当年 Slack 是黄金男孩:18 个月从 100 万做到 1000 万美元收入,惊为天人。现在你们这样的公司,几年内冲到 8 亿;你提到的 Cursor,几年内冲到几十亿。公司收入增长的速度完全不可同日而语。
Lin: 我认为根源在于:这项技术是一次根本性的颠覆,它是普惠赋能的——它触达每一个人,让每个人都有创造力,释放了大量过去无从释放的创造力。所以我们才看到这种极端高速的增长——背后是需求。
节目录制后的进展:2026 年 9 月下旬,Fireworks 完成由 Altimeter 牵头的员工股份出售,估值 175 亿美元、与 7 月 D 轮持平;另有报道称公司正洽谈新一轮融资,目标估值 300 亿美元。年化营收在 7 月已达 10 亿美元——按约 200 名员工计,人均 ARR 约 500 万美元,比 Harry 在节目里按 8 亿美元算出的 400 万又高一截。
请来乔治·胡:把组织规模化
Harry: 快问快答之前最后一个问题。你请了乔治·胡——前 Salesforce 总裁。他非常出色,是我见过最直接、最不废话的操盘手之一。但你一年前就见过他,当时你说“我们还没准备好请你”。为什么这么说?又为什么现在到时候了?
Lin: 一年前我们大概只有 50 人。今天我们是 200 人,也不算大。
Harry: 哇,那人均 400 万美元 ARR 啊。
Lin: 50 人的时候,我想的是先把产品规模化,而不是把组织规模化。我们聊了,我非常敬重他——他是硅谷传奇的操盘手。但我直觉我们对他来说还太小了,于是直说:我们可能对你来说太小了,不过我希望以某种方式跟你合作。于是他真的帮了我很多:搭团队、面试高管,他的反馈永远均衡、深思熟虑。我们就以这种方式合作了起来。
到去年底,我们增长得非常快,他看在眼里,开始认真谈。早期的缘分兑现了。他这个人很妙:成就等身,商业视野的站位很高,但又极其好奇、不做预设。他不是那种“我全懂、所有电影我都看过、不过是同一部、我按老办法执导就行”的人——他没有这种姿态。他知道 AI 的节奏快得疯狂,一路学习,同时全面拥抱 AI。
实际上,他的团队——我们的 GTM(市场进入)团队——在用各种 AI 智能体,互相分享技能,把生产力拉满。他清楚我们面对的是超线性需求曲线,GTM 团队的建设速度有上限:要追上这条曲线,团队既要扩,人效也必须同步提升。这就是他在解的题。能跟他合作我感到很幸运。
总的来说,我发现 AI 行业对人有独特要求:需要一些看似矛盾的特质组合。比如,经验极其丰富,但又在陡峭的学习曲线上保持超级好奇。或者迪马——前面聊到他——才华横溢、智力马力十足,却又极度谦逊。这种组合很奇怪:他几乎带着东欧式的愤世嫉俗,同时又非常谦卑。
快问快答:只招移民、极致担当与黄仁勋的一课
Harry: 来一轮快问快答吧。第一个:过去 12 个月,你在哪件事上改变最大?
Lin: 我想是增长速度。我之前很担心团队过早变大——所以当初见乔治才说“我们对你来说太小了”,因为我本来不打算在人员上激进扩张,我太怕失去敏捷和速度。但此后我们非常激进地用 AI 工具,也形成了自己独特的方法,专门招某一类人:我们确信他们会带着极强的主人翁意识高速冲锋,善于沟通,永不接受“不行”这个答案。我们学会了怎么找到这些人。现在我对高速扩张(scaling)安心多了。
Harry: 你们要的是哪一类人?
Lin: 我知道这听起来奇怪,但我们的人选画像非常具体:几乎只招移民。
Harry: 英国人确实不太努力。抱歉。
Lin: 还要科学严谨,几乎所有事都用数据说话。我其实认为创造力往往来自数据、被数据启发。以及毫不动摇的担当和主人翁意识——没有任何事是别人的错,全是我的错,哪怕真是别人的错。
Harry: 这就是 20VC 想要的人。那你呢?你自己是哪一类?
Lin: 说来奇怪,不是能力——我们当然要能力强的,但更能预示一个人在这波浪潮里、尤其在 Fireworks 能不能做好的指标,是他是不是为极致担当(extreme ownership)而生。
极致担当的意思是:我们不把任何人放进任何格子里,也不会把格子叠成金字塔。有人会自动站出来:这是一个端到端的问题,我要从头看到尾,跟一帮人一起把它做成,无论如何我都要交付。这种人走得最远,成长曲线也惊人。
“几乎只招移民、极致担当、数据说话”本质是一套自选择机制:招来的人自带高内驱与高承压,再用 AI 工具把人效拉到极致,这与芒格推崇的“激励机制决定行为”一脉相承。巴菲特看组织还看一条——文化能不能穿越规模:200 人时靠共同背景凝聚的极端文化,到 1000 人时往往被稀释。Fireworks 的人效神话能否续写,是这家公司下一阶段最值得跟踪的变量。
Harry: 跟黄仁勋共事,你学到的最大一课是什么?他为什么这么特别?
Lin: 他无处不在。我认真怀疑他有好几百个分身。比如我给他发邮件,他一分钟内就回。我不理解他怎么做到永远泡在细节里。但现在我自己经营公司四年,懂了:这就是速度的定义。
领导力是什么?不是特权,是判断——判断需要正确的上下文,你要替团队做出对的判断。在高速迭代的领域,如果你不知道一线在发生什么、什么有效什么无效、缺口在哪,你就会下错判断。慢行业可以等信息层层传递再做决定,快行业等不起——信息在层层传递中必然失真。
不知道真实发生了什么,判断就没有精度,这就是坏的领导力。他用自己做了示范——早在 AI 这波疯狂之前他就是这么经营的。过去我只是佩服他做到的体量,现在我懂了背后的智慧,因为我也这么干:我必须知道地面上在发生什么,才能替公司做判断。
“领导力就是判断。它不是特权,是判断。” "Leadership is just judgment. It's not privilege. It's judgment."
▍点拨:乔琳从黄仁勋“一分钟回邮件”里读出的不是勤奋,而是机制:高速迭代领域里信息层层衰减,领导者只有贴着地面才有判断精度。这解释了英伟达为何能十年保持创业速度——也解释了 Fireworks 自己的管理风格从何而来。
Harry: 在 Fireworks 的旅程里,有什么事你等太久、后悔没早点做?
Lin: 市场(marketing)。我们经常聊这件事。我们在这点上有点书呆子气:创业早期,没讨论过但都默认“产品自己会说话”——产品最后站在那里就算数。我们把全部精力放在做产品、服务客户、验证 PMF 上,几乎没在市场营销上花时间,也没有优先去教育客户:该怎么看趋势、价值在哪。但我现在认为这很重要。市场营销不是搞花活,是教育,是把事情讲清楚。我们正在补课。
Harry: 你觉得今天 AI 里哪个领域投资不足?你提到冷却、服务器之类的。哪个方向被低估了?
Lin: AI 性感的一面是:这是如此创新、有创造力的技术,所有人的焦点都是在它上面建东西。但监控 ROI——我觉得行业开始注意到了,而这才是最终要紧的。不是花了多少,是回报多少、成本多少、归因到哪。接下来几年,随着 AI 越来越深入生产环境,会有大量注意力放在把这笔账算清楚、把这种纪律建立起来。token 堆量(token maxing)只是一时的风潮,我们正快速转向 ROI 最大化(ROI maxing)——这才是经营生意的本质。
Harry: 哪家大客户是你还没有、但最想拿下的?
Lin: 我们没在传统大企业客群上花太多时间,因为之前太小了。现在随着公司成形,我发现即使不主动投入,像盖可(Geico)、第一资本(Capital One)这样的公司也找上门来。我们没有刻意追求传统企业,他们自己来了。但我确实认为那是个非常大的市场。
Harry: 今年年底之前必须发生什么,你才会觉得今年是个好年?
Lin: 我对我们驱动业务的能力有信心。对我来说,今年要证明的是:我们能在保持同样速度的情况下快速规模化。这对我非常重要。如果做到了,就有了一个证明点,明年我会更有信心继续极其激进地扩张。今年我只想确保把这件事做对。
Harry: 最后一个问题:未来三年,有什么是你看得非常清楚——会发生或不会发生——而别人都没看到的?
Lin: 我清楚看到:每一家公司都会拥有自己的智能——不是可选项,是必需品。这是正在发生的趋势。类比软件:每家公司都自建自己的软件栈是有原因的——不存在拿来就能解决你问题的标准化成品软件,因为每家公司在解决独特的问题,而建软件是为了完全掌控。当然,他们会挑:栈的哪部分自己建,哪部分是公共知识、没必要建。但每家公司都拥有自己的软件栈——这是 SaaS 时代就在发生的事。我认为同样的逻辑会重演:到某个时点,每家公司都应该拥有自己的智能。
尾声
Harry: Lin,最初是 Matt 介绍我们认识的。很开心一路了解你,当然还有乔治。怎么也谢不完你今天的到来,谢谢你专程来现场。能面对面做这期太好了,你今天棒极了。
Lin: 演播室太赞了。你问了很多有意思的问题,我聊得非常开心。
Harry: 我们确实做了很多功课,对吧?
这期对话收敛出的关键判断,对经营者和建设者同样适用:
- 智能的前沿在私有数据,不在公开互联网。 通用模型吃的是公开数据,差异化只能来自你锁在应用和企业里的专有数据。行动含义:先盘点自己能激活的私有数据,再谈模型选型——数据资产清单应先于技术架构图。
- 找到 PMF 不等于生意成立,先算清 token 账再扩张。 “扩张到破产”是 AI 时代的新死法:流量越大、亏得越快。行动含义:上线任何 AI 功能前,按任务评估 token 成本与单位经济,把它写进定价模型,而不是交给 CFO 事后补救。
- 拥有智能优于租用智能。 没有控制权就没有优化空间,优化能力决定规模化阶段的生死。行动含义:在核心业务场景上,逐步建立基于开放权重的定制与微调能力——哪怕第一步只是搭起自己的评估集与路由。
- 专用化的速度会超过通用智能的阶跃。 基座模型每年阶跃一两次,但“树干上的枝叶”长得更快。行动含义:把竞争力押在工作流与编排层的自有智能上,别把战略赌在下一代基座模型的时间表上。
- 增长、毛利与自建都是时机问题。 权利是挣来的:先有流量和稳定负载,再谈自建与优化。行动含义:超高速期不要过早优化毛利,但必须持续优化差异化——前者牺牲速度,后者积累护城河。