洞见·No Priors·2026.09.18

Inception CEO Stefano Ermon:更并行的终将获胜

对话 Inception 联合创始人、扩散模型之父 Stefano Ermon:自回归在推理时仍是 RNN 式的串行负载,而扩散模型把训练时的并行搬到了推理时——“更并行的终将获胜”是苦涩教训的又一次应验。

Overview 背景概览

本文译自No Priors 播客,发布于 2026 年 9 月 18 日;主持人莎拉·郭(Sarah Guo),对话 Inception 联合创始人兼 CEO、斯坦福大学教授斯特凡诺·埃尔蒙(Stefano Ermon)。

图像和视频的世界早已被他的扩散模型统一,而文本的世界仍由自回归架构统治——Ermon 用一期节目讲清了为什么这个格局必须改变:自回归在推理时依然是 2017 年前 RNN 式的串行负载,与 GPU 的天性背道而驰;而扩散模型把“训练时的并行”搬到了推理时。当 AI 的经济账越来越由“每瓦智能、每美元智能”决定,这场架构之争可能重新分配整个推理市场的版图——按照他的估算,仅延迟敏感型负载就占全部工作量的两到三成。

▍嘉宾:斯特凡诺·埃尔蒙(Stefano Ermon)

斯特凡诺·埃尔蒙是斯坦福大学计算机科学教授、Inception 联合创始人兼 CEO,扩散模型的奠基人之一。

  • 学术轨迹:2014 年加入斯坦福,在生成模型尚属冷门时深耕不辍;2019 年与博士生 Yang Song 提出基于分数的生成模型,奠定现代扩散模型基础——Stable Diffusion、Midjourney 的技术根脉皆出于此;亦是 FlashAttention(与 Tri Dao 合指导)与 DPO 的作者单位。
  • 创业:2024 年其团队首次证明扩散语言模型可在 GPT-2 规模追平自回归质量且快 10 倍,随后创立 Inception 将技术规模化,推出 Mercury 系列商用扩散语言模型。

▍关于 Inception

Inception 是一家总部位于旧金山的 AI 公司,约 50 人,致力于用扩散架构重构大语言模型。

  • 核心主张:自回归模型在推理时仍是串行、内存带宽受限的工作负载,与 GPU 天然错配;扩散语言模型在推理时天然并行,能以普通 NVIDIA GPU 跑出定制芯片级的速度。
  • 商业进展:Mercury 模型在基准上对标 Haiku/Flash/mini 级速度优化模型,已在语音智能体(如 OpenCall)等延迟敏感场景投入生产;自研全套训练、推理服务与后训练栈,API 与 OpenAI 兼容。

扩散模型之父

Sarah: 各位听众好,欢迎回到 No Priors。今天做客的是斯特凡诺·埃尔蒙(Stefano Ermon),斯坦福资深教授,如今是 Inception 的联合创始人兼 CEO。Stefano 在生成模型领域的成果极其广博,而他最广为人知的身份是“扩散模型之父”之一。我们聊他的公司、聊如何挑战大实验室,以及为什么未来几年 AI 的胜负手是速度与效率。Stefano,欢迎,非常感谢你来。

Stefano: 很高兴来到这里。

研究起点:在不热的领域等风来

Sarah: 我想先请你讲讲你的研究背景,以及你是怎么走上创业这条路的。

Stefano: 当然可以。我整个职业生涯基本上都在做生成模型研究。2014 年我加入斯坦福当助理教授,那会儿这个领域一点都不热——模型还不太好使,我们还在 MNIST 上训练小小的生成模型,能生成一张模模糊糊的手写数字就算重大成功。那时候想在这个方向发论文都不容易,你还得把“训练生成模型”包装成“从无标注数据里学特征、好提升监督学习”的手段,因为大家在乎的只有监督学习。

后来你们都知道,时代变了。可以说我是在对的时间、对的地方、做着对的事,可以说从最开始就在做那个方向的研究。

Sarah: 除了对这个领域的好奇,回到 2014、2015 年,你心里有没有一个更个人的期待——你希望这些模型最终能做到什么?

Stefano: 我一直觉得,生成式建模是从无标注数据里学习的正确路径——想真正理解数据里的结构,就得能把它“生成”出来。我当时完全没敢想今天 LLM 展现出的这种能力。我思考更多的是“世界模型”(World Model):我大量研究图像,所以总在想——如果我有一个世界模型,我就能在脑海里预演“如果我站起来走出这扇门会发生什么”,而这种预演对决策、对模型预测控制(MPC)都至关重要,它天然要求生成能力。

所以我认定这是正确的方向。我当时还想:这个问题足够难,够我研究一辈子,是个好问题。当然,后来我大错特错——事情的发展速度远超我的预期。

从图像到文本:创办 Inception

Sarah: 这句话放在谁身上都成立。那带我梳理一下你后来的研究脉络,以及它是怎么把你引向创业的。

Stefano: 我最早做的是图像生成模型,一开始是自回归(Autoregressive)路线,又慢又糊;后来是 VAE,再后来 GAN 一统天下。

但那时候我们对图像生成模型的现状非常不满意:GAN 是能用,可训练极不稳定、结果极难复现。我们就在想:能不能造一个和 GAN 一样好、但更有理论根基的东西?于是从 2019 年起,我和我的博士生 Yang Song 开始做基于分数(Score-based)的生成模型——也就是后来扩散模型的前身。

核心想法是:训练一个神经网络去给图像去噪。如果一个模型能把噪声去掉,说明它对图像结构的理解已经足够深,深到可以反过来构造一个生成过程。这就成了现代扩散模型的底层技术:不再像从前那样从左到右一个像素一个像素地生成,而是从纯噪声出发,一步步细化,直到得到一张干净的图。这项工作 2019 年在我的实验室诞生,然后席卷了整个领域——直到今天,最好的图像生成、视频生成模型,某种程度上还有音乐、蛋白质结构,底层都是扩散。

我的团队后来又做了大量工作:各种扩散模型的变体、采样加速技术、质量提升。在图像上做通之后,我开始琢磨一个更大的问题:能不能把扩散模型用到文本和代码这种离散对象上?有没有办法超越自回归,走向一种更并行、自带纠错能力的生成方式?

我们在斯坦福围绕这个方向做了一系列研究,2024 年取得突破——论文证明:在 GPT-2 规模(不到 10 亿参数,仍然偏学术)上,扩散语言模型第一次做到了与自回归模型质量持平。同样的数据、同样的参数量、同样的困惑度(Perplexity),但扩散模型生成文本的速度快了 10 倍——因为它一次吐出多个 token。

那一刻我太兴奋了:如果把它放大呢?于是我创办了 Inception,把这项技术规模化,去造商业级的扩散语言模型。

扩散为什么能赢自回归

Sarah: 如今所有人都见识过扩散模型在图像上的产出了。我甚至想说,扩散模型生成的短视频,在世界某些地方已经是一种主流娱乐形态,在这里也迟早会是。作为一个跟踪这个领域十几年的人,今天能做到的质量仍然让我觉得不可思议。这个方向在图像和视频上如此成功,甚至有人专门造硬件去支撑它——这不难理解。但说它适用于其他领域、说它是对当前“全 Transformer、全自回归”主流路线的一条有意思的竞争路线,这就不那么直观了。你能给一些直觉吗?

Stefano: 从研究者的视角看,当下的格局非常有趣:构建生成模型有两大范式。一种是自回归:模型预测下一个 token 或下一个像素,从左到右、一次一个地生成。另一种是扩散:一种“从粗到细、迭代去噪”的生成。如你所说,连续模态(图像、视频、音频)是扩散的天下;而离散模态(文本、代码)上,所有大实验室都押注在同一种架构上——自回归。

而当我们走向越来越强的多模态,人们开始畅想“一个模型处理所有模态、通晓世界的一切”——那个模型会是什么架构?自回归,还是扩散?没人知道,陪审团还在外面。在 Inception,我们押注扩散,因为我们相信:最终决定胜负的是推理时扩展(Inference-time Scaling),而扩散模型在推理时比自回归好,是有根本原因的。

回顾自回归的历史,2017 年有一个转折点:大家从 RNN 切换到 Transformer。为什么?因为 RNN 必须串行地、一个一个地处理 token,训练慢得无法忍受;而 Transformer 让你能并行地同时处理大量 token——这才是为训练而扩展的架构,LLM 的成功都建立在这上面。

但你再看推理——不是训练,是生成——自回归模型依然是串行的:计算从左到右、一次一个 token,没生成完前 9 个,就轮不到第 10 个。这种工作负载和 GPU 天然不匹配:它极度受限于内存带宽(Memory-bound),你绝大部分时间花在显存层级之间搬运权重,真正做算术的时间少得可怜。这是自回归模型的根本问题。

所以,“RNN 之于 Transformer”在推理侧的等价物是什么?就是扩散模型。扩散模型天生就是为“一次并行处理大量 token”的工作负载而设计的——它在推理时的工作方式,和 Transformer 训练时的工作方式几乎一模一样,因此能把 GPU 最擅长的事情发挥到极致。我们赌的就是这个:造出推理时扩展性最好的架构。因为最终,经济账是由“每瓦特智能、每美元智能”(Intelligence per Watt, Intelligence per Dollar)决定的。

你再想推理模型(Reasoning Models)的进步,大量收益来自测试时计算(Test-time Compute)的扩展——在这个轴上扩展能力更强的架构,自然更占优。甚至 RL 后训练也一样:瓶颈在于生成 rollout——让模型大量探索、给轨迹打分、据此改进——这又是推理。一个推理时扩展性更好的模型,RL 后训练的扩展性也自动更好。这就是我们押注扩散语言模型的原因:它本质上更并行。而“苦涩教训”(The Bitter Lesson)告诉我们:更并行的解法,终将获胜。

Highlights 高光金句

“‘苦涩教训’告诉我们:更并行的解法,终将获胜。” "The bitter lesson is that the more parallel solution is the one that is eventually going to win."

▍点拨:Ermon 把 Sutton 的苦涩教训用作了架构选择的最高判据——历史上,凡是能更好利用大规模并行计算的通用方法,最终都会战胜依赖人工结构的精巧方法。他的推论链条因此非常清晰:Transformer 靠“训练时并行”干掉了 RNN;而自回归推理本质上是 RNN 的幽灵复活——串行、内存带宽受限。如果苦涩教训继续灵验,推理时代的赢家必须具备“推理时并行”的形态,这正是扩散模型唯一的、也是决定性的卖点。

Tips 知识科普

苦涩教训(The Bitter Lesson):强化学习之父 Rich Sutton 2019 年的著名论断——70 年 AI 史反复证明,依赖人类领域知识的精巧方法短期内有效,但长期都会被“用更多算力暴力搜索与学习”的通用方法超越。语音识别、计算机视觉、围棋莫不如此。它的投资含义同样深刻:押注“更聪明的算法设计”不如押注“更能吃算力的架构形态”——Ermon 本期全部论证都建立在这条教训的延长线上。

Inverse 反向思考

“并行”不是免费的午餐:扩散语言模型的并行解码有一个隐含的质量税——同时生成的多个 token 之间条件独立性假设会带来局部不一致,需要用更多去噪步数或引导技术来修补,而这些同样消耗算力;所谓“10 倍速度”是在特定批量与延迟预算下测得的,真实生产负载中的加速比会打折扣。此外,大实验室并非看不见同一堵墙:如果推理瓶颈真的致命,OpenAI 与 Anthropic 凭借算力优势转向并行架构的成本,远低于 Inception 追赶前沿智能的成本——护城河必须建在“他们已经转向之前”的时间差里。

Value 价值视角

“每瓦智能”是 AI 时代最巴菲特式的指标:当模型能力趋同,竞争就回归最古老的经济学——成本。巴菲特寻找的从来不是“最好的产品”,而是“以最低成本生产同等产品”的公司,因为低成本是不可被溢价收购的护城河。Ermon 把这场架构之争翻译成“每瓦智能、每美元智能”,等于宣布 AI 推理正在从科学竞赛变成制造业竞赛——在制造业里,单位成本领先 30% 的企业几乎总能赢下整个市场,无论第二名在实验室里多聪明。

离散与连续:打通文本的去噪之路

Sarah: 在打通“离散与连续模态”这颗坚果上,你是怎么考虑适用性的?跑过哪些实验?要知道,现有主流范式也在通过新的分词(Tokenization)方法,把视频、语音都纳入同一个 token 体系。你们的路子明显不同,是怎么走通的?

Stefano: 这背后有大量的研究。扩散这项技术,骨子里是和“连续结构”绑定的:它学的是给图像去噪,对连续数据天经地义——两个像素颜色之间可以插值,插出来的东西仍然有意义。但两个单词之间,可没有什么“中间状态”——一切都是离散的。所以,把这些想法扩展到离散空间,需要一整套全新的科学,我们为此做了大量研发。

Sarah: 那今天你能宣布它好用到什么程度?

Stefano: 我们认为已经非常好用了。我们的 Mercury 系列模型,在基准测试上已经能对标各大前沿实验室的速度优化型模型——Anthropic 的 Haiku 级、Google 的 Flash 级、OpenAI 的 mini/nano 级。

更重要的是,我们已经跨过了“纯研究原型”到“真实可用”的鸿沟:这些模型今天就在生产环境里服务着真实客户。这背后有一大堆脏活累活——比如,你没法用 vLLM 或 SGLang 来跑扩散语言模型,我们必须自研一整套推理服务引擎(Serving Engine),才能扛住真实生产负载的复杂度。这些挑战我们全部解决了,今天能把这种全新的体验端到端地交付给真实客户。

Inception 的今天

Sarah: 那正好聊聊 Inception 这家公司的现状:多少人?在服务什么?研究进展到什么阶段?

Stefano: 公司成立快两年了,50 人左右。精力大头仍在研发上:搞清楚这些模型的正确训练方式、怎么把推理继续加速。要知道,扩散模型在“推理时用算力换质量”上有非常大的探索空间——图像、视频扩散模型里早就有大量采样加速技术:蒸馏、各种花哨的微分方程求解技巧,都能让采样快几个量级。围绕训练、推理、工程——数据配比、评测、RL 后训练的基础设施——有太多活要干,才能配出属于这种新模型的“配方”。

能复用的我们尽量复用:它仍然是 Transformer 架构,不必抛弃这些年积累的优秀设计;注意力机制照用;公开数据集、评测基准照用。我们是创业公司,就得精打细算(Scrappy),把子弹打在最差异化的地方——眼下是速度,未来谁知道呢?扩散语言模型有没有可能本质上比自回归更聪明?没人知道。

这正是这件事让人兴奋的地方:我们正在打造极其强大的 AI 系统,但一切还非常新。我绝不相信人类已经找到了构建这些系统的最佳方式——一定存在别的路。效率终将变得无比重要:所谓“AI 工厂”到底该怎么运转?现在没人真正知道。而能在这个场子里、用另一种方式去创造智能,这件事本身就让人兴奋。

Sarah: 完全同意。而且我认为,在一个算力与供给日益受限的大环境里,效率研究的地位正在从“第二优先”变成“第一优先”——过去很多工业界实验室眼里只有纯粹的能力扩展。如果你从底层相信:我们能用掉的算力终将全部用掉、而且经济上成立,那么对效率的关注度只会急剧上升。现在很多人已经在说:AI 公司最重要的决策之一,就是手里的算力在训练与各种高价值用例之间怎么分配。

速度在哪里赢

Sarah: 顺着这个话题:站在 2026 年 9 月,速度到底在哪里赢?哪些场景的人已经足够在乎它了?

Stefano: 基本就是延迟敏感(Latency-sensitive)的应用。广义地说,人人都在乎速度——同样的质量、更快的速度,用户永远选快的。你看前沿实验室也纷纷推出更快的模型档位,用户愿意为此多付钱。而且用过快模型就回不去了,跟当年的宽带一个道理:一旦体验过,就再也忍不了慢的。

客户案例:语音智能体

Sarah: 有没有可以公开讲的客户,今天就在乎这个?

Stefano: 有几个可以提。语音领域比如 OpenCall,他们做语音智能体(Voice Agent):整条管线是语音识别(ASR)→ LLM(负责工具调用、决定说什么,通常还得是推理型 LLM 才能保证质量)→ 语音合成(TTS),每一跳都在吃延迟,速度对他们至关重要。他们之前把 LLM 部署在 Cerebras 的定制芯片上——靠专用硬件才够得着目标时延。

后来他们切到了我们的扩散语言模型:用软件层面的并行,在普通 NVIDIA GPU 上就能跑出定制硬件级别的速度。GPU 再紧张,供给和成本也比定制芯片友好得多,质量还更好。这就是语音领域的一个例子。

Facts 时空复盘

定制推理芯片与 GPU 软件加速的 2026 年战况:Ermon 客户的迁移路径是这一年推理市场格局的缩影——Cerebras、Groq 等定制芯片靠片上 SRAM 消灭内存带宽瓶颈,曾在超高速推理上独占鳌头,但供给紧张、编程生态薄弱、单价高昂;而 2026 年的现实是,NVIDIA GPU 凭借供给与生态优势仍是绝对主流,"用软件架构创新在通用 GPU 上逼近定制芯片速度"成为更经济的路线。这印证了行业反复出现的历史规律:专用硬件的窗口期取决于通用平台追上来的速度——当年比特币 ASIC 对 GPU 的胜利是例外,更多时候(如 TPU 之外的大多数 AI 芯片初创)是通用生态获胜。

与硬件版图的互动

Sarah: 我正想问你,这和硬件版图怎么互动?我们现在已经看到明确的需求侧信号:有人就想要又大又贵、SRAM 巨多的芯片,而且愿意为它产出的速度买单——编程等场景都是。

Stefano: 没错,硬件是加速的一条路。而如果我们能把现有硬件用好,软件这条路可能更好。

Sarah: 没错,而且两者是互补的——这才是最妙的地方:软件层面拿到的加速,和硬件层面的加速,是相乘的关系。

Stefano: 而且说不定哪天,有人会做出和我们的模型更匹配的专用硬件。完全可能,完全可能。

大卫与歌利亚:新架构如何自保

Sarah: 把镜头拉远一点,聊聊 Inception 在整个行业里的位置。投资圈有一种担忧——你听听是否成立:今天投“新架构”很难,因为一旦架构或方法上出现突破,它很快就会被有算力、有资源的大玩家吸收掉。在这种格局下,作为“大卫”,你怎么想跟歌利亚竞争这件事?

Stefano: 这个问题非常实在,也是我们自己天天在想的事。

起步阶段,我们的护城河就是 IP——商业机密,是研究员脑子里那些让模型变得更好的想法。而随着公司成熟,我们越来越清楚:不能只躲在纯研究里。我们做了产品、有了真实客户、从真实世界回收反馈——这个过程本身就在长出新的护城河。比如推理服务引擎:没有它,你根本没法在生产环境跑这些模型;从第一天起我们就逼着自己端到端地部署,逼出来的整套服务能力,本身就是极难复制的 IP——就算你也能训出扩散语言模型,没有服务引擎、没有“你的 vLLM”,你照样跑不起来。

客户侧也一样:我们从真实使用中知道什么好使、什么不好使,拿到反馈、沉淀数据、共建评测集——这些东西,比一篇论文难复制得多。

压缩即智能

Sarah: 不知道我这么问在技术上成不成立:扩散模型在图像、视频、语音上受益的结构前提是——世界里存在某种一致的结构,存在“什么最可能发生”的客观分布。但 AI 今天最有价值的一些领域,比如代码,训练数据是人类生成的、非常 messy——可以说它并没有那种“客观正确的结构”。你怎么看待人类生成数据和自然模态数据之间的这个差别?

Stefano: 好问题。但归根结底,每当你训练一个生成模型——无论自回归还是扩散——你做的事本质上都是同一个:构造一套压缩方案(Compression Scheme),去识别数据里的结构。这听起来不直观,但训练这些模型的过程,就是在寻找“用最少比特描述数据”的方式;压得越好,说明你找出的模式越多。“预测下一个词”之所以神奇,就在于它逼着你去学习数据的结构——这一点,扩散和自回归没有区别。

我们 2024 年那篇论文里,度量“追平自回归”用的指标就是困惑度——它量的正是“你识别出了多少结构”。数字说明:在 GPT-2 规模上,我们识别出的结构量和自回归模型一样多。

Tips 知识科普

困惑度与“压缩即智能”:困惑度(Perplexity)衡量模型对文本的“意外程度”——越低说明模型越能预测数据,等价于发现了越多结构。信息论视角下,预测与压缩是同一枚硬币的两面:能多好地预测下一个 token,就能用多短的编码描述这段文本。这也是“压缩即智能”命题的由来——从大压缩假说到近年 Ilya 等人反复引用的“智能就是对数据的无损压缩”,Ermon 用它把扩散与自回归拉到了同一个可比较的擂台上:不比架构情怀,只比谁压得更狠。

Sarah: 对,那个经验结果摆在那儿。我只是直觉上好奇:代码这类数据并不锚定在物理世界上,噪声很大——而你的答案是,这个问题是可控的。

Stefano: 万事万物里都有噪声。数字不说谎:你能把困惑度压下去,就说明压缩方案成立、结构就在那里、模型也确实挖到了它。剩下的是归纳偏置(Inductive Bias)的问题:Transformer 是不是找这些模式的最佳容器?“预测下一个 token”是不是正确的建模范式,还是“去噪”更好?——这是纯粹的经验问题,而我们今天连分析它的工具都还不完备。

扩散模型的可控性

Sarah: 顺着刚才语音客户的例子问一句:一些做 AI 产品的人发现,把 LLM 放在语音管线中间,好处之一是更容易做对齐(Alignment)和可控性(Controllability)。扩散模型在这方面的形态应该很不一样吧?

Stefano: 这正是关键的价值主张之一。客户最关心的是:他们提供的核心价值里,很大一部分是套件(Harness)——确保模型确实做对的事。而我们的扩散语言模型在接口上做了完整的向后兼容:API 一模一样、兼容 OpenAI、文本进文本出;模型在指令遵循、JSON 结构化输出这些方面表现都很好——实测比他们原来用的模型还要好。所以他们能无缝地继续为客户提供同等水准的服务,只是把底层换成了 Mercury。

Sarah: 接口一致、栈不用动,那就太顺了。

Stefano: 是的。不过还有一层更有意思:扩散模型在“可控性”上天然比自回归有优势。你想想:自回归模型必须等整个对象生成完,你才能判断它是否满足某个约束、是否对齐、是否“符合品牌调性”——比如生成分子时关心溶解度,你得等整条链出来才能用奖励函数打分。而扩散模型是从粗到细的生成——

Sarah: 所以可以渐进地引导。

Stefano: 没错。从第一步开始,你就能判断“这个东西像不像我要的”,然后用外部奖励函数或一组约束,把生成过程往那个方向“掰”。学术界已有大量证据:扩散模型更容易控制,而且有些引导方式在自回归模型上根本不存在。这意味着我们能提供一种自回归模型给不出的全新接口。我们最近一直在琢磨:围绕这些“自回归给不了的能力”,应该设计出什么样的产品体验。

规模化之后的涌现能力

Sarah: 你想象中,Inception 的模型在规模化之后,会涌现出哪些今天模型没有的能力——不只是性能?

Stefano: 这正是让人兴奋的地方:我们不知道。

它是涌现(Emergent)的。眼下我们的楔子是速度——这是我们最初的赌注,因为它最容易验证、最容易度量,价值也显而易见。但随着我们对“怎么训好这类模型”理解得越来越深,谁知道会发现什么?

学术界已经有不少证据表明:扩散模型的数据效率(Data Efficiency)比自回归更高。直觉是:训练扩散模型时,你给同一张图加上不同的噪声再去噪,相当于免费做了大量数据增强。所以如果这一点在规模化后依然成立,而你又相信我们终将走进“数据成为瓶颈”的时代——那这件事就更有意思了。我们拭目以待。这项技术如此重要、如此有价值,只要做出真正的差异化,就一定能创造价值。

未来的工作负载比例

Sarah: 往外推演一下——五年在 AI 世界太久了,就两年:你觉得届时扩散模型和传统模型的工作负载比例会是多少?

Stefano: 我们还没到前沿智能的水平,而今天大量工作负载确实需要前沿智能。但我做过一个估算:OpenRouter 上有一套很好的任务分类——研究、对话、编程、软件工程、日志处理等等——我按这个口径估了一下,大约有 20% 到 30% 的工作负载对延迟极度敏感。所以作为下限,我认为这部分市场是可触达的:在给定的延迟预算内,谁能提供最高的质量,谁就赢。

采纳的挑战

Sarah: 任何技术路线都有代价。做扩散模型,难处在哪里?

Stefano: 它是一套不同的技术栈。很多东西必须自研:服务引擎、算子内核(Kernels)……周围没有一个成熟的生态——开源界有一些扩散语言模型,但质量一般。这让部署、让客户试用都变得更难,毕竟大家不熟悉。这是最大的挑战之一。

Sarah: 我想这也会映射到外部采纳上:越成熟的客户越在乎成本与性能——而你说过,某些场景你们一开始就得在成本性能上赢。再加上现在大家对后训练的兴趣越来越大,一套全新架构意味着这条路也得自己走一遍?

Stefano: 对,SFT、RLHF、RL 的全套栈我们都得自建。这些反过来也成了 IP 的一部分——这也是我们选择不全量开源的原因之一:把 IP 攥得紧一点。当然代价也明显:社区没机会参与共建,采纳门槛更高,本地化部署(On-prem)更难做。两种选择各有利弊。

Inverse 反向思考

自建全栈的沉重税:Inception 被迫自研服务引擎、算子内核、SFT/RLHF/RL 全套后训练栈——这些固然沉淀为 IP,但每一分投入都是从“追赶前沿智能”的主战场上抽走的弹药。更隐蔽的代价在生态位:不开源就没有社区帮你找 bug、做集成、造声势,企业客户没有 on-prem 选项就意味着放弃了合规敏感的大单子。历史经验(Android vs iOS、Kubernetes vs Mesos)一再表明:基础设施层的竞争,开放生态经常战胜单点技术领先——Inception 的封闭策略必须靠“快得让对手来不及开源”来兑现。

招聘与团队组织

Sarah: 能谈谈你们的训练规模吗——现在的和目标的?另外 50 人的团队肯定还在招人:为什么研究员、工程师应该考虑这个方向、考虑加入 Inception?

Stefano: 模型规模、算力这些属于商业机密,不便透露,但我可以说的是:我们在持续推进前沿。如果你想亲手塑造一个领域的方向,Inception 是个极好的地方——这个领域还很小,还有海量东西等待被发明。那些拒绝其他实验室 offer 选择我们的人,想要的正是这种“所有权感”:他们喜欢发明新东西,喜欢更开阔的绿野(Greenfield),喜欢没人知道答案的开放局面。我们吸引的就是这种人。

递归自我改进

Sarah: 还有一件事,让研究圈既兴奋又有些绝望:用模型做研究本身的递归自我改进(RSI)。你恰好在一个很不一样的方向上,你怎么看?

Stefano: 我们也在用,而且用很多——它确实大大加快了我们迭代和试错的速度,前沿实验室的模型我们都用,对研发帮助巨大。但至少现在——我不知道六个月、一年后会怎样——人的独创性(Human Ingenuity)依然至关重要:提出正确的想法、修剪搜索空间、识别出更有前途的方向,这些对我们来说一直非常重要。换句话说,我和我团队要干的活还多着呢。

资源分配

Sarah: 50 个人,对一家“全栈”公司——研究、服务、产品——来说并不算多。你们怎么组织?资源怎么分配?

Stefano: 团队小,但每个人都很强、很拼,再加上有智能体大幅提升我们的生产力,所以人数是够用的——说实话,我常觉得瓶颈在算力而不是人。组织上大致两块:一个产品团队,负责平台、对接客户、让客户用我们当前最好的模型拿到结果;另一个团队负责打造下一代模型——训练、RL、推理——偏研究。

学术界的影响力

Sarah: 最后一个问题。2024 年那篇论文影响巨大。而你在这个领域深耕多年——很多人说,在算力可以无限规模化的时代,学术界的 AI 研究已经很艰难了;你自己也把方向做成了公司。但在拿到 2024 年那个结果之前,你对“这个方向会有影响力”的信心是从哪来的?

Stefano: 来自我实验室里一连串结果的积累。最早的扩散工作就是在斯坦福的实验室里做的:在我们能负担的学术规模上,我们证明了它能打败 GAN,而且训练稳定得多——后来这项技术席卷世界,有了 Stable Diffusion、Midjourney,而它们的根都在学术界、在我的实验室。

还不止这一个。我和 Tri Dao 共同指导过学生,做了 FlashAttention——又一个从学术界走出来、深刻影响了整个工业界的东西。再比如 DPO:它最初只是我组里的一个轮值项目(Rotation Project),源于对那个问题里一个巧妙数学结构的洞察,如今被用于对齐各种 LLM、扩散模型,无处不在——它完全诞生在学术界。

所以,机会就在那儿:总有宝石等着被发现,总有更好、更巧的方式去解决重要的问题。学术界的好处恰恰在于它允许你下“反共识的注”。资源永远是不够的——有更多算力我们当然能做得更好——但你有最聪明的学生,人人都在试图发明新东西,没人害怕下注。这就是为什么学术界的影响力一直这么大:AI 领域许多最重要的想法,根都在学术界,甚至就诞生在学术界。

Highlights 高光金句

“AI 领域许多最重要的想法,根都在学术界,甚至就诞生在学术界。” "A lot of the important ideas have roots or even were created in academia."

▍点拨:在“学术界已死”成为流行判断的 2026 年,这句话出自一个履历本身就是反证的人:扩散模型、FlashAttention、DPO——过去五年 AI 工业界的三块基石,全部出自同一个学术实验室。学术界的真正功能从来不是与工业界拼算力,而是提供工业界激励结构里长不出来的东西:反共识的注、十年不问回报的问题、以及一代代敢下注的年轻人。砍断这个源头,工业界几年后就会发现无米下锅。

Value 价值视角

反共识下注是最便宜的深度价外期权:Ermon 的学术生涯是一组教科书级的期权组合——2014 年在冷门方向投入的是极低的固定成本(一个教授加几个博士生),换来的是扩散模型这样改变整个行业的上行爆发。巴菲特讲“下行有保护、上行无封顶”,学术界的反共识研究正是这种结构:失败了不过是几篇没人读的论文,成功了就是 Stable Diffusion。对投资者与创业者同理:真正值钱的不是“在热方向做得更好”,而是“在没人看的地方先站住”——期权的价值来自没人愿意付的那个低廉权利金。

结语

Sarah: 太好了,非常受鼓舞。Stefano,再次感谢你来。

Stefano: 谢谢邀请。

Sarah: 欢迎在 Twitter 上关注我们 @NoPriorsPod;如果想看到我们的对话画面,欢迎订阅我们的 YouTube 频道;也可以在 Apple Podcasts、Spotify 或任何你常用的播客平台关注本节目,这样每周都能第一时间收听新剧集。你还可以订阅我们的邮件通讯,或在 no-priors.com 获取每期播客的完整文字转录。

Takeaway 行动指南

本期 Stefano Ermon 与 Sarah Guo 的对话,收敛出五个可以直接复用的判断:

  1. 用“每瓦智能”重新给 AI 项目算账:模型能力趋同后,竞争回归成本经济学。评估任何 AI 方案,别只看跑分,看同等质量下的单位推理成本——它决定了你的产品能有什么样的毛利结构和定价权。
  2. 押注“能吃算力的架构形态”,而不是“更聪明的手工设计”:苦涩教训在投资与技术上同样成立——能被大规模并行放大的通用方案终将胜过精巧但串行的方案。选型时先问:这条路线的扩展性天花板在哪?
  3. 差异化的护城河要建在“交付层”,不只是“想法层”:好想法会被大厂吸收,但服务引擎、生产部署、客户反馈循环这些“脏活”难以复制。把研究逼到真实客户面前,是让 IP 变成护城河的唯一路径。
  4. 谨慎对待“范式主流”的舒适区:自回归一统文本世界,只是因为没人证明过替代品可行——直到有人证明了。评估任何“行业共识”,区分它是被验证过的真理,还是仅仅没被挑战过的惯性。
  5. 保护反共识下注的源头:无论是学术界、内部研究小组还是个人探索,那些“在没人看的地方先站住”的低成本注,是组织未来期权的唯一来源。砍掉它们,省的是今天的钱,断的是三年后的路。
Inception CEO Stefano Ermon:更并行的终将获胜