洞见·20VC·2026.09.19

Positron 联创 Thomas Sohmers:反数据中心是场叙事战,能源不是真瓶颈

20VC 对话 Positron AI 联合创始人兼董事长 Thomas Sohmers:为什么席卷欧美政坛的「反数据中心」情绪可能是一场叙事战;规划中的数据中心有多少能真正建成;能源、政策监管与主权债务谁才是 AI 的真正瓶颈;内存墙、KV 缓存与量化压缩如何决定推理经济学;token 单价从 60 美元跌到 1 美元之后,该用什么度量智能的价值。

Overview 背景概览

本文译自播客20VC,发布于 2026 年 9 月 19 日;主持人哈里·斯泰宾斯(Harry Stebbings),对话 Positron AI 联合创始人兼董事长托马斯·索莫斯(Thomas Sohmers)。

这期对话从“推理为什么是一场内存战争”讲起,一路覆盖 AI 产业当下最尖锐的几场争论:API 大厂到底赚不赚钱、“放慢前沿”是安全还是权力、“反数据中心”情绪从何而来、能源与债务谁才是真瓶颈。Thomas 的判断几乎每一条都逆着主流叙事:他认为大厂停止训练就能立刻盈利,token 跌价 60 倍的背后,单位智能的价值其实涨了上千倍,而席卷欧美政坛的反数据中心运动“几乎完全是一场中国心理战”。

▍嘉宾:托马斯·索莫斯(Thomas Sohmers)

托马斯·索莫斯是 AI 推理芯片领域最一线的创业者之一:

  • 半导体老兵:约 13 年前进入半导体行业创业——按他自己的说法,彼时“硅”在硅谷还是个脏词;现任 Positron AI 联合创始人兼董事长。
  • 技术立场:推理芯片架构师,核心主张是“推理是内存受限问题”,并以此设计芯片与系统。
  • 个人侧写:居于内华达州;自由市场与自由贸易的坚定信徒,长期看多太空经济,自称“永远押注马斯克赢”。

▍关于 Positron AI

Positron AI 是一家为生成式 AI 推理造硬件的半导体公司:

  • 核心模式:从芯片、跑在芯片上的底层软件,到完整系统和机柜级部署,垂直一体。
  • 融资与估值:2026 年完成 8.75 亿美元 C 轮融资,估值 50 亿美元;投资方包括加文·贝克(Gavin Baker)的 Atreides 等。
  • 技术主张:以内存为中心设计——基准情形下英伟达(NVIDIA)设备 500 兆瓦完成的工作,Positron 用 100 兆瓦即可;下一代产品单设备内存容量目标为英伟达最高内存型号的 8 倍。

开场:给 AI 经济造引擎的人

Harry: 这里是 20VC,我是 Harry Stebbings。我们或许正处在科技史上最重要的时刻之一:最大的模型供应商公开表示,我们需要“放慢前沿”(pacing the frontier)。这在现实中到底意味着什么?真的可行吗?它对来自中国的竞争意味着什么?对基础设施层的未来走向又意味着什么?

今天我们请到了这个领域真正的专家——托马斯·索莫斯(Thomas Sohmers),Positron AI 联合创始人兼董事长。公司刚完成 8.75 亿美元 C 轮融资,估值 50 亿美元,投资方包括 Atreides 的加文·贝克等一批业内顶尖机构。

Thomas 这期毫无保留。这期节目是一种很妙的组合:既有对支撑 AI 经济的基础设施的精彩科普,也有——我不知道该怎么形容——或许可以叫“分析师级别的八卦”,也就是对接下来几个月这个行业最大的玩家们会有哪些动作的深度讨论。

Harry: 您已到达目的地。Thomas,这期我太期待了。开场前我就跟你说过,有些大问题全世界都还不知道答案,或者自以为知道——而我们今天要纠正其中的一些。非常感谢你来做客。

Thomas: 嗯,很高兴来到这里。谢谢你,Harry。

Harry: 能不能先简单介绍一下 Positron 是做什么的?它在整个技术栈里处于什么位置?

Thomas: Positron 是一家无晶圆厂(fabless)半导体创业公司,做硬件。从芯片本身,到直接跑在芯片上的软件,再到完整的系统和机柜级部署,全是为生成式 AI 推理(inference)提供动力的。可以说,硬件栈、以及直接和硬件打交道的底层软件栈里的一切——也就是支撑当下全世界为之兴奋的那些应用(从 ChatGPT、Claude 等等)的一切——都是我们在做。

训练是算力问题,推理是内存问题

Harry: 你做的推理基础设施栈,和训练所需的相比,会发生什么变化?

Thomas: 训练从底层计算的层面看,本质上是一个算力受限(compute-bound)的问题——你拥有的 FLOPS 越多越好。无论是监管层面还是一些出口管制框架,关注重点也都在 FLOPS 上,即每秒能完成多少次浮点运算。过去十年的扩展定律(scaling laws)揭示了一个惊人的事实:给网络加越多参数、训练时投入越多 FLOPS,模型就会变得越好。

推理——也就是这些模型的部署——最大的不同在于,实际要做的数学运算大约只有训练的一半,而且不应该把这些步骤简单理解为计算量的差异。关键在于:前向传播、也就是推理这个环节,是高度、高度内存受限(memory-bound)的。因为每生成一个 token、每一点输出,都要把权重——也就是参数,你可以从生物学的角度理解为神经元——的数值完整读一遍。

这里面有一点很有意思。我倒不是说推理因此比训练更重要——当然必须先有训练——而是说,训练时语料已经在你手里,全部训练数据都是现成的,所以你可以把海量的 token 输入、把那些词句段落大规模并行处理,靠堆算力硬算过去。

但推理是生成式的:你不知道往下第五个词是什么,只能自回归地、按顺序一个一个生成,没有先见之明。于是它变成一个严重内存受限的问题,没法像训练那样靠大规模并行硬压过去。

内存墙:120 倍对 17 倍的错位

Harry: 从算力受限到内存受限这个转变,我完全听懂了。人们谈到你们做的事时常说的“内存墙”(memory wall),指的就是这个吗?

Thomas: 算说对了一部分。内存墙这个词在 AI 热起来之前很久就存在了。回看过去五六十年,摩尔定律让我们能在每平方毫米硅片上持续塞进更多晶体管,带来了更大的原始算力和 FLOPS,但内存技术的进步速度没有跟上。

粗略地说,从 2014 年——新一轮 AI 时代才刚刚起步——到 2024 年,单块英伟达 GPU 的 FLOPS 提升了约 120 倍,那十年的大部分进步都建立在这上面;而同期内存带宽只提升了 17 倍。

真正的症结在于:单设备的 FLOPS 突飞猛进,外围的互连等方面也有不少改进,但算力与内存带宽的比值一直在发散。结果就是,如果一个问题本身是内存受限的,算力没法线性地把内存瓶颈抹平,那么随着时间推移,它只会变得越来越内存受限。

Harry: 为什么两者的进步速度会这么错位?一个 120 倍,一个只有 17 倍,原因是什么?

Thomas: 这涉及很多技术实现细节。往最底层看,硅片上用的内存叫 SRAM(静态随机存取存储器)。一个 SRAM 单元由六个晶体管加位线、字线和一些外围控制逻辑组成,但大约 15 年来,SRAM 单元的尺寸并没有跟随摩尔定律同步缩小——它的缩小速度远远慢于用于其他用途的晶体管组。

可以说,计算侧有大量架构层面的进步空间,而一个 6T SRAM 单元从架构原语的角度看,三四十年几乎没变过。这是输入侧的问题:制造工艺等原始技术能力上,内存就是提不上去。

但我认为,那十年里也缺少正确的动机。卷积神经网络——比如 2012 年开启深度学习革命的 AlexNet,以及后来的 ResNet——整个 2010 年代的进步,都属于算力受限的机器学习模型:往 CNN 上堆 FLOPS 就能出更好的结果,对内存容量和带宽的需求并不大。

真正的转折是 Transformer。《Attention Is All You Need》那篇论文 2017 年就发表了,但说句玩笑话,它直到 2020 年才真正得到自己应得的“注意力”。GPT-1 和 GPT-2 在 2018、2019 年已经发布,但真正是 GPT-3 证明了:从十亿级参数扩到 1750 亿参数,能力会出现巨大跃升。我认为 Transformer 革命是从那里开始的,而大多数人直到 2022 年底 ChatGPT 出来才反应过来。

缓存 token:AI 时代最暴利的生意

Harry: 看今天的 token 经济学和 token 效率,有什么是大家不知道、也不怎么讨论,但你认为应该被摆到聚光灯下的?

Thomas: 和一两年前相比,现在各家确实已经把缓存(cached)token 和未缓存(uncached)token 分开定价了。但我觉得人们没有意识到:任何一家提供商,即使缓存 token 和未缓存 token 定同一个价(很多人以为缓存价已经很优惠了),利润率都高得离谱。他们的钱全是从卖已缓存的输入和输出 token 里赚来的。

Harry: 为什么这么说?不好意思,我想确认自己听懂了。

Thomas: 因为前面说过,处理一个已缓存 token 基本是免费的——成本大约是重新计算并生成那个 token 的千分之一量级。所以卖缓存 token 能榨出的利润空间非常大。

基本上所有提供商的做法是:把 token 写入缓存时,收一笔比普通输入 token 处理费更高的费用;你之后从缓存读取时,再收一笔较低的费用。你付低费率的时候感觉很好,但他们在缓存读取上赚的是暴利。据报道,Anthropic 现在 API 业务的毛利率高达 80 个百分点,原因就在这里。

Harry: 80 个百分点让你意外吗?

Thomas: 不怎么意外。在任何行业,80 个点的毛利率都令我佩服,做到很不容易。资本主义的好处就在于,竞争会把这样的利润率压下来。对此我有信心,也乐见其成——尽管这些公司理论上都是我的客户,我的利润率某种程度上建立在他们的利润率之上,但我更在乎生态的长期健康。

更让我意外的是,直到今天还有那么多人认为这些是烂到家的亏损生意、整个市场会归零。那种“OpenAI、Anthropic 只会烧钱,迟早把能烧的钱烧完”的迷因,在我看来很荒谬。只要停止训练,他们一夜之间就能大幅盈利;就算不像达里奥·阿莫迪(Dario Amodei)刚刚那篇文章里说的那样“放慢前沿”,他们手里还有一大堆别的杠杆。

我私下开玩笑说,“放慢前沿”这套讨论有那么一点像是 IPO 之前削减成本的好办法——但我不认为 Anthropic 或任何人需要这么做。以他们的增长速度,这些公司都是利润率高得惊人的生意。

Highlights 高光金句

“只要停止训练,他们一夜之间就能大幅盈利。” "Like if they stop training, they'd be massively profitable overnight."

▍点拨:这句话是对“AI 公司只会烧钱”迷因的直接回击。市场把训练开支混同于经营性亏损,Thomas 拆开给你看:推理 API 是 80 个点毛利的好生意,亏损来自主动选择的训练投入——那是投资,不是失血。给这类公司估值,要把“停止扩张后的存量盈利能力”和“继续扩张的选择权”分开看。

Harry: 我再确认一下理解:之所以能削减成本,是因为训练开支会减少,因为放慢了速度?

Thomas: 对。我不认为那真是他们的本意,但训练确实是他们成本的大头。

Value 价值视角

用巴菲特的框架看缓存定价:80 个百分点的毛利率,意味着 API 大厂在“已缓存 token”上握有近乎收租的特许经营权——成本是重算的千分之一,售价却只打了几折。但 Thomas 自己也点破了护城河的另一面:资本主义会引来竞争,毛利率迟早被压缩。对投资者的含义是:这类超额利润属于“市场无效率的窗口期”,长期持有的逻辑不能建立在 80 点毛利永续的假设上;真正可持续的故事是 token 总量的增长(量),而不是单 token 的暴利(价)。

“放慢前沿”之争:安全叙事与权力集中

Harry: “放慢前沿”是你先提的,那你自己是怎么解读这件事的?

Thomas: 在安全这个话题上,我心情复杂。我是个普通人,想安度晚年,更希望人类能延续下去、走向星辰大海。但相比而言,我更相信这项技术有能力以正面的方式彻底改变人类的一切。

我担心的是,目前讨论的很多“放慢”方式——不一定是它最终实施的样子——有两大风险。其一,一次大规模的停摆,会助长那股——找不到更好的词——仇视新技术的情绪:你推动暂停,实际上是给那些想彻底叫停这项技术的人递弹药、提供更好的口实。我认为这是人类面临的重大风险。

其二是我真正的 P(doom)(译者注:AI 灾难概率,即说话人认为最可能发生的坏结局)所在。在所有 AI 结局里,我最担心的是技术与能力集中到相对少数人的手里。现在讨论的很多监管框架、技术限制之类的东西,我认为就是现代版的《通往奴役之路》。

把技术能力集中起来、把做矩阵乘法定为非法——这种事会把我们打回工业革命之前,甚至是启蒙运动之前的水平。这是我能想到的对古典自由主义理念最大的攻击。我确实认为,未来绝大多数 token 会由大玩家生产;但如果这项技术本身被限制为只有他们能用,那他们就会成为新的领主和国王,其他人全都退回农奴。

Harry: 恕我直言,这难道不只是嘴上说说吗?好啊,我们在角落里摆个计量装置装装样子(原文此句听写存疑),合规走过场,然后我们就可以 IPO 了;萨姆·奥尔特曼(Sam Altman)也有个不 IPO 的理由,因为他的数字没有 Anthropic 好看。这件事迎合了所有人的诉求——马斯克(Elon Musk)也想要时间追赶,所以人人有份。

Thomas: 完全同意。而且我认为,除了达里奥之外,这确实是所有人最大的内在动机。达里奥——以及我会说 Anthropic 的绝大多数人——是真正的信徒,既相信技术的全部前景与能力,也相信风险。如果我处在他们的位置,我也会扛起那份巨大的责任。

但确实,这背后有很多战略考量:引入审计师之类,可以从法律角度卸掉一些潜在的责任。而真正的风险在于——我觉得这是很多聪明人的通病,尤其是当他们积累了巨额财富和权力之后——他们以为自己能一直保住这些。

最可怕的地方,回到我说的技术集中化:如果权力集中到公司、政府手里,那些自以为是房间里最聪明的人,到头来会发现真正掌控局面的并不是自己。达里奥基本上是在口头上恳求政府接管 Anthropic——他这么说,部分原因是他不相信这真的会发生。

我很想看真发生那天他的反应,他会意识到:“靠,我以为我主动求监管,他们就会让我来当监管者。”而当这一切没有发生,监管变成一个叫停所有进步的官僚机构,现有的能力被少数官僚挥霍掉——那是我能想象的最糟结局。

Inverse 反向思考

Thomas 把“放慢前沿”批为通往奴役之路,但反过来也要问:完全不设防的竞赛,代价由谁承担?暂停派真正的论点不是“叫停技术”,而是能力扩展与对齐研究之间的时间差——如果能力增长是抛物线、安全研究是线性的,没有任何缓冲机制的世界未必比“官僚叫停”更安全。更值得玩味的是:Thomas 最怕的结局是权力集中,而纯粹的速度竞赛恰恰可能把权力更快地集中到最先撞线的少数人手里——他开的解药(自由扩散)和他的恐惧(集中)之间,存在一个他没有回答的张力。

Harry: 再看中国的进展,尤其是他们的开放生态——那是一个人极具才华、正在高速前进的生态系统。如果我们放慢、他们不放慢,会发生什么?

Thomas: 先说明,我刚才说“最糟结局”的时候,没把“终结者”结局算进去,也没把这种情形算进去。当然,所有人都同意终结者式的结局非常糟糕,但我认为概率极低,我不相信那种末日情景。

对绝大多数人来说,这种情形会导致和我刚才描述的情形同等程度的“农奴化”;而在一个由中共控制的超级智能 AI 世界里,对相当一部分人来说会糟得多。他们目前的战略是让技术通过开源等方式扩散,但我认为,一旦他们占据领先位置,梯子会以某种方式被顺手抽走——我不认为他们真的希望技术人人可得。

他们是否会允许世界其他地方保留一些使用权,我不知道;但可以肯定,他们不会让那十亿非党员人口平等地受益于这项技术。

Harry: 我确认一下:你赞同我这个理解吗?因为我实在想不通——除非全球 AI 共同体一起放慢,否则根本没法“放慢前沿”,而我看不出普京会签这个字。

Thomas: 同意。我认为这和我刚才说的那种天真如出一辙——这些公司的领导者、乃至西方世界普遍的心态是:我们太强大、太先进、领先太多,别人不可能追上来。

纸面上,美国是世界最强军事力量吗?是。但如果突然之间,从墨西哥那边飞来相当于俄乌战场水平的无人机入侵——就假设墨西哥发展出了非常初级的无人机技术,达到俄罗斯、乌克兰、伊朗那种水平——作为一个国家,我们该怎么应对?再强的军力也没用,我们的军队是为上一场战争打造的。

地缘政治上,我们的思维还停留在“我们还是老大”。而在 AI 技术上,人们不愿承认一个事实:出口管制和其他所有理论上能让我们放慢、让别人跟在后面的手段,都不是好的长期解法。

出口管制与自由贸易的例外

Harry: 那你认为我们应该有出口管制吗?

Thomas: 我坚决相信自由贸易和思想的自由交流。唯一的例外是:我认为中国在一定程度上搭了便车——享受着自由主义自由贸易秩序给全世界带来的所有好处,同时把自己的一切都封闭起来。

任何愿意拥抱思想自由交流、自由贸易和其余一切的政府、社会和人民,我们都应该和他们共建非常有活力的经济和生态。但极权体制不应该被允许参与其中——尤其是当他们拿走全部好处、还能向外输出那些让他们的极权体制更能续命的东西的时候。

Harry: 再问一下。我们聊到“放慢前沿”和各方支持者的表态——扎克伯格(Mark Zuckerberg)和 Jensen(黄仁勋)都没吭声。其实扎克伯格公开反对过,说应该按原计划继续推进。一个看似沉默、一个公开反对,我们该从中读出什么?

Thomas: 基于我目前的整体判断——从这场对话大概也能看出来——我总体上是反对“放慢前沿”现在所走的方向的。所以我赞赏任何参与讨论、并且对收益与风险持现实主义态度的人。但对任何发言者的动机,你都得留个心眼。

要我说,扎克伯格或达里奥的话,我远比随便哪个政客的话愿意听——不只是普通政客,还包括那些所谓“领袖级”、其实根本不懂技术的政客。

整个政治光谱里最让我害怕的一件事是:“反数据中心”现在几乎成了左右两派的最大公约数。而我认为,这几乎完全是一场中国心理战(psyop)。

Highlights 高光金句

““反数据中心”现在几乎成了左右两派的最大公约数,这几乎完全是一场中国心理战。” "it's now become a almost unifying issue on left and right about being anti-data centers. I think that is almost entirely a Chinese psyop."

▍点拨:这是全期锋芒最盛的判断,注意它的论证链条其实是两步:事实层面(用水、用电的流传数据是错的)加动机层面(错误信息被谁放大)。前半段他给了硬数据支撑,后半段给的主要是战略推断——读者可以接受前半,对后半保留自己的判断。

反数据中心:一场心理战?

Harry: 为什么“反数据中心”是中国心理战?我完全赞同你说的数据中心的好处——加文·贝克也说过,数据中心是对美国大片地区经济拉动最大的引擎。但普通人看到的是:电价涨了、水价涨了、后院多了个难看的数据中心。这里面我没看到的是什么?

Thomas: 先说“难看”这一点,我完全支持——我们确实需要美化工程,把数据中心真正变成社会的地标。如果几千年后的未来回望历史,他们看到那些真正庞大、震撼的数据中心,应该像看到金字塔一样——我们应该把它们装扮成技术时代的世界奇迹。

至于用水、耗电这些说法,早期流传的信息里,很多出自不专业的写手,或者干脆就是明摆着的错误。一家 In-N-Out 汉堡店的用水量就比美国最大的数据中心还多,高尔夫球场更是高出几个数量级——更何况数据中心大多是闭环液冷系统,很多场景你根本不想用水。

从中国心理战的角度看:你说得对,他们没有放慢——他们在以吉瓦为单位新增发电容量(其中大部分还是高污染的),在建巨型数据中心,大规模地让居民搬迁。让我特别恼火的是,在西方世界,我们有基于错误信息批评公司、批评政府、批评一切的自由——我热爱这种自由;但当中国可以说拆就拆、为了新增训练算力的“大局”随便搞轮流限电时,这种自由就成了我们的战略劣势。

Harry: 我绝无冒犯之意,但我真不明白,怎么会有人觉得美国或欧洲能赢过中国——他们没有任何监管和政策限制。而在英国,你想放个纸飞机都得先申请许可。所以照我看我们完蛋了——而美国也在朝那个方向走,在监管和政策要求上越来越像一个欧洲国家。是我错了吗?还是我太悲观了?

Thomas: 你没说错。美国在这方面最大的优势是:还有大量土地、大量没有同等限制的地方。我不同意我经历过的历届政府的很多事,但现任政府因为所谓“破坏环境”“破坏国家公园”挨骂——实际上,联邦土地里 90% 以上(确切数字我不记得)只是西部空旷无人的沙漠,根本不在国家公园范围内。

在 BLM(美国土地管理局)管辖的土地上建数据中心,明明离任何聚居区都有几百英里,却处处受限——这在我看来完全荒谬。我所在的内华达州有丰富的地热、太阳能等各种绿色能源,我们完全可以在沙漠腹地建核电站和其他设施,不影响任何人。连这都要限制,毫无道理。

应该说,现在已经有一些政治意愿和推动力在解决这些问题。但就在过去一年里,一些共和党州长和政客——他们的政纲里本来有一部分是支持增长的——也开始后退,因为他们看到自己的基本盘在反对数据中心,而那些反对完全建立在错误的前提上。

回到你提到的一点:人们担心电价会涨。这是最基本的供需原理——如果我们增加发电容量,没有人说要挪用留给居民家庭的电力。我看到的一个监管问题是:电力公司必须把“随时可供”的电力承诺摊进所有人的成本和产能里。

数据中心绝无可能去抽走任何已经分配出去的电力,这是不可能发生的事。而且现在新建的数据中心,都自带覆盖自身需求甚至富余的发电能力,我们却不让它们并网——并网其实可以拉低所有人的电价。电力公司那边还在游说反对新增发电容量,因为市场力量会让供给增加、价格下降——那对消费者是好事。这个市场非常拧巴。

规划中的数据中心,有多少能建成

Harry: 你觉得规划中的数据中心,最终有多大比例能真正建成?

Thomas: 从大厂来看,我认为他们规划的容量基本都会建成,只是地点可能变。确实有些本地社区成功阻止了项目落地,但那些数据中心随后就搬走了。

我不认为一年前那些大型数据中心建设者和运营者料到政治阻力会这么大,所以现在他们在社区教育上投入了更多精力,我认为这会扭转一些势头。但这也意味着数据中心会搬到没有这些麻烦的地方去。就像我说的,我们有成片的大土地可以支撑建设,所以我并不太担心容量建设会遇到存亡级别的威胁。当然,如果马斯克成功了,还有太空。

Facts 时空复盘

Thomas 判断“规划的容量基本都会建成,只是地点会变”。对照截至 2026 年 9 月的公开报道:美国数据中心建设确实在“用脚投票”——弗吉尼亚等传统枢纽的社区诉讼和并网排队持续拉长,而得州、内华达、中西部等“欢迎算力”的州拿走了大部分新增容量。与此同时,多个州 2026 年以来真的出现了以电价和用水为由收紧数据中心审批的立法动议。他“容量不亡、只是搬家”的大判断基本被验证,但“社区教育会扭转势头”这一部分,从各地选举季反数据中心议题的热度看,还远没有兑现。

Harry: 你真相信太空是可行的替代方案吗?还是说那只是会议上的谈资、是给市值找说法的嘴上功夫?

Thomas: 我认为一件事可以以一种面貌开始,然后变成另一种东西。我永远不会押注马斯克输——我基本上都是押他赢。但如果你一年前问我,我不会认为短期内有充分理由把数据中心搬上太空,因为在陆地上建更便宜、更容易。

而且还有其他很好的替代技术。我们合作的一家公司——我和他们的 CEO 也是好朋友——叫 Panthalassa,在造海洋数据中心,基本上是在海中央做一套很有意思的抽水蓄能方案。所以不上太空也有替代路径。

长期看,我确实是太空数据中心的坚定信徒,部分原因是:我认为人类要实现自己的长期潜力,终究需要一个太空经济。

Inverse 反向思考

太空与海洋数据中心的叙事很迷人,但反向看:数据中心的核心成本从来不是“找一块没人的地”,而是并网、散热介质、运维可达性和光纤回程——这四样在太空和深海全部显著恶化。Panthalassa 的抽水蓄能方案绕开了土地政治,却引入了海洋工程这个全新的风险域。马斯克式“先射星再算账”在火箭上成立,是因为发射成本被他自己打下来了两个数量级;太空数据中心要成立,需要同样的成本革命先发生,而它还没有发生。把“永远不押马斯克输”当成投资策略,本质上是把他过去的成功当成未来的先验。

能源不是瓶颈,债务才是

Harry: 说得好。永远不押马斯克输,我完全同意。如果智能的成本和能源的成本绑定,我们该怎么看待能源这个瓶颈?它在多大程度上是瓶颈?前面我们说政策和监管是核心瓶颈——能源往前看是真瓶颈,还是其实没有人们想的那么严重?

Thomas: 我认为有两个层面。其一,Positron 努力的方向就是每瓦、每兆瓦交付更多算力和能力——按我们的基准情形,你用英伟达设备要花 500 兆瓦才能做完的事,我们 100 兆瓦就能做到。但我不认为这意味着你只建 100 兆瓦的设施——你还是会建尽可能多的算力,只是每焦耳能得到更多 token、更多智能。

其二,往长期看:假设人类还能延续几百几千年,一切最终都会变成能源问题。回看几千年人类史,文明进程几乎完美对应我们生产和使用能源的能力——从发现火,到核电站。所以你那个问题的半开玩笑版答案是:一切进步都由能源门控。即便有能源可用,如果经济上不划算,也没人去做。

所以我会说,比起“我们生产能源的能力”——这方面的技术和能力我们都有的是——更大的限制在经济层面:未来几年,全世界愿意为这一切背多少债?这既牵涉能源,也牵涉基础设施本身。经济学是个更容易被指认的替罪羊——大家已经在非常担心债务周期里积累的天量债务了。

Highlights 高光金句

“一切进步都由能源门控。” "The simple tongue-in-cheek answer to your question is all progress is gated by energy."

▍点拨:这句半开玩笑的话是全期宏观框架的题眼:能源、算力、智能、经济的传导链。但注意 Thomas 紧接着自己拆了台——“即便有能源可用,经济上不划算也没人做”,把真正的瓶颈让位给了资本成本。两句话合起来才是完整判断:能源是物理上限,债务是现实约束。

Harry: 你觉得这些担心有道理吗?你自己也有同样的担心吗?

Thomas: 我认为我们有一个严重的主权债务问题,它掩盖了金融体系里大量的二阶、三阶效应。一个可以无限印钞的政府,其通胀后果是深远的;而且我们已经看到,国债和整个债券市场对这种最“无风险”资产的风险定价在持续上升,这会传导到金融体系的每个角落。

所以当人们担心甲骨文(Oracle)的债务和信用评级时,我的想法是:比起美国政府,我更相信甲骨文的商业模式和执行力——只不过美国政府能自己印钱,还有枪和核弹来保证税收。

我最大的经济担忧是:国家债务的复利累积导致货币贬值,进而引发一场更急性的具体危机,带来下游一连串后果。至于 AI 债务链条里的那些公司,我反而不担心它们完不成收入目标——过去三四年已经证明,这些生意的收入、利润,以及对下游生产率和价值的提升,全都在加速。

Value 价值视角

“比起美国政府,我更相信甲骨文的商业模式”——这句话值得用芒格的方式拆开。信用评级体系的隐含假设是“主权高于企业”,因为主权有征税权和印钞权;Thomas 的洞见在于指出这个排序在货币贬值情景下会翻转:通胀税会无差别打击所有美元资产,而拥有真实定价权和现金流的企业至少能转嫁,长债持有人却无处可逃。对资本配置的含义:在主权债务复利化的世界里,长久期债券本身成了风险源,优质股权反而是更“安全”的资产——这正是巴菲特在通胀年代一贯的配置逻辑。

KV 缓存入门:用存储换计算

Harry: 我跳一下话题,管他呢。我做功课的时候读到了 KV 缓存(KV caching)和压缩,说实话越读越晕,但又越挖越着迷——我怎么以前不知道这些?我觉得很多听众也不知道。关于 KV 缓存我们该知道什么?它为什么重要?能给我讲讲吗?

Thomas: 可以。创新总是伴随着取舍。要讲清楚这件事,得先解释一个概念:序列(sequence)。我先前提过 token——任何一家大模型公司训练新模型时,都会定义一个词表:拿巨大的语料做统计工作,找出最佳编码方式,把文本切成可以高频复用的碎块,让一切更高效。

拿一本英语词典来说,你会发现常见的前缀、后缀和词的组合。如果只给这些前缀、后缀分配符号,怎样压缩最好——这样切出来的东西,基本就是 token。你用 ChatGPT 时文字是流式吐出来的,如果吐得特别慢、或者你眼神够尖,会发现它有时一次出来的是词的一部分:有时是整个词,有时是一小块。你看到的每一小下闪烁,就是一个 token。粗略地说,在大型英文语料上,一个 token 平均相当于半个到四分之三个单词。

序列——也就是构成模型上下文(context)的东西——是这些 token 按顺序排列的一组。推理时你给模型一个提示词,比如“法国的首都是哪里”,它被分词成五六个 token 送进模型;模型接着生成“法国的首都是巴黎,是光之城……”之类的内容。

Transformer 刚出来的时候,每生成一个 token,都要把序列里所有 token——包括已经处理过的——的计算重做一遍。后来有人想到:以计算机发展史的眼光看,这几乎是显而易见的,但最初没人做——已经输入和已经生成的东西,其实不必重新计算。

于是 KV 缓存诞生了:模型里有两个叫 K 和 V 的矩阵(键和值),完全由提示词和当前这一轮已生成的内容决定。把这两个矩阵存下来,就不用重算,代价是要占内存去存。

简单例子里这只有几百 KB,但它随序列长度增长。有意思的是:注意力机制里每个 token 的计算量随序列长度呈平方级增长——那是一条越来越陡的曲线;而存成 K、V 矩阵只是线性增长。KV 缓存的意义就是:用存储换掉那笔增长极快的计算。

存储本身也带来了复杂性——你服务的每个用户都有一份独立的 KV 缓存。要保留多久?在一个大系统里怎么管理?这些都是问题。

Tips 知识科普

KV 缓存里的 K 和 V 是什么:注意力机制中,每个 token 会被投影成三个向量——查询(Q)、键(K)、值(V)。模型生成新 token 时,用当前的 Q 去和序列里所有历史 token 的 K 做匹配(算出注意力分数),再按分数对 V 加权求和得到输出。由于历史 token 的 K、V 只取决于它们自身和前文,不随后续生成而改变,缓存下来就不必重算。KV 缓存占用的显存大致与“层数 × 头数 × 维度 × 序列长度 × 2(K 和 V 各一份)”成正比——这正是长上下文显存爆炸的来源。

Harry: 那人们常说 KV 缓存的压缩与解压缩、以及系统里可能的熵,又是什么意思?

Thomas: 压缩有两种主要形式——其实不止两种,但主要的是两种。第一种是量化(quantization)。你的每个数值——权重、KV 缓存、激活值——都以某种数据类型存储。机器学习革命之前,世界上大部分计算用 FP32,即用 32 位表示一个浮点数,拆成尾数和指数。

人们很快意识到,32 位精度对要表示的东西来说严重过剩——无论存储还是计算,成本都比低精度高。于是降到 FP16;谷歌(Google)搞了 BF16,把那些位重新分配了一下;再到 FP8;现在主流系统已经到 FP4。精度降得很快,但这也带来——找不到更好的词——某种“脑损伤”,因为你要用更少的位编码同样的信息。

于是出现了很多有趣的方案:把一组 FP16、BF16 数值量化,通过截断和取整压到 int4——这组数值的总大小立省 75%,从 16 位缩到 4 位。但天真地这么做,很多基准测试成绩会掉 20%、30%——空间省了 75%,模型却被“脑叶切除”了。

高级量化技术的做法是:这 16 个数值,共享一个偏置和一个乘数——比如 16 个 int4 或 FP4 值,额外存一个新的 FP16 值,计算时统一应用到全部数值上。全部数值压掉 75%,代价只是每组多加一个 FP16。

目前的最先进水平,可以从每值 16 位压到每值约 4.5 位。这套方法既可以用于权重(模型的实际参数),也可以用于 KV 缓存。但天下没有免费的午餐——脑叶切除多多少少还是会有一点,好在已经能控制在与未量化模型相差 1% 以内。

96% 的缓存率与内存分层

Harry: 那 KV 缓存是搭建推理基础设施里最难的部分吗?还是延迟 SLO、负载尖峰,或任何我们能想到的其他东西?最难的是什么?有什么是我们看不见但应该看见的?

Thomas: 没有 KV 缓存也能跑服务,只是经济性、性能等各方面都会差得多。真正的“黑魔法”在于:行业迄今发现最有价值的那类工作负载,恰好是可缓存性极高的。

SemiAnalysis 有一个 Agent X 基准测试,测试集取自大量 Claude Code 会话——一次会话里有几十到上百轮交互,带子代理等各种结构。他们分析了大量真实追踪的代码生成、智能体编码会话,发现整个会话里流转的 token 约 96% 都是命中缓存的。

如果你的工作负载有这样极高的缓存率、同一批 token 被反复复用,那么“如何取回这些缓存”的重要性就会被急剧放大——因为这些东西会变得非常大。

模型参数已经进到万亿级:GPT-4 据传是 1.8 万亿参数模型,假设按 int4 量化再往下取整,模型权重就有约 900GB。再拿外界对 Claude Fable 的高预期来说,那是 10 万亿参数模型,权重约 5TB。但疯狂的是,这种尺寸的模型在长上下文下,单个用户会话就能到 100GB 量级——服务上只要 50 个用户,他们的上下文加起来就超过你要存的模型权重了。

而 Claude 和 OpenAI 的用户远不止 50 个。于是这里有一个很有意思的权衡:加速器内存里,多少分给权重?权重每生成一个 token 都要用,越快越好——它决定你的 SLO、决定 token 延迟。但如果用户的 KV 缓存不能持久保留,你会损失巨大的效率——因为那是不必重复做的工作。

当然,KV 缓存持久化也会带来一点用户能感知的速度提升,但它本质上主要是服务商的经济账:同一批 token 能反复用,运营方的成本就大幅下降。

Tips 知识科普

96% 缓存率为什么是“黑魔法”:智能体编码会话的特点是,系统提示词、工具定义、代码库上下文在每一轮都原样重复,真正新增的只有上一轮的动作结果——所以输入 token 几乎全是缓存命中。Thomas 引用的 SemiAnalysis Agent X 基准,用真实 Claude Code 会话轨迹量化了这一点。对推理服务商的经济含义:同样一张卡,服务高缓存率负载的有效吞吐量可以数倍于冷上下文负载——缓存命中率已经取代裸算力,成为推理定价的第一变量。

Harry: 完全听懂了:省钱是因为不用重复算,但内存这边的挑战更大了。那合理的下一步是什么?既然既要省算力、又要面对 KV 缓存的内存难题,答案是什么?芯片上堆越来越大的内存吗?具体长什么样?

Thomas: 目前部署最广的方案——现在绝大多数推理跑在 GPU 上,其次是 TPU 等计算设备——主流范式是:GPU 加速器内存主要放权重,同时保留若干正在活跃处理的用户会话;更大一群用户则走分层存储(tiered memory)。

比如,过去几秒内还在、但暂时没有活跃请求的用户,放在主机内存(host memory)里——主机侧的内存大约是加速器侧的 4 到 10 倍,能存更多。几分钟甚至几小时没回来的用户,放到更远的地方:本机 NVMe 闪存(慢得多但容量大得多),或者网络挂载的闪存盘。

我敢说,我六个月前的 ChatGPT 会话,此刻就躺在某个数据中心的一块慢速 SSD 之类的磁盘上——用昂贵内存存它才是犯傻。这种分层是常态,但它引入了大量复杂性:面对海量用户,什么时候把什么东西放到哪里,怎么决策?

我们的思路是:预期模型尺寸、用户规模、上下文长度都会大幅增长。两三年前,典型上下文长度还在 8,000 到 64,000 token,后来涨到 128K、256K,现在 100 万 token 上下文已经是模型支持的标配。

但 100 万 token 也只能装下我们公司内部最大代码仓库的一部分。如果你真想要一个能接管一整支程序员团队能力的智能体,我认为今天的主要瓶颈不是模型能力本身、也不是把模型继续做大,而是模型能装进多少上下文——它需要多少数据来做聪明的决策。

大模型与小模型:token 都流向哪里

Harry: 你刚才那番话我想拆开几处。你说你认为模型会变大——但我以为大家都在走向“拥有自己的智能”:每个企业用自己的私有数据养一个自己的小模型。这和“模型越来越大”矛盾吗?帮我理解一下。

Thomas: 我觉得可以再分成两层。一层是前沿模型:OpenAI、Anthropic、也许还有谷歌和 xAI 等,在推进能力边界的最前线。我认为这条路还很长,这些模型会继续变大、继续变好。

有很多工作负载——就说 Positron 自己怎么用 LLM 吧——我今天根本不在乎成本:如果一个模型今天能给我 10 倍的产出价值,我非常乐意付 10 倍的 token 价格。我真心希望前沿继续往前推。

另一层,部分是出于省钱,部分是要真正拥有自己的私有数据:企业确实在推动本地部署(on-prem)推理,而最大的模型很难提供本地部署。大多数公司——无论是基于开源改还是自研——都没有推前沿的资源,于是这部分就走向了小模型。

Harry: 你不认同这个判断吗?

Thomas: 这么说吧:目前全球消耗和产生的 token,大约 80%–85% 来自排名前四的模型公司,接下来的 5%–10% 来自再往后三四家。所以我完全相信,本地部署能占到全部 token 的 5%——其余还是被大厂锁定。无论从 Positron 的生意、还是我看世界演进的方式,我都更关心高流量的那头。

但小模型其实更有意思的地方在你的手机上。这里有个普遍的误解:如果问题能在手机上回答、提示词都能在本地跑完,流向云端大厂的 token 就会变少。我认为恰恰相反。

实际情形是:如果我的笔记本、手机,或者企业的本地私有云里跑着一个 LLM,它会以极快的速度消费涌进来的一切数据,基于这些数据生成分析,然后自己决定:哪些结果直接返回给本地用户?哪些问题需要更聪明、非自托管的模型来处理?

那些被“节省”下来的 token,反而会生成更多 token。道理很简单:一个普通个人用户,只会在想起来的时候偶尔去问 ChatGPT 或 Claude 一句——提问频率受限于他什么时候想起来问。但如果他有一个本地 LLM 在不停地看邮件、日历、消息,并频繁决定调用云端模型,那么按人头算,云端模型消耗和产生的 token 会暴增——尽管天真的看法是“token 都转移到端侧了”。

Inverse 反向思考

“端侧模型越多,云端 token 越多”是本期最反直觉的判断之一,但要警惕说话人的立场偏向:作为推理芯片厂商的董事长,这个叙事恰好把所有方向的演变(端侧普及、云端增长)都解释成对自己有利。反向的可能是:端侧能力的提升速度如果超过信任曲线的建立速度,越来越多的任务会停留在本地闭环,云端只承接真正高价值的请求——量增价跌,token 总量涨而云厂商收入不涨。Thomas 的论证默认了“人类会快速信任本地代理”,而一次像样的隐私丑闻就足以把这个前提打回去几年。

Harry: 我理一下:小模型、企业自有模型这块,你认 5%。那你为什么还这么看多大模型、看多尺寸继续膨胀?

Thomas: 分开说。先说模型变大这件事——AI 圈里很多人大概都会承认,这多少是种直觉:我们看到的扩展定律,之所以叫“定律”,是因为从 1 亿到 10 亿、100 亿、1000 亿、1 万亿参数,能力每次都出现惊人的提升;今天从 1 万亿到 5 万亿、10 万亿,我们仍看到同样的趋势。

我们叫它定律,是因为观察到了,但没有任何数学证明说它会一直成立。所以这在某种程度上是“凭感觉看多”:扩展一直在继续,没有放缓迹象——会不会一路走到 50 万亿、100 万亿?我看不到任何会停下来的迹象,所以我看多。

GPT-6 Astra:AGI 的第一印象

Harry: 规模到现在的三倍,扩展定律会长什么样?Jensen 都已经宣布 AGI 实现了——恕我直言——那“三倍于现在”又是什么?

Thomas: 问得好。GPT-6 Astra,我用它的头 24 小时,基本和 2022 年 11 月第一次用 GPT-3.5 时一样震撼。我当时就在 2022 年 NeurIPS 的 ChatGPT 发布现场——那是新奥尔良 NeurIPS 大会期间的一场派对,Sam 和伊利亚(Ilya Sutskever)都在。派对快结束时他们就说了句:“嘿,我们上线了一个叫 ChatGPT 的小实验,去看看吧。”零造势,真的只是顺口一提,我觉得现场没人当回事。

但我回到酒店——晚上十点十一点的样子——打开它,一口气玩了四五个小时,随机给它各种提示。那是我用电脑以来最魔幻的体验。后来 Sora 2 发布时,我有短暂的类似体验,被视频质量震撼——尤其是 Sora 2 上线那个周末,生成内容还没有任何限制。

GPT-6 Astra,我确实认为它就是 AGI。至于你问的“那接下来意味着什么”——我想我的猜测和任何人的猜测一样值钱。

Harry: 但 GPT-6 Astra 到底好在哪?为什么是堪比当年的突破?我自己没感觉到——它很棒,但说实话,和以前差不多啊。

Thomas: 那就说说过去 LLM 最让我失望的地方。先说一个偏线性改进的例子:通用编码能力、性能分析和问题分析这些,Astra 是台阶式提升,但还不算惊掉下巴——别的模型修不了、或者兜圈子给出不优雅方案的问题,换成人类软件架构师仍能想出更好的方案,Astra 只是把这一档抬高了。

真正震撼的是另一种:我给过它几个用其他所有 LLM 都没能解决的硬问题,它一次性就过了——通读代码库,既找性能优化点又找 bug,还在我们代码库的好几处发现了我自己都不知道存在的新空间。这是一个层面:台阶式,但还不算离谱。

第二个层面就真的离谱了:用一组通用工具操作电脑的能力。比如做 Blender 动画——网上已经有一堆它复刻各种视频的梗图了——那种保真度,在 GPT 5.6 soul 上基本是不可能的,这是巨大的能力跃升。我让它只看几张照片就给我家做室内设计,结果让我惊呼:一个本质上的文本模型,怎么能做到这个?

最后、也是对 Positron 最重要的一件事:每个新模型发布我都在试同一件事——让模型处理一个相对简单的逻辑设计题:实现一个加密模块,然后走完从 RTL 到 GDS 的完整流程。也就是从“实现这个加密功能”的规格说明开始,写出硬件描述语言 Verilog 代码,再把代码一路推进到一个理论上可以拿去流片的芯片设计。以前的模型能完成其中某些环节、能写脚本,但会在中途各种地方翻车。

一个大问题是:做芯片设计的电子设计自动化(EDA)工具是上世纪 90 年代、2000 年代初设计的,极其反直觉,公开网络上几乎找不到文档,模型对它们没有好的内在理解。但 GPT-6 靠着电脑操作能力和强得离谱的脚本能力,把一个 ChaCha 加密模块(译者注:原文此处听写存疑,据上下文为加密算法模块)用台积电 N3 工艺的 PDK 一路做到 GDS,只花了 50 多个小时,还达成了时序、跑过 1GHz。

这个任务如果交给一个同样刚入门的人,把流程基本跑通大概要一周;优化到 Astra 这个水平,视人而定还要再加一到两周。把两三周压到两天多一点——按我对它训练集的天真理解,它不该擅长这个。当然,OpenAI 自己也在造芯片,我很高兴这些能力被放进了公开发布的模型里,而不是只留在公司内部。

人人都在自研芯片

Harry: 我们看到了 Jalapeno——这名字我个人觉得烂透了——OpenAI 自研芯片;Anthropic 在自研芯片;DeepSeek 据说也在自研芯片。人人都在造芯,芯片这个玩家在被商品化。这事该怎么看?

Thomas: 作为这些东西的消费者——先把我 Positron 的帽子和 T 恤脱了——我会说这对行业是好事:根本上会拉低成本、提升能力、惠及更多人。我 13 年前进入半导体行业时,“硅”在硅谷还是个脏词;现在世界上最大的公司全都以某种方式和半导体产业连在一起,做着最有趣、最令人兴奋的应用,还垂直整合一路做到硅这一层。这个世界太有意思了。

你提到的那几家以及更广的阵营,宏观目标都一样,但实现细节各不相同——作为工程师和技术人,这正是让我兴奋的地方:剥猫皮有很多种方法,每个人都可以有自己的架构主张,按自己的方式实现,得到不同的结果。

Hot Chips 是这个设计领域最大的会议,OpenAI 上个月就是在那儿发布的 Jalapeno。让我高兴的是,这个行业还相当开放、愿意分享——不如五六年前那么知无不言,但仍有相当多的公开讨论。

这对 Positron 的意义是:我们有自己的架构主张和做事方式,未来也会演进,别人也一样。市场里还有大把空间可以下注、走不同的方向。而市场的美妙之处在于:价值由市场裁决,创造价值的人会得到回报。

上下文长度的极限与中国方案

Harry: 前面聊过上下文长度的扩展。它能扩多大?上下文长度有无限扩展的可能吗?这意味着我们能做什么今天做不到的事?我太好奇了。

Thomas: 用传统的线性乃至平方复杂度注意力,硬件能支撑的规模终有上限。Positron 的重点之一就是大幅提高单设备内存容量——我们下一代产品的内存容量将是英伟达最高内存型号的 8 倍;而英伟达受内存市场行情影响,其实在下调单设备内存。

但坦率说,在内存成本平方级膨胀的前提下,把上下文从今天的一百万 token 推到一千万甚至更多,非常、非常难。过去一年算法层面的进步非常有意思:线性和稀疏注意力机制能进一步降低上下文所需的存储和计算——而这些创新主要出自中国模型实验室。

这是个绝佳的例子:约束倒逼创新。出口管制不让他们拿到内存容量和 FLOPS 最高的芯片,于是他们在“不需要那种芯片”的方向上创新。DeepSeek 2025 年初的 DeepSeek V3 之所以引起轰动,就是靠多头潜在注意力(multi-head latent attention,MLA)大幅缩小了 KV 缓存——代价是多花 FLOPS 来换更小的 KV 缓存。

这条路在过去一年半突飞猛进。我个人目前最喜欢的是 Gated DeltaNet 及其衍生版本:注意力部分的总耗时可以降低 75% 左右。

Facts 时空复盘

Thomas 称 Positron 下一代产品的单设备内存容量将是英伟达最高内存型号的 8 倍,而英伟达在下调单设备内存。对照截至 2026 年 9 月的公开信息:HBM 持续供不应求、价格高企,头部存储厂的产能基本被 AI 订单预订;“内存容量即推理能力”确实已成行业共识,Cerebras、Groq 等大 SRAM 路线玩家同样在主打大内存、低延迟。需要打折的是:8 倍这一数字是 Positron 自己的口径,独立第三方的公开基准数据尚缺,采购或投资决策前应要求看实测。

Harry: 那新硬件还重要吗?DeepSeek 不靠新硬件,光靠架构创新就把成本砍了 80%。

Thomas: 还是那句,天下没有免费的午餐。MLA 压缩是以某种形式的模型能力为代价的——中国实验室重度拥抱 MLA 而美国实验室一家都不用,是有原因的。后半句基于传闻,但我对此有相当可靠的信息和判断:美国大厂肯定没用 MLA,也没用它的那些近亲。这一点未来会演变,但简版结论是:那一边并不是纯赚。

回到你上一个问题:人人都想要更长的上下文。如果我有 1000 万 token 的上下文,我想就够装下我们好几个最大的代码库,让一个智能体编码模型在它们之间真正交叉授粉。还有一点我该早说:不是“装得下”就够了。早年有些模型号称一百万 token 上下文,可一旦超过 64,000 token——那是两年前——召回能力就烂成渣。标称最大上下文是一回事,能不能有效利用这个上下文完全是另一回事。

这也是 Astra 的惊艳之处。有几个测长上下文性能的基准,一个叫 RULER,里面有一种“大海捞针”测试:拿一堆垃圾文本(比如各种书籍段落)灌满上下文窗口,随机在中间塞一个哈希值之类的异常串,然后问模型“秘密值是什么”。很多模型表现很差;才发布六七周的 GPT 5.6 只有约 70% 的正确率,GPT-6 Astra 能到 95% 以上。所以这些维度上还有很大的提升空间。

从 60 美元到 1 美元:智能该怎么计价

Harry: 说到提升空间,问个我做功课时看到的:Silicon Data 的 token 价格指数这个月跌破了每百万 token 1 美元,而五年前是每百万 60 美元。从 60 到 1。你觉得 2028 年——也就两年后——一百万 token 多少钱?

Thomas: 比起“60 到 1”这个数字,我更在意的是另一个事实:五年前那个 60 美元的 token,今天白送都没人要——相对地说,那是个彻头彻尾的垃圾 token;而你今天花一美元买到的一百万个 token,质量高出不知道多少个数量级。

Harry: 这是因为 token 效率、因为能做的事变多了?

Thomas: 不,我说的是纯模型能力。现在是 2026 年——2021 年全世界最好的模型是 GPT-3。以今天模型的发布节奏看这很疯狂:GPT-3 从 2020 年(他记忆中正式发布是 2021 年 8 月)(译者注:GPT-3 实际于 2020 年发布)一直到 2022 年 11 月 ChatGPT 之前,都是世界最强,中间两三年没有新模型;而 GPT-3.5 本质上只是在同一个基座模型上做了人类反馈强化学习(RLHF)。

回忆一下 GPT-3.5 有多差,再想想它的经济产出价值,对比今天的 GPT-6——或者随便你选什么对比点。每个 token 的价值——就改善一个人的生活、改善一家公司的经营而言——提升了若干个数量级,我会说 100 倍到 1000 倍。

所以“60 美元到 1 美元”这根轴其实该拆成两点:成本确实降了,但今天这个 token 的价值,保守说也高了 100 倍。这里还应该乘上一个系数——按“单位智能的价值”算,提升更接近 1000 倍,而不仅是你说的 60 倍。

Highlights 高光金句

“按单位智能的价值算,提升更接近 1000 倍,而不仅是你说的 60 倍。” "I would actually be saying that there needs to be some multiplier there as well, where like the value per, you know, unit of intelligence is probably closer to 1,000 fold, not just the 60 fold you're talking about."

▍点拨:这是评估“AI 通缩叙事”时最重要的框架修正:价格降 60 倍是通缩,价值升上百倍是再通胀——“智能的实际单价”在超速下降,而智能服务市场的总价值在膨胀。这是杰文斯悖论(Jevons paradox)的现代版本:效率提升没有减少算力支出,反而打开了更多值得用算力的场景。

Harry: 那把这条线外推到 2028 年会怎样?token 的成本还重要吗?它还是我们该用的首要度量单位吗?人人都在谈 token 成本,会不会其实有另一个该用的度量?

Thomas: 有意思的是,GPT-6 发布时格雷格·布罗克曼(Greg Brockman)说,他认为他们不会再按 token 定价太久了,想转向按“有用结果的成本”定价。我不认为最后会走到那一步——那太难定价了,涉及感受性(qualia)之类的问题。

按 token 定价的好处是:生成一个 token 的成本很好算,定毛利、给普通客户按批量定价都很简单。我认为这个模式会以很大的份额长期存在,因为它就是简单。

至于最大的 token 提供商,他们的商业模式可能会演化:如果 GPT-7、GPT-8 达到超人水平、能以惊人的能力充当一名完整员工,OpenAI 不管用什么方法算出“让它全速运转”的成本——比如几十万美元的 token 成本——他们可能会发现,干脆收一年一百万美元、不限量使用这个“虚拟员工”,反而更简单、更能推动普及。事情可能会这样演化。

Facts 时空复盘

Silicon Data 的 token 价格指数跌破每百万 1 美元,与截至 2026 年 9 月的公开市场一致:前沿模型 API 价格一年内多次下调,DeepSeek 等开源系持续压价。需要打折的是“60 美元到 1 美元”的分母口径:2021 年的 60 美元对应的是当时最贵旗舰模型(GPT-3 davinci)的标价,彼时其实已有便宜得多的小模型——用“最贵旗舰价”对“当前市场价”,会夸大降幅。Thomas 自己补的“价值乘数”,才是真正重要的修正。

泡沫的第一道裂缝长什么样

Harry: 问你个事。我一直很小心,不想当那个年轻天真、没经历过周期的人——虽然我也不那么年轻了。加文·贝克有句话说得好:他没法跟任何一家数字不是抛物线式向右上角冲的公司对话——现在的一切都比历史上任何时候都好。那么,鸿沟里的第一道裂缝会是什么?

从前沿模型转向开放权重模型?Anthropic 和 OpenAI 不再保持同等水平的增长——不是说增长率,那种规模下不可能——而是增长的绝对水平?明年开始达不到数字预期?然后两大核心领头羊出点什么状况,泡沫被戳破一点?

Thomas: 我承认这是一种可能。我不认为它大概率发生,原因是:开源模型和本地部署的发展,实际上会给大厂带来更大的 token 量。

Harry: 等等,这怎么讲?我以为它们是竞争关系。

Thomas: 不。手机上的 Siri 越聪明、越能干,它就会在后台替我完成一大堆事情,让我不必再做那个发起请求的人——数据会被交给更聪明的模型去处理。

我真心认为,现在很多 AI 应用的瓶颈,其实是要由人来做某个决定。不同任务有不同的自主级别,决定什么会被发给 OpenAI 或 Anthropic 的模型处理。

下一个数量级——乃至几个数量级——的 token 量增长,会出现在这一刻:我们人类开始信任一个能随时访问我们全部数据的本地 LLM,让它自己决定去做那些它自己不够聪明、做不了的事。

现在,我在很多事情上信任 Astra 甚于信任我自己,但仍然是我给它下指令,然后它也许能自主跑 12 个小时或三天。下一个大跨越,是我敢信任跑在笔记本或手机上的模型,让它去给更聪明的模型派活、派更广泛的活。

数据经济:Mercor 们能长多大

Harry: 再看支撑你所看多的大模型的数据经济:我们看到 Mercor,看到 Surge 收入冲到 30 亿美元。这些公司能长多大?Anthropic 和 OpenAI 可以是 4 万亿、5 万亿美元的公司——这完全说得通——那 Mercor 和 Surge 成为 2000 亿美元公司,同时服务前沿实验室和自建模型的世界级大企业,也完全说得通,不是吗?

Thomas: 我唯一的疑虑是前沿实验室会垂直整合。这件事之所以还没发生,是因为 Anthropic 和 OpenAI 的资本和脑力有更好的用途,轮不到自己去做 Scale AI、Mercor 那些活。但我认为这个状态不会永远存在。

假如 GPT-7 或 GPT-8 能有效地顶替 Sam Altman 管理一家大公司——到那时,他们为什么不让智能体把那些任务也接管了?

收尾:AI 对齐之前,先对齐人类

Harry: 在结束前,我想以乐观的基调收个尾。今天最让你兴奋、而你认为世界关注太少、值得我们花时间去关注的是什么?

Thomas: 我非常同情 AI 对齐(AI alignment)、AI 安全社区里那批更聪明的人在思考的问题:怎么对齐激励?很多人空谈 AI 对齐是个问题,但我认为其中关键的一环是“人类对齐”——我们这个社会、这个物种,如何对齐我们自己,去获得一个会被人工智能赋能的好结局。

我们刚才聊了一堆地缘政治和社会层面的难题,以及这些事的处理方式。很多聪明人在 AI 对齐问题上做着很好的工作、在认真推演解法。但如果我们在监管框架、能源生产、数据中心选址这些事情上没有更好的“人类对齐”,他们在 AI 对齐上能做的事情就会被卡住。

我希望把这个框架也当作一个技术问题——一个聪明人可以研究、可以推理的技术问题——让更多人这样去想它。还有一点常被那个圈子里的人低估:经济因素。我认为真正驱动决策和行动的,恰恰是经济因素。如果不从理性的、自利的行动者这些角度去看问题,你就不会有任何进展。

Harry: Thomas,这是我有史以来话题跨度最大的一场对话——从令人难以置信的基础设施演进科普,一路聊到达里奥和 Sam。你太棒了,非常感谢你今天来做客。

Thomas: 非常感谢你,Harry。

Takeaway 行动指南

本期对话收敛出五个关键判断:

  1. 推理的本质是内存生意,不是算力生意。 评估任何推理基础设施方案(自研芯片、云服务、本地部署)时,先看内存容量与带宽,再看 FLOPS——上下文长度和 KV 缓存命中率已经取代裸算力,成为推理成本的第一变量。
  2. 头部模型公司的 API 是 80 个点毛利的好生意,“烧钱”烧的是主动选择的训练投资。 分析这类公司时,把存量推理业务的盈利能力与训练扩张的选择权分开估值,不要把资本开支当经营性亏损。
  3. 能源是物理上限,资本成本才是现实瓶颈。 跟踪 AI 基建进度时,与其盯发电能力,不如盯债务周期与主权信用——那是会先断裂的链条。
  4. 别再用 token 单价度量智能。 价格降 60 倍的同时价值升了上百倍,正确的度量是“单位成本换来的有用结果”——评估供应商或自建方案时用业务结果反算,而不是比价目表。
  5. 面对反技术叙事,先查数据再谈立场。 数据中心的用水、电价指控大多建立在错误信息上;形成判断前,先核对闭环液冷、自带发电这些基本事实——叙事战的胜利条件,就是让你跳过查证。