深度·Leopold aschenbrenner·2024.06.04

情境感知:IIIa. 狂飙:千亿与万亿美金级算力集群 (Racing to the Trillion-Dollar Cluster)

《情境感知》第三章上篇:2026 年吉瓦级、2028 年 10 吉瓦级、2030 年万亿美元级——算力集群的资本与能源总动员已经开始。AI 收入半年翻番能否买单?电力与芯片瓶颈能否突破?为什么这批集群必须建在美国本土?

Overview 背景概览

本文译自前 OpenAI 超级对齐团队研究员 Leopold Aschenbrenner 于 2024 年 6 月发表的警世长文Situational Awareness(情境感知)系列第三章第一部分(IIIa)。

  • 栏目/系列:Situational Awareness: Racing to the Trillion-Dollar Cluster
  • 作者:利奥波德·阿申布伦纳 (Leopold Aschenbrenner) —— 前 OpenAI 安全研究员、现 AI 投资人
  • 发表时间:2024 年 6 月 4 日

▍关于本篇 这是系列中“产业视角”最重的一篇。前两章完成了从 GPT-4 到 AGI、再到超级智能的技术推演,本篇则回答一个更现实的问题:这一切要花多少钱、用多少电?作者把 AGI 竞赛从算法话题还原为一场资本与能源的工业总动员,为随后 IIIb(如何守住机密)与 IV(政府工程)提供了物理与经济的底座。


内容提要:作者从训练算力年均 0.5 个数量级的增长趋势出发,推演出一条惊人的资本曲线:2026 年出现造价数百亿美元的吉瓦级集群,2028 年出现造价数千亿美元的 10 吉瓦级集群,2030 年前后则将诞生耗电相当于美国全国发电量两成、造价上万亿美元的单一训练集群。文章随后从三个层面论证这条曲线的可行性:AI 收入每半年翻番的商业回报足以买单;铁路、电信、战争举债等历史先例证明这种规模的资本动员并非没有先例;电力与芯片的供给瓶颈虽然真实存在,但凭借美国的天然气资源和台积电的扩产能力,完全可以克服。真正的悬念不在“建不建得起”,而在“建在哪里”——作者疾呼,这批集群必须落户美国本土,而非中东。

最非凡的科技资本加速(techno-capital acceleration)已经启动。随着 AI 收入的快速增长,在本年代末之前,数万亿美元将涌入 GPU、数据中心和电力基础设施建设。这场工业大动员,包括使美国发电量增长数成,将是极其激烈且密集的。

在本篇中:


你看,我告诉过你,如果不把整个国家变成一座工厂,这件事是成不了的。而你们恰恰做到了这一点。

—— 尼尔斯·玻尔 (Niels Bohr) (1944 年得知曼哈顿计划的规模后对爱德华·泰勒所说)

万亿美金级集群

万亿美金级集群。插图来源:DALLE。

这场迈向 AGI 的竞争将不仅在代码和笔记本电脑屏幕后展开——它更将是一场动员美国工业实力的肉搏战。与我们近期从硅谷看到的任何其他事物不同,AI 是一个庞大的工业化过程:每一个新一代的模型都需要一个更庞大的全新集群,很快就需要配套建设全新的巨型发电厂,并最终需要新建巨型芯片制造厂(fabs)。其中涉及的投资规模令人瞠目结舌。但在幕后,这一切早已悄然启动。

在本文中,我将带大家梳理一系列具体数字,以便直观感受这其中的真正含义:

  • 随着 AI 产品收入的迅猛增长——到 2026 年左右,像谷歌或微软这样的巨头,仅凭 pre-AGI(AGI 前夕)的强大系统,其 AI 业务年收入运行率(annual run rate)就大有希望突破 1000 亿美元。这将倒逼更大规模的资本总动员,到 2027 年,全行业的 AI 总投资额可能将突破 每年 1 万亿美元

  • 我们正朝着 2028 年单个训练集群造价达 数千亿美元 的方向迈进——这些集群消耗的电量相当于美国一个中小型州,其造价甚至超越了国际空间站(International Space Station)。

  • 到本年代末,我们将迎来造价高达 1 万亿美元以上 的单个训练集群,其耗电量相当于美国全国发电量的 20% 以上。数万亿美元的资本支出(capex)将在全球范围内每年源源不断地催生出数亿张 GPU 的总产能。

在过去一年中,英伟达(Nvidia)的数据中心业务年化销售额从约 140 亿美元 疯涨至约 900 亿美元 ,震惊了世界。但这依然仅仅只是序幕。

训练算力

在此前的工作中,我们发现 AI 训练算力的年均增长趋势大约为 0.5 个数量级(OOMs)1 如果这一趋势在本年代的剩余时间里继续保持,那么最庞大的前沿训练集群将走向何方?

年份数量级增长 (OOMs)等效 H100 数量造价成本功率电耗电力消耗参照系
2022~GPT-4 集群级别~10k~5 亿美元~10 兆瓦 (MW)~10,000 户普通家庭
2024+1 OOM~100k数十亿美元~100 兆瓦 (MW)100,000 户家庭
2026+2 OOMs~1M数百亿美元~1 吉瓦 (GW)胡佛水坝,或一座大型核反应堆
2028+3 OOMs~10M数千亿美元~10 吉瓦 (GW)美国一个中/小型州
2030+4 OOMs~100M1 万亿美元以上~100 吉瓦 (GW)美国总发电量的 20% 以上

最庞大训练集群的规模扩张,基于粗估的粗略推演。

关于最大训练集群测算的详细说明

年份:根据 OpenAI GPT-4 技术报告 ,GPT-4 于 2022 年 8 月完成了训练。在此基础上,我们按年均约 0.5 个数量级(OOMs)的趋势继续向前推演。

等效 H100 数量:根据 Semianalysis摩根大通(JP Morgan) 等机构的估算,GPT-4 的训练使用了大约 2.5 万张 A100,而单张 H100 的性能相当于 A100 的 2 到 3 倍。

造价成本:人们在谈及 GPT-4 训练成本时,经常会引用诸如“GPT-4 训练花费了 1 亿美元”之类的数字,这其实仅仅计算了 GPU 的租赁成本(即:“在 3 个月的训练周期内,租赁这一规模的集群需要多少钱”)。但这是一个认知的误区。真正起决定性作用的是 构建该集群的实际造价成本 。如果你想拥有全球最顶尖的集群之一,你绝对不可能只租用它 3 个月!此外,你对算力的需求绝不仅限于最后那次旗舰模型的正式训练:在之前和期间,会有大量的去风险实验、失败的尝试、其他伴生模型的设计与训练等。

为了估算 GPT-4 的集群建造成本:

  • 公开估算 数据表明,GPT-4 集群的规模在 2.5 万张 A100 左右。

  • 按照每张 A100 每小时 1 美元的租赁折算,运行 2 到 3 年的累计建造成本大致为 5 亿美元。

  • 另一种估算方式是:单张 H100 的成本约 2.5 万美元,1 万张等效 H100 对应的 GPU 采购价即为 2.5 亿美元。而英伟达 GPU 的采购成本通常只占整个集群造价的 约一半 (其余部分为电力引入、物理数据中心建设、冷却系统、高速网络互联、维护人员薪资等)。

  • (例如,这一份 总拥有成本(TCO)分析报告 估算得出,在一个大型集群中,仅 H100 GPU 本身就占了总成本的约 40%,另外还有 13% 的开支支付给英伟达采购 Infiniband 网络设备。这意味着,如果在此测算中剔除资金成本,GPU 约占造价的 50%,而算上网络设备,英伟达实际赚取了整个集群超 60% 的总开支。)

虽然每代英伟达芯片的 性价比(FLOP/$) 都有所提升,但幅度并没有想象中那么夸张。例如,从 H100 迭代到 B100,性价比可能只提升了约 1.5 倍:B100 实际上相当于把两颗 H100 芯片强行拼接在一起,但其零售价低于 H100 的 2 倍。不过,B100 在很大程度上是个特例。它的性价比极高,很大一部分原因在于英伟达 极度渴望借此彻底掐灭竞争对手的苗头 。相比之下,从 A100 到 H100 的性价比提升非常有限(在不使用 fp8 精度的前提下,单芯片性能提升 2 倍,而成本也基本翻倍),如果把 fp8 精度优化的红利计算在内,性价比提升也仅约 1.5 倍——而这已经是跨越两年的技术迭代周期了。

虽然我认为随着竞争加剧、利润率被压缩,未来性价比(FLOP/$)会迎来一定的改善利好,但由于供应端的极度紧缺,GPU 本身的价格也可能会水涨船高。尽管 AI 芯片专用化带来的红利将持续释放,但目前尚未看到会有颠覆性的技术突破能再次大幅拉升 FLOP/$。毕竟,当前的芯片早已针对 AI 进行了极致的定制优化(例如完全针对 Transformer 架构进行优化,且已经把计算精度下探到了 fp8 甚至是 fp4 级别),而且摩尔定律(Moore's Law)近来已近乎停滞, 诸如高带宽内存(HBM)和片间高速互联等其他瓶颈部件的性能提升速度也相当缓慢 。从 Epoch 的统计数据 来看,在过去十年里,顶级 ML(机器学习)GPU 的 FLOP/$ 提升幅度甚至还不到 10 倍。基于上述原因,我预计这一性价比改善趋势在未来只会进一步放缓。

Tips 知识科普(FLOP、fp8 与“等效 H100”)

全文用一把统一的标尺衡量算力:等效 H100。H100 是英伟达 2022 年发布的旗舰 AI 芯片,因其出货量最大而成为行业计价单位;后续芯片(如 B200)按性能折算成若干张 H100,从而可以跨代比较集群规模。FLOP 指每秒浮点运算次数,是算力的物理度量;FLOP/$FLOP/Watt 则分别代表“每美元买到的算力”和“每瓦电力换到的算力”,前者决定集群造价,后者决定电力需求。文中反复出现的 fp8、fp4 是计算精度:位数越低,同样硬件能完成的运算越多——从 16 位降到 8 位再到 4 位,是近几年近乎“免费”的算力增量来源,但也意味着这条捷径正被快速耗尽。

如果性价比(FLOP/$)每年能保持约 35% 的提升速度,那么要建成一个性能提升 4 个数量级(+4 OOM)的集群,总成本将锁定在 1 万亿美元左右。即便性价比的提升速度快于预期,但由于我们不能再仅仅租用现有的已折旧发电厂,而必须垫付高昂的早期资本支出去全新建设配套电网和电力设施,这会导致数据中心的基础资本开支大幅攀升。

无论如何,这些都只是非常粗略的概算。根据误差范围,如果 1 万亿美元级集群的建设效率超出预期,实际落地时完全有可能会释放出高达 +4.5 个数量级的巨大算力跨越。

电力需求:单颗 H100 的额定功率为 700 瓦(W),但若算上冷却、网络和存储等数据中心的综合电力开销,Semianalysis 估算 实际运行中每颗 H100 大约需要配套 1400 瓦的电力支撑。

在能效比(FLOP/Watt)方面我们依然可以榨取出一些优化空间,但一旦我们彻底耗尽了 AI 芯片专用化带来的红利(参见前文所述,例如计算精度已经下探至极限),能效比的提升将非常受限(基本上只取决于缓慢的芯片制程升级工艺)。也就是说,随着电力供应成为最核心的瓶颈(因而占总成本的比例急剧上升),未来的芯片设计可能会牺牲一部分绝对 FLOP 性能,来换取更高的能源利用效率。然而,数据中心在冷却、网络传输和存储等外围层面的刚性电力开销(在上述 H100 数据中已占到近一半的比例)依然雷打不动。

为了便于进行这套粗略的推演,我们在正文中将统一按照每颗等效 H100 配套 1 千瓦(kW) 的综合功耗来估算。再次强调,这只是概略计算(如果未来在能效比 FLOP/Watt 上出现出乎意料的技术大跃升,我认为总的电力消耗规模仍将保持不变,这只会转化为更庞大的数量级算力增幅)。

电力消耗参照系:一个 10 吉瓦(GW)的集群如果全年无休连续运行,年耗电量将达到 87.6 太瓦时(TWh,即 876 亿度电)。作为对比,俄勒冈州 全州年耗电量约为 27 TWh ,华盛顿州 全州年耗电量约为 92 TWh

一个 100 吉瓦(GW)的集群全年连续运行将消耗 876 太瓦时(TWh,即 8760 亿度电)的巨额电力,而目前全美国的年度总发电量也不过在 4250 太瓦时(TWh)左右。

这听起来或许像天方夜谭——但事实上,这一切已经在我们眼前发生。扎克伯格一口气 买下了 35 万张 H100 。亚马逊 买下了一座紧邻核电站的 1 吉瓦级数据中心园区 。行业传闻 透露 ,科威特正在悄然动工建设一个功耗达 1 吉瓦、拥有 140 万张等效 H100 的巨型集群(这大体相当于我们前文预测的 2026 年集群级别)。媒体更是爆出猛料, 微软与 OpenAI 正在秘密规划代号为“星际之门(Stargate)”、造价高达 1000 亿美元的超级集群,预计于 2028 年落成 (其开销直逼 国际空间站 的总造价!)。随着每一代新模型的问世不断震撼世界,资本加速的油门很可能会踩得更深。

或许其中最疯狂的一点在于,目前“投资意愿”根本不是制约算力集群扩张的瓶颈。真正的瓶颈在于稀缺的基础设施:“我到底去哪里弄来 10 吉瓦的电力?”(这是 2028 年趋势线上、造价超千亿美元集群所需的电力容量),这是目前旧金山人工智能圈子里最核心的谈资。任何一个负责算力部署的高管,每天脑子里盘旋的都是如何锁定电力资源、圈下土地、搞定环评与建设许可,以及推进数据中心动工建设。2 即使你需要苦苦等待一年才能拿到买好的 GPU,但建设上述配套电力基础设施的交付周期还要漫长得多。

万亿美金级集群——相比 GPT-4 集群跃升了 4 个数量级,也是当前趋势下预计在 2030 年左右登场的训练集群——将是一项真正空前绝后的宏伟工程。其所需的 100 吉瓦电力,等同于超过 20% 的美国全国发电量;这绝不是把 GPU 塞满几间简易仓库那么简单,而是需要数百座发电厂为其全天候输电。也许,这最终将不得不演变为一项国家级的联合财团工程。

(值得指出的是,我认为我们很有可能只需要一个造价约 1000 亿美元或更小的集群就足以实现 AGI。这个万亿美金集群,更可能是我们用来训练和运行超级智能的底座,或者是当 AGI 的研发难度超出预期时的备用方案。但无论如何,在 AGI 诞生后的世界里,谁掌握了绝对霸权的算力总量,谁就掌握了绝对的控制权。)

Facts 时空复盘(截至 2026 年 8 月:从泄密传闻到“星际之门”与吉瓦级集群)

截至 2026 年 8 月:Stargate 已扩至 7 个园区、规划容量超 9 吉瓦,但仅阿比林旗舰园区投产约 0.3 吉瓦;OpenAI 与甲骨文追加的 4.5 吉瓦、3000 亿美元云合同,令承诺容量远超最初的 7 吉瓦,但 5000 亿美元融资架构屡遭市场质疑——2026 年 3 月 OpenAI 还放弃了阿比林 600 兆瓦扩建、由微软接手。xAI 的 Colossus 2 已于 2026 年初上线,孟菲斯园区设计容量 2 吉瓦,并自建 1.2 吉瓦燃气电厂。吉瓦级集群这一“2026 年级”节点,确如作者的时间表准时登场。


整体算力

以上仅仅是对最大旗舰级训练集群的粗略预估。全行业的整体投资规模显然会更加庞大:因为产出的大量 GPU 实际上将被部署到推理端 3(即用于在实际产品中运行 AI 系统的 GPU 算力),而且参与这场军备竞赛、拥有巨型集群的玩家也绝非仅此一家。

据我粗略估算,2024 年全社会的 AI 总投资额就将高达 1000 亿至 2000 亿美元:

  • 英伟达(Nvidia)的数据中心业务季度收入很快就将突破 250 亿美元 的大关,这意味着仅流经英伟达一家的年化资本开支就达 1000 亿美元左右。当然,英伟达并不是唯一的芯片供货商(谷歌自研的 TPU 性能同样极佳!),而且数据中心资本支出中,有将近一半实际上花在了芯片以外的地方(场地选址、土建、散热系统、变电站设施等)。4

英伟达数据中心季度营收

英伟达季度数据中心收入趋势。图表制作:Thomas Woodside。

  • 科技巨头们正在以疯狂的节奏拉升其资本开支预算:今年微软和谷歌的资本支出很可能将突破 500 亿美元5 而亚马逊 AWS 和 Meta 也将突破 400 亿美元。虽然这些钱并非 100% 砸向 AI,但在 AI 狂潮的席卷下,这几大巨头的年度资本支出同比增幅已达 500 亿至 1000 亿美元,即便如此,他们依然在大幅削减其他传统项目的预算,以便将一切弹药移师 AI 战场。此外,其他次级云厂商、知名科技公司(例如 特斯拉今年将在 AI 研发上砸下 100 亿美元),以及各主权国家也在大手笔布局 AI。

大型科技公司资本开支

自 ChatGPT 引爆 AI 狂潮以来,科技巨头的资本支出正呈极速拉升态势。数据图表来源。

让我们把这一趋势推演下去。我的最佳预判是,全球 AI 整体计算投资的增速会略慢于旗舰级训练集群(旗舰集群为每年增长 3 倍),我们不妨假定整体投资年增长率约为 2 倍。6

年份年度总投资额AI 加速器年出货量 (等效 H100)电力消耗占美国总发电量比例芯片消耗占台积电(TSMC)当前前沿晶圆年产能比例
2024~1500 亿美元~500万 至 1000万张 71-2% 85-10% 9
~2026~5000 亿美元数千万张5%~25%
~2028~2 万亿美元约 1 亿张20%~100%
~2030~8 万亿美元数亿张100%当前台积电前沿产能的 4 倍

全球 AI 整体投资趋势的前瞻推演。基于粗估的粗略概算。

而且,这些数据绝非我个人的天马行空。 AMD 曾做出预测 ,到 2027 年全球 AI 加速器市场规模将达到 4000 亿美元,这意味着届时 AI 总开支将突破 7000 亿美元,这与我的推演非常吻合(而 AMD 显然远没有我这般坚定地高看 AGI 的到来)。另据媒体报道,奥特曼(Sam Altman)一直在四处奔走游说,试图筹集 高达 7 万亿美元 的巨资以全面重构全球半导体和 AI 算力供应链(这一惊天数字当时遭到了广泛嘲讽,但如果你仔细对比本文的数据推演,会发现这并非痴人说梦……)。不管怎样,这一史诗级的工业扩张大幕已经拉开。

Facts 时空复盘(截至 2026 年 8 月:资本开支曲线加速兑现)

截至 2026 年 8 月,曲线加速兑现:英伟达最新一季营收 816 亿美元(同比 +85%,其中数据中心业务 752 亿),下季指引 910 亿,年化已站上 3000 亿美元量级;微软、谷歌、亚马逊、Meta 四家 2026 年资本开支指引合计约 6900 至 7200 亿美元,远超本文“2026 年全球 AI 投资约 5000 亿”的推演线。而“单家 1000 亿美元 AI 营收”仍无人撞线:OpenAI 年中年化约 250 亿美元,Anthropic 2 月官宣 140 亿美元——剪刀差在收窄,但投资仍跑在收入前面。


它会实现吗?能实现吗?

此处预估的投资规模看起来或许近乎科幻。然而,无论是从需求端还是供给端来看,目前的行业底层逻辑都足以支撑这一狂飙轨迹。首先,丰厚的经济回报完全能为这笔开销买单;其次,对于一项颠覆性的通用技术(general-purpose technology)而言,这种体量的资本开支在人类历史上并非没有先例;最后,针对电力能源与半导体芯片的工业总动员,也完全处于人类的能力范围之内。

AI 收入

只有在预期经济回报能够值回票价的前提下,各大企业才会进行如此惊人的 AI 投资。

根据公开报道,OpenAI 的年化营收在 2023 年 8 月 达到了 10 亿美元,而在 2024 年 2 月 则迅速翻倍至 20 亿美元。这相当于大约每 6 个月年化营收就会翻一番。如果这一势头得以延续,即使不考虑下一代全新模型发布带来的爆发式拉升,我们在 2024 年底或 2025 年初也应该能看到约 100 亿美元的年化营收运行率。而据一项估算,仅 微软 目前斩获的 AI 增量收入就已高达 50 亿美元左右。

Tips 知识科普(什么是“年化营收运行率”?)

本文衡量 AI 收入用的不是年度财报数字,而是年化运行率 (annual run rate):取最近一个月或一个季度的收入,乘以 12 或 4,折算成“如果全年都保持这个水平”的年收入。对于收入每半年翻一番的业务,这个方法比滞后一年的财报敏感得多,也是硅谷讨论高增长业务的通用口径。理解它有助于看懂后文的里程碑推演:所谓“2026 年实现 1000 亿美元营收”,指的是某个月收入达到约 83 亿美元,而非全年累计。这一口径同样有陷阱——它把订阅或算力合同的名义金额当作可持续收入,在算力行业常见的循环交易中(厂商互相采购),运行率可能高估真实的终端需求。

到目前为止,AI 投资领域每一次 10 倍的规模扩张,似乎都能顺利兑现匹配的商业回报。GPT-3.5 彻底引爆了 ChatGPT 全球狂潮;据估算造价 5 亿美元的 GPT-4 训练集群成本,早已被微软和 OpenAI 如今每年赚得的数十亿美元年营收轻松抹平;如果微软和 OpenAI 的 AI 营收按预期冲上百亿美元大关,那么今年规划建设的、耗资数十亿美元的“2024 级”训练集群也将轻而易举地收回成本。这一轮狂潮是纯粹的 投资拉动型:从签下天量的 GPU 订单,到集群落成、模型完成训练并推向市场,中间存在数年之久的时间差,目前正在筹建的超大集群都是面向未来数年的。但只要上一轮采购的 GPU 能够源源不断地变现,资本滚雪球的势头就会继续狂飙(并且其增速会持续跑赢短期营收),驱使巨额资金不断押注下一次 10 倍扩张带来的更大红利。

我经常思考的一个关键 AI 营收里程碑是:哪家科技巨头(谷歌、微软、Meta 等)将率先从 AI(产品与 API 接口)中实现 1000 亿美元 的年营收运行率?这些巨头如今的总营收规模大致在 1000 亿至 3000 亿美元之间,因此,1000 亿美元将开始占据其核心业务中相当可观的份额。如果按照每 6 个月翻一番的极简方式进行推演,假定我们在 2025 年初达到 100 亿美元年营收,那么在 2026 年中左右就有望实现 1000 亿美元的目标。

这看起来或许有些激进,但在我看来,要实现这一目标,所需要的想象力其实低得令人惊讶。例如,目前 微软 Office 办公套件的付费订阅用户大约有 3.5 亿人 ——我们能否说服其中三分之一的用户,每月额外支付 100 美元来购买 AI 助手服务?对于一个普通白领而言,这笔开销对应的仅仅是每月挽回区区数个小时的工作生产力;而在未来一两年内,行业完全有能力打磨出具备这种生产力挽回水平的强悍模型。10

这一里程碑一旦达成,其引发的全球市场大地震将无以言表。这将使 AI 产品成为全美最庞大跨国巨头绝对的核心营收引擎,以及远超其他一切、最具爆发力的增长点。各大科技巨头的营收增长预测将被全面调高,股市将随之陷入狂热;我们或许会在不久后亲眼见证首家市值突破 10 万亿美元的超级商业帝国的诞生。到了这一阶段,科技巨头们将彻底甩开所有包袱,各自砸入数千亿美元(甚至更多)来推动更大规模的 AI 投资。届时我们或许将目睹历史上首笔高达数千亿美元的超级企业债券发售案。11

Value 价值视角(万亿军备的资本账:飞轮、折旧与循环融资)

用资本配置的框架看,这场狂飙是一个高杠杆的飞轮:以 GPU 三年左右的有效折旧期,去押注十年尺度的收入曲线。只要收入兑现,每代集群都能被下一代产品的营收“轻松抹平”,正如作者对 GPT-4 集群的描述;但飞轮的反面是,一旦收入增速低于资本开支增速,折旧与利息将同时反噬利润表。2025 年后行业出现的大量结构性安排——芯片厂商入股客户、云厂商与客户互签长期算力合同、项目公司举债建设再回租——本质上都是把收入确认前置、把风险后置的资本工程。对投资者而言,区分“终端真实需求驱动的收入”与“供应链内部循环的名义收入”,是评估这场军备竞赛资本回报率的第一课;作者的飞轮逻辑能否持续成立,最终只取决于前者。

当营收冲破 1000 亿美元的大关后,未来的走向将变得更加科幻。但只要我们确实是在奔向 AGI 的康庄大道上,超高额的资本回报就绝非空中楼阁。全球白领每年的薪资开支高达数十万亿美元;哪怕是一套能够完全接管并自动化部分白领/脑力工作的“开箱即用式”虚拟雇员(例如一个真正全自动的 AI 软件工程师),其创造的经济价值也足以轻松为万亿美金级集群买单。即便抛开商业逻辑不谈,这场迈向 AGI 的惨烈竞争所蕴含的至关重要的国家安全意义,也绝对能催生出一项打包国家所有核心资源倾力一搏的政府工程(后文将对此做详细推演)。

历史先例

到 2027 年实现每年 1 万亿美元的 AI 总投资规模,听起来或许有些匪夷所思。但在人类历史的参照系中,这并不是绝无仅有的异类:

  • 在资金投入最鼎盛的时期,曼哈顿计划(Manhattan Project)和阿波罗计划(Apollo program)的投入 也仅占 GDP 的 0.4% ,折算到今天大约相当于每年 1000 亿美元(实际上出乎意料的小!)。在年投资额达 1 万亿美元时,AI 投资占美国 GDP 的比例大约将为 3%。

  • 在 1996 至 2001 年的互联网泡沫期间, 各大电信运营商累计砸下了 相当于今天近 1 万亿美元的巨资,用于铺设全球互联网底层基础设施。

  • 从 1841 到 1850 年, 英国私有铁路的累计投资额达到了 相当于当时英国 GDP 约 40% 的惊人水平。如果按相同的 GDP 比例折算今天的 美国经济总量 ,这相当于在十年内累计投资约 11 万亿美元。

  • 目前全球正在为绿色低碳能源转型砸入 数万亿美元的巨资

  • 处于极速增长期的经济体,往往会将极高比例的 GDP 投入到固定资产投资中。例如,中国在过去二十年中, 投资占 GDP 的比例长期维持在 40% 以上 (这大致相当于按美国当前的 GDP 算,每年在投资端砸入 11 万亿美元)。

  • 在人类历史上遭遇最极端国家安全危机(即战争时期)的关头,为了支撑国家生死存亡的惨烈动员,政府举债占 GDP 的比重往往高得超乎想象。第一次世界大战期间, 英国法国 以及 德国 的举债规模甚至突破了其 GDP 的 100%,而 美国 的举债比例也超过了 20%;到了第二次世界大战, 英国 和日本的战争举债规模再次突破 GDP 的 100%,而 美国 也超过了 60%(相当于今天的 17 万亿美元以上)。

因此,到 2027 年实现每年 1 万亿美元的 AI 投资虽然惊世骇俗——堪称人类史上规模最大的资本动员项目之一——但绝非史无前例。并且,在本年代末建成一个耗资达万亿美元级的单个训练集群,完全是一项可以落地的切实方案。12

Value 价值视角(通用技术狂潮的资本史:铁路与光纤的教训)

作者引用的历史先例,值得用另一面重读。1840 年代英国铁路狂潮在十年内吸走了相当于 GDP 40% 的投资,铁路最终彻底改变了经济,但高峰期买入铁路股票的投资者大多亏损累累;1996 至 2001 年电信业铺设的近万亿美元光纤,多数在泡沫破裂后以原价的零头被清算,催生了“暗光纤”这个词。通用技术的社会回报与股东回报从来不是一回事:基础设施会被全社会长期使用,但过度建设的成本由当期的资本埋单。对今天的算力军备,这个视角提示两条纪律:其一,“AI 值不值得建”与“以什么价格、什么资本结构建”是两个独立问题;其二,历史上这类狂潮中活得最好的,往往是卖铲子的人和资产负债表最厚的幸存者,而非出价最高的竞速者。

电力能源

在整个算力供给端,最大的硬性约束很可能将是 电力资源 。在不远的未来(例如 2026 年的 1 吉瓦级、特别是 2028 年的 10 吉瓦级规模),电力就已经成了卡死所有项目的核心瓶颈:电网中根本没有多少冗余电量,而大额电力采购合同通常都是被长期锁定住的。至于新建一座吉瓦级的大型核电站,动辄需要十年的周期。(我不禁感到好奇,我们何时会开始看到科技公司出手买下 铝冶炼厂 ,仅仅是为了接管其原有的吉瓦级专属大宗供电合同。13

美国发电量趋势与 AI 电力需求估算

美国电力总产量趋势,与我们对 AI 电力需求的粗略概算对比。

在过去十年中,全美国的总发电量 几乎只增长了 5%14 虽然电力公用事业公司 正在因 AI 的到来而兴奋不已 (他们此前预估未来 5 年行业需求增速仅为 2.6%,如今已上调至 4.7%!),但他们对即将倾泻而来的电耗海啸可以说是完全毫无准备。在短短 6 年内,仅这个造价万亿美元的 100 吉瓦集群本身就将鲸吞当前美国总发电量的约 20%;若是再算上更庞大的推理端消耗,总电力需求将是这个数字的数倍之巨。

在大多数人眼里,这完全是天方夜谭。有些人甚至开始把筹码押在那些中东威权国家身上——这些国家的统治者最近一直在全球各地四处推销其无穷无尽的电力潜能和庞大集群项目,以此作为换取未来 AGI 话语权入场券的筹码。

但完全有希望在美国本土彻底解决这一问题:因为我们拥有源源不断的天然气资源。15

  • 为一个 10 吉瓦的集群供电,仅占美国天然气总产量的几个百分点,且可以极速完成建设。

  • 即使是 100 吉瓦级别的集群,其可行性也高得令人惊讶。

  • 仅仅看宾夕法尼亚州周围的马塞勒斯/尤蒂卡(Marcellus/Utica)页岩气产区,目前每天的天然气 产量 就在 360 亿立方英尺(BCF)左右。这些日产天然气如果通过发电机组直接发电,足以源源不断地提供近 150 吉瓦的持续电力(如果使用效率更高的联合循环燃气电厂,总输出功率甚至可达 250 吉瓦)。

  • 要支撑一个 100 吉瓦的集群,大约需要开凿约 1200 口 新气井16 单台钻机每月大约能钻探 3 口气井,这意味着仅需 40 台钻机(这不过是目前马塞勒斯产区现存的 在运钻机数 )就能在不到一年的时间内,彻底夯实支撑 100 吉瓦发电设备所需的全部天然气产能底座。17 而马塞勒斯在 2019 年时的活跃钻机数曾高达 80 台左右,因此额外增加 40 台钻机来建设这一产能基底,对整个行业而言可以说是轻而易举。18

  • 从更宏观的视角看,美国页岩气产量在 过去十年中实现了一倍以上的暴涨 ;我们只需延续这一既有的增长曲线,就完全有能力同时为数个万亿美金级的数据中心提供源源不断的动力。19

  • 真正的硬骨头在于能否制造出足够数量的燃气发电机组和燃气轮机;这虽然不是件容易的事,但通过砸下约 1000 亿美元的资本支出, 20 建设 100 吉瓦的天然气电厂是完全切实可行的。常规的联合循环电厂建设周期约两年,而应急简单循环发电机的落地速度还要快得多。21

Facts 时空复盘(截至 2026 年 8 月:电力如期成为第一瓶颈)

截至 2026 年 8 月:三里岛(Crane 清洁能源中心)瞄准 2027 年下半年重启,6 月获 FERC 豁免、转移 760 兆瓦并网权,避开拖至 2030 年的并网风险;GE Vernova 燃气轮机积压订单达 83 吉瓦,交付排到 2029 年之后。xAI 孟菲斯临时轮机诉讼出现转折:司法部 6 月以国家安全为由请求法院撤诉。去监管也有实质进展:最高法院 2025 年 Seven County 裁决压缩了 NEPA 审查范围,CEQ 已废除其 NEPA 法规,但输电审批的全面立法改革仍未落地。

目前,阻碍我们在美国本土铺开数万亿美元数据中心大建设的绊脚石,完全是我们自我设限的产物。出于善意但极度僵化的气候环保承诺(不仅来自政府,也包括微软、谷歌、亚马逊等科技巨头自身所背负的绿色数据中心净零承诺),死死堵住了这条最直观、最快捷的能源脱困通道。退一步讲,即便我们坚决不碰天然气发电,一场雷厉风行、全方位的去监管化(deregulatory)法案改革,也完全能迅速松绑并释放出光伏、储能电池、小型模块化核反应堆(SMR)以及地热能等巨型能源项目的庞大潜力。然而,复杂的建设审批、电力公用事业管制、联邦能源监管委员会(FERC)对 输电线路建设 成本分摊的漫长扯皮,以及国家环境政策法(NEPA)的繁冗环境评估流程,硬生生把本该在几年内竣工的能源项目拖上十年甚至更久。但在这场生死存亡的竞争中,我们根本没有这个时间。

我们的一味推诿正在硬生生地把未来的 AGI 数据中心拱手推向中东,将其置于残暴且反复无常的独裁者的五指山下。我当然也更青睐清洁能源——但在美国国家安全的终极利益面前,这根本不应成为阻碍。我们必须拿出二战时期的铁血意志和决心来推进电力建设。电力资源这一硬性约束,可以解决,必须解决,而且终将被解决。

Highlights 高光金句(电力约束,终将被解决)

“电力资源这一硬性约束,可以解决,必须解决,而且终将被解决。”

"The power constraint can, must, and will be solved."

▍点拨:作者的底气不是口号,而是前文那组硬数据:马塞勒斯产区 40 台钻机一年即可夯实 100 吉瓦的气源底座。2026 年回看,方向确已兑现:核电重启、燃气轮机订单爆满、科技巨头自建电厂成风;真正的卡点从“资源”移到了“设备交付与并网审批”——恰是本文呼吁去监管的环节。

芯片半导体

虽然每当人们谈及 AI 的产能瓶颈时,脑海中浮现的首要制约因素往往是芯片,但芯片很可能是一个比电力还要容易克服的约束。目前,全球 AI 芯片的总产量占台积电(TSMC)前沿制程总产能的比例依然非常低,大概还不到 10%。因此,通过让 AI 逐步吃掉台积电更大比例的产能份额,我们依然拥有极大的增长弹性空间。

事实上,2024 年全行业所生产的全部 AI 芯片(约 500 万至 1000 万张等效 H100),就已经几乎足够塞满我们前文所描绘的那个造价数千亿美元的 2028 级超级集群(假定这些芯片全数流向这单一数据中心)。从纯逻辑晶圆代工厂(logic fab)的角度看,仅仅台积电一年的全部前沿制程产能,就完全足以支撑起那个万亿美金级的超级集群。22 当然,台积电绝无可能将其所有的晶圆年产能 100% 倒贴给 AI 芯片,也不可能将一整年生产的 AI 芯片全部塞进这单一训练集群中。到 2030 年,全球(包括推理以及多方势力的并行竞赛)对 AI 芯片的总需求将呈数倍暴涨,其规模将远远撑爆台积电目前现有的全部前沿制程逻辑芯片总年产能。台积电在过去 5 年里实现了营收 近乎翻倍的增长23 而要跟上未来 AI 芯片雪崩般的需求狂飙,他们必须将这一历史扩张步伐至少再拉快一倍。这将是一场波澜壮阔的全新巨型晶圆厂资本投资竞赛。

即便纯逻辑晶圆的制造(raw logic fabs)不至于完全卡死进度,但 CoWoS 先进封装(用于将芯片与核心内存高速连接,主要由台积电、英特尔等主导)以及高带宽内存(HBM,目前行业对 HBM 的需求 极其 疯狂)早已成了当前英伟达 AI GPU 产能扩张最致命的卡脖子瓶颈。由于这类封装和专用内存的技术高度绑定 AI 架构,完全不同于传统的通用逻辑芯片,因此行业在暴涨前夕几乎没有任何冗余的产能储备。在短期内,这两大硬约束将是阻碍更多 GPU 产出的罪魁祸首,也将是未来 AI 规模持续拉升时面临的核心关卡。好在,这类封装和内存设施的扩产周期相对较短;在过去一年里,台积电甚至直接以极其惊人的速度平地起高楼(greenfield fabs,即完全从零新建全新的独立封装厂房)来成倍释放 CoWoS 的产能量级(甚至英伟达也已经开始研发 CoWoS 的替代封装方案 ,以设法绕开这一封装瓶颈)。

Tips 知识科普(CoWoS 与 HBM:藏在芯片背后的隐形瓶颈)

一颗 AI GPU 的产能,不只取决于台积电能切出多少片晶圆。CoWoS 是台积电的先进封装技术:把逻辑芯片与多块高带宽内存并排封装在同一块硅中介层上,让它们以极高速度交换数据;没有它,再先进的计算核心也无法被“喂饱”。HBM (高带宽内存)则是把多层 DRAM 垂直堆叠而成的专用内存,供给集中在 SK 海力士、三星、美光三家手中。两者的共同点在于:扩产需要新建专用厂房,周期以年计,而需求却随 AI 骤然爆发——这就是为什么 2023 至 2025 年间,限制英伟达出货量的常常不是晶圆,而是封装与内存的排队。读懂这两个词,就读懂了 GPU 供应链的真实结构。

台积电每新建一座超大型晶圆厂(Gigafab,堪称 现代工业科技的奇迹之作),其资本投入就高达约 200 亿美元,建成后每月可处理 10 万片晶圆的投片量(wafer-starts)。而为了在十年末实现每年产出数亿张 AI GPU 的宏伟愿景,台积电必须在短短几年内新建数十座这样的超大型晶圆厂——这还不包括在 HBM 内存、CoWoS 高级封装、超高速光纤通信网络等外围配套产业链上倾注的巨额扩产投资。所有这些配套投资加总,累计资本支出将轻松突破 1 万亿美元。虽然过程将是一场脱胎换骨的极限大动员,但完全在人类的技术版图内。(或许其中最大的拦路虎根本不是技术可行性本身,而是台积电高层自己压根还没做好准备——台积电至今似乎还没有完全“吃下 AGI 极速狂飙的红利药丸”!在他们的官方预测里,AI 业务在未来似乎“仅仅”会保持 约 50% 的年化复合年增长率(CAGR) 。)

近期美国政府推出《芯片法案》(CHIPS Act)等一系列法案,极力推动将一部分 AI 芯片产能回流至美国本土(以作为防范未来台湾突发地缘政治局势的保险手段)。虽然将 AI 芯片的生产环节转移一部分到美国确实是一步好棋,但这在战略优先级上,其实远远不如确保 承载 AGI 权重的实体数据中心本身 坐落在美国国土上关键。如果将海外的芯片代工产能比作海外的铀矿储量,那么把 AGI 数据中心建在海外,就等同于把生产好的核弹头直接建造并储存在海外独裁者的仓库里。鉴于过去几年我们在美国本土尝试建造晶圆厂所遭遇的种种效率低下与高昂造价教训,我的建议是:应将最核心的战略资源倾斜在确保 AGI 数据中心落户美国本土,而将代工芯片晶圆厂的大规模扩产项目,更重地押注在像日本和韩国等效率高得多的民主盟友身上——日韩在推进这批半导体大建设计划时,其执行力与落地效率 显然要高得多


民主的集群

在本年代结束前,价值数万亿美元的超级算力集群终将被建造出来。唯一的悬念在于,它们最终会落户在美利坚的领土上,还是别处。据传,已经有一些核心玩家正把赌注押在将集群移师海外、尤其是中东的荒漠上。我们真的甘愿让这场人工智能时代“曼哈顿计划”的终极底层物理设备,落入某些喜怒无常的中东独裁者之手吗?

我们今天正在规划布局的这批算力集群,绝对不仅仅是用来跑什么“炫酷的科技公司消费级产品”,它们极有可能就是未来的 AGI 乃至超级智能被训练并全天候运行的核心母体。美国国家安全和最高利益强烈要求,这批具有生死存亡意义的物理设备必须牢牢锁定在美国本土(或极其可靠的民主盟友境内)。除此之外的任何选择,都将埋下不可逆转的终极安全隐患:这将导致 AGI 的核心模型权重面临随时被窃取的极高风险,24 (并可能最终被 打包运往中国对此后文有详细剖析);甚至当未来的 AGI 军备竞赛进入白热化阶段时,这些独裁国家可能会直接通过物理查封的方式强行接管这批数据中心,将其收归国有并运行他们自己的 AGI;即便这些极端威胁最终只是作为筹码在暗中博弈,也无异于让未来的 AGI 和超级智能沦为独裁者拿捏的软肋。上世纪 70 年代,美国曾因对中东能源的重度依赖而付出了极其惨痛的历史代价,我们耗费了数十年的心血才彻底摆脱了受制于人的梦魇。我们绝不能在 AGI 时代重蹈覆辙。

Highlights 高光金句(算力选址即权力选址)

“我们真的甘愿让人工智能时代的‘曼哈顿计划’,落入某个喜怒无常的中东独裁政权之手吗?”

"Do we really want the infrastructure for the Manhattan Project to be controlled by some capricious Middle Eastern dictatorship?"

▍点拨:两年后回看,这句警告以一种意外的方式应验:中东确实成了算力热土——Stargate UAE 一吉瓦集群首期 2026 年上线,沙特 HUMAIN 剑指 2030 年 1.9 吉瓦——但它们被绑进美国技术与出口管制体系(G42 剥离中资、HUMAIN 弃用华为才换来芯片许可),是“加盟者”而非独立一极。

我们完全有能力在美国本土拔地而起建设这批庞大集群,我们必须立即动员一切力量,确保大建设发生在美国的国土上。美国国家安全必须被置于压倒一切的首位,其优先级必须高于诱人的中东热钱、陈腐而繁复的法条管制、甚至,是的,即便是极具崇高理想的气候环保承诺之上。我们正面迎接着一场真正的地缘政治体制对抗——难道这种史诗级的工业总动员,只能在“自上而下”的威权体制国家才能做成吗?只要松开套在美国私营企业头上的重重枷锁,美国的建设效率与爆发力依然会让全球惊叹(至少在去监管化的红州是如此)。展现出对使用天然气发电的包容与支持,或者至少立刻通过一项大刀阔斧的去监管法案——豁免环境政策法(NEPA)繁冗的评估、在联邦层面修正能源监管委员会 (FERC) 与输电线路的审批流程、强行接管并重构地方公用事业管制、动用联邦特权直接打通土地征用与通路权限制——是攸关国家存亡的最高安全战略优先级。

Inverse 反向思考(单一巨型集群的前提,会不会中途瓦解?)

本文所有推演都建立在一个隐含前提上:训练必须集中在单一物理地点的巨型集群里,且算力需求会无限增长。两个前提都值得追问。其一,作者自己在脚注中承认,若分布式训练成熟,电力与选址难题将大幅降级——2025 年后头部实验室已在实践跨园区协同训练,“一地一集群”的刚性正在松动。其二,2025 年 1 月 DeepSeek 以极低成本发布 R1,曾引发“算力需求是否被高估”的全球抛售;尽管事后资本开支不降反升(效率提升反而刺激了总需求),但这一幕提醒:效率革命改变的是算力的用途结构,而非必然服从本文的线性外推。万亿美元单一集群或许仍会出现,但“它是唯一路径”的判断,比作者的语气要开放得多。


无论如何——指数级狂飙的巨轮已经全面加速。

在过去“AGI”依然在学术界被视为上不得台面的“脏词”的旧时光里,我和几位同事曾尝试建立过一系列宏观经济学数学模型,用以推演迈向 AGI 的底层趋势。在这些模型中,有一个经典的量化指标被称为“AI 觉醒”(AI wakeup)临界点——即当全世界终于如梦初醒,意识到这些模型的恐怖潜力并开始疯狂追加投资的那个转折点,这一临界点最终将以国家将 GDP 的数个百分点砸向最宏大的旗舰级训练集群为标志。

这在当时看来还是极其遥远的科幻情节,但如今,这个时刻已经降临。2023 年正是人类历史上的 “AI 觉醒之年”25 在幕后,最惊心动魄的科技资本大加速早已如火山般喷薄爆发。

做好准备,迎接恐怖的超重过载吧。

系列专题下一篇:IIIb. 实验室防御战:迈向 AGI 的安全锁

(至于这一切对于英伟达 NVDA、台积电 TSM 等标的意味着什么,我在此将其作为思考题留给各位读者。提示:那些具备情境感知的人,早在你高攀不起的价位之前就早已重仓入场了,但目前的估值依然远远没有把这一前景定价进去。26

Takeaway 行动指南
  • 把瓶颈迁移当作投资地图:本文最大的实用价值不在 GPU 数字,而在“瓶颈迁移”的方法论——芯片之后是封装与内存,再之后是电力,再之后是并网与审批。任何高增长行业都可照此推演:找到下一个卡脖子环节,超额利润就在那里。
  • 用运行率而非财报观察爆发期业务:对每半年翻一番的业务,年化运行率是最敏感的仪表盘;但务必剔除供应链内部循环交易的“名义收入”,只认终端真实需求。
  • 盯住飞轮的折旧端:资本开支飞轮向上时人人是天才;评估相关企业时,盯住折旧年限假设、自由现金流与表外承诺(租赁、购电协议、采购义务),这些是飞轮反转时最先断裂的地方。
  • 通用技术狂潮中,买确定性而非竞速者:历史反复证明,基础设施最终惠及全社会,但高峰期的股东回报两极分化;卖铲子的、收租的、资产负债表最厚的,通常比出价最高的竞速者活得更好。
  • 能源与物理资产正在重新定价:电力接入权、土地与老工业厂址,正从成本项变成战略资产——这一判断对数据中心之外的制造业与不动产同样成立。

Footnotes

  1. 作为说明,OOM = 数量级(order of magnitude),10x(即 10 倍)等于 1 个数量级。

  2. 一个关键的不确定因素是分布式训练的普及程度——如果我们不再需要在一个物理地点集中这么庞大的电网容量,而是能将其化整为零分摊到 100 个不同的物理节点上,那么建设难度会大幅降级。

  3. 参见扎克伯格的公开访谈,目前他买入的 35 万张 H100 中,仅有约 4.5 万张部署在了其最大的旗舰级训练集群中,其余绝大部分都在承载 Meta 庞大的日常推理开销。虽然 Meta 由于其广泛的社交产品用户群而在推理端的需求比其他厂商更重,但随着全球各家的 AI 商业化应用进一步铺开,我预计推理开销占 GPU 总开支的比例将在全行业范围内占据绝对的主导地位。

  4. 例如,前文引用的总拥有成本(TCO)分析报告指出,在大型集群中,GPU 芯片采购款只占了 40% 左右,而英伟达的网络设备开支占 13%。排除资金利息成本后,GPU 本身约占 50%,如果加上配套网络,英伟达实际赚取了整个集群超 60% 的总开支。

  5. 并且,即便微软的单季资本支出相比去年同期疯涨了 79%,在最近一季财报中,他们依然表示其云端 AI 的客户需求依然处于极度供不应求的紧缺状态。

  6. 展望未来,由于全球算力资源向少数几个顶尖实验室高度聚拢,而不是所有大公司都各自建造前沿大模型集群,全球 GPU 产能流向这几个超大训练集群的集中度会显著提升。

  7. 我估算英伟达在 2024 年的数据中心 GPU 总出货量将达到约 500 万张。其中只有一小部分是 B100(在此我们将单张 B100 折算为 2 张以上的等效 H100)。此外还有大量非英伟达阵营的 AI 芯片:包括谷歌 TPU、亚马逊 Trainium、Meta 自研芯片以及 AMD 的 GPU 等。

  8. 这一数据虽然并非 100% 发生在美国本土,但它可以作为一个极好的数量级参照标尺。

  9. 目前台积电每月大约可生产 15 万片 5 纳米(nm)晶圆,并正在将 3 纳米晶圆产能扩充至每月 10 万片,此外还有大约 15 万片 7 纳米晶圆的月产能;我们粗略将前沿先进制程的总月产能记为 40 万片晶圆。单片晶圆(以 H100 采用的 5 纳米工艺为例)大约可产出 35 颗 H100 芯片。按 2024 年全球产出等效 500 万至 1000 万颗 H100 计算,这意味着全年 AI 芯片的晶圆消耗量在 15 万至 30 万片之间。根据具体产能区间以及是否计入 7 纳米产出,这大约将耗掉台积电先进制程晶圆年产量的 3% 至 10% 左右。

  10. 对我而言,最核心的一个变数在于这些前沿技术在全社会范围内的渗透与普及速度。一个合理的担忧是,由于将 pre-AGI 模型深度融合进现有的企业工作流需要耗费大量极其琐碎的工程对接与重构精力,短期内的营收增长曲线可能会被拉平;从历史上看,通用技术从问世到完全释放其社会生产力增益,往往存在较长的时间滞后。这就是我们前文讨论“音爆”效应的核心背景:一旦我们彻底解除了大模型的各种束缚,使其在形态上越发接近独立的智能 Agent 或可随时上岗的虚拟雇员时,部署门槛将大幅降低。与其为了利用 GPT 聊天机器人挽回 25% 的效率而大费周折地重组工作流,你现在可以直接像招募新员工一样,直接把模型部署上岗(例如直接让模型接替部分初级开发工程师的岗位,而不需要再花大精力去培训人类员工使用什么新软件)。或者,更极端、也更遥远的一幕是:你甚至不需要再去耗巨资重组智能无人工厂的流水线,而是直接买来人形机器人即可。当然,这一经济价值和营收的爆发速度,极大地取决于我们“解除模型束缚”的演进斜率。

  11. 届时全球利率市场的走势将会变得极其有趣……对此感兴趣的读者可以参考 Tyler Cowen 的分析文章,以及 Chow, Mazlish 与 Halperin 撰写的学术探讨。

  12. 并且,虽然这看似极其遥远,但如果 AGI 真的带来了整个宏观经济增速的断裂式上扬,届时每年 10 万亿美元以上的资本支出也将开始变得完全符合常理——其参照系就是那些高速增长的经济体在起飞时期的固定资产投资率。

  13. “自 2011 年起,加拿大阿鲁埃特(Alouette)铝冶炼厂在开足马力生产时的最大电力消耗就已经达到了 930 兆瓦(MW)。”

  14. 值得指出的是,这指的是“净新增”电力容量:其中包含了新建清洁可再生能源并关停老旧化石燃料电厂的替代过程。粗增量发电装机容量的增速可能在每年百分之一到二左右。

  15. 特别鸣谢奥斯汀·弗农(Austin Vernon)为本文上述电力数据测算提供的一手专业协助。

  16. 每口新建天然气井日均气产量约在 0.01 BCF 左右。

  17. 考虑到每口气井在其全寿命周期内大约可产出 20 BCF 的天然气,这意味着全产区每月只需新建 2 口气井,就足以完全对冲由于老井枯竭而折旧的产能,即仅需维持 1 台钻机的常态运转就足以让产能量级维持在相似区间。

  18. 当然,在实际工程推进中,更合理的方案是稍微调低同时运转的钻机规模,并将整个产能储备的构建周期拉长到 10 个月以上,以实现更高的综合资金效率。

  19. 1 立方英尺的天然气大约可发电 0.13 度(kWh)。2020 年全美页岩气日均总产量约为 700 亿立方英尺。假定我们在十年内再次将这一日产量翻倍,并且所有新增的天然气资源全数用于数据中心发电。这将产生约每年 3300 太瓦时(TWh,即 3.3 千亿度电)的电力,足以同时支撑近 4 个 100 吉瓦的超级集群。

  20. 目前新建天然气电厂的单位装机资本支出大约在每千瓦 1000 美元以下,这意味着 100 吉瓦总容量的天然气发电设施建设开支大约在 1000 亿美元左右。

  21. 虽然光伏结合大型储能电池并非完全不可行,但在工程实施难度上,天然气发电显然比其顺畅得多。我很赞赏 Casey Handmer 曾对“为全球 AI 铺满光伏面板”所做的量化推导:“以现有的 GPU 能效算,全球太阳能数据中心的算力总输出大约等于 1500 亿人脑的算力;但若未来的计算设备能完全媲美人类大脑的恐怖能效,我们届时能支撑多达 5000 万亿个 AI 灵魂同时在线。”

  22. 这自然带来了一个极其有趣的话题:为什么在芯片晶圆产量遭遇真正硬性天花板之前,数据中心的电网消耗就已经率先被拉到了极限?答案非常简单:数据中心需要全年全天候以接近 100% 的满载功率运转,而目前全球生产出的大部分芯片,在绝大多数时间里都是处于闲置待机状态的。以智能手机为例,其占据了台积电目前近一半的前沿制程晶圆需求,但手机芯片的单位面积耗能极低(通过牺牲晶体管密度来换取串行计算能效,并进行极致的省电深度睡眠优化),且因为人们大部分时间都在睡觉或锁屏,其整体综合负载极低。而 AI 革命意味着我们将逼迫所有的晶体管全天候开足马力进行恐怖的高强度运算,彻底将这些芯片钉死在常时运行、高散热的高性能 AI 服务器中,而不是让它们在电池供电的低能耗设备里打瞌睡。感谢卡尔·舒尔曼(Carl Shulman)分享这一极具洞察的观点。

  23. 此处使用台积电的年营收变化趋势作为其整体产能规模的近似替代指标。

  24. 毕竟,一旦对方获得了物理数据中心层面的物理访问特权,通过硬件后门等物理侧信道攻击来窃取核心模型权重的难度,将呈断崖式降低!

  25. 我清晰地记得,在 2023 年 3 月底,我曾在办公室的白板上写下了“大起飞已然开始(THE TAKEOFF HAS STARTED)”这行大字。

  26. 直至最近,主流卖方分析师依然在其财报预测中假设英伟达 2024 至 2025 日历年(CY24–CY25)的营收增长率仅在 10% 到 20% 之间,预测其年营收大致在 1200 亿到 1300 亿美元左右。这简直荒谬至极!任何一个稍具常识的人在很久以前就应当清楚,英伟达在 2025 年的年度总营收必然将轻松跨越 2000 亿美元的关口。