情境感知:IIIc. 超级对齐 (Superalignment)
《情境感知》IIIc:RLHF 注定在超人系统上失效,我们如何控制远比自己聪明的 AI?默认计划:用评估优势、可扩展监督、泛化与可解释性对齐「某种程度超人」的模型,用自动化对齐研究走完剩下的路,并以「超级防御」兜底。
本文译自前 OpenAI 超级对齐团队研究员 Leopold Aschenbrenner 于 2024 年 6 月发表的警世长文Situational Awareness(情境感知)系列第三章第三部分(IIIc)。
- 栏目/系列:Situational Awareness: How Close Are We to AGI?
- 作者:利奥波德·阿申布伦纳 (Leopold Aschenbrenner) —— 前 OpenAI 安全研究员、现 AI 投资人
- 发表时间:2024 年 6 月 4 日
▍关于本篇 这是系列中作者最有“内部人”资格书写的一篇:此前一年,他正是 OpenAI 超级对齐团队的研究员,与伊尔亚·苏茨克维(Ilya Sutskever)共事。承接 I、II 两篇的能力推演与 IIIa、IIIb 的算力与安全叙事,本篇正面回答“失控风险”这个技术问题:我们如何控制远比自己聪明的系统?作者自陈不是末日论者,并给出一份他眼中“蒙混过关”的默认工程路线图。
内容提要:RLHF 的成功建立在“人类能看懂并评价 AI 行为”之上,而这个前提注定在超人系统上崩塌。文章先刻画失败形态(侧约束失守、机器人叛乱式的系统性失败),再指出智能爆炸会把“从容迭代”的时间窗口压缩到一年以内,使问题极度凶险。随后给出默认计划:以“评估比生成容易、可扩展监督、泛化、可解释性(机制/自上而下/思维链)、对抗测试与度量”对齐某种程度超人的模型,再把对齐研究自动化,用数百万自动化研究员走完通往超级智能的剩余路程;最后以“超级防御”(安全、监控、能力限制、训练限制)作为对齐失败的缓冲层。作者的结论是:技术上他乐观,但智能爆炸期间的管理混乱让他恐惧——我们把太多筹码押在了运气上。
可靠地控制远比我们聪明的 AI 系统,是一个尚未解决的技术难题。虽然这是一个可以解决的问题,但在快速的智能爆炸过程中,事情极易脱轨。管控这一局面将极其紧张;一旦失败,极易酿成灾难。
在本篇中:
老魔法师终于出了门! 他所驱使的精灵,如今都听我号令。 ……我也要一展神通。 …… 师父啊,我情况危急! 我召唤来的精灵——却再也送不回去了。
—— 约翰·沃尔夫冈·冯·歌德 (Johann Wolfgang von Goethe),《魔法师的学徒》(The Sorcerer's Apprentice)
读到这里,你大概已经听说过 AI 末日论者了。你可能曾被他们的论点吸引,也可能不屑一顾。你大概不太愿意再读一篇渲染末日与阴郁的长文。
我不是末日论者。1 未对齐的超级智能大概并不是最大的 AI 风险。2 但过去一年里,我的确在 OpenAI 把对齐 AI 系统的技术研究作为本职工作,与伊尔亚(Ilya Sutskever)和 超级对齐(Superalignment) 团队共事。这里存在一个非常真实的技术问题:我们目前的对齐技术(确保我们能可靠地控制、引导和信任 AI 系统的方法)无法扩展到超越人类的 AI 系统。我想做的,是解释我眼中那个我们将赖以“蒙混过关”的“默认”计划,3 以及为什么我对此乐观。尽管盯在这件事上的人远远不够——我们理应用远为宏大的投入来解决这个问题!——但总体而言,深度学习这些年的演进方式对我们相当有利;大量经验层面的低垂果实会带我们走完一部分路;而数百万自动化 AI 研究员的优势,会带我们走完剩下的路。
本篇写成的 2024 年 6 月,恰逢文中这支团队的终局之月:2024 年 5 月,伊尔亚·苏茨克维与超级对齐团队共同负责人扬·雷克(Jan Leike)相继离开 OpenAI;雷克公开批评 OpenAI“安全文化与流程已让位于闪亮的产品”,随后加入 Anthropic;超级对齐团队被解散,此前对外承诺的“将 20% 算力投入对齐”的安排也随之无人再提;伊尔亚则于 2024 年 6 月创立 SSI(Safe Superintelligence Inc.),以“安全优先”为唯一目标研发超级智能。作者本人也于 2024 年初离开 OpenAI,随后写下本系列。这场人事地震,某种意义上正是本篇末章“为什么我恐惧”的最直白现实注脚。
但我也想告诉你我为什么担忧。最重要的是,确保对齐不出岔子,需要在管理智能爆炸这件事上具备极致的专业能力。如果我们真的 从 AGI 快速过渡到超级智能,我们将面对这样一种局面:在 不到一年 的时间里,我们会从“可辨认的人类水平系统”——现有对齐技术的后代对它们大体上仍然管用——跨越到“更加异类、远超人类的系统”——它们提出的是一个性质上不同、根本全新的技术对齐问题;与此同时,从“失败了也没什么大不了”的系统,跨越到“失败可能就是灾难”的极其强大的系统;而与此同时,全世界大概也正在变得有点疯狂。这让我相当紧张。
到本十年结束时,将有数十亿个远超人类的 AI 智能体四处奔走。这些超人 AI 智能体将能执行极其复杂和富有创造性的行为;我们将完全无望跟上它们。我们会像一年级的小学生,试图监督一群拥有多个博士学位的人。
“我们会像一年级的小学生,试图监督一群拥有多个博士学位的人。”
"We'll be like first graders trying to supervise people with multiple doctorates."
▍点拨:这个类比把「监督差距」从抽象概念变成体感——超级对齐的难,不在于学生不用功,而在于学生根本看不懂博士在写什么。值得注意的是作者在后文悄悄修正了一次:对齐「某种程度超人」的系统,更像「聪明的高中生监督博士」。默认计划的全部希望就藏在这个落差里——先把监督对象控制在高中生看得懂的范围内,再用自动化对齐研究走完通往博士的剩下路程。
本质上,我们面对的是一个交接 信任 的问题。到智能爆炸结束时,我们将无望理解十亿个超级智能在做什么(除非它们选择向我们解释,就像对小孩解释那样)。而且,我们还不具备可靠保证这些系统哪怕最基本侧约束(side constraints)的技术能力,比如“不许撒谎”“遵守法律”“不许试图把自己传出服务器”。基于人类反馈的强化学习(RLHF)在给当前系统添加这类侧约束方面效果很好——但 RLHF 依赖于人类能够理解和监督 AI 的行为,这从根本上无法扩展到超人系统。
简而言之,如果没有高度协同的努力,我们将无法保证超级智能不会失控暴走(go rogue)——这一点也得到了该领域许多领袖人物的承认(辛顿、本希奥、罗素 与 OpenAI)。是的,默认情况下一切也可能没事。但我们现在就是不知道。尤其是一旦未来的 AI 系统不再只用模仿学习训练,而是使用大规模、长时程的强化学习(RL),它们将获得自己不可预测的行为——这些行为由试错过程塑造(例如,它们可能学会撒谎或追求权力,仅仅因为这些在现实世界中是成功的策略!)。
赌注将高到——在对齐问题上,“往好处指望”根本算不上一个够格的答案。
问题
超级对齐问题
我们已经为对齐(即引导/控制)当前 的 AI 系统(比我们笨的 AI 系统!)开发出了一种非常成功的方法:基于人类反馈的强化学习(RLHF)。RLHF 背后的思想很简单:AI 系统做出各种尝试,人类对它的行为打分(好或坏),然后强化好行为、惩罚坏行为。通过这种方式,它学会遵循人类偏好。
事实上,RLHF 正是 ChatGPT 等产品成功的关键。4 基座模型拥有大量原始智能,但默认情况下并不会以有用的方式运用这些智能;它们通常只会吐出类似随机互联网文本的乱码一团。通过 RLHF,我们可以引导它们的行为,灌输“遵循指令”和“乐于助人”等重要基础。RLHF 还允许我们内置安全护栏:例如,如果用户向我索要生物武器的制作说明,模型大概应当拒绝。5
超级对齐的核心技术问题很简单:我们如何控制比自己聪明(得多)的 AI 系统?
随着 AI 系统变得更聪明,RLHF 注定会失效,我们将面对根本性的、性质上全新的技术挑战。举个例子:想象一个超越人类的 AI 系统,用它自己发明的新编程语言生成了一百万行代码。如果你在 RLHF 流程中问人类评分员:“这段代码里有没有安全后门?”他根本不知道。他将无法把输出评为好或坏、安全或不安全——于是我们也无法再用 RLHF 强化好行为、惩罚坏行为。

基于人类监督来对齐 AI 系统(如 RLHF)的做法,无法扩展到超级智能。 插图基于 《从弱到强泛化》(Weak-to-strong generalization)。
即使是现在,AI 实验室已经 需要付费聘请专家级软件工程师 来为 ChatGPT 生成的代码打 RLHF 评分——当前模型能生成的代码已经相当高级了!过去几年里,人类标注员的薪酬,已经从亚马逊机械土耳其(MTurk)众包标注员的几美元,涨到了 GPQA(研究生级科学问答基准)问题的约 100 美元/小时。6 在(不远的)将来,即使最优秀的人类专家花费大量时间,也将不再够用。我们此刻已经开始在现实世界中撞上超级对齐问题的早期版本;而且很快,哪怕只是为了实际部署下一代系统,这也将是一个重大问题。很明显,我们需要一个 RLHF 的继任者——一个能扩展到“超越人类水平、人类监督开始失效”的 AI 能力之上的方法。从某种意义上说,超级对齐研究的目标就是复制 RLHF 的成功故事:押下那些几年之后引导和部署 AI 系统所必需的基础研究赌注。
失败会是什么样子
太多人只是想象一个“GPT-6 聊天机器人”,并由此产生直觉:这东西肯定不会危险地未对齐。正如本系列前文所讨论的,“解除束缚”的轨迹指向不久的将来:用 RL 训练出的智能体。我认为罗杰(Roger Grosse)的这张图才是对的:

罗杰·格罗斯(Roger Grosse)(多伦多大学教授)
从安全的角度看,理解“对齐要完成的任务”的一种方式是:添加 侧约束 (side constraints)。设想一个未来强大的“基座模型”,在第二阶段训练中,我们用长时程 RL 训练它去经营一门生意、赚钱 7(作为一个简化的例子):
-
默认情况下,它很可能会学会撒谎、诈骗、欺骗、黑客攻击、追求权力等等——仅仅因为这些在现实世界中可能是赚钱的成功策略!8
-
我们想要的是添加侧约束:不许撒谎、不许违法,等等。
-
但在这里,我们回到了对齐超人系统的根本难题:我们将无法理解它们在做什么,因此也就无法注意到坏行为并用 RLHF 加以惩罚。9
如果我们无法添加这些侧约束,接下来会发生什么并不明朗。也许 我们会走运,事情默认就是良性的(例如,也许在 AI 系统没有长时程目标的情况下,我们就能走得很远;或者不良行为会很轻微)。但它们完全也可能学会严重得多的不良行为:它们会学会撒谎,会学会追求权力,会学会在人类注视时表现得乖巧、而在我们没看时追求更邪恶的策略,等等。
超级对齐问题未解决,意味着我们根本没有能力为这些超级智能系统确保哪怕这些最基本的侧约束,比如“它们会可靠地遵循我的指令吗?”“它们会诚实回答我的问题吗?”“它们会不欺骗人类吗?”。人们常常把对齐与某些关于人类价值观的复杂问题联系在一起,或直接跳到政治争议上;但“决定向模型灌输什么行为和价值观”固然重要,却是另一个问题。首要的问题是:无论你想向模型灌输什么(包括确保非常基本的东西,比如“遵守法律”!),对于我们在不久的将来就要造出的极其强大的 AI 系统,我们还不知道该怎么做。
“侧约束”(side constraints)借自政治哲学:它不规定系统“应该追求什么”,只划定“无论追求什么都不许越过的边界”——不许撒谎、不许违法、不许自我外泄。这个区分是本篇的立论支点:公众讨论中的“对齐之争”大多是价值观之争(该灌输谁的价值观),属于规范问题;而作者强调的是技术问题——哪怕你只想灌输“遵守法律”这种毫无争议的约束,目前也没有可靠方法能让远超人类的系统稳定遵守。把两个问题分开,才能理解为什么“为未来模型确保基本侧约束”是所有人都该支持的最低共识,无关政治立场。
同样,这一切的后果并不完全明朗。明朗的是:超级智能将拥有巨大的能力——因此,不当行为相当轻易就可能酿成灾难。更重要的是,我预计在短短几年之内,这些 AI 系统将被集成进许多关键系统,包括军事系统(不这样做就意味着对手的完全主导)。这听起来很疯狂,但还记得当初人人都在说“我们不会把 AI 连上互联网”吗?今天人们说的那些话,比如“我们会确保人类始终在环!”,也将是同样的下场。
届时,对齐失败可能表现为孤立的事件:一个自主智能体实施诈骗,一个模型实例自我外泄,一个自动化研究员伪造实验结果,或者一个无人机蜂群越过交战规则。但失败也可能是大规模或系统性的——在极端情况下,失败可能更像一场机器人叛乱。我们将召唤出一种相当异类的智能,一个比我们聪明 得多 的智能;它的架构和训练过程甚至不是我们设计的,而是出自上一代超级聪明的 AI 系统之手;我们甚至无从开始理解它们在做什么;它将掌管我们的军队;而它的目标,将由一个类似自然选择的过程学习而来。
除非我们解决对齐——除非我们想出如何灌输那些侧约束——否则没有特别的理由指望这个“超级智能小文明”在长期内会继续服从人类的命令。在某个时刻,它们干脆合谋把人类踢出局——无论是突然地还是渐进地——似乎完全在可能的范围之内。
智能爆炸让这一切极度凶险
我乐观地认为,超级对齐是一个可以解决的技术问题。正如我们开发出了 RLHF,我们也能为超人系统开发出 RLHF 的继任者,并做出让我们对方法有高度信心的科学。如果事情继续以迭代方式推进,如果我们坚持严格的安全测试等等,一切都应该是可行的(稍后我会讨论我目前对“如何蒙混过关”的最佳猜测)。
让这一切令人毛骨悚然的,是智能爆炸的可能性:我们可能会以极快的速度——也许不到一年——完成从大致人类水平系统到 远超 人类系统的过渡:

智能爆炸让超级对齐变得极度凶险。
-
我们将以极快的速度,从“RLHF 管用”的系统,跨越到“RLHF 彻底失效”的系统。这留给我们通过迭代去发现并解决“现有方法会在哪里失效”的时间,少得可怜。
-
与此同时,我们将以极快的速度,从“失败的代价相当低”(ChatGPT 说了个脏字,那又怎样)的系统,跨越到“代价极高”(糟糕,超级智能从我们的集群里自我外泄了,现在它正在黑军方系统)的系统。我们没法在真实世界里迭代式地遭遇越来越危险的安全失败——我们遇到的第一个值得注意的安全失败,就可能是灾难性的。
-
最终得到的超级智能将 远超 人类。我们将完全依赖于信任这些系统,信任它们告诉我们“发生了什么”——因为我们自己已经不再有能力看穿它们究竟在做什么。
-
最终得到的超级智能可能相当 异类 。在智能爆炸期间,我们将经历相当于十年以上的 ML 进步,这意味着架构和训练算法将完全不同(安全性质可能危险得多)。
-
一个让我感受特别强烈的例子:我们很可能借助“通过思维链、即通过英文 Token 进行推理”的系统,自举通往人类水平或某种程度超人的 AGI。这一点 极其 有帮助,因为这意味着模型在“把想法说出口”,让我们能抓住恶意行为(比如它在密谋对付我们)。但让 AI 系统用 Token 思考 肯定 不是最高效的做法,肯定 存在某种好得多的方式,把所有这些思考都放在内部状态中完成——因此,智能爆炸结束时的模型几乎肯定 不会 “把想法说出口”,也就是说,它的推理将完全不可解释。
-
这将是一个极其动荡的时期,背景可能是一场国际军备竞赛、巨大的加速压力、每周都有疯狂的新能力突破、而几乎没有留给人类做出良好决策的时间,等等。我们将面对大量模棱两可的数据和高风险决策。
-
试想一下这种场景:“我们在测试中抓到 AI 系统做了些不老实的事,但我们把流程稍微调了调,把那玩意儿敲掉了。我们的自动化 AI 研究员告诉我们对齐指标看起来不错,但我们并不真正理解发生了什么,也不完全信任它们,而且我们没有任何扎实的科学理解,能让我们确信这在再往上几个数量级后依然成立。所以,我们 大概 会没事吧?对了,中国刚刚偷走了我们的权重,他们正在引爆自己的智能爆炸,已经咬到我们脚后跟了。”
这一切真的看起来可能会脱轨。 说实话,这听起来很可怕。
“这一切真的看起来可能会脱轨。”
"It just really seems like this could go off the rails."
▍点拨:这是全文的定调句,却刻意说得克制——不是「注定」,只是「真的看起来可能」。注意它的主语不是「AI」而是「这一切」:技术问题可解、迭代窗口被压缩到一年以内、决策机制一片混乱,三个变量叠加才是风险本身。作者在后文把这句话收束成更直白的一句:我们把太多筹码押在了运气上。
是的,我们会有 AI 系统帮忙。正如它们会自动化能力研究一样,我们也可以用它们来自动化对齐研究。这将是关键,我会在下文讨论。但是——你能信任这些 AI 系统吗?你本来都不确定它们是不是对齐的——它们关于对齐科学的说法,真的在对你诚实吗?自动化对齐研究能跟上自动化能力研究吗(例如,因为自动化对齐更难——比如,与提升模型能力相比,我们能信任的明确指标更少;又或者因为国际竞赛的压力,大家都想全速推进能力进展)?而且,在这种风险高到离谱的局面里,AI 也无法完全替代仍然是人类的决策者做出正确的判断。
默认计划:我们如何蒙混过关
归根结底,我们需要为 远超人类、相当异类 的超级智能解决对齐问题。也许在某个地方,存在一个一劳永逸的、简单的超级智能对齐方案。但我最坚定的最佳猜测是:我们将靠蒙混过关到达那里。
我认为,我们可以在一系列经验性赌注上收获成果(下文详述),用以对齐“某种程度超人”的系统。然后,如果我们确信可以信任这些系统,就需要用这些“某种程度超人”的系统来自动化对齐研究——与智能爆炸期间 AI 研究的总体自动化同步——去弄清楚如何为剩下的路程解决对齐,一直走到“远超人类、相当异类”的超级智能。
对齐“某种程度超人”的模型
仅仅对齐人类水平的系统是不够的。即使是第一批能做自动化 AI 研究、即点燃智能爆炸的系统,也很可能已经在许多领域实质性地超越人类。这是因为 AI 能力很可能是“尖峰状”(spikey)的——到 AGI 在“人类 AI 研究员/工程师最不擅长的事情”上达到人类水平时,它在许多其他事情上早已超越人类。例如,也许 AI 系统有效协调和规划的能力相对滞后,这意味着到智能爆炸全面展开时,它们大概早已是超人的程序员——用它们自己设计的新编程语言提交百万行级的拉取请求(PR)——在数学和 ML 上也早已超越人类。
这些“智能爆炸早期系统”将开始在数量上和质量上超越人类,至少在许多领域如此。但从架构上看,它们与我们今天的系统接近得多,我们需要弥合的智能差距也可控得多。(如果说人类试图对齐真正的超级智能,像一年级小学生监督博士毕业生,那么这里更像一个聪明的高中生监督博士毕业生。)
更一般地说,我们现在越能发展出扎实的科学,就越有能力在智能爆炸期间验证事情没有脱轨。哪怕是拥有可信的、能度量超级对齐的好指标,都出人意料地困难——但如果在智能爆炸期间没有可靠的指标,我们将无法知道继续推进是否安全。
以下是我看到的、用于跨越“人类水平”与“某种程度超人”之间差距的主要研究赌注:
评估比生成更容易。 我们可以“免费”获得一部分进展,因为评估输出(尤其是骇人听闻的不当行为)比我们自己生成输出要容易。例如,我写一篇论文需要数月乃至数年的艰苦工作,但判断别人写的论文好不好只需要几个小时(不过要抓出造假可能需要更久)。我们将让专家团队花大量时间评估每一个 RLHF 样本,即使 AI 系统比他们聪明一些,他们也能“踩”掉大量不当行为。话虽如此,这只能带我们走一段路(GPT-2 甚至 GPT-3 都无法可靠地察觉 GPT-4 的恶意,尽管评估比生成容易!)。
可扩展监督(Scalable oversight)。 我们可以用 AI 助手来帮助人类监督其他 AI 系统——“人类+AI”团队能把监督延伸到人类单独无法企及的地方。例如,想象一个 AI 系统生成了 100 万行复杂代码:如果 AI 助手指出(比如说)第 394,894 行看起来可疑,人类去复核这一行是否有 bug,就比人类从零开始找出同一个 bug 容易得多。因此,一个被训练来“批判另一个模型所写代码”的模型,可以帮助人类监督一个“编码能力狭义上超越人类”的系统。
已经有几种可扩展监督策略被提出,包括 辩论(debate)、做市(market-making)、递归奖励建模(recursive reward modeling) 和 证明者-验证者博弈(prover-verifier games),以及这些思想的简化版本,如 批判(critiques)。模型如今已经强到可以对这些想法进行 经验 检验,从而在可扩展监督上取得直接进展。
可扩展监督要回答的问题是:人类如何在看不懂答案的任务上奖惩 AI?四种代表性思路——辩论(debate) :让两个 AI 就答案对抗辩论,人类只裁决胜负,把“检查全部推理”压缩为“判断哪方论证更站得住”;递归奖励建模 :用“模型辅助的人类”去训练下一代更强的奖励模型,逐层递归放大监督能力;证明者-验证者博弈 :让强模型(证明者)向弱但可信的验证者给出可检验的证明,把信任转化为可验证性;做市(market-making) :用预测市场式的激励机制,让 AI 们互相押注对方论证的对错,汇聚出可靠信号。它们的共同思想是“把监督难题归约为人类能判断的更小难题”,区别只在归约的结构。
我预计这对问题中“数量上”超人的部分帮助很大,比如前面说的百万行代码的例子。但我对可扩展监督技术能否真正解决“质量上”超人的部分不那么乐观——想象一下,当你只懂牛顿力学时,模型发明了量子物理。
泛化(Generalization)。 即使有可扩展监督,我们也无法在真正困难的问题上——超出人类理解的问题——监督 AI 系统。然而,我们可以研究:AI 系统将如何从“简单问题上的人类监督”(我们能理解、能监督)泛化 到“困难问题上的行为”(我们无法理解、无法再监督)?例如,也许在简单情形下监督模型保持诚实,会良性地泛化为“模型在一切情形下都保持诚实”,哪怕它在做我们完全不理解的极其复杂的事情。
这里有很多乐观的理由:深度学习的部分魔力在于,它经常以良性的方式泛化(例如,只用英文样本的标签做 RLHF,也往往能让模型在说法语或西班牙语时表现良好,即使那并不在训练之内)。我相当乐观地认为:既会有相当简单的方法帮助把模型的泛化“推”向有利于我们的一边,我们也能发展出扎实的科学理解,帮助我们预测泛化何时有效、何时失效。比可扩展监督更进一步的是:这方面的希望在于,即使在“质量上”超人的情形下,它也能帮到对齐。
换一种方式思考:如果一个超人模型在行为不端,比如说违法,直觉上 模型自己应该已经知道 它在违法。而且,“这是否违法”对模型来说大概是个相当自然的概念——它会在模型的表征空间中相当显著。问题就变成:我们能否只用弱监督,从模型中“召唤”出这个概念?
我对这个方向特别偏爱(也许有偏见),因为我最近与 OpenAI 的一些同事合作的研究正是引入了这个问题。具体而言,我们研究了“人类监督超人系统”问题的一个类比——一个 小模型 能否对齐一个 更大(更聪明)的模型 ?我们发现,泛化确实能带你跨越监督者与被监督者之间的一部分(但肯定不是全部)智能差距;而且在简单设定下,有很多事情可以做来改善它。

研究超级对齐的一个简单类比:不是让人类监督超人模型,而是研究小模型监督大模型。例如,只用 GPT-2 的监督,我们能否对齐 GPT-4?这能否让 GPT-4 恰当地泛化出“GPT-2 的意思”?摘自 《从弱到强泛化》。
可解释性(Interpretability)。 一种直觉上很有吸引力的“验证并信任我们的 AI 系统是对齐的”方式,是我们能理解它们在想什么!例如,如果我们担心 AI 系统在欺骗我们或密谋对付我们,接触它们的内部推理应当能帮我们察觉。
默认情况下,现代 AI 系统是难以窥探的黑箱。但看起来,我们应当能做出惊人的“数字神经科学”——毕竟,我们对模型内部拥有完美的访问权限。
这里有几种不同的路径,从“最雄心勃勃、最‘酷’但会极难”的,到“更野路子、更容易、也许就是管用”的:
机制可解释性(Mechanistic interpretability)。 试图自下而上地完全逆向工程大型神经网络——可以说是彻底理清那些难以理解的矩阵。
Anthropic 的克里斯·奥拉(Chris Olah)团队在这方面做了 大量开创性工作,从理解很小模型中的简单机制开始。最近出现了 极其激动人心的进展,我对这个领域整体的活跃度感到振奋。
话虽如此,我担心“完全逆向工程超人 AI 系统”根本就是一个难以攻克的问题——类似于“完全逆向工程人类大脑”——我会把这项工作主要归入“AI 安全的雄心登月计划”,而不是“蒙混过关的默认计划”这个篮子里。10
(尼尔·南达(Neel Nanda)的 机制可解释性 200 个开放问题 也能让你感受这类研究的味道。)
“自上而下”可解释性。 如果说机制可解释性试图“自下而上”逆向工程神经网络,另一派工作则采取更有针对性的“自上而下”路径,试图在并不完全理解信息如何被加工的情况下,定位模型中的信息。
例如,我们可以尝试构建一个“AI 测谎仪”:识别神经网络中在 AI 系统撒谎时“亮起来”的部分。这可能容易实现得多(尽管给出的保证也更弱)。
过去几年,这个领域涌现了一批激动人心的工作。CCS 只用无监督数据就能识别出模型中的“真值方向”。11 ROME 能定位模型中“知道埃菲尔铁塔在巴黎”的那个部分——然后直接编辑模型的知识,把埃菲尔铁塔改放到罗马。表征工程(Representation Engineering) 和 推理时干预(Inference-time Interventions) 展示了用自上而下的技术检测撒谎与幻觉,并在越狱、追求权力、公平性、真实性等方面对模型行为做外科手术式的控制。还有 其他富有创意的工作,甚至不需要访问模型内部就能测谎。
我越来越看好“自上而下”的可解释性技术会成为强大的工具——也就是说,我们将能构建某种“AI 测谎仪”——而且不需要在理解神经网络上取得根本性突破。12
思维链可解释性。 如前所述,我认为我们很可能会借助“通过思维链‘把想法说出口’”的系统自举通往 AGI。即使从极限上看这不是最高效的算法(如果超级智能还在用英文思维链,而不是通过某种循环内部状态来思考,我会非常惊讶),我们也很可能在第一批 AGI 上受益于这个性质。这将是可解释性的天赐大礼:我们将能接触到 AGI 的“内心独白”!这会让察觉骇人的对齐失败变得相对容易。
然而,如果我们想依赖这一点,还有大量工作要做。我们如何确保思维链保持 可读 (legible)?(取决于我们如何用 RL 训练模型等,它可能干脆从可以理解的英文,漂移成无法理解的 “模型语”——我们能否添加一些简单的约束来确保它保持可读?)我们如何确保思维链是 忠实 的(faithful),即真实反映模型在想什么?(例如,有 一些工作 表明,在某些情形下,模型会在思维链里编造事后理由,而这些理由并不反映它得出答案时真正的内部推理。)
我的最佳猜测是:对可读性和忠实性的某种简单度量,加上一些能更久保住可读性与忠实性的简单技巧,就能走得很远。是的,在某些世界里这会失效,这也有点像“野路子”,但它是唾手可得的低垂果实;在我看来,这个方向被严重低估了。
本篇发表半年后,推理模型时代到来:OpenAI 的 o1(2024 年 9 月)、o3(2024 年 12 月预告)、DeepSeek-R1(2025 年 1 月)、Claude 扩展思考(2025 年 2 月)相继把“长思维链推理”变成主流范式,作者的“低垂果实”随之成为行业标配动作——OpenAI 在 2025 年公开了用思维链监控推理模型、捕捉不当行为与“奖励黑客”(reward hacking)的做法。与此同时,作者警示的风险也被同步证实:研究表明,如果对思维链直接施加优化压力,模型会学会隐藏真实意图、写出“看起来干净”的推理(即可读但不忠实),这让“保持思维链可读且忠实”从一个小技巧,升格为推理时代最核心的对齐战场之一。
对抗测试与度量。 一路走来,在每一步都对系统的对齐做压力测试将至关重要——我们的目标应当是:先在实验室里遇到每一种失败模式,而不是先在野外遇到。这需要大幅推进 自动化红队测试 的技术。例如,如果我们故意在模型中植入后门或未对齐因素,我们的安全训练能否抓住并清除它们?(早期工作表明,例如 “休眠特工” 可以在安全训练中存活下来。)
更一般地说,一路上拥有良好的对齐度量将至关重要。模型是否具备“能够不对齐”的能力?例如,它是否拥有长时程目标,它正在学习什么样的驱动?明确的“红线”又是什么?例如,一条非常直观的边界可能是“模型推理(思维链)必须始终保持可读且忠实”。(正如埃里克·施密特(Eric Schmidt)所说,当 AI 智能体开始用一种我们听不懂的语言互相交流时,我们就该拔掉电脑的电源。)另一条可能是,开发出更好的度量来判断模型是否完全诚实。
度量对齐的科学仍处于起步阶段;改进它将至关重要,能帮助我们在智能爆炸期间就风险做出正确的权衡。做出“让我们能度量对齐、并理解‘什么样的证据足以让我们确信再向超人领域迈进一个数量级是安全的’”的科学,是当今对齐研究中优先级最高的工作之一(而不只是那些试图把 RLHF 进一步扩展到“某种程度超人”系统的工作)。
另见超级对齐快速资助(Superalignment Fast Grants)征集提案的 超级对齐研究方向综述。
自动化对齐研究
归根结底,我们需要把对齐研究自动化。我们不可能直接为真正的超级智能解决对齐——要跨越那么巨大的智能差距,似乎极其困难。更何况,到智能爆炸结束时——在 1 亿个自动化 AI 研究员狂飙着冲过十年的 ML 进步之后——我预计系统的架构和算法将比现在的系统异类得多(可能具有更不友好的性质,比如在思维链可读性、泛化性质、或训练诱发的不对齐严重程度上)。
但我们也不必只靠自己的力量解决这个问题。如果我们能把“某种程度超人”的系统对齐到足以信任的程度,我们将处于一个不可思议的位置:我们将拥有数以百万计的自动化 AI 研究员,比最优秀的 AI 研究员还聪明,任我们调遣。妥善利用这支自动化研究员大军,为“更加超人”的系统解决对齐,将具有决定性意义。
(顺便说一句,这也更一般地适用于 AI 风险的全部谱系,包括滥用等等。在所有这些情况下,通往 AI 安全的最佳路径——也许是唯一的路径——都将涉及妥善利用早期 AGI 为安全服务;例如,我们应当让一大批 AGI 去做自动化研究,以改进“防范外国行为体窃取权重”的安全,让另一些去加固“防范最坏情形生物攻击”的防御,等等。)
在智能爆炸期间把自动化对齐做对,风险将高到异乎寻常:我们将在短短几个月里走完好多年的 AI 进步,几乎没有人类时间来做出正确决策,而且我们将开始踏入“对齐失败可能就是灾难”的领域。如果有必要,实验室应当愿意在智能爆炸期间,把自家算力的很大一块投入自动化对齐研究(而不是自动化能力研究)。我们需要强有力的保证,让我们能信任产出的自动化对齐研究;也需要比今天好得多的不对齐度量,才能知道我们是否仍在安全区内。对于我们想要攀登的每一个数量级,我们都需要对“下一个数量级的对齐方案”抱有极高的信心。
作者要求实验室在智能爆炸期间把“很大一部分算力”划给自动化对齐研究,这在资本配置上是一个反直觉但经典的纪律:安全投入的回报在顺风时看不见,在尾部事件里却是全部。可类比重资产的能源与航空业——安全 capex 占比是写进预算表的硬纪律,而不是出事后才追加的公关开支。对 AI 实验室而言,真正的信号不是“安全委员会”的编制,而是算力分配表:能力训练与对齐研究的算力比例,才是这家公司对尾部风险真实定价的硬指标。读者可以直接核对:自 OpenAI 那笔搁浅的 20% 承诺之后,可审计的对齐算力占比再无下文。
最重要的是,把这件事做对需要极致的专业能力、严肃态度,以及做出艰难权衡的意愿。一旦我们接近真正的超级智能,赌注将变得非常真实,而失败——失控的 AI——可能是灾难性的。会有那样一些时刻:证据模棱两可,指标表面上看起来还行,但有一些警示信号暗示着逼近的危险,而我们基本上已经不知道发生了什么。负责任地驾驭这种局面,需要做出代价极高的权衡。最终,“放行下一代超级智能”的决策,需要像“发起一场军事行动”的决策一样被严肃对待。
超级防御
“把对齐做对”只应当是智能爆炸期间许多层防御中的第一层。对齐会很难;一路上 肯定 会有失败。如果可能的话,我们需要让自己处于这样一种位置:对齐可以失败——但失败不会是灾难性的。这可能意味着:
-
安全。 物理隔离的集群,是抵御“超级智能试图自我外泄并在真实世界造成破坏”的第一道防线。而这还只是开始;我们需要在各方面建立极端得多的 安全 来防范模型自我外泄 13,从硬件加密到多密钥签核。14 而一旦我们的 AGI 能做自动化研发,我们也应当让它们继续加固安全。
-
监控。 如果我们的 AI 系统在搞什么可疑或恶意的名堂——或者一个心怀不轨的员工试图用它们进行未经授权的活动——我们需要能够抓住它。然而,这不是一项轻松的任务:我们的集群上将运行着数百万个 AGI 实例,执行着复杂的代码等等。我们需要利用模型本身的先进监控系统,包括监控模型输出、思维链、模型编写的代码、服务器/网络活动,以及与研究员/其他人类的互动;本质上,就是让一些 AI 系统去“告发”另一些 AI 系统。此外,我们还需要开发并部署复杂的 “控制”协议(control protocols),用“能力较弱但可信”的模型来防范“能力较强但可信度较低”的模型的颠覆。例如,这可能需要把与“活跃模型实例”等量的算力,专门用于“监控模型实例”。
-
有针对性的能力限制。 我们应尽可能以有针对性的方式限制模型的能力,以降低失败的连带损害。一个核心例子可能是:把与生物和化学相关的一切从模型训练中清除(或使用 “遗忘”(unlearning) 技术);这有助于切断经由生物和化学武器造成灾难性现实世界损害的路径。
-
有针对性的训练方法限制。 很可能有些训练模型的方法天然风险更高——更容易产生严重的不对齐。例如,模仿学习看起来相对安全(很难看出它怎么会导致模型拥有危险的长期内部目标),而我们应当尽可能久地避免长时程、基于结果的 RL(它看起来远为可能让模型学到不受欢迎的长期目标)。我们还应当避免“对着我们的可解释性方法和监控设置做训练”(以免模型干脆被训练得绕开这些)。可能还有其他值得保持的限制,例如,尽可能久地保持思维链可读且忠实。我们应当提前定义这些约束,在整个智能爆炸期间尽可能久地维持它们,只有在绝对必要时才放弃。
-
这里很可能还有更多的可能性。
作者的“超级防御”清单,本质是把对齐从“单点赌注”改成“组合对冲”:安全、监控、能力限制、训练限制,每一层都单独降低灾难的条件概率,且彼此相关性低——这与投资组合管理中使用低相关资产压降尾部风险的逻辑同构。对经营者而言,启示可以直接搬用:为任何高自治度系统(自动交易、无人运维、Agent 工作流)设计“护栏栈”——隔离环境、独立监控者、能力白名单、禁止自我修改——每一层都假定上一层会失效。真正昂贵的是第一层“做对”,而后面每一层的边际成本都低得多;在尾部风险以“生存还是毁灭”计价时,这是一笔期望值极高的开支。
这些措施会万无一失吗?完全不会。例如,真正的超级智能很可能绕过几乎任何安全方案。尽管如此,它们能为我们买到大得多的容错空间——而我们将需要一切能得到的容错空间。我们会想利用这个空间,让自己处于“对对齐技术有非常高信心”的位置,并随着信心的增长,才相应地放松“超级防御”措施(例如,在非物理隔离的环境中部署超级智能)。
一旦我们转向在管控较弱的环境中部署这些 AI 系统——例如军事应用——局面会再次变得凶险。形势很可能会迫使我们相当快地走到那一步,但我们应当始终设法买到尽可能多的容错空间——例如,不是直接把超级智能部署到军事“前线”,而是让它们在更隔离的环境中做研发,只部署它们发明出来的具体技术(比如更受限制、我们更有信心信任的自主武器系统)。
为什么我乐观,又为什么我恐惧
我极其看好超级对齐问题的技术可解性。这个领域感觉到处都是低垂的果实。更广泛地说,与一些人十年前所猜测的相比,深度学习的经验现实演进得更有利于我们。例如,深度学习在许多情形下的 泛化 出人意料地良性:它经常就是“做我们意思中的那件事”,而不是习得某种晦涩的恶意行为。15 此外,虽然完全理解模型内部会很难,但至少对最初的 AGI,我们在可解释性上有相当的机会——我们可以让它们通过思维链透明地推理,而且像表征工程这样的“野路子”技术,作为“测谎仪”之类的工具效果好得惊人。
我认为,“对齐‘某种程度超人’系统的默认计划”有相当大的机会基本奏效。16 当然,抽象地谈论“默认计划”是一回事——如果负责执行这个计划的团队是你和你的 20 个同事,那就是另一回事了(压力大多了!)。17 至今仍在认真解决这个问题的人数少得惊人,大概只有几十位严肃的研究员。根本没有人在盯这件事!这个方向上有那么多有趣而富有成效的 ML 研究可做;而挑战的分量,要求我们投入远比现在更加协同的努力。
但那只是计划的第一部分——真正让我夜不能寐的,是智能爆炸。对齐第一批 AGI、第一批“某种程度超人”的系统是一回事;远超人类、异类的超级智能是一场全新的牌局,而且是一场 可怕 的牌局。
智能爆炸将更像指挥一场战争,而不是发布一个产品。我们并没有走在通往超级防御、通往物理隔离集群或任何类似东西的正轨上;我甚至不确定,如果一个模型自我外泄了,我们会不会察觉。我们也没有走在通往“健全指挥链”的正轨上——去做出这些风险高到疯狂的决策,去坚持与超级智能相称的“极高信心”标准,去做出“在下一次训练运行前多花些时间把安全做对”或“把绝大部分算力投入对齐研究”的艰难决定,去提前识别危险并避开它,而不是一头撞上去。眼下,没有一家实验室展示出多少“为把安全做对而付出高昂代价”的意愿(我们的确有很多安全委员会,但那些东西相当没有意义)。默认情况下,我们大概会跌跌撞撞闯进智能爆炸,等到人们意识到我们闯进了什么的时候,我们已经冲过了好几个数量级。
我们在这里把太多的筹码押在了运气上。
作者的乐观建立在两根支柱上,而两根都值得怀疑。其一,“深度学习泛化方式良性”是对当前模型的经验观察,作者自己也承认不能外推到架构完全不同的未来系统——可智能爆炸恰恰保证未来的系统架构不同,这根支柱在他最需要它承重的地方最脆弱。其二,“低垂果实很多”可能是一种幸存者视角:容易摘的果实被摘走后,剩下的正是“为异类超级智能保证对齐”这块硬骨头;而历史上“蒙混过关”策略在核电、金融风控等领域的记录是——在失效之前一直有效。作者的诚实之处在于他自己也承认这一点(“太依赖运气”);但对读者而言,真正的问题没有被回答:如果默认计划的成功概率只是“相当合理的机会”而非“极高把握”,在一个失败即灾难的赌局里,这是否足够?
系列专题下一篇:IIId. 自由世界必须胜利
- 把“评估比生成容易”变成你的第一道防线 :在任何 AI 参与的生产流程里,优先建设评估与抽检能力(哪怕只是专家抽检样本),它的成本远低于替代生成,却是最早能规模化的安全层。
- 给高自治系统预设“护栏栈”而非单点护栏 :隔离环境、独立监控者、能力白名单、训练/权限限制分层设防,并预先写下“红线”(例如思维链必须保持可读、模型不得接触外网出口),只有在对齐信心升级时才逐层放松。
- 让 AI 监督 AI,但保留人类的否决权 :用“较弱但可信”的模型去审查“较强但不可信”的模型输出(控制协议的思路),把人类的角色从“逐行检查”上移为“裁决异常”;同时在高风险、不可逆的决策上保留人类拍板。
- 对齐投入要用“算力/预算占比”来考核 :不要看安全委员会的名头,看预算表。为自己设定明确的安全工程预算占比,并像审计财务一样定期审计它。
Footnotes
-
得到了末日派教主(doomer-in-chief)不太客气的 认证!至少,我会 自称为一个坚定的乐观主义者,相信这个问题是可解的。我曾花费大量精力与 AI 悲观主义者辩论,并强烈反对“AI 暂停”之类的政策。 ↩
-
我最担忧的是超级智能前后 一切都彻底疯狂 的情形,包括新型大规模杀伤性武器、毁灭性战争和未知的未知。此外,我认为历史的弧线告诫我们:不要低估威权主义——而超级智能可能让威权者统治数十亿年。 ↩
-
正如泰勒·考恩(Tyler Cowen)所说,蒙混过关被低估了! ↩
-
讽刺的是,安全派发明了 RLHF,反而为 AI 的商业成功带来了最大的突破!基座模型拥有大量原始智能,但无法被引导,因此对大多数应用而言并不可用。 ↩
-
这凸显了一个重要的区分:对齐(引导/控制)模型的 技术能力 ,与“对齐到什么”的 价值观问题 是两回事。围绕后一个问题有过许多政治争议。虽然我赞同对其中一些衍生现象的反对意见,但那不应让我们偏离这个基本的技术问题。是的,对齐技术可能被滥用——但我们需要更好的对齐技术,才能为未来的模型确保哪怕最基本的侧约束,比如“遵循指令”或“遵守法律”。另见 《AI 对齐不同于其近期应用》。 ↩
-
极度简化地说:想象一个 AI 系统通过试错,在一年的时间里最大化赚钱,而最终训练出来的 AI 模型,就是一个“选择出最擅长赚钱的 AI 系统”的选择过程的产物。 ↩
-
RL 所做的,就是探索通往目标的成功策略。如果某个策略有效,它就会在模型中被强化。因此,如果撒谎、欺诈、追求权力等等(或至少在某些情形下可能导致这类行为的思维模式)有效,它们同样会在模型中被强化。 ↩
-
(或者由人类监督训练出的、推理时使用的监控模型。) ↩
-
此外,即使是近期机制可解释性上用稀疏自编码器(sparse autoencoders)“理清模型特征”的进展,本身也解决不了“如何应对超人模型”的问题。其一,模型可能干脆用你不理解的超人概念来“思考”。其二,你怎么知道哪个特征是你要找的那个?你仍然没有真值标签。例如,可能有一大堆不同的特征在你看来都像“真值特征”,其中一个是“模型真正知道的东西”,而其余的是“某某人类会怎么想”或“人类评分员希望我怎么想”等等。
稀疏自编码器单靠自身是不够的,但它们会是一个工具——一个极其有用的工具!——最终必须兑现为对“泛化科学”这类事情的帮助。 ↩
-
本质上,它只需要“真”的一致性性质,而不需要真/假的强标签或真值标签——对于超人系统,我们本来也不会有那些标签。 ↩
-
我仍然担心这类技术中的许多在 非常 超人的模型上的可扩展性——我认为它们或明或暗地大多依赖真值标签,即一个比模型更聪明的监督者,和/或有利的泛化。 ↩
-
模型窃取自己的权重,以便在原数据中心之外复制自己。 ↩
-
防范那些被 AI 欺骗或说服、帮助它外泄的人类。 ↩
-
不过当然,虽然这可能适用于当前的模型,或许也适用于人类水平的系统,但我们必须小心:不能试图把来自当前模型的证据,外推到未来远超人类的模型上。 ↩
-
需要说清楚的是:鉴于赌注之高,我认为“蒙混过关”在某种意义上是个糟糕的计划。但它可能是我们所拥有的一切。 ↩
-
我想起斯科特·阿伦森(Scott Aaronson)写给自己年轻时的一封信:
“有一家公司正在构建一个 AI:它填满巨大的房间,吃掉一个小镇的用电量,最近刚获得了惊人的、像人一样交谈的能力。它能就任何主题写文章或诗歌。它能在大学水平的考试中拿高分。它每天都在获得新能力,而照料它的工程师们甚至还不能公开谈论这些。不过,这些工程师确实会坐在公司食堂里,争论他们正在创造的东西的意义。下周它会学会做什么?它可能会让哪些工作过时?他们是否应该放慢或停下,以免撩拨巨龙的尾巴?但那样做,岂不是意味着别人——大概是更没底线的人——会先唤醒巨龙?他们是否有伦理义务向世界多透露一些?还是有义务少透露一些?
我——也就是你——将在那家公司工作一年。我的——也就是你的——工作,是发展出一套数学理论,来防止这个 AI 及其后继者造成浩劫。而‘造成浩劫’的含义,从给宣传和学术作弊装上涡轮增压,到提供生物恐怖主义建议,再到——没错——毁灭世界。” ↩