1000层自监督强化学习网络 (Kevin Wang)
本期对话 NeurIPS 2025 最佳论文作者 Kevin Wang 团队,探讨如何将强化学习网络扩展到1000层,并揭示自监督表示学习在其中的关键作用。
本文译自Latent Space 播客,发布于 2026 年 1 月 2 日。本期对话由 Shawn Wang (Swyx) 主持,对话 NeurIPS 2025 最佳论文《1000 Layer Networks for Self-Supervised RL》的主创团队:Kevin Wang(普林斯顿本科毕业生,项目负责人)、Michał Bortkiewicz(普林斯顿大学博士生)以及 Benjamin Eysenbach(普林斯顿大学助理教授)。
普林斯顿团队在强化学习(RL)领域挑战了“网络加深即崩溃”的十年定式,通过将目标函数从传统的 Q学习(Q-learning)或时序差分(TD)回归转化为自监督对比学习的分类问题,成功将 RL 网络扩展至 1000 层并解锁了暴涨的性能。本期访谈不仅复盘了残差连接与层归一化在 RL 扩展中的协同效应,还深入讨论了 JAX 加速数据收集、模型蒸馏(“深师浅友”部署范式)以及机器人学的应用前沿。至于那个反常识的结论——为什么你的 RL 代码里不需要出现任何一行“最大化奖励”,其深刻的理论逻辑就藏在正文之中。
▍嘉宾:Kevin Wang 普林斯顿大学本科生(现已毕业),项目发起并负责人。在研讨会中提出并牵头完成了 1000 层强化学习网络的探索。
▍嘉宾:Benjamin Eysenbach 普林斯顿大学助理教授,机器学习与强化学习实验室负责人,指导了本项最佳论文研究。
▍关于普林斯顿机器学习实验室 (Princeton ML Lab) 普林斯顿大学计算机科学系旗下的前沿实验室,致力于推进深度学习、强化学习与自监督表示学习的交叉边界。本项研究颠覆了学术界此前对深层强化学习的悲观共识,利用 JAX GPU 并行加速环境展示了架构规模扩展的红利。
本科研讨会诞生的 NeurIPS 最佳论文
Swyx: 欢迎来到 Latent Space。我们致力于为无法亲临现场的听众提供最优质的欧洲播客体验。恭喜你们的论文获奖,现在感觉如何?
Kevin: 我以前从没得过最佳论文(Best Paper)…… 你是直接在网站上看到的吗?我当时刚起床,查了一下邮件,然后就收到了通知,直接告诉我们获得了最佳论文奖。 虽然从评审意见(Reviews)中能看出反馈不错,但评审好和最终拿到最佳论文奖完全是两码事。所以在此之前,我们确实不知情。
Swyx: 好的,我们稍微跳过了一点开头。接下来大家可以依次做个自我介绍,讲讲自己是谁,以及在团队中负责什么工作。
Kevin: 我是 Kevin(Kevin Wang)。我之前是普林斯顿大学(Princeton University)的本科生(Undergraduate),刚刚毕业。在这个项目中,我负责牵头并启动了这项研究,非常高兴能与 Ishaan(Ishaan Javali)、Michal(Michał Bortkiewicz)以及 Ben(Benjamin Eysenbach)共同合作。
Swyx: 明白。你们当时是在同一个研究小组吗?你们是怎么聚在一起合作的?
Kevin: 我们都来自普林斯顿。这个项目起步于 Ben 教授的一门独立研究研讨会(Independent Work Seminar, IW Seminar)。这算是我在机器学习(Machine Learning, ML)研究领域的初次尝试,这段经历非常宝贵。 Ishaan 当时也在那个研讨会上做方向相近的课题,所以我们在期间有大量的交流与合作。项目随后取得了一些不错的初步成果。后来,Michal 也因为在做类似的研究加入了进来,最终形成了一个高效的合作团队。
Swyx: 好的,其他人要不要补充一下当初是如何决定研究这个问题的?
挑战传统:打破RL浅层网络限制的尝试
Ben: 我的实验室专注于深度强化学习(Deep Reinforcement Learning, DRL)。但在此之前,强化学习中的“深度”通常只有两三层,最多四层,绝不是 1000 层。 当 Kevin 和 Ishaan 提出想尝试极深的网络时,我非常怀疑这行不行得通。我自己以前试过,失败了;文献中也有其他尝试,同样无法工作。因此我起初极度怀疑,不知道我当时有没有把这种顾虑传达给他们。
Swyx: 这也是我原先的直觉。作为导师,你认为自己的职责是做筛选——比如告诉学生这行不通,应该换个想法;还是不论想法听起来多么愚蠢,都应该给予鼓励?这实际上是在选择押注的方向。
▍深度强化学习的网络层数限制:在深度学习(如计算机视觉和 NLP)中,网络加深能直接带来性能跃升,但强化学习(RL)却长期受限于 2-3 层的浅层多层感知机(MLP)。这是因为 RL 的数据是在线收集的非独立同分布数据,且传统的时序差分(TD)目标依赖于 bootstrapping(自举引导)。如果网络过深,误差在极深的网络层中传导会导致梯度消失、爆炸或表示崩塌(Representation Collapse)。因此学术界长期存在“RL 网络越深,性能越差”的定式。
Ben: 没错,而这就是一个我愿意去下的赌注。
Swyx: 是什么让你愿意在这个方向上冒险?
Ben: 因为这笔尝试的成本相对较低。尤其是 Michal,在过去一年里搭建了一套高效的实验基础设施,让这类运行测试变得容易得多。 而且从常理来看,更深的网络理应表现得更好,这正是过去十年来深度学习革命(Deep Learning Revolution)的核心逻辑。那我们为什么要停下加深网络的脚步呢? 强化学习(Reinforcement Learning, RL)是一个特例,大家一直在使用非常浅层的网络。在我们关注的研究背景中——即智能体从零开始学习、没有任何先验经验的设置下,这种情况尤为明显。你们其他人还有什么要补充的吗?
Kevin: 如果放眼整个深度学习的版图,你会看到自然语言处理(NLP)、计算机视觉(CV)和强化学习(RL)这三大支柱。在语言和视觉领域,整个行业已经收敛到大网络参数量扩展的范式上,参数量轻松达到成百上千亿、甚至万亿级别。 深度学习从中获益匪浅。但在深度强化学习(Deep RL)中,这种情况尚未发生。当我进入 Ben 教授的研讨会时,我惊讶地发现,为什么即便是前沿的强化学习算法,内部也只是用简单的两层多层感知机(MLP)? 于是我非常好奇:我们能否设计一种强化学习算法或整理出一套方案,使其能够像语言和视觉模型一样进行有效的深度扩展?
传统的值函数强化学习(Value-based RL)无法有效扩展,这在文献中已经得到了印证。因此,我们尝试了一种不同的方法,即自监督强化学习(Self-Supervised Reinforcement Learning)。 我们不再去学习值函数,而是去学习状态、动作以及未来状态的表示(Representations)。我们的目标是让同一条轨迹(Trajectory)上的表示在向量空间中尽可能接近,而让不同轨迹上的表示尽可能远离。 这是一种自监督的学习方式,使我们能够在不依赖人工设计奖励信号的情况下,解决目标达成(Goal-Reaching)的任务。
突破瓶颈的核心配方:自监督强化学习与架构协同
自监督学习在深度学习的其他领域已被证明具有极佳的扩展性,那么自监督强化学习是否也能实现类似的深度扩展? 我们最初尝试时失败了。直接加深网络后,模型的性能完全崩溃。不过,强化学习文献中还有一些其他工作可以借鉴。我们尝试引入了残差连接(Residual Connections)以及其他几个架构层面的改进。 有一天,我在一个测试环境中运行实验,突然发现,将网络深度增加一倍没有任何效果,但当深度再次加倍并融入了这些特定的架构调整后,在该环境下的性能出现了爆发式的增长。这个探索过程非常不易。
Ben: 传统的超参数优化思路是控制变量:试着改变变量 A 看是否有改善,或者改变变量 B 看看效果。但在我们这个任务中,如果仅增加深度,性能会变差;如果仅引入残差连接,也没有任何提升。 真正起作用的是 Kevin 和 Ishaan 发现的多种架构要素的协同效应。在此之前,我们也尝试过在其他维度上进行扩展,比如增加批次大小(Batch Size)或者增加网络宽度(即隐藏层的神经元数量)。
Swyx: 没错,这与单纯盲目增加深度类似。一旦引入了残差连接、层归一化(Layer Normalization)等特定的架构选择,我们就能观察到显著的性能跃升。在某些“临界深度”(Critical Depths)上,性能会呈倍数级增长。 单纯拓宽网络宽度虽能带来一些改善,但当网络宽度增加时,参数量的增长通常是二次方(Quadratic)关系;而增加深度,参数量只呈线性(Linear)增长。 从实验结果来看,加深网络不仅参数效率更高,样本效率(Sample Efficiency)也更好。这在某种程度上是在一个可控的小型模型上复制了在大模型中观察到的涌现现象。
Michal: 补充一下 Kevin 刚才提到的点。我们在语言模型和图像生成模型中,通过加深网络和增大规模看到了明显的性能提升,这非常直观。 因此,我们的工作借鉴了基础性的前沿研究,比如使用残差连接来避免梯度消失(Vanishing Gradients)的残差网络。 在论文附录的消融实验(Ablation Studies)中,我们展示了移除残差连接后的对比。我们本质上是借用了其他领域的成熟概念,并将其成功应用到强化学习中。
Swyx: 在 Ben 离场之前,我想把最后一个问题交给他。这项研究为你后续的工作带来了哪些新的启发?
模糊的界限:自监督与强化学习的融合
Ben: 在回答这个问题之前,我想先对这篇论文做个澄清。很多读者看到标题可能会觉得:“哇,大网络太棒了,把大网络用到我的算法里就解决问题了。” 他们可能会尝试将深层网络直接套用到近端策略优化(Proximal Policy Optimization, PPO)或软演员-评论家(Soft Actor-Critic, SAC)等常用的强化学习算法中。但这阻碍了对其核心结论的理解。 加深网络不仅需要这些架构技巧,更关键的是如 Kevin 之前提到的,它需要一种全新的目标函数(Objective Function)。这个目标函数实际上并不依赖奖励(Rewards)。
“在我们的代码中,没有一行是写着‘在此处最大化奖励’的。这到底还算不算强化学习方法?我不知道。” "Our code doesn't have a line of code saying maximize rewards here. And so is at the end of the day, this a reinforcement learning method? I don't know."
▍点拨:这揭示了该论文获评 NeurIPS 2025 最佳论文的核心精髓:将强化学习的本质从“通过回归逼近奖励分布”改变为“自监督下的目标状态空间表示学习”。模型不学习如何拿分,而是学习如何表达世界和目标,任务的解决最终变成了二分类问题。
目标分类:将时序差分回归问题转化为二分类判定
所以标题中的“强化学习”一词在某种意义上有些误导,因为我们并没有直接去最大化奖励。在我们的代码中,没有一行是写着“在此处最大化奖励”的。 这到底还算不算强化学习方法?我不知道。它其实更接近机器学习其他领域中的自监督学习(Self-Supervised Learning)方法。因此,这项工作确实处于强化学习和自监督学习研究的交叉地带。 我们在海报左下角贴了一张 Yann LeCun 演讲幻灯片的截图,他在其中讨论了构建智能系统的途径,究竟是依赖无监督学习,还是监督学习加强化学习。我们的论文表明,这两者之间的界限非常模糊,未来的关键或许在于融合这几种方法的优势。
Swyx: 确实如此。非常感谢 Ben 的时间,我知道你待会儿还有事,谢谢你的参与。 关于“模糊界限”的见解非常有意思。你提到的自监督与强化学习的结合,是否触及了表示学习(Representation Learning)的抽象层?这是否是你们发现的某种根本性规律,或者说,是读者在阅读论文时最容易忽略的地方?
“我们从根本上把学习的负担从 Q学习或时序差分误差的回归问题——这被证明是非常不稳定、多噪且存在偏差的——转化为了一个分类问题。” "We're fundamentally shifting the burden of learning from something like Q-learning or regressing to TD errors, which we know is quite spurious and noisy and biased, to fundamentally a classification problem."
▍点拨:传统的强化学习算法(如基于 TD 误差的方法)非常依赖回归拟合。当网络加深时,回归目标的微小偏差会在多层传播中被无限放大并导致发散。本研究证明,将回归转化为对轨迹未来状态是否契合目标的“二分类判定”(交叉熵损失),能够利用分类任务天然的泛化稳定性,使深层架构的学习过程变得极具鲁棒性。
Kevin: 传统的强化学习很难进行有效扩展。那为什么引入这种自监督目标的强化学习就可以呢? 因为我们从根本上把学习的负担从 Q学习(Q-learning)或时序差分误差(Temporal Difference errors, TD errors)的回归问题——这被证明是非常不稳定、多噪且存在偏差的——转化为了一个分类(Classification)问题。 我们只是在分类判断某个未来状态是处于当前的轨迹上,还是属于其他轨迹。我们通过表示学习来达成这一点。
在深度学习文献中,分类、交叉熵损失(Cross-Entropy Loss)以及表示学习被证明是极具扩展性的。比如语言模型中使用的很多目标函数都是这个原理。 在某种程度上,我们模糊了界限。我们依然在做强化学习,这仍然是一个演员-评论家(Actor-Critic)的框架,也是一个目标条件强化学习(Goal-Conditioned Reinforcement Learning, GCRL)算法。 但解决强化学习任务的学习负担,已经转移到了类似于语言和视觉领域中成熟的目标函数上。这使我们能够将强化学习网络扩展到 1000 层的惊人深度,远远超出了常规强化学习所能承受的极限。
机器人学的自主进化与目标条件强化学习
Michal: 我可以补充一点关于架构的细节。我们虽然使用了对比损失(Contrastive Loss)等不同的目标函数,但在网络架构上,我们其实与之前的 SimBa(SimBa 架构)等工作十分相似。 我们对这些架构做了一些微调,所以并不是从头去重新发明轮子。真正带来质变的是网络架构与特定学习目标(Objective)的完美融合,这才是推动模型能力随规模扩展而提升的关键。
Swyx: 这确实值得深入探讨。目前你们已经在多种网络架构和数据集上进行了测试,你认为哪些领域或行业是这项技术最直接的落地应用方向,也就是所谓的“低悬的果实”?
Kevin: 我们的实验任务大多集中在机器人领域。我很期待这项研究能如何改变机器人行业。 目前机器人训练有几种主流路径:一种是模仿学习(Imitation Learning),这需要收集海量的示范数据,依赖大量的人工监督,然后通过这些行为数据来训练模型。 而另一种路径是目标条件强化学习(Goal-Conditioned Reinforcement Learning, GCRL),它能让机器人在完全没有人类监督和示范的情况下,自主通过强化学习来解决复杂的任务。
从数据扩展转向架构扩展:效率与权衡之问
Swyx: 没错,这样显然更具扩展性。
Kevin: 是的,这提供了一个极佳的替代方案。与其花费大量精力去扩展数据和人工标注(这往往是扩展的瓶颈),我们或许可以通过优化目标函数来扩展网络架构。 看到这种通过扩展架构和优化学习目标来赋能智能体的方法能为机器人行业带来改变,是非常令人兴奋的。
Swyx: 我想再深入探讨一下关于效率的问题。常理来说,网络越深,计算延迟和复杂度应该会呈二次方恶化,但你们似乎得出了不同的结论?我对这部分的既有文献不甚熟悉,只是根据直觉推导。在这其中有哪些需要提醒读者的权衡与限制?因为你刚才特别提到了效率。
▍效率极限的第一性原理:从效率的第一性原理出发,普林斯顿团队对“宽度(Width)”与“深度(Depth)”的扩展对比具有极强的工程指引意义。宽度扩展由于网络全连接层之间的矩阵运算导致参数量呈二次方增长,极易引起过拟合和计算开销过大;而深度扩展使参数量呈线性增长,有利于层与层之间特征表示的层次化剥离。在计算和存储资源受限的硬件边界下,优先选择加深(Depth)能够带来更高的样本效率与参数效率。
JAX 与 GPU 加速下的海量数据 Rollout
Michal: 针对这个问题,我们可以看一下海报和论文中的图表。我们对比了网络在“加深(Depth)”和“拓宽(Width)”两个维度下参数量的增长情况。 以我们最基础的架构为基准,其宽度为 256(即隐藏层有 256 个神经元),深度为 4 层隐藏层。 当沿着“深度”方向扩展时,模型的参数量呈线性增长;而如果沿着“宽度”方向扩展,因为每一层的输入和输出同时在变宽,参数量的增长是二次方的关系。
在实验中,我们控制了参数总量,对比了这两种不同的扩展方式。结果表明,在相同参数规模下,沿着深度扩展的性能曲线提升更为陡峭。这正是论文中的核心发现。 而宽度扩展的性能提升则慢得多。因此,如果你的计算资源有限,优先选择加深网络是更明智的,因为它能以更少的参数获得更好的性能。 宽度在计算上是非常昂贵的。当然,参数总量增加意味着整体计算成本都会上升,这是在使用这些网络时需要权衡的另一个基本维度。
Kevin: 谈到权衡和局限性,最显而易见的一点是网络越大,运行时间就越长。深度翻倍在某些情况下可能意味着前向传播(Forward Pass)的延迟也会翻倍。 但在很多实际环境中,尤其是强化学习中,数据收集通常才是主要的瓶颈,前向传播本身并不是瓶颈。在我们的实验中,很多任务甚至不需要 1000 层,可能 64 层就已经足够让性能达到饱和。在这种情况下,网络的延迟并不是大问题。
另外,我们在研究中使用了基于 GPU 加速的 JAX 强化学习环境——JAX-GCRL(JAX-based Goal-Conditioned RL)。 这使我们能够并行收集数千条环境轨迹,从而确保有充足的数据来支撑大型网络的学习,避免数据成为训练的瓶颈。
Swyx: 明白了。对于大多数习惯了 PyTorch 而对 JAX 不是很熟悉的读者,你们能否再展开讲讲这套基于 GPU 加速的环境?
Michal: 没错。JAX 正在受到越来越多的关注,尤其是在强化学习领域。因为对于在线强化学习(Online RL)而言,尽可能获取海量数据是至关重要的。
Swyx: PyTorch 应该也有类似的生态。对于那些也想尝试这种大规模 rollout 训练的同行,你们有什么实用建议吗?
Michal: 对于目标条件强化学习,我推荐使用 JAX-GCRL,另外也可以尝试多智能体 JAX 实现。 回到我们的论文,如果仔细看图表,你会发现只有当收集的数据超过 5000 万次状态转移(Transitions)这个门槛后,超深网络才会展现出巨大的性能优势。所以充足的数据量确实是关键。
▍JAX 在强化学习中的统治力崛起:在 2025 至 2026 年期间,JAX 在学术界强化学习研究中的普及率显著提升。传统的 PyTorch 加上 CPU-GPU 异步 Rollout 在数据收集上非常缓慢。而使用 JAX 可以将整个物理环境(如 MuJoCo)及 Policy 同时运行在 GPU 上,实现数千个并行 Rollout。这不仅抹平了数据收集的瓶颈,更使得 5000 万次状态转移(Transitions)这样的超大规模训练在单卡上几小时内即可完成,奠定了 RL1000 的工程基础。
隐式世界模型与推理阶段的“深师浅友”蒸馏
Kevin: 补充一下。这其实和深度学习其他领域的成功非常类似。例如在大语言模型(LLM)中,之所以能够训练如此巨大的网络,是因为我们找到了可以利用整个互联网数据规模的自监督训练范式。在传统的强化学习中,数据往往非常稀缺且难以获取。但在 GPU 加速的环境下,我们可以在几小时内收集数亿级别的交互数据。
这为我们研究如何通过扩展网络容量来获取类似的性能红利,提供了一个极佳的试验田。
Swyx: 你是说你们在预训练的方法上与语言模型有本质区别吗?你们使用的具体目标函数是什么?在语言模型中,大家熟知的范式是预测下一个词或 Token(Next-Token Prediction),这非常有效。你们是如何改造这一目标的?
Kevin: 我们并不会去改变它,而是希望借鉴语言模型的思想,将其合理应用到强化学习中。
Swyx: 我倒觉得你们或许应该反过来思考。
Kevin: 反过来思考?这确实也是个很有意思的研究方向。 其实,我们强化学习的目标函数在某种意义上虽不是直接预测下一个词,但非常类似于“下一个状态预测”。在给定的当前状态和当前动作下,我们预测某个特定状态是否属于同一轨迹的未来状态。 这实际上是在进行一种隐式的世界模型(World Model)构建。在语言模型中,是通过交叉熵损失对下一个 Token 进行分类;而在我们这里,则是通过二分类来判断未来的状态。这两者有很强的相通性。 我们应该更深入地去探寻是什么促成了深度学习的规模化扩展,然后将这些核心逻辑提炼出来,应用到包括语言和强化学习在内的各个领域。
Swyx: 明白。昨天在海报展区,我听 Ben 教授也向人解释过这一点。 由于算法在进行表示学习,为给定的状态-动作以及目标学习有意义的表示,这在某种程度上相当于在隐式地学习环境或世界的运行模型(World Model),而不需要去进行高维且复杂的“下一帧图像预测”等操作。
Michal: 没错。我们试图推进的角度正是:与其直接去——
▍超深网络部署的隐性壁垒与延迟:虽然 1000 层网络在训练时表现优异,但在实际机器人或者嵌入式端侧(如自动驾驶芯片)进行边缘推理(Edge Inference)时,前向传播的毫秒级计算延迟是极其致命的。1000 层的网络层数会导致串行计算延迟剧增。这也就是为什么在实际落地中,必须使用“深层教师与浅层学生”的知识蒸馏技术,否则超深网络将因推理延迟过高而根本无法用于高频控制闭环。
Swyx: 预测下一个世界的状态,不如生成若干候选状态并对它们进行分类。这就像玩扑克时,根据对手的动作分类判断其手牌的范围,信息越多,分类就越精准。这就是表示学习去理解世界运行逻辑的终极视角。 但与视频生成领域那些具象的世界模型相比,这种隐式表示可能稍微抽象了一些。
既然提到深层模型在推理(Inference)时更慢且成本更高,现在的工业界趋势是让推理模型变得更扁平、更浅。 我联想到了一个概念:“深层教师与浅层学生”(Deep Teacher, Shallow Student)。这是否会成为未来一种很好的部署范式?也就是用超深网络去探索能力的上限,然后将其知识蒸馏(Distill)到小模型中。
Kevin: 确实如此!这正是我们在项目网站底部列出的未来研究方向之一。 我们在 JAX-GCRL 的目标条件强化学习任务中取得了显著优于前沿水平(SOTA)的性能。能将强化学习智能体的训练上限推向新的高度,是非常令人振奋的。 如果我们能通过蒸馏等方式,在推理时达到同样高效的水平,那将是非常完美的成果。毕竟,用于训练的模型不必与最终部署推理的模型完全一致。
拼接技术与多轴向联合扩展的未来
Swyx: 没错,这样就能在部署时兼顾性能与效率。
Kevin: 是的,如何将知识蒸馏到更小的模型,或者对模型进行剪枝(Pruning)并保持性能不衰减,是一个非常有价值的研究课题。
Swyx: 让我们聊聊其他的未来研究方向。你们个人最感兴趣的领域是什么?
▍强化学习中的“拼接”技术 (Stitching in RL):拼接是离线强化学习(Offline RL)中的核心能力。当智能体只能接触到静态的数据集(例如包含多条简短、片段式的子行为轨迹),它需要通过值函数或表示对齐,将这些零散的轨迹“拼接”成一条完整的、能够从起始状态通往目标的最佳路径。本论文探讨的极深网络能够显著提升状态表示的连续性,从而在测试阶段将不连贯的子策略融合成复杂的全局行为。
Michal: 我目前正在研究强化学习中的“拼接(Stitching)”技术。我们尝试将智能体学到的简短的子行为进行泛化,并在测试阶段将它们拼接融合起来。这应该是我在攻读博士学位期间的最后一篇论文了。我个人非常希望能够尽可能探索并推进这个研究前沿。
Kevin: 另外,在我们的论文中虽然重点探讨了深度扩展,但也注意到增加宽度同样能提升表现。 而且我们发现,通过加深网络,实际上也为我们解锁了扩展批次大小(Batch Size)的空间。
Swyx: 这就像是多个维度之间存在着协同共线关系。
Kevin: 没错。在传统的强化学习(比如值函数方法)中,扩大批次大小通常起不到太大的作用。 但深度学习其他领域的研究表明,只有当网络容量(Network Capacity)足够大时,扩大批次大小才能充分发挥其优势。 因此,强化学习中批次扩展无效的一个假说就是:过去使用的网络太小了,无法捕获并消化大批次带来的丰富信号。我们的工作成功实现了极深网络的训练,这提供了一个极佳的试验台来验证这个假说。 实验证实,随着网络容量的扩大,扩大批次确实能够带来额外的扩展收益。
因此,我非常期待有足够计算资源的同行能在这个环境下,同时将深度、宽度和批次大小推向极致。 就像大语言模型在多个轴向上进行同时扩展一样,我们是否也能在强化学习中解锁不同维度的扩展法则?这能将强化学习智能体的训练上限推到多远?
Swyx: 你们刚才提到“足够的计算资源”,你们在实验中具体的计算预算是多少?我想了解一下你们的软硬件开销。
Kevin: 我们希望这项研究能保持高可获得性。非常棒的一点是,我们所有的实验,即使是 1000 层的网络,也完全可以在单张 80GB 的 NVIDIA H100 GPU 上跑通。
视觉-语言-动作模型在具身智能中的应用前沿
Swyx: 那这笔开销确实是在可承受范围内的。
Kevin: 是的,所有内容都能在单张 GPU 上完成。不过,如果有了分布式训练(Distributed Training)环境,能够投入更庞大的计算资源去挑战极限,结果肯定会更加令人期待。
Ishaan: 我最近也在努力学习关于“视觉-语言-动作模型”(Vision-Language-Action Models, VLA)的知识,并探索这些表示学习方法在机器人学(Robotics)中的应用,正大量研读文献并与同行交流。
▍动作空间(Action Space)在 AI 产业化中的失落与重构:自 2023 年以来,大语言模型(LLM)的繁荣让文本生成(Text Generation)与工具调用(Tool Calling)主导了产业界。绝大多数智能体(Agents)实际上只是在结构化文本的框架下进行离线决策。但对于具身智能(Embodied AI)和机器人而言,它们必须直面物理世界中连续或复杂的动作空间输出。普林斯顿团队在极深网络和对比学习目标上的尝试,为打破“结构化文本套壳”的局限、直接在底层构建泛化的物理控制动作输出提供了极具启发性的思路。
Swyx: 巧的是,我们刚发布了一期关于 Genuine Intuition 的节目。他们起初是一家游戏视频剪辑公司,后来开发了视觉-语言-动作模型,我看了演示,非常令人惊叹。虽然目前还不确定这套模型向具身智能(Embodied AI)应用迁移的效果如何,但仅用于屏幕任务已经足够强大。
目前在工业界中,“动作(Action)”作为模型的直接输出似乎并不太流行,这主要是因为文本生成完全主导了过去三年的大模型发展,而工具调用(Tool Calling)本质上也只是另一种结构化文本。 我很好奇要解锁以“动作”为核心的下一阶段研究,还需要跨越什么障碍?你们在现场有看到什么有启发性的进展吗?
Ishaan: 现在有很多利用预训练视觉-语言模型(VLM)的优秀工作。比如保持其权重冻结,然后在其基础上构建一些专家策略来输出具体动作。 或者构建分层规划(Hierarchical Planning)系统,让大模型先输出高阶计划,由于大模型推理较慢,这个计划是以较低频率输出的;然后由一个运行更快的二级系统去执行具体的底层动作。这个方向有很多非常有前景的研究。
Swyx: 最后一个问题。在海报展区,被问到最难回答的问题是什么?或者遇到了什么有趣的人吗?
Kevin: 其实我还没怎么来得及逛展。我已经开始全职工作了,就在来录音的几分钟前我才刚刚领到我的参会证。所以这个问题我可能不太适合回答。
Swyx: 不过在海报展示时,应该有不少人向你提问吧?
Kevin: 确实。大家普遍觉得这篇论文非常有启发性。因为它的核心自监督目标非常简单且优雅。 我们成功挑战了“强化学习网络无法有效扩展”的传统共识,将其扩展到了 1000 层的深度,并且性能依然能随着深度增加而持续提升。 大家的共识是,如果能沿着这个方向继续深入,在更多维度上进行纵深扩展,将会极大推高强化学习的上限。我也非常期待后续的发展。
Swyx: 好的。非常感谢你们能抽出时间来到节目,再次恭喜你们的论文获奖,也祝你们未来的研究工作一切顺利。谢谢。
本期对话收敛出以下 3 个关键判断与行动原则:
- 深度不只是参数数量的累加,更是表示抽象能力的阶跃:在解决非平稳或多目标任务时,应优先考虑使用具有残差连接和层归一化的深层架构,而非简单堆叠宽度的浅层网络。深度能带来层次分明的特征剥离,以线性参数增长换取超越二次宽度扩展的样本效率。
- 摆脱对人工奖励工程(Reward Engineering)的依赖,转向自监督表示目标:复杂的强化学习系统设计中,人工设计奖励函数极易导致“奖励作弊”和策略退化。应当探索自监督表示学习(如对比学习分类),将时序差分回归问题转化为目标状态空间的二分类判定,彻底释放强化学习的泛化能力。
- 构建高吞吐量模拟器是算法规模扩展的工程前提:没有丰富且廉价的数据,再大的模型容量也会发生崩溃。必须先从底层重构数据流(如使用 JAX 将环境运行在 GPU 上),抹平数据瓶颈。确保单机可以在几小时内产生数千万次状态转移(Transitions),从而支撑极深网络跨越其扩展临界点。