执掌IMO金牌、深度思考与在策略RL (Yi Tay)
本期对话 Google DeepMind 新加坡 Reasoning and AGI 团队负责人 Yi Tay,回顾端到端 Gemini 拿下 IMO 金牌的全过程,并深入探讨在策略 RL 哲学、推理与潜在思考、AI 编程、注意力架构、数据效率与世界模型、DSI 生成式检索,以及 GDM 新加坡的建队与招聘哲学。
本文译自Latent Space 播客,发布于 2026 年 1 月 23 日,由 Swyx 主持,对话 Google DeepMind 新加坡 Reasoning and AGI 团队负责人 Yi Tay。作为 2025 年 IMO 金牌项目的四位联合负责人之一,Yi Tay 在本期系统回顾了团队放弃 AlphaProof 专用系统、以端到端 Gemini 模型拿下 IMO 金牌的全过程,并深入讨论在策略(On-Policy)RL 哲学、宝可梦长程智能体、推理与潜在思考、AI 编程、注意力架构与硬件彩票、数据效率与世界模型、DSI 与生成式检索,以及 GDM 新加坡的建队与招聘哲学。
▍嘉宾 Yi Tay,Google DeepMind 新加坡 Gemini 团队(Reasoning and AGI)负责人,2025 年 IMO 金牌项目四位联合负责人(co-captain)之一。他此前是 Reka 联合创始人兼首席科学家,更早任职于 Google Brain,是 PaLM 2 架构联合负责人,曾参与 UL2、T5 与 DSI(生成式检索)等工作。
▍关于 本期对谈是 Yi Tay 时隔一年半重返播客。与上次在 Reka 时期不同,这次他回到 Google DeepMind 并在新加坡组建团队,身份也转变为 IMO 金牌项目的联合负责人。节目中他详细拆解了在策略与离策略之争、一周内训出 IMO 模型的幕后、四位负责人跨时区"交接棒"的工作方式,以及他对推理、架构、数据效率、世界模型等研究前沿的判断,最后落在 GDM 新加坡的建队思路、招聘哲学与他的健康管理上。
开场:重返 GDM 与 Reasoning and AGI 团队
Yi Tay: 我觉得这些模型总体上最有用的一点是:我手上有一大张装满实验结果的电子表格,我想给它画图,就直接截个图丢给模型,让它"帮我画个图"。我特别讨厌写 matplotlib 那些东西,太烦人了。今年有很多个时刻,AI 突然跨过了那种"涌现"的门槛。为什么?AI 编程就是其中之一,就像我们刚聊到的。还有 Nano Banana 也到了那个程度——以前你用这类模型生成图片,基本就是图个乐、整整朋友什么的,但 Nano Banana 是真的变得特别好了。
Swyx: 欢迎回来。最近怎么样?
Yi Tay: 挺好的,挺好的。
Swyx: 回来真好。已经有一年、一年半了。
Yi Tay: 对,一年半了。
Swyx: 感觉过了很久。上次我们聊的时候,你还在 Reka。然后你又回到了 Google DeepMind(GDM),又跟着 Quoc 干了。
Yi Tay: 对。
Swyx: 最近你又在搞 GDM 新加坡。是叫 GDM 新加坡还是 Gemini 新加坡?不知道你们团队正式起名了没有。
Yi Tay: 我想我们在新加坡有一个 Gemini 团队。
Swyx: 对,新加坡的 Gemini 团队,名字叫"推理与 AGI"(Reasoning and AGI)。
Yi Tay: 对,Reasoning and AGI。
Swyx: 名字里带上 AGI,重要吗?
Yi Tay: 把 AGI 放进去主要是一种氛围(vibe)上的事。
Swyx: 嗯。
Yi Tay: 我们做这些模型的原因之一,就是我们想抵达 AGI。把 AGI 加进招聘启事里,也只是一种氛围上的表达。目前还没有正式的团队名称,但实质上就是 Gemini 新加坡团队。
Swyx: 我觉得大家都在琢磨、在互相参照:Amazon 有个 AGI 团队,你们有个 AGI 团队,然后 Meta 现在又有个超级智能(Superintelligence)团队。大家给团队起这些名字的时候,到底在释放什么信号?是"我们真有一个计划",还是纯粹的氛围?
Yi Tay: 你这是想从我嘴里套点暴论出来。
Swyx: 不是,你的职位头衔里可是官方写着 AGI 的。
Yi Tay: 不,那不是一个正式的名字,也不是团队名。我们只是想表明那颗北极星——我们要把这个模型做到 AGI。
Swyx: 好吧,我真不是在套话,不谈政治。说回来,你重新加入了 GDM。
Yi Tay: 对。
Swyx: 我把上次那期完整重听了一遍,非常精彩。上次你讲到,你当时从 Google Brain 出来,现在又回到了 GDM。
Yi Tay: 对。
Swyx: 我很好奇,重新接回 Google 的基础设施,你总体上有什么感受?
Yi Tay: 回来这件事很有意思,因为回到 Google 的感觉就像——你的 LDAP、你的用户名,全都还在原样。就像你玩宝可梦(Pokémon),放下一阵子,再回来点"继续游戏",读取存档接着玩,就是那种感觉。当然,我离开的一年半里,很多东西变了,Brain 现在并入了 GDM 之类的。所以确实有很多变化,但总体来说回归非常顺滑。我本来就很喜欢 Google 的基础设施,TPU 也很棒。总之很高兴能回到 Google 的技术栈。
Swyx: 你回来的时候就打算做深度思考(Deep Think)吗?
Yi Tay: 并没有。我那时非常想念研究——不是说特别基础的研究,而是贴近模型的研究。我真的很怀念站在前沿、并试图越过前沿的感觉。所以我特别想念那个状态。我回来的时候,Deep Think 还不存在,我觉得也没有任何相关计划,就是先回去做研究,看看会发生什么。
Swyx: 但我猜应该是有某种倾向的:推理(Reasoning)是下一个前沿,而且这显然是最有回报的研究方向,尤其是今年。
Yi Tay: 对,如今推理和强化学习(RL)基本就是一回事——推理很大程度上来自 RL。我过去花了很多年做架构和预训练(Pre-training),我管那叫"前世"。但现在我更多转向了 RL 研究——不是老派的 RL,而是面向智能体的 RL,老派 RL 是另一回事。说实话,我回来的时候几乎没有 RL 背景。但如今 RL 是主要的建模手段,所以重新上手其实挺容易的。研究里的很多基本功是通用、普适的,即使在一个你不太熟悉的工具集里,要做出创新也并不难。总之,RL 基本就是我们现在日常摆弄的主要建模工具集。
在策略 RL 哲学:从蒙特梭利到学习率
Swyx: 表面上看,你在 UL2 和 T5 的工作里,对目标函数(objective)的关注、对"你到底想激励模型学什么"的关注,跟现在是有一些重合的。我本来会猜重合度比你说得更高,不过这挺有意思,我理解你的意思。
Yi Tay: 目标函数确实是目标函数,两者是有些重合。但关键的区别在于设计这些东西时的在策略(On-Policy)与离策略(Off-Policy)之分,这也会改变学习算法本身。
Swyx: 给不熟悉这套 RL 术语的听众简单解释一下吧。我确实觉得很多人都在试图理解:这一代 RL 研究到底什么在起作用。对了,Jason(Jason Wei)有篇很有意思的文章,我记得你也是认同的——核心观点是:你永远应该保持在策略上,而不是模仿别人的成功轨迹;采取你自己的动作,从环境给的奖励中学习。说白了就是修正自己的路径,而不是试图复制别人的路径。
Yi Tay: 对,对。
Swyx: 首先,他写得真的很好,我希望更多人像他那样写。不知道你对此有什么感想,或者有什么要补充的?
Yi Tay: 在策略和离策略最大的类比是:离策略基本上就是你做监督微调(SFT)的时候——你拿来一些别的模型、更大的模型生成的东西,说白了就是用别人生成的输出、轨迹什么的。而在策略是现代大模型 RL 的核心思想:让模型自己生成,然后根据它自己的生成结果给它奖励,再让模型在自己的生成结果上训练。所以从某种程度上说,这有点像自蒸馏(Self-Distillation):模型生成自己的输出,你给它奖励,再让它在自己的输出上训练。"在策略性"(on-policy-ness)基本就是这么个理念:模型在自己的输出上训练,让模型生成自己的轨迹,再让某种奖励来验证它,然后模型在自己的输出上继续训练。我认为这总体上更具泛化性。关于 SFT 和 RL 之间的差距,仍然有很多科学问题有待研究,但说白了就是在策略与离策略之分。把这个类比带回现实生活:在策略性更像人类——我们更像是在策略的,我们在世界里闯荡,犯错,然后"啊,好吧,原来是这样"。而模仿学习(Imitation Learning)大多不是第一性原理的:别人告诉你该怎么做,然后你照抄。所以,把这种哲学带回生活,是相当有力量的。我现在有孩子了,我希望我的孩子自己去尝试,然后你告诉他:这一步哪里错了、哪里做对了——而不是"你就照抄别人做的一切"。
Swyx: 蒙特梭利(Montessori)教育基本就是这样,对吧?非常非结构化的学习,你自己探索自己的路径,我们只是给你一个安全的环境去做这件事。那么,应该在什么时候从模仿切换到在策略?我自己在这个问题上也是反复摇摆。
Yi Tay: 你说的是人类,对吧?不是模型?
Swyx: 在模型上,似乎一直有一条很明确的路:先模仿——也就是预训练——最后再上 RL。
Yi Tay: 严格说 SFT 仍然是模仿。但对人类来说,确实也有这么一点味道。拿运动来说吧:你做一项运动,一开始是硬核模仿——我不知道这个类比好不好——看大量教学视频之类的东西更像模仿,你试着学会某些动作。但在策略性就像是亲自上场比赛,从比赛中获得奖励信号。所以我认为人类确实需要某种形式的模仿学习,每个人都是先模仿起步的。不过话说回来,人类和模型之间——做类比是好玩,但我们不该太当真。
Swyx: 其实我还挺认真的,我是那种会把机器学习的洞见认真套用到人类学习上的人。
Yi Tay: 我们现在就是从模型身上学东西。
Swyx: 因为我认为机器学习是人类有史以来研究"学习"这件事最科学的方式。
Yi Tay: 这倒是真的。
Swyx: 在机器学习里,我们得从零发明课程(curriculum)。
Yi Tay: 对,确实。
Swyx: 还有学习率(Learning Rate)这种东西:学习率太高会怎样怎样,太低又怎样怎样。
Yi Tay: 人类真的有学习率吗?
Swyx: 我确实会告诉别人,要意识到自己有一个学习率,并且警惕它过低。比如说,如果你错了一次,你应该问:我还在哪些地方错了?通常来说,人们在发现自己错了之后,更新得比应有的慢。
Yi Tay: 那叫什么?固执?
Swyx: 可能是固执吧,我不知道这个词对不对。也可能是他们太贝叶斯了——实际上他们的先验假设就是错的,需要把之前的假设整个扔掉,因为一个反例就可以让全部既往经验失效:你的整个世界模型(World Model)都是错的,扔掉它。所以贝叶斯式更新反而是错的。假设你在某种假设下生活了十年,然后出现一个打破你叙事的例子,你不该想"好,那我更新 2%"——不,你应该想:"一定是出了什么大变化,我过去十年假设的一切可能都是错的。我还在哪些地方错了?"然后更新 20%、更新 50%,而不是 2%。这就是我的"学习率"理论。我自己的直接例子就是进入 AI 这行的经历:我看了十年的 GAN——有十年吗?2012、2013 年开始。
Yi Tay: 时间过得真快。
Swyx: 对,我一直在看 GAN,心想:挺酷,细节越来越多了,但也没那么惊艳。然后突然之间 Stable Diffusion 出来了,而且能在笔记本上跑。那就是我的学习率时刻:靠,我关于生成式图像的心智模型里根本不包括这种东西。所以我意识到:我错得很离谱,我需要把一切转向。Latent Space 就是这么开始的。
Yi Tay: 所以这说明你的学习率高?
Swyx: 对,我会把它往上调。因为一个世界模型被推翻了,所以我会重新安排自己的学习节奏。
Yi Tay: 我觉得这是个好策略。这也引出一个话题:当新范式出现时,人们采纳它的速度有多快,或者说推翻自己既有理解的速度有多快。作为科学家,随着领域的进展,我们确实常常必须不断推翻自己的世界模型——可能长期以来你一直认为某件事就该这么做,然后突然冒出一个东西把它推翻了。
Swyx: 你可以为你的先验非常自豪,直到它变成你的监狱——那其实很危险。好吧,这有点跑题了,不知道我们怎么聊到这儿的。你之前推荐过 Denny(Denny Zhou)关于大模型推理的讲座,他梳理了 LLM 推理的思想史,从思维链(Chain of Thought)一路讲到强化学习。我还想顺带问一下自洽性(Self-Consistency)——这个概念大家大概都知道。我觉得 OpenAI 的实现比你们的粗糙,他们就是直接跑八次推理,然后投票或者让评判器来判之类的。但我确实认为这跟在策略蒸馏也有关系:八条不同的路径,全部来自同一个模型。你帮我验证一下我的直觉:你刚才说的"为什么在策略很重要",再加上用一个外部验证器来改进推理——这事用并行推理其实也能做。
Yi Tay: 对。我们训练 RL 模型的时候,本来就会采样多次。所以某种程度上确实包含某种形式的自洽性。
Swyx: 那直接就是自洽性,对吧?
Yi Tay: 自洽性要更……更细腻的版本是——你跟 Denny 聊的话,他会告诉你,它肯定不是简单多数投票,而是更……
Swyx: 我同意。
Yi Tay: 对,它是更细腻的版本。不过我认为并行思考(Parallel Thinking)确实跟自洽性有关。
Swyx: 说到这个,OpenAI 其实也发过几篇有趣的论文,讨论多数投票和其他形式的多输出共识。最高级的做法是用一个真正的大模型评判器(LLM Judge)来判定:基于某种内部一致性、或者直接检视思维链,这条轨迹确实更有价值、更站得住脚。我们能训练模型来做这件事,这本身就很酷。
Yi Tay: 当然。自洽性是一个重大的基础性思想。思维链本身也是一个大思想,自洽性同样是现代 LLM 文献里的一个重大基础思想。
IMO 金牌:一周训出的端到端模型
Swyx: 好,那我们进入正题。这期播客的头条之一大概就是要深入聊聊国际数学奥林匹克(IMO)的事。时间大概是五月、三月……七月,你们官宣了。这里有一张很棒的照片——我刚才一直在看——应该是在伦敦拍的,你们去了 Dishoom(那家餐厅)。
Yi Tay: 对,Dishoom。哈,你得出现在合影里才能算拿到功劳(credit)。
Swyx: 这也太扯了吧?搞什么?
Yi Tay: 开玩笑的,开玩笑的。
Swyx: 贡献者名单可比这照片长多了。
Yi Tay: 对对,不过他们当时就在说,"哦,你应该去……"
Swyx: 才能拿到一块字面意义的金牌。
Yi Tay: 不是不是,是说要想在 IMO 项目的贡献名单里挂上号、名字排进去,得如何如何。就是个玩笑。
Swyx: 好吧。你能讲讲这个 IMO 项目的故事吗?据说只用了一周就做完了。
Yi Tay: 让我先把一些事情讲清楚。
Swyx: 好。
Yi Tay: IMO 这个方向的投入其实已经持续很久了。Thang(Thang Luong)、还有 Quoc,去年就一直在做这件事。去年他们拿了银牌——那会儿我还没回 Google——他们有 AlphaGeometry 那套东西,还有 AlphaProof。所以这是一条延续了很久的路线。但今年我们想尝试的是:真正把 Gemini 作为一个端到端(End-to-End)模型来用。
Swyx: 不再有第二套系统。
Yi Tay: 没有第二套系统,就是一个端到端模型。
Swyx: 即便这个决定本身也很反直觉。我报道过去年的银牌成绩,当时我想:离金牌就差一分,再努把力不就拿到了?所以放弃那条路线的决定,我觉得相当大胆。
Yi Tay: 我个人一直相信——事后诸葛亮当然好当——但这有点像是:如果模型拿不到 IMO 金牌,那我们还能到 AGI 吗?所以在某个节点上,我们必须让这些模型去闯一闯奥林匹克竞赛。今年的目标之一就是:好,我们要做一个端到端的模型。这也是我参与进来的契机。我其实只参与了模型训练那一段——得说清楚,IMO 这件事大部分是 Thang 做的,我只是和一队人一起把模型训出来。我们做的事情就是为真正的 IMO 比赛准备好模型检查点(checkpoint)。这也是 IMO 这件事容易被忽视的一点:很多时候你刷基准测试(benchmark),是可以一直跑、一直迭代、一直爬山(hill climbing),直到刷上去为止。但 IMO 是一场现场比赛:团队里一些成员人就在澳大利亚,事情正在现场实时发生。
Swyx: 很有 AlphaGo 的感觉:你拿到赛题,把它输进系统,然后……
Yi Tay: 对对对。Thang 团队的一些教授亲自去了 IMO 现场——我也不知道 IMO 算不算"会议",反正澳大利亚那边有人。这是现场直播式的事:有人的工作就是对放出来的 IMO 第 1 题到第 6 题跑推理,而且这些题是分不同天放出来的,第一天一套、第二天一套,类似这样。最好玩的是,我对 IMO 一无所知,我小时候没参加过 IMO,我当年没那个水平——我是弹钢琴的。我只知道的是:好,我们交付了检查点,那个检查点被用来拿到了 IMO 金牌。然后在伦敦有那么一周,所有人聚在一起——大家都飞去了伦敦,那张照片就是在那儿拍的。你能看到各个部分如何拼到一起,还能跟其他几位联合负责人(co-captain)待在一个屋子里,感觉有点像黑客松(hackathon)。所以,这个 IMO 模型的训练过程本身大概就一周左右,而不是整个项目从头到尾。
扔掉 AlphaProof:一个模型吞并一切
Swyx: 我真正的问题是:我还是没放下"扔掉 AlphaProof"这个决定。
Yi Tay: 嗯。
Swyx: 我觉得这非常重大。我理解你们有 AGI 这个目标,显然在某个节点上,一个模型应该包办一切。但如果你在 2024 年拿枪指着我说:要做 IMO、IOI、ICPC 和你们做成的所有这些事,需要什么?我会说:你需要一个会操作电脑、会写 Lean、会跑 Lean 验证器的大模型推理系统。而你们实际上是把 Lean 验证器揉进了思维链里——这件事能做到,本身就完全不显然。
Yi Tay: 所以你的意思是:这些东西以某种方式被编码进了模型里?
Swyx: 对。
Yi Tay: 说到底,就是你是否相信"一个模型、大量参数"这条路线。当然也有工具调用(Tool Use)这条路,之类的。但我认为某种程度上,模型应该能走到那一步:LLM 刚出现的时候,模型连计算器都当不了,现在它多少能当计算器了。所以严格说,计算器这样的工具已经在某种程度上被编码进了模型参数里。我认为我们最终会走到那一步。"有没有什么是永远无法表达进模型参数的",这是一个开放问题,我们不知道极限在哪里,但我们会一直把这个极限往前推。所以无论是 Lean 这样的系统,还是解决其他问题的物理引擎之类的,我们都会继续推这个边界。不过我当时其实并不知道有没有过很多关于"符号系统(Symbolic System)对……"的争论——
Swyx: 对,就是这个——符号系统。
Yi Tay: 我真的不知道有没有争论过。对我来说就是:"哦,那就训模型吧。"有人让我训模型,然后我就训了。反正这个决定是统筹 IMO 项目的人做的。而且我也认为,那些专用系统都是一次性的系统:你可以做一个化学引擎、一个数学引擎,做各种各样的东西。但说到底,你想要的是一个包办一切的模型。所以这个方向更符合那个目标。而且这个模型后来也以 Gemini Deep Think 的形式发布了,就是一个通用的 Gemini Deep Think。
Swyx: 所以它基本没改,可能只是把一些配置调低了一点。
Yi Tay: 对。推理时的配置——给大多数用户服务的那个版本是不一样的。完整的 IMO 推理配置只给了一些数学家用,因为推理成本的问题。但那个版本已经足够好,可以当通用模型了。我的看法是:正是这种直觉,让我们走向"一个模型",而不是——因为专用系统这条路是没有尽头的。
Swyx: 对。
Yi Tay: 你可以做出无数个专用系统。
Swyx: 是的。
Yi Tay: 我能看到的最远未来是:会有一个模型,如果真有什么东西是模型无法吞并的,那就用个工具之类的。但我的预测是:大多数东西都能被模型吞并。AI 研究员是很擅长爬山的。
Swyx: 历史会给你很多支持证据。这是模型的输出吗?就是这个,对吧?
Yi Tay: 这是什么?哦对,这就是模型的输出。
Swyx: 你看着这个输出的时候,看到了什么?显然它看起来像一份写得很好的证明,像一个真正的人类数学家会写的东西。有人拿你们的和 OpenAI 的版本对比过,OpenAI 的更"生",他们还得清理一下自己的版本。我们可以不聊 OpenAI。我是想问:当你看到这种输出时,什么让你觉得有意思?
Yi Tay: 我得先做个特别的免责声明:我对数学一窍不通。这就是 LLM 时代的美妙之处:你可以是一个 AI 研究员或工程师,不具备任何领域知识,却仍然能拿到金牌。这是一个你一无所知的通用工具。这些题我是肯定做不出来的,它们对我来说完全是天书。
Swyx: 不过,证明也许是一种特殊形态的思维链。另外一件有意思的事:你的一些合作者提到过——这大概是"推理首次进入一个不可验证(non-verifiable)领域"的例子。但对我来说,证明按定义就是可验证的呀。我就是抛几个话题,看有没有值得展开辩一辩的。
Yi Tay: 我认为,除了证明之外,还有很多领域是不可验证的,或者说不容易验证。人们说"不可验证",意思是"验证起来不平凡(non-trivial)",或者说不像检查一道数学题的答案那么容易。因为证明是长文本(long-form),所以验证起来很不平凡——除非你把它转成 Lean,再做各种各样的处理。所以在这些不可验证领域还有大量工作要做。好吧,我开始进入"不确定哪些能说、哪些不能说"的地带了。
Swyx: 好,那没关系。另一个公开争论的话题是:到底做了多少领域特定的工作或后训练(Post-training)?因为你们后来又用同一个模型去做了 IOI 和 ICPC,对吧?
Yi Tay: 我没有直接参与 ICPC,但多少有点关联。我能说的就这么多。
Yi Tay: "如果模型拿不到 IMO 金牌,那我们还能到 AGI 吗?所以在某个节点上,我们必须让这些模型去闯一闯奥林匹克竞赛。" Yi Tay: "你可以是一个 AI 研究员或工程师,不具备任何领域知识,却仍然能拿到金牌。这是一个你一无所知的通用工具。"
四位负责人、IMOcat 与肾上腺素飙升的等待
Swyx: 还有什么值得特别一提的吗?比如团队方面,你特别提到 Jonathan 是这个项目的联合负责人之一。这个项目的人员构成是怎样的?
Yi Tay: IMO 项目一共有四位负责人:两位在伦敦,Jonathan 在山景城,我在新加坡。我们四个人一起把这个模型训了出来。我记得 Thang 说过一个很有意思的点:我们全都在不同时区。还有一件很有意思的事是"交接棒":负责人之间并没有什么固定的工作流,完全是很即兴的——"我要登机了,接下来 12 小时 AFK(不在线)",然后就得有人顶上。
Swyx: 所以有时候你们就是在"看孩子"一样看着训练任务。
Yi Tay: 会有 bug,任务偶尔会挂掉。所以一切都非常即兴,负责人之间怎么配合非常、非常随意,大家自己商量着来。但那段时间也挺有意思的,因为我们都在飞:伦敦的同事不用飞,但我要飞,Jonathan 也要飞。而且你去另一个国家出差、访问一个办公室,就会有一堆会,所以我当时会议进进出出,挺忙的。还有一点:当时没人真的知道我们能不能拿到金牌,因为 IMO 还没开赛。那段时间很有意思、很刺激。然后是等待 IMO 委员会验证结果的整个过程——你懂的,"好吧,但我们还是别去现场了"。我也因此学了很多 IMO 的运作方式:原来金牌线甚至不是一个固定分数,是按比例划的(类似钟形曲线)。所以那段时间你就盯着分数看,我甚至会去看人类选手的表现、看他们的得分,因为 Gemini 能不能拿金牌,取决于人类选手考得怎么样。你就在那儿看百分比到了什么位置……
Swyx: 某种程度上,这完全不在你的掌控之中。
Yi Tay: 对,但你就是好奇嘛。我得说,这绝对比跑个基准测试、拿个数字更刺激、更肾上腺素飙升,而且这整个过程也持续了一段时间。总之,如果你有具体的问题也可以问。但对我来说,这整件事、这个 IMO 项目,是一段高光时刻。
Swyx: 我得说,如果两年前你问大多数人,一个模型能不能拿 IMO 金牌,他们会说:不可能。
Yi Tay: 对。
Swyx: 去年的银牌起了铺垫作用。但你们能把那套系统整个扔掉,直接拿现成的 Gemini,把 Deep Think 扩展上去,然后就在 IMO 上拿了金牌——相比去年,我觉得这也是非常非共识(non-consensus)的。
Yi Tay: 确实,某种程度上是的。我觉得研究员们也很惊讶——与其说是惊讶,不如说是一种"拍拍肩膀"式的惊喜:我们真的取得了很大的进步——这里说的"我们"是集体,是所有在 Gemini 上工作的工程师和研究员。看看我们一年走了多远。而且我还想说,不用两年前,就五年前——你想象一下这个结果,看看 AI 现在的状态:IMO 金牌、ICPC 金牌,甚至还有 Nano Banana 这样的东西。如果你拿现在的 AI 进展跟五年前比,人们会觉得我们已经达到了 AGI。
Swyx: 某种形式的 AGI。
Yi Tay: 某种形式的 AGI。
Swyx: 我们只是不断把标准往前挪。
Yi Tay: 如果你带着这些检查点穿越回五年前——真该有人把这拍成一部剧。这个领域进步的速度,真的非常惊人。
Swyx: 你会说,最难的部分是推理扩展(scaling inference)吗?
Yi Tay: 你指哪个方面?推理难?
Swyx: 或者说"贵"意义上的难——也许是团队消耗脑力最多的部分。我看到一些评论说:最难的其实是推理优化,或者说 Deep Think 相比普通 Gemini 所需的超长程(long-horizon)推理,诸如此类。
Yi Tay: 推理时扩展(Inference-time Scaling)不是我做的,所以这块我真不了解。
Swyx: 那部分基本就是这样。哦对了,还有件事:据说当时的代号叫 IMOcat,是你起的名。
Yi Tay: 这个嘛,其实算不上——我后来也发过推文讲这件事。IMOcat 说白了……它不是什么官方代号,只是那个训练任务的配置文件叫 IMOcat。就是这样。
Swyx: 你总得给任务起个名字。
Yi Tay: 对,我就是……我喜欢猫嘛。
2024 年 GDM 凭借 AlphaGeometry 与 AlphaProof 的组合拿到 IMO 银牌;2025 年团队放弃专用系统,改用端到端的 Gemini 模型拿到金牌,模型本身的训练过程约一周。IMO 项目共有四位负责人,分别位于伦敦(两位)、山景城(Jonathan)和新加坡(Yi Tay),靠跨时区"交接棒"推进;训练任务的配置文件名为 IMOcat。该模型随后以 Gemini Deep Think 的形式发布,完整的 IMO 推理配置因推理成本仅向部分数学家开放。
宝可梦图鉴:长程智能体的未解难题
Swyx: IMO 的话题基本就这些,除非你还有什么想说的。我们还有其他研究向的话题。不过在进入那些之前,我想先把舞台留给你:关于 GDM 正在进行的推理方向的投入,大家还应该知道些什么?
Yi Tay: 让我想想从哪儿说起。大家需要知道什么?它真的很强。对,这就是大家需要知道的。
Swyx: 也许有个简单的开场:两年前大家可能还在盯学术基准测试,去年可能是 LM Arena,今年是宝可梦。宝可梦是非常有意思的推理、视觉推理,以及广义的长程智能体规划……
Yi Tay: 对。
Swyx: ……基准。而且我感觉你特别关注它,Gemini 也做得非常好。显然这是个很好聊的话题。
Yi Tay: 我大概应该说一句:我们其实没有为宝可梦专门做任何事——当然,真的没有专门为宝可梦做什么。Logan(Logan Kilpatrick)最近有条推文,讲 Gemini 3 玩《宝可梦水晶》(Pokémon Crystal)……
Swyx: 那件事讨论度特别高。
Yi Tay: 我觉得宝可梦——我以前经常玩宝可梦,总的来说是个大宝可梦迷。就像你说的,它是一个很棒的长程基准。而且我觉得,隔一段时间在这种基准上校准一下挺好的——这种基准几乎不会被污染,也没人专门花时间去爬它。有些人那种"你在做什么?哦,我在刷 AIME,我在刷 HLE,我在刷宝可梦什么榜"——就有点好笑。
Swyx: 我们采访过那个基于 Claude 的宝可梦 AI 的作者,我记得他叫 David。那个项目暴露出 Anthropic 在屏幕理解、视觉能力上的严重缺陷:字面意义上的——它想翻过这堵墙,但它不知道墙在那儿,于是一直往墙上跑。它完全没有任何空间推理能力。
Yi Tay: 这里面有一部分可能是 harness(外挂框架)的问题,也跟模型能不能拿到游戏状态信息有关——还是说它只能看到纯视觉画面。
Swyx: 对,Claude 那套实现非常依赖游戏状态,他们实际上是把模拟器里正在发生的一切内存状态全导出来了。
Yi Tay: 这样啊。我不知道是不是又跑题了。我觉得"通关宝可梦"这件事,关键会变成你通关得有多快。而我至今还没看到的是:模型能不能集齐宝可梦图鉴(Pokedex)。
Swyx: 为什么集齐图鉴更有挑战性?
Yi Tay: 集齐图鉴太难了。你需要规划,需要查资料。有些事如果你不上网,模型永远不可能知道——它需要一点"深度研究"(Deep Research)的能力。比如有些宝可梦必须通信交换才能进化,模型得能上网、去论坛发帖、找到人问:"嘿,能跟我交换一下吗?"有些宝可梦就是必须交换才能进化的。
Swyx: 对,或者靠生蛋繁殖。
Yi Tay: 对。反正,我还没见过有模型能集齐图鉴。"集齐"对模型来说是真的难。所以我觉得这其实是很有意思的一个方向。
Swyx: 我在想,它在现实世界里的对应物是什么。假设我们有一个能做到这件事的模型,我们能让它做出哪些今天做不到的事?
Yi Tay: 这里面涉及大量规划,是真正的深度研究式的规划。宝可梦游戏本身是很线性的,而图鉴涉及大量的回溯(backtracking)、大量的研究。所以它的性质本身就不太一样。
Swyx: 那这件事对你来说,有没有像 AI for Science 领域里很多人在做的那种"发现你查不到的东西"一样有趣?
Yi Tay: 新知识(novel knowledge)。
Swyx: 对,新知识。因为你刚才说的本质上是:我们还没走到那一步。我们还处在"模型连查到的知识都没法稳定运用"的阶段。对吧。就比如你给 Gemini 接上网络搜索,然后说,好,去把宝可梦图鉴(Pokedex)里的所有宝可梦(Pokémon)都收集齐。你对它能做到这件事并没有多大信心。我不知道有没有人真试过。可能有吧。也可能没有。
Yi Tay: 没有。我觉得真正的难点其实在于如何把网页上的知识综合起来,然后应用到游戏本身里面。要面对那么多不断变化的视觉状态之类的信息。这个问题大概迟早会被解决——目前还没有。
Swyx: 这挺有挑战性的。
Yi Tay: 也不能说有挑战性,但就是没那么有意思。
Swyx: 因为它本质上就是……这个任务实际上就是:你能不能查到攻略,然后能不能照攻略执行?就这样。你知道什么比这更智能吗?写出攻略。成为第一个搞明白怎么写出攻略的人。那是什么?
Yi Tay: 哦,对,对。但说到这个,目前主流做法还是穷举搜索那一套。模型像人一样不断尝试,然后形成攻略。对。
Swyx: 好,所以那对你来说反而没那么有意思。有意思。
Yi Tay: 嗯,其实吧,仔细想想,它算不上特别、特别有意思,但也还行。反正我还没见过有模型真正尝试做这件事。
Swyx: 是的。我觉得对新想法空间的高效搜索才是有意思的。显然任何东西都可以暴力破解,但我们说的不是暴力破解,我们说的是尝试造出一个 AI 科学家(AI Scientist)。
Yi Tay: 不过新知识确实是个有意思的东西,我觉得它会成一件大事。能够生成全新的……
Swyx: Google 在这方面做过一些东西——你可能跟那些团队走得不太近——就是做过 AI 科学家方向的工作。
Yi Tay: 这方面有一些事情是这样的。比如说,你把模型权重冻结在 2015 年,把时间冻结在 2015 年,然后就算用现在的模型……好,我们假设不存在信息泄漏。如果你问这个模型,最好的机器学习……好吧,不是 2015 年,就 2012 年吧,它大概只会告诉你 SVM 是最强的。对吧。这在当时就是机器学习的基本面貌。对吧。那么问题来了:它能发明出 Transformer 吗?对吧。它可能做不到。哪怕是今天的模型,可能也发明不出 Transformer。如果你把时间冻结在某个时点,哪怕你把技术……我是说,模型本身就是 Transformer。所以我就说,假设不存在泄漏问题——虽然这根本不可能。所以我认为,模型到底能不能真正创新、生成真正的新知识,仍然有很多悬而未决的问题。
推理祛魅与潜在思考(Latent Thinking)
Swyx: 是的,这引出了一个相关的问题,我觉得和 Danny 那篇论文也有关,就是人们对"推理"(reasoning)这个词有一种神秘化倾向。但如果你真正去祛魅,推理无非就是发生在思维链(Chain of Thought)标签内部的那些东西。
Yi Tay: 没错。
Swyx: 而你不过是从预训练语料里已经潜在存在的东西中,把这种推理行为激发出来——这是对这件事的一种解读版本。
Yi Tay: 我觉得现如今"推理"这个词本身非常含糊、非常开放。基本上不同的人对推理是什么有不同的定义。对吧。所以我同意,思维链基本上就是人们想到推理时联想到的东西,显然它就是"思考"(thinking)里发生的那些事情,好,那就是推理。对吧。但我觉得现如今——这个我之前也说过——推理和强化学习(RL)基本上就是:任何为了激发能力而做的后训练(post-training),基本上就是用 RL 和后训练去激发能力。所以我认为推理的实际技术定义,就是通过思考和后训练让模型变得或多或少更好。对。所以基本上就是用 RL 让模型更会思考,而"思考"更像是思考轨迹(thinking traces)、思维路径之类的东西。另外还有一条研究路线是潜在思考(Latent Thinking)之类的,比如潜在思考和离散 token 思考将来会不会变成同一件事。这是个开放问题,意思是给……
Swyx: 给你的词表加一些额外的 token,用来表示……
Yi Tay: 我忘了叫什么名字了。就是那些学术论文里做的循环式的做法,或者 pause token 之类的。基本上就是:与其解码出离散 token,你实际是在潜在空间(latent space)里模拟这个过程。
Swyx: 对。
Yi Tay: 所以当你做思维链、思考和推理的时候,你基本上是多解码出一些 token,把它们藏在思考标签里,然后再解码出内容。而潜在思考基本上就是你不解码 token,干脆不碰这一步。
Swyx: 也许思考的母语本来就是数字,不需要经过英语这层滤镜。而且有时候模型可能会开始用中文或者别的什么语言思考。
Yi Tay: 是的,总的来说我并不认为模型的思考必须和人类的思考一样。其实在机器学习这件事上,我一贯属于"让模型想干嘛就干嘛"那一派。
Swyx: 总体上,之前有过一场讨论。有一篇柏拉图表征假说(Platonic Representation Hypothesis)的论文,我觉得如果你还没读过的话,你可能会挺认同的——至少在我看来它是显而易见的。基本上,图像模型对"笔记本电脑"的概念,和文本模型对"笔记本电脑"的概念,会是一样的。它们会收敛到同一个潜在表征上,而且显然你可以把它们对齐,可以对它们做各种操作。所以它们的概念就是一个代表"笔记本电脑"的数字向量,这完全说得通。这就是概念本身。是的。好,也许不同模型对"笔记本电脑"的理解会有一些数值上的差异,但大体上是一样的。对,非常有意思。我真正想引出来的问题是:我们现在处在这样一个时代,LLM 生成的文本也进了我们的训练语料,这就有点像一个递归循环。对吧。推理 token 现在满世界都是。所以预训练模型本身、预训练基座模型也具备了推理能力,而且随着越来越多的推理文本进入语料,它们会越来越强。这件事是有意思呢,还是令人担忧呢?
Yi Tay: 你在互联网上真的看到很多推理轨迹吗?反正我从来没见过,虽然我……
Swyx: 我会说,在 Hugging Face 上有。对。人们专门在发布这类东西。至于研究人员到底有没有把它们放进训练语料,谁知道呢,对吧。那是他们的选择。但我会说,Common Crawl 里含有思维链 token 的比例,已经从 0 涨到了 0.001%,而且只会随着时间继续往上涨,因为人们在不断发布它们。
Yi Tay: 是的,不过我觉得如果来源很清楚的话,你其实可以把这些东西过滤掉。因为通常人们会把它放在 GitHub 上,或者放在……
Swyx: 你想过滤掉吗?也许你并不想。
Yi Tay: 这是可以选择的。
Swyx: 对,确实可以选。说来,这个话题我们之前那部分没聊到——两年前很多人都在说,哦,你只要往预训练语料里多加代码 token 就行了。
Yi Tay: 但推理 token 和代码 token 还是不一样的。
Swyx: 代码 token 可以泛化到代码之外的推理上。
Yi Tay: 哦,那听起来像……
Swyx: 你不信这个说法?
Yi Tay: 不不不。我觉得……我不知道这个说法今天还成不成立,不过我明白你的意思了。
AI 编程:从氛围编程到氛围训练
Swyx: 好,以上就是我们对推理这个话题的总体覆盖。我会说这方向有很多有意思的工作,也还有很多可做。也许我还可以聊一件我知道你有切身体会的事,就是你已经开始用 AI 编程了。
Yi Tay: 哦,对。其实我过去基本不怎么用 AI 编程,但我觉得我们已经到了 AI 编程开始变得真正好用的阶段。好,在 AI 编程之前,我觉得这些模型对我最有用的场景是:我有一大张装满各种结果的电子表格,然后我需要把它画成图。我觉得模型可以很直接地……给我截一张这个的图出来。我特别讨厌写 matplotlib 那套东西,太烦人了。好,但这基本上就是我能想起来的、我过去使用 AI 的方式。但我觉得 AI 编程已经到了这样一个程度:我跑一个任务,遇到一个 bug,我几乎连看都不看这个 bug,直接把它粘贴进 Antigravity,告诉它帮我修掉,然后我把任务重新跑起来。这已经超越了氛围编程(vibe coding),更像是氛围训练(vibe training)、氛围 ML 之类的东西。我得说大多数时候它干得相当不错。而且实际上有一整类问题,我总体知道它特别擅长,事实上可能比我做得更好——换我自己得花 20 分钟去找出问题、修好、再重新加载。
Swyx: 是的,这个很有意思,因为我会说,一级氛围编程是你其实知道该怎么做,你只是太懒了。对。就是"啊,帮我做了吧,这种事我做过一千遍了,直接去修,我很清楚该怎么做"。而你说的是下一个层级:你其实并不知道,它在替你调查。只要答案看起来是对的,你就直接 ship 了。
Yi Tay: 一开始我还有点……我会检查它,把什么都看一遍。然后到了某个时候我就想,好吧,也许模型看得比我准。所以我就放手让它干,然后基于模型给的修复方案重新跑任务。而且我觉得模型只会越来越聪明。对。所以这确实……对。我还觉得,最近有了 Antigravity。这些工具以前在 Google 的基础设施里不是这样……也没那么容易用上。我不太熟悉外面都有什么可用的工具。而且我在创业公司那段时间也没有真的……我觉得一年半以前模型还没这么好。所以这也算是一个助推,大家都在说,哦,试试 Antigravity,它是改变游戏规则的东西之类的。好。所以我就开始用了,然后……是的。
Swyx: 嗯。你最近还跟 Varun 待过一段时间。
Yi Tay: 哦不,我确实跟 Antigravity 打过交道了。对。
Swyx: 我记得你之前跟我说,你是个连 AI 都不怎么用的 AI 研究员,而现在作为用户,你是真的被 AI"洗礼"了。
Yi Tay: 今年有太多这样的时刻:AI 突然跨越了那个涌现的临界点。我觉得 AI 编程就是其中之一,就是我们刚讨论的这个。我觉得 Nano Banana 也到了那个程度——以前如果你做这种图片,基本就是图一乐,拿去整蛊朋友之类的。但 Nano Banana 真的好用到你可以把它用在正事上,你可以用它做……基本上,是的。所以它变得非常好用。而且我觉得,是的,今年这些东西……甚至以前这些模型会疯狂幻觉,但现在我基本上默认就信它。我觉得我们只是……大家就是在享受这些模型带来的效用。所以现在我就是这样,我一直是 AI 的拥趸。AI 是好事,我不明白这有什么可反对的。
Swyx: 是的。而且你是把它用在你自己高度专业的领域上,也就是你自己的机器学习工作上。
Yi Tay: 是的。
Swyx: 顺带一问,你内部用的 Gemini 是有什么我们拿不到的特供版吗?还是说就是公开版 Gemini?
Yi Tay: 应该就是公开版 Gemini。对。
Swyx: 我只是想说,专门训练一个只针对你们代码库和你们工作的内部版 Gemini,是完全合理的。
Yi Tay: 哦,其实我不确定。这些东西对我来说就是拿来即用的。
Swyx: 但显然,如果它能把你的生产力提升,比如说 10%,那就值了。对吧。所以我认为这很有意思。还有个有意思的问题是信任的层级:你对它信任到什么程度?你把自己多少工作自动化掉、不再亲自做?我猜还有个问题:如果大家不再需要初级员工了,后来的人怎么成长、怎么在这个领域里得到训练?因为 Gemini 就是你的初级员工了,研究员先生。所以我认为这些都是很有意思的问题。
Yi Tay: 我想先快说一点。关于模型能不能顶一个初级员工之类的。对吧。我觉得可以这样看:如果一份工作、一个人的工作量,可以被模型本身替代……但假设你是个管理者,对吧?你追踪的目标、你关心的指标是你的时间。如果你有一个模型,它能帮你省下的时间,等于你下属干那些活要花的时间——但你实际上并没有裁掉某一个人,而是……
Swyx: 从每个人身上都省一点。
Yi Tay: 对,没错。那我完全同意:把净节省的时间加起来,有些时候模型修掉的 bug,本来可能要花掉我一天。一天是很可观的。这些东西绝对……我不知道有没有人对此做过真正的指标评估,但如果你把时间当作真实指标,而不是按"哦,也许三小时"这种口径来算,对吧。这些东西并不会真的取代某一个人,它更像一个被动光环,用游戏术语说,就是给全队加 buff。对吧?是的。
Swyx: 我经常把自己当成一个吟游诗人,因为我负责讲故事,还能给身边所有人加增益。在一个 DND 小队里,这对我来说是理想位置。
Yi Tay: 好。我不玩 DND,不过行吧。那他们就是辅助之王。
Swyx: 英雄辅助位。
Yi Tay: 没错。
Swyx: 是的。好,AI 辅助这个定位我觉得非常让人鼓舞。那我想问:有什么地方它还是不灵?你试过之后觉得,唉,我本以为它会更好的。
Yi Tay: 哦。有些时候模型会犯懒,想糊弄着修点东西——它们还是会犯懒,然后试图"煤气灯"我,让我以为 bug 已经修好了。所以还是存在这样几类问题:有些问题对模型来说非常容易、对人类来说非常难;也有些事情对人类来说非常容易、对机器来说非常难——这就是莫拉维克悖论(Moravec's Paradox)那套东西。所以还是很难把这些问题规整地划分到清晰的象限里去。所以我会说,现在模型的能力已经好到真的能帮上忙了,但还是有点……还是有一些毛病。不过,是的,我觉得这个问题……我不认为有什么办法可以专门"集火"解决它们。这更像是通用能力提升的事:模型随着时间推移变得更好,这些毛病自然就会消失。
Swyx: 你这么说……好,是的,我觉得显然从大局来看,就是相信过程,在每个维度上继续扩展,问题自然就会消解,能力会涌现出来。但你以前也说过——我记不清具体是哪条推文了——大意是每多一个数据集,效果都会随时间复利累积,虽然每次只是很小的增量。而我会说,当你说"集火解决某些问题"的时候,你会想到那些"对人容易、对机器难"的事情,那些就是低垂的果实:你直接加一个针对性的数据集去集火解决它。爬山算法(hill climbing)不就是一连串这样的动作,一路爬到 AGI 吗?
Yi Tay: 好,我明白你的意思。我觉得确实,很多时候整体上的进展就是一连串小的增量改动堆出来的。我觉得这个描述是准确的,是事实。也确实有很多看似微不足道的小改动——找不到更好的词了——把 AI 推到了今天这个阶段。所以我绝对同意。我没有任何针对那些喜欢"集火"的人的意思,只是说,当我说集火的时候,要集火那些不太好刻画的东西可能并不容易。所以只有当问题足够明确的时候,对吧——好,我想提升这个能力,那就加点数据。我觉得定义评测(eval)就是定义问题,就是把它刻画清楚。如果能刻画清楚,那好,没问题。但我想说的是编程那个例子:这些东西甚至……我不做编程方向,但有些问题类别……做编程的人可能知道,他们对不同类型的失败有自己的术语。所以也许某个地方正有人在集火解决这类问题,让模型变得更好。那对所有人都是好事。
Swyx: 是的。这就是为什么需要一千号人才能把所有这些拼到一起。
Yi Tay: 如今的 AI 绝对是一项庞大的集体工程。它是一台大机器。是的。
注意力架构与硬件彩票
Swyx: 真的很疯狂。好。接下来我想把话题放宽一点,聊聊社区里大家在讨论的研究方面的东西——我也知道你现在非常专注,不一定读过所有论文,但我们可以随便聊聊想法。你显然也可以问我是怎么看的。"注意力就是你所需要的一切"(Attention Is All You Need)吗?
Yi Tay: 注意力(Attention)和 Transformer 是近年的核心思想。预训练和规模化(scaling)是让注意力和 Transformer 真正大放异彩的东西。对吧。因为没有……我觉得第一篇 Transformer 论文是讲机器翻译的。然后基本上是 GPT 和 BERT 真正展示了这个思想的全部潜力。所以,注意力真的就是我们所需要的一切吗?可能不是。但我觉得它是……从架构的角度看,也许也不是,但它虽然不是全部,我们绝对需要它。
Swyx: 在同一个层级上你还在想什么别的?你是说 MoE 之类的东西吗?你说"它不是你所需要的一切"是什么意思?
Yi Tay: 你肯定需要预训练的规模。你需要所有的 token。你需要 RL。我觉得当人们……
Swyx: 当人们说"注意力就是你所需要的一切"时,他们主要是……
Yi Tay: 从架构的角度说的。
Swyx: 但 Transformer 能带我们一路走到 AGI 吗?对吧。我猜问题在这。
Yi Tay: 所以基本上,问题是你怎么算到达 AGI。
Swyx: 到时候它还会是 Transformer 架构吗,还是会变成某种明显不同的东西?
Yi Tay: 它还会是 Transformer。我觉得这真的取决于你怎么称呼它。但我觉得,除非范式彻底转移——作为科学家,你不能把话说死,说这永远不会发生。但我的感觉是,从 Transformer 2017 年出来到现在已经多久了,差不多 10 年了,Transformer 已经九年了。我觉得我们并没有替换掉自注意力(self-attention)——顶多是它的某种形式。你可以给它改个名,你可以叫它别的什么。有时候你可以做局部、全局、滑窗注意力。对,但它归根到底还是 Transformer。我觉得它不会消失。除非连反向传播(backprop)这整套东西都变了,整个东西彻底变了,那就是另一个故事、另一场讨论了。但如果还是在同一个范畴和边界之内……所以我花了很多时间思考架构,思考有没有替代架构之类的。好。在序列处理这个层面,就像那个终极的……
Swyx: 对,就是序列到序列(sequence-to-sequence)的 Transformer。
Yi Tay: 自注意力大概是……曾经有一整个时代,我也参与其中——那个时代人们想尽办法削弱注意力:试图移除它、简化它、让它更高效。就是整个"高效注意力"(efficient attention)时代。到头来,结果永远都是:哦,我们把注意力全删了,但还留了一层自注意力在那儿,然后它照样 work。故事的结尾永远都是……
Swyx: 甚至 Noam(Shazeer)本人也发表过一些东西,讲他用某种比例去混合局部注意力和全局注意力。对吧。基本上还是注意力,只是做了相当大的改动。
Yi Tay: 我会把局部注意力和全局注意力仍然算作注意力。
Swyx: 只是你跳过多少的问题。
Yi Tay: 对。唯一的问题是,如果形式变化太大,你的 QKV 变成 ABCD、FG 之类的东西了,那……
Swyx: 也许我可以给你一些做这件事的现实动机。你们对超过 18 万 token 的上下文还在收两倍的价——还是 24 万来着,差不多这个数。而理论上限是 200 万 token,对吧?那如果我们需要 2 亿呢?会不会到某个点上,连"输入 token 上下文"这个概念本身都变得无关紧要?因为你在做持续学习(Continual Learning)之类的东西,你把它建模为……好,AGI 将通过序列到序列的变换来实现,而注意力是最好的序列到序列模型或架构,所以注意力就是你所需要的一切。但我觉得另一些人的看法是:序列到序列并不能准确刻画智能。
Yi Tay: 但这其实和序列到序列关系不大,更多是整个梯度设计和反向传播的问题。对吧。这不是架构本身的问题。我们面临的这个问题更多是学习范式本身的问题,而不是架构本身。我觉得架构基本上就是学习算法和 token 之间的接口。我觉得这更多关乎学习算法本身。还有持续学习这个……关于如何处理大到离谱的上下文,比如 2 亿、10 亿 token 之类的,有很多种思考方式。对吧。不管是哪一种——比如你有一种新的学习算法,每次跑推理的时候你都在它上面学习。对吧。那样你技术上就有了某种记忆,就像我现在跟你说话的同时也在学习一样。对吧?所以这也是一种方式。另一种方式是,可能有人会说,好,注意力对 2 亿、10 亿的上下文来说实在太贵了,所以我们需要新架构。也会有人说,哦,我们直接改进芯片、改进加速器就行了。所以我觉得有很多种解读方式。但我认为,如果问题是关于……有很多根本性的东西。如果是关于持续学习之类的,那学习算法本身也有很多根本性的问题。
Swyx: 那些东西也必须跟着变。
Yi Tay: 我觉得学习范式和架构这些东西是相辅相成的。而且随着领域发展,想法是一个叠一个堆起来的。所以还有这么一件事:新提出的想法必须和之前已经做过的所有工作兼容,才能发光。这有点像 Sara Hooker 那个"硬件彩票"(Hardware Lottery)的变体——不是我写过的那个 GPU 掉链子的硬件彩票,而是最原始的那个硬件彩票。但它更像是一种"彩票":新提出来的东西必须和以前提出来的东西配合得好。所以在某种程度上,这有点像一路走进了一个局部最优。我们现在就处在"Transformer 统治一切"的局部最优里。一切皆是如此。对吧。也许要完全跳出来并不容易,因为大量的投入和优化都已经做完了。能玩得转的东西,必须和以前的那些想法配合得好。而依我现在看来,要从中跳出来是非常难的。
想法依然重要:封闭与开源的差距在扩大
Swyx: 好,我不完全确定我听懂了你的意思,但我们就管它叫生成式 AI(Gen AI)吧——我超恨这个词。这仍然是一个非常年轻的领域。所以,是的,Transformer 上已经有八年的工作了,但放到大局里这算什么?也许我们确实在一个局部最优里,得想办法把自己推出去。我想把这个问题留着不下结论,我也没有答案。我确实觉得人们正处在 Ilya Sutskever 所说的"研究的时代"(age of research)。
Yi Tay: 对吧?
Swyx: 我们就像是:好,能扩的我们都扩了。我们知道在我们已知的每个维度上,再扩一到两个数量级大概是什么样。但下一个要扩的维度是什么?
Yi Tay: 这里有个小小的误解,就是"哦,过去五年只是在扩规模"。扩规模。
Swyx: 好,请展开讲讲。对,你之前还开过那个玩笑,说现在轮到扩研究员的薪水了。
Yi Tay: 好,这个就不展开说了。但我认为想法是重要的,而且我认为过去五年有很多好想法。只是也许它没有那么……它不是盲目地……如果你拿一个 MLP,对吧,没有自注意力。好,我往这东西上砸 100 万亿美元,把它扩起来,然后这东西……
Swyx: 永远不可能 work。
Yi Tay: 永远不可能 work。
Swyx: 对,对。
Yi Tay: 所以并不存在……这里面也有一部分是……我觉得"苦涩的教训"(The Bitter Lesson)被用得太滥了,被太随手地到处引用了。但实际上也有一点——不止一点——也有一条"甜蜜的教训"(Sweet Lesson),那就是想法是重要的。而且我觉得直到今天,对吧,人们仍然在贬低想法的价值之类的。
Swyx: 你觉得新想法的产出速度——不用具体说是什么想法,显然你不能透露——但想法的产出速度是变快了还是变慢了?因为按理说有收益递减的规律,至少应该是变慢了。
Yi Tay: 我觉得想法的数量永远和钻研某个问题的研究员数量成正比。所以按定义它应该是增加的。但我认为真正奏效的想法的数量并没有下降,和过去相比……我们现在还没进入收益递减的时代。所以我认为想法仍然非常重要,而且仍然有非常好的、改变游戏规则的想法正在被发明出来。
Swyx: 这个问题我想我已经知道答案了。封闭实验室相对开源的优势是在扩大还是在缩小?比如中国的实验室,他们一直在发布开源模型,一些美国实验室也在发布开源模型。你会说,我在那里看到的想法——Nvidia 有 Nemotron,OpenAI 有 GPT-OSS——这些基本上就是截至今年为止、公开已知的模型训练技术的一个个存档点?
Yi Tay: 哦,好,好。
Swyx: 因为人人都……
Yi Tay: 对,好。
Swyx: 是的,人人都这么做。
Yi Tay: 我认为差距在扩大。
Swyx: 我觉得从你之前说过的话里并不能完全预见到这个结论。
Yi Tay: 我认为差距绝对在扩大。
Swyx: 是的,我觉得这正好证明了研究员的价值。不然养研究员干嘛?不就是为了找到那些能随时间复利累积的新技巧吗?
Yi Tay: 但我确实认为差距在扩大。
Swyx: 好,我岔开一个话题。不知道你对此有没有看法?这和 Nvidia 最近收购 Groq 的事关系很大——我不知道你有没有观点,因为你是非常 TPU 体系的人。但我们的瓶颈到底是内存还是算力?这也和我们刚才聊的 Transformer 讨论相关,具体到 serving 上。我觉得经典观点是我们受算力约束(compute bound),因为预训练和 RL 需要更多算力,然后推理也需要。但我要提的反对论点是:我手头其实有这些摩尔定律的图表——真希望我能随手调出来——算力的扩展、内存的扩展、网络和带宽的扩展,各自的摩尔定律曲线。算力扩展的斜率比另外两个高得多。
Yi Tay: 内存。你是说便宜的内存?说实话,我不太想内存约束(memory bound)这个问题。也许它不……对。所以我不同意这个看法,但我对此的把握也不大。
Swyx: 因为你主要在做研究,不太碰推理侧。
Yi Tay: 对,也许搞推理的那帮人会说……我又不是每天一睁眼就想着 serving。所以,对,也许我确实不太想推理这块。对。
Swyx: 我之前在这方面的思路是:Nvidia 收购 Mellanox 非常有远见,因为网络才是规模化真正的瓶颈,它的"摩尔定律"斜率最低。而接下来第二个就是内存,这非常有意思。
Yi Tay: 好,好。但说实话,我确实不怎么会去想这个。这个我确实想得不多。对,我理解。
"苦涩的教训"(The Bitter Lesson)被引用得太多、太随手了。Yi Tay 认为还存在一条"甜蜜的教训":想法是重要的。过去五年并非只是盲目扩规模——给一个 MLP 砸 100 万亿美元也永远不可能 work。真正奏效的想法数量并没有进入收益递减的时代,改变游戏规则的想法仍在被发明出来。
数据效率与世界模型
Swyx: 好。数据效率(data efficiency)。这本来是个玩笑,但言下之意是数据暴露量存在某种上限。对吧。以前我会说,很多训练范式都是"一个 epoch 就是你所需要的一切"(one epoch is all you need)这个思路。我会说真实数字可能在三到四个 epoch 之间。而且我确实想知道,从训练和压缩的角度看,模型数据效率的理论极限应该是多少。我不知道这意味着什么,数据……
Yi Tay: 效率——但你这个问题其实是在问:重复多少次是可以容忍的?
Swyx: 能不能容忍,取决于它是否真的有实质提升。这不是说你要为了重复而重复,但我确实认为存在这个问题。另外就是,用有限的数据我们究竟能学到多少东西。这么说吧:假设你不受算力约束,也不受内存约束,但假设你受数据约束。上次我们录播客的时候,聊过 Chinchilla 最优(Chinchilla-optimal)训练。但现在我觉得很多人甚至在讨论数据最优训练(data-optimal training):给定有限的数据集,你能从中学到多好?我觉得这是个有意思的研究方向,讨论的人还不够多。也许在实验室内部这已经是常识了,但在我看来很清楚的一点是:我们从数据中学到的东西,远远没有优化到位。我就把这个观点放这儿。
Yi Tay: 我觉得总体上,从每个数据点里榨取更多东西肯定是有价值的。但我也觉得这和我们正在把全世界的 token 用完这个事实有关。我不做预训练数据这块,而且我说的这些只代表行业的一般状况,不代表……对吧。所以我认为我甚至不知道数据这块是不是已经分化……这些事情的各家做法是不是已经在实验室之间分化得太厉害了,而且并不公开。
Swyx: 各家之间肯定有很多交叉授粉。
Yi Tay: 交叉授粉。好,好。对。但我确实不太想数据这块,就是预训练数据这块。
Swyx: 今年上半年早些时候,我可能还会说预训练已死,所有人都把全部工作往 RL 上堆。我们之前看到过 Grok 的一张图,非常有意思,显示他们在 RL 上投入的算力已经和……你觉得那是心理战吗?
Yi Tay: 不,我不知道。我完全没概念。
Swyx: 是的,我觉得大家是当真的。他们的态度是,对,好,管它呢。尤其是那些 Agent 实验室,像 Cognition、Cursor,他们拿别人的开源模型,然后在上面做——姑且叫它预训练规模的 RL。如果他们真有那个量级的内部数据——他们确实有——那就非常有意思了,我会说。对。这个数据效率的论点。对。我觉得对我来说,它更多是要发现新的学习范式,好走到我们所有人都想去的地方。而存在性证明就是人类。对吧。你两岁的女儿在某些事情上比 LLM 能干得多,而她见过的数据少了大概八个数量级。这非常有意思。
Yi Tay: 是的。把人类学习和机器学习放在一起比……
Swyx: 纯粹是作为一个存在性证明:我们大概可以做得更好。比如只看三四个狗的例子,再来一只没见过的动物,我作为人类大概能认出那是条狗。但经典的做法是机器要 20 个……
Yi Tay: 人类的数据效率绝对比模型高得多。对。唯一的问题是:这东西到底从哪来?是真的要在每个 token 上砸更多 FLOPs 吗?还是说又回到了 Transformer 是不是最优架构的问题?也许问题在反向传播,也许在"湿件"(wetware),也许在离策略性(off-policy-ness),也许……bug 到底在哪?对吧。
Swyx: 正是。
Yi Tay: 但也可能这是个特性而不是 bug。我不知道。
Swyx: 好,我们大概把问题识别出来了。我费了不少劲才把意思传达到。这就是我所说的那种数据效率。我觉得它正在浮现。基本上每年年底我都会试着下注:好,明年的大主题会是什么。我觉得这就是其中之一,人们真的会开始聚焦它,因为大家都感觉到了数据紧缩,尽管所有人还在往数据上投钱。对了,我还忘说了:我之前说"预训练已死"是错的。是的。我现在已经见过 Anthropic 和 OpenAI 两边的预训练负责人了,最近也看了 DeepMind 那个人的演讲。所以所有人都还在往预训练上投钱,这挺好的。
Yi Tay: 可没人说过预训练已死啊。
Swyx: 我知道。不,这只是一个我们想证实或证伪的说法。总之,我觉得……好,让我绕回我的总体思路。对。数据效率看起来值得做。你的态度大概是:好,那你告诉我 bug 在哪,我去修。但我们不知道 bug 在哪,我们只有"可以做得更好"的存在性证明。然后我觉得对我来说,这条逻辑链的最后一环是:所有人都在聚焦某种"世界模型"(World Model)的概念,把它当作这种更高效学习的一种形态,而它可能不会以序列到序列 Transformer 的形式出现。我不知道那要怎么运作,这绝对有点超出我的知识范围了。在我看来,它之所以更高效,是因为每个世界都必须是内部自洽的。如果下一条新证据进来,推翻了某些世界,那你就永远不需要再走那些路径了,你可以直接收敛到你识别出的那个世界上。所以对我来说,这就是学习:你在学习拟合世界模型。对。所以,是的,也许你可以把学习过程看作曲线拟合。
Yi Tay: 是的。所以你学的是世界,而不是在学世界模型——对,是在学世界模型。对吧。好。方法是采样出多个世界模型,然后找出哪个最拟合数据。
Swyx: 我想我的问题是这样——大家谈论的其实是这些东西(你尽管反驳,我只是抛砖引玉,这是我和很多人聊下来听到的):你们说世界模型(World Models),到底在说什么?数据效率、学习效率又在说什么?这些东西怎么拼成一个连贯的、关于未来的图景,让我们真正能……
Yi Tay: 那先说说,世界模型的定义是什么?一开始的定义?
Swyx: 对。有三种。
Yi Tay: 好,你继续。
Swyx: 第一种是 Veo 那种,或者说另一个叫什么来着——Genie,DeepMind 的那个——也就是视频世界模型那一类。你用某种高斯泼溅(Gaussian Splatting)之类的东西建模一切,然后你仿佛栖身在那个 3D 空间里。
Yi Tay: 嗯。
Swyx: 第二种,姑且叫它 Yann LeCun 的 Meta 学派吧——不知道你熟不熟。他发表了 JEPA 架构;另外 FAIR 还发表了代码世界模型(Code World Models),专门针对代码的,非常有意思。你执行代码,逐行执行的同时,建模执行环境的内部状态。
Yi Tay: 好。
Swyx: LLM 实际上学会了预测这些东西,而且在他们测试过的规模上,看起来效率高得多,这很酷。
Yi Tay: 你锚定的是哪个定义?
Swyx: 第三个,代码那个。
Yi Tay: 代码世界模型是第二个。
Swyx: 那两个我捆在一起说了。JEPA 的粉丝现在大概很恨我,因为我把 Meta 的所有工作都归到同一个学派下面了,但无所谓。
Yi Tay: 好。
Swyx: 第一种是 Veo、Genie、超级空间智能(Spatial Intelligence)那类基于视频的世界模型。第二种是某种执行过程,或者说在你遍历语料时做某种显式建模。然后我觉得第三种是个很不定形的东西——我觉得大家真正想逼近的,是我说的那种"可能世界的分辨率",你在学习、在推理的过程中不断做曲线拟合。
Yi Tay: 嗯,但世界模型本身到底是什么?它是像……
Swyx: 它是一个关于"一切都在哪、你认为世界如何运转"的心智模型。我认为就是你对一切的认知。
Yi Tay: 但技术上它总得是个具体的东西。
Swyx: 在潜在空间(latent space)里。
Yi Tay: 好。所以简单点说,它可以就是一个介于……之间的 Transformer 模型,然后……
Swyx: 这是最贴合当前范式的形态——你确实可以在现有的 Transformer 里做这件事。我认为训练它的方式可能必须有所不同。
Yi Tay: 好,我懂了,我懂了。
Swyx: 我这里没有任何结论。我只是把它抛出来,因为我知道你对这类东西感兴趣,而我也没那么多懂行的人可以聊这个。
Yi Tay: 不,我并不常思考世界模型。我觉得是因为世界模型这个东西从一开始就没有被很好地定义。
Swyx: 嗯,但重点不一定是世界模型本身。问题在于学习效率,可能还有准确率,或者说在我们当前的 scaling 路径上不容易被解锁的那种 AGI 能力。
Yi Tay: 嗯,说到数据效率,我觉得核心命题更像是找到办法在每个 token 上花更多的 FLOPs。因为基本上,如果你受数据约束(data bound),你就想要更高的数据效率——你能从每个数据点学到更多,把它榨出更多东西。所以那些能提取更多、能在每个 token 上用更多 FLOPs 的方法,绝对就是数据效率的一种形式。然后是学习算法的问题。有一张著名的图,人类、机器、狗、猫,各自有一条不同的 scaling law 曲线。这两件事并不是完全不同的东西,因为有可能所谓"更好的架构"其实只是在每个 token 上花了更多 FLOPs。所以如果你处在一个数据非常受限、但算力完全不受限的点上,你就去找那些在每个 token 上花大量算力的算法。所以我认为总括性的论点就是:数据效率本质上是学习算法的问题;而正确的做法到底是不是就在每个 token 上施加更多 FLOPs、从每个数据点里榨出更多——这是个问题。另外,你说人类"接触的数据更少",这本身也很含糊,因为严格来说人是 24/7 全天候在线的,而且大部分是视觉输入,有各种各样不同类型的输入。而他们对听到的每样东西是不是花了更多 FLOPs,也是个问题——也许他们只是效率高?总得有人去数一数大脑处理这些东西用了多少 FLOPs。也许他们只是在每个 token 上花了更多算力,也许学习算法确实不一样。但我同意数据效率非常重要,因为我觉得世界上可用的数据是有限的。
RL 环境、DSI 与生成式检索
Swyx: 在聊 DSI 之前还有一件事。我们刚才在聊 RL,你也在做 RL 相关的工作。为什么大家愿意花大价钱买 RL 环境(RL environments)?
Yi Tay: 等等,谁在花钱买 RL 环境?
Swyx: 至少 OpenAI 这个话题上——没人提过 DeepMind 什么。很多不是你们的模型实验室,出了名的会花至少七位数美元,让外部初创公司给他们搭建用于训练的 RL 环境。
Yi Tay: 哦。
Swyx: 我觉得问题在于:如果你的模型编程那么强,为什么不自己做?我认为这其中有相当多的人类专家专长被蒸馏进了 RL 环境,然后你就可以让智能体在里面撒野。但我很好奇除了这个之外还有没有更深的洞见,因为我对我自己的解释并不满意。
Yi Tay: 蕴含大量领域专长的 RL 环境,可能确实非常有价值。其实我并不清楚大家具体在买什么样的 RL 环境。你对你自己的解释不满意的是哪一点?
Swyx: 它既然这么值钱——而很多人都在说:你看,那不过是一个 Docker 容器里的 Next.js 应用,你往里送输入,它就记点日志出来。那你自己内部大概也能做。为什么要花那么多钱给一家你不认识的初创公司来做?
Yi Tay: 说真的,我完全不知道为什么会这样。毫无头绪。
Swyx: 一个经典的例子:如果你想做一个在电商场景买东西的计算机使用智能体(computer use agent),你会想要能完美复刻前 1000 个电商网站的 RL 环境,然后在所有环境上并行 rollout。这听起来有意义吗?
Yi Tay: 我不知道。
Swyx: 行吧,酷。那聊 DSI 和 LLM 推荐系统(RecSys)。今年我为自己的大会下的一大赌注,就是我们开始聚焦 LLM RecSys。
Yi Tay: 做 LLM RecSys 背后的动机是什么?
Swyx: 我认为 RecSys 是消费级 AI 里的王者问题,是单一最有价值的东西。你所有的信息流(feed),甚至搜索,都是 RecSys。
Yi Tay: 基本上,搜索、检索就是那个"上帝问题"。
Swyx: 对。因为 RecSys 是排序(ranking),但也是过滤、也是个性化、也是重索引和性能。它是上帝问题,而且做好它能赚大钱。工程师们对它却不怎么兴奋,这很奇怪——他们中很多人不做 RecSys,可能永远也不会做,但他们看不到一个好的 RecSys 能带来的金钱价值。另外我这边的两个新动态——我之前其实都不知道 DSI 跟这个直接相关——第一个是 Twitter 公开把他们的信息流算法换成了 LLM。
Yi Tay: 现在 RecSys 用 LLM 已经到处都是了。但它是不是真的大 LLM、是不是那种通用检索式的模型,这是另一个问题,对吧?是这样吗?
Swyx: 我们不知道。我们只知道他们说过,已经把现有的 RecSys 换成了基于 LLM 的 RecSys,他们就是这样披露的。但真正发表了论文的是 YouTube——他们在 YouTube 的 RecSys 里采用了语义 ID(Semantic IDs)。而 YouTube 显然是件大事。
Yi Tay: 这是公开信息?
Swyx: 是。
Yi Tay: 哦,好。
Swyx: 他们来我们这儿讲过。然后今年还发表了 V2,更多信息。我就是想——上次你上播客的时候我们没怎么聊 DSI,但你其实有信息检索(IR)的背景。你在乎 IR 吗?
Yi Tay: 不,我不在乎 IR,但我觉得 DSI……好吧,DSI 或者说生成式检索(Generative Retrieval / DSI),算是我以前最喜欢的作品之一。我有 IR 背景:读博的时候我做过一些 RecSys 的工作,做过检索结合 RecSys 之类的东西,所以我有 IR 和 RecSys 两方面的背景。现在生成式检索和生成式 RecSys 被混为一谈,但 DSI 一开始是个检索方向的工作。我们做的是 Natural Questions 那样的任务:对索引排序、对文档排序,诸如此类。其实我和 Don 还接受过 Yannick 的采访,那篇论文很久以前就出来了。当时我们想重新想象检索和搜索。那时候我们还在用 T5 模型,还没有进入 LLM 时代,是 pre-LM 时代,就是"预训练很灵"的那个阶段,周围有一些预训练模型。所以我们想重新想象检索。但说到底,检索和 RecSys 都是同一个范式:排序问题、检索问题。于是我们开始把检索想象成一个把一切编码进记忆里的巨型模型。那条路上我们试了非常多种不同的语义 ID 方案——其实是我的合作者 Vin 想出了那些点子。整个生成式检索的起点,说白了真的就是给文档一个标识符(identifier),然后直接硬预测——纯粹的暴力预测。它居然真的有效,因为模型能记住东西。你回头看文献,从很早一直到 Doc2Vec 之类的东西,那些词其实没有意义,它们只是词表里的 ID,甚至不是数字。而技术上模型确实有足够容量去预测。但我认为语义 ID 的想法在于:你有某种语义关联,然后尝试把搜索空间层级化地拆解。后来这个方向是怎么发展到 RecSys 领域的呢——DSI 出来之后,Mahesh 他们那个团队做了一些把 DSI 应用到 RecSys 的探索,那篇生成式 RecSys(生成式推荐系统)的论文就是这么出来的。说来好笑,当事人自己当时都不知道自己被卷进了这件事。
Swyx: 挺疯狂的。
Yi Tay: 那基本上就是我们把这套东西迁移过去的过程。DSI 有效,我们就把它试在 RecSys 上。我觉得推荐系统领域的人做语义 ID 的方式略有不同,但那只是因为领域略有不同。那之后,我觉得我们在这个方向上的发明创造部分已经做完了。
Swyx: 剩下的都是细节。
Yi Tay: 剩下的都是细节。后来我也离开了 Google。这些年这些东西各自演化了一点。我还看到 Spotify 也在用类似的东西——YouTube、Spotify 都在用这种语义 ID、这种 DSI 式的模型。我认为从研究社区的角度看,DSI 是第一个提出并解码语义 token 的工作。但后来——我不知道——这个圈子的风气有点怪,他们会说"哦,这是生成式检索,不是生成式 RecSys",就是搞这种莫名其妙的划界,挺奇怪的。总之这就是生成式检索的整个历史。显然现在也有很多人在做,我其实完全没跟进了,这事根本不在我脑子里。有一次我在新加坡办公室,还真有人在做生成式检索——我不知道他们现在还做不做——我碰到一个人试图给我解释生成式检索,挺搞笑的,毕竟这东西算是我参与共同发明的。整个 IR 这个领域……对我来说那只是个有趣的阶段。我绝对认为 DSI 是我做过的最有创造力的工作之一,而且它跟 LLM 没什么关系。
Swyx: 但按照"把 ML 应用到一切"的大原则,如果 Google 内部有人在做通用检索,那会不会就是 AI Overviews 之类的东西?是类似的吗?
Yi Tay: 我完全不知道。
Swyx: 好。跟听众说一下,我在大会上设了一个相关 track,你搜 AI Engineer 就能找到。是 YouTube 的人讲怎么用 Gemini 做 RecSys——抱歉,是 YouTube 的人,不是 Gemini 的人。我不知道用的 Gemini 是多大尺寸,他没讲。但这已经是公开的工作了:基本上每个上传的 YouTube 视频都会被编码进某种码本(codebook),他们用某种批处理任务每天重新训练。
Yi Tay: 嗯。
Swyx: 挺有意思的。所以你大概也不知道 Gemini 被用在什么地方。
Yi Tay: 我这些日子确实不跟进了。
Swyx: 我是这么想的——对还没听懂的人解释一下:把智能、把 LLM 的通用智能用到检索和推荐任务上,意味着你能处理那些非常古怪的推荐需求、非常古怪的查询,而传统系统根本处理不了。而且我觉得这在某种意义上是涌现的(emergent):你用 T5 的时候,在一个普通的 BM25 检索技术之上其实加不了多少价值。你觉得这么说准确吗?这不只是改写(paraphrasing)的问题,而是理解查询意图(query intent)的问题。
Yi Tay: BM25 是个非常强的基线。说真的,BM25 真的很强。
Swyx: 抱歉,我不知道你们当时 T5 相对 BM25 的比较增量是多少,但我预计不会很高;而我预计一个真正基于 LLM 的做法会高得多——当然取决于查询集。
Yi Tay: 我以前没这么想过。因为我在很多不同领域做过建模,包括搜索、IR 社区。那边也有一些基准,大家在上面刷榜爬山(hill climbing),有一些像……我现在都记不清叫什么了。但总体来说,IR 任务的建模动力学跟 RecSys 任务很不一样,跟标准的语言任务、视觉任务也都很不一样。我们爬山式优化 LM、训练模型的方式,以及模型与环境交互的方式,都完全不同。所以我说实话——我很讨厌做 RecSys 和检索的东西。回想当年,你做 T5,改改架构,想办法降 perplexity,刷 SuperGLUE——那是上古时代。就算现在训练 LLM,你也就是做做 zero-shot、few-shot 这类事。作为研究员或工程师,你就是这样跟环境大量交互——有点像在这个环境里做 RL。但 RecSys 和 IR 有一种非常奇怪的感觉,奇怪在于它感觉像"怎么都行"。就像你身处一个重力不一样的世界,那些凭直觉成立的建模直觉在那里统统不成立。所以那是个很奇怪的空间。我当年也写过一些 RecSys 的论文,每次跑 RecSys 的建模实验,我都不享受。感觉那个环境很"无礼",氛围就是不对。
Swyx: 怎么个无礼法?就是感觉很事务性(transactional)?
Yi Tay: 不是事务性。我不知道怎么形容。打个比方,你打网球或者羽毛球,击中球的时候有种非常好的感觉——打中甜区(sweet spot)的感觉。你在传统领域做建模,拿到反馈的时候,你会觉得一切都对、一切都顺。但 RecSys 和 IR 就像——你击打羽毛球,却听到一声玻璃碎裂的怪响。你就是会莫名感到一种因果关系错位的诡异感。
Swyx: 因果之间离得太远了。
Yi Tay: 就是感觉奇怪。而且有时候指标——RecSys 用的都是 NDCG 这类指标——然后 BM25 又很强,你做出来的东西还不如 BM25。想当年,你把 2 层 LSTM 堆到 3 层,都会激动:"哇,我看到生命了。"
Swyx: 就是个回报感很低的领域。
Yi Tay: 就是很奇怪。而且 IR 社区、检索社区总是落后于主流,现在因为 LLM 这波东西,差距可能还更大了。好,我要开始发表暴论了:有些会议就是落后于 NeurIPS、ICML 这些,有些会议就是把别人做的东西拿过来套。
Swyx: 它们是下游。
Yi Tay: 是下游,是下游。
Swyx: 嗯。
Yi Tay: 所以做这些东西总感觉很不振奋人心。
Swyx: 是啊,怪不得你——
Yi Tay: 离开了。不过那也就是个支线任务(side quest),我是把它当支线来做的。
Swyx: 好,我懂。我仍然认为那是个重要的商业问题,哪怕作为一个研究领域回报感不高。
Yi Tay: 我多少能理解为什么。因为那些任务的学术基准跟工业界的现实脱节得太远了。我没在工业界做过这些,只从学术角度接触过。
Swyx: 哦,那你需要的只是在线评估(online evaluation),对吧?A/B 测试之类的。
Yi Tay: 那大概会是完全不同的体验。
推荐系统(RecSys)是消费级 AI 的"王者问题":搜索、排序、过滤、个性化本质都是检索,被 Swyx 称为"上帝问题",做好它能赚大钱。Twitter 已公开将信息流算法换成基于 LLM 的 RecSys,YouTube 则在其推荐系统中采用语义 ID(Semantic IDs)——而后者正是 Yi Tay 早年 DSI(生成式检索)工作向 RecSys 迁移的延伸。
GDM 新加坡:人才密度与研究品味
Swyx: 好,研究话题和各方面覆盖得差不多了。最后用一个很简单的问题收尾:关于 GDM 新加坡(Google DeepMind Singapore)——你在这里组织了一场研讨会(symposium),请来了 Jeff Dean、Quoc 和其他人。创办 GDM 新加坡的总体愿景或动因是什么?
Yi Tay: 先讲那场活动吧。那场活动主要是——Quoc 和我要组建一个团队,在我回来之前我们已经讨论了一段时间,Jeff 非常支持。就在我准备回来的前后,他多次来这个地区,去了越南、新加坡。所以这场活动本身,是趁着 Quoc 和 Jeff 来访,我们想激励一下本地的社区。我觉得这也有点像是——用个软件的说法——定个基调(setting the tone),为 Gemini 新加坡团队的开局定调。我觉得这是很难得的场合:Jeff 和 Quoc 这样真正的世界级 AI 先驱同处一室——你当时也在场。很多人跟我说……
Swyx: 别抬举我,我不是什么 AI 先驱,我当时是去现场发推的。
Yi Tay: 嗯,把他们聚在一个房间里分享想法——很多人事后找我说,他们在场这件事本身、他们出现在这个地区,就让人深受鼓舞。组建团队、开创新局面,也并不是"按下一个按钮就开始了"的某个瞬间,而是一个过程。
Swyx: 对。
Yi Tay: 我们招人,人一个接一个加入,诸如此类。所以我觉得这场活动更多是营造氛围(set the vibe)。我相信新加坡是有可能贴近前沿(frontier)的。有真正的 AI 先驱在场,我们想传递的更多是一种鼓舞,同时也让 Quoc 和 Jeff 见见这里的人。Jeff 去年来过,但 Quoc 有一阵没来了,而他以后要在这里带团队,所以带他转转、见见本地的人也挺好。活动非常棒。我们还见了李显龙——
Swyx: 很多人不知道他有计算机科学学位,是少数有 CS 学位的总理之一。
Yi Tay: 嗯。我会说那次会面的背景,部分是他想多了解一些 IMO(国际数学奥林匹克)的事。
Swyx: 哦,真的?
Yi Tay: 还有关于 Jeff……
Swyx: 哦,是因为他们邀请你的时候不知道这些人会来,还是怎样?
Yi Tay: 就是 Jeff、Quoc 和我去总统府(Istana)拜访、聊天。我们聊了一会儿深度思考(Deep Think),聊了一会儿 IMO。然后剩下的部分更多是 Jeff 和李显龙在谈——话题变得不那么关于 AI,更多是宏观经济、政治层面的事。那是我很不熟悉的领域,所以我就……
Swyx: 你还穿了西装。
Yi Tay: 我就只聊 Deep Think、IMO 这些。但他看起来真的挺惊讶 AI 已经发展到这个程度。总之我觉得那次会面很有意思。
Swyx: 对听众来说——你做了一件新加坡历史上迄今独一无二的事:在新加坡建立一个前沿研究实验室(frontier research lab),这本身就是一项成就。另外我还在琢磨的一件事是:地理位置真的重要吗?你们都在一个团队里工作,你有伦敦的人、山景城的人,反正你主要就是跟他们协作,你一辈子都是这么跟他们协作的。说到研究、或者泛泛地说 AI,我都快不知道"国家"意味着什么了,因为这件事从根上就是国际化的。
Yi Tay: 这是个很好的问题。它也和身份认同(identity)有关——你自己也在旧金山和新加坡之间来回搬。我一两周前还在山景城,现在就在这里。但几乎——除了家人之外,我聊的所有人某种程度上都在湾区,就是因为工作的原因。我认为地理位置确实重要。首先最实际的是时区问题。
Swyx: 所以你字面上想要全球 24 小时覆盖。
Yi Tay: 有它的好处。不,我想说的是:差别可能更多在于——某种程度上是人定义了地点,而不是地点定义了人。时区的问题我们稍后再谈,各有利弊。我觉得是有利有弊的。
Swyx: 所以你看好亚洲、看好新加坡的人才池。
Yi Tay: 我觉得我们找到了非常优秀的人。但我也必须说,这种事更多是"人才吸引人才"。我觉得大多数时候大家都很兴奋,我感受到的氛围是:人们非常兴奋,因为这是 Quoc 的团队和我的团队,我们在做跟 AGI 非常核心相关的事。所以我们能从本地区招到的人才真的很棒。但那是因为是我们——是我们才能解锁这些人才,否则他们可能就去了别的地方。
Swyx: 是的,搬去美国。
Yi Tay: 关于身份认同,我很同意你说的"这有什么重要"。新加坡本身——或者说任何地方——的优势在于:世界连接得很好,技术上你想跟谁互动都可以,你也可以飞过去。但我认为新加坡有这个优势:你既可以离得近,也可以离得远。湾区太……我有在伦敦和纽约的朋友,他们就是绝对不会搬去湾区。我不是反对湾区,湾区是个好地方。但那里就是 AI、AI、AI,到处都是 AI。有时候你需要一点心理空间和精力去接触一些别的文化——伦敦、新加坡、纽约都有自己的文化。但湾区的文化就是 AI。你走到哪里都听到 AI,连广告牌都是。
Swyx: 是有点太多了。
Yi Tay: 嗯。
Swyx: 不过我在这边也看到了一些广告牌。我当时想:这是什么文化在向外传染?
Yi Tay: 我确实认为,某种程度上,想做研究,你需要在某个地方有一点安静和平和。这座岛也许适合这个,但我们依然能保持连接。所以主要就是人才方面——我觉得这里的人很强。
Swyx: 离得足够远,但依然保持连接,人才也强。你们在招什么样的人?你还在招人,对吧?
Yi Tay: 我们在招。我的团队会为 Gemini 和 Gemini Deep Think 做 RL 和推理(reasoning)。我们现在更看重人才密度(talent density),所以也不会扩得很大,先保持小团队——因为人均算力(compute per capita)可能很重要。这基本上就是我们现在的招聘方向。我个人收到很多私信(DM)……总体上有很多非常能干的人。但我主要想找的是:要么你有 RL 研究的实绩(track record);要么甚至不一定是 RL——在编程竞赛上有过杰出成就,或者在某个领域有过杰出成就。这就是我们想要的人。
Swyx: 对,因为你并不硬性要求背景对口。我记得你在 Reka 的时候说过,你喜欢从零开始培养年轻人。
Yi Tay: 我忘了我说没说过这话。但某种程度上是。某种程度上,我觉得我们绝对会非常喜欢那些"属性值"很高的人——哪怕没有太多统计知识……不不,不是统计(statistics),是属性点(stats)。就像游戏里加点,智慧(WIS)、智力(INT)点得很高的那种人。就是纯粹的高智商、高技术天赋的人。我认为只要有很强的工程能力,ML 很容易学,AI 知识也很容易学。
Swyx: 嗯。这件事的另一个版本是:学生的预算还能做出东西吗?用学生的预算还能做出有意思的东西吗?跟这个相关的一点是,现在会议更冷清了。我采访过一位最佳论文得主,他们做的是千层神经网络(thousand-layer neural network)之类的工作,就是在学生预算下完成的,执行得非常干净,论文扎实,发现也很好。我不确定生产模型会不会真的做到一千层,但他们把它往一个有趣的方向拉伸了,得出了一些好的结论。那个人立刻被 OpenAI 招走了。我觉得这对市场上的研究生是个鼓舞——他们会想:我是不是得认识在这些实验室工作的人才进得去?比如我叔叔在那工作,我才能拿到实习。其实不是,你真的可以用学生的预算、配上好的导师做出来。
Yi Tay: 哦,我觉得一件有意思的事是:大多数我亲自去招的人——你看到他们的工作,然后给他们发私信。我收到很多……不不,是说一般性的招聘。总的来说,接着你的话说:你几乎可以——你只需要做好工作、放到网上,然后就会有人联系你。这事超级简单,同时又超级难,因为我可以告诉你……
Swyx: 我跟一些研究生聊过,他们不知道什么叫"好的工作"。因为有太多事情——他们的教授有自己的议程,强加在他们身上,而那可能并不对,因为教授们自己也不知道该做什么。所以,他们需要的只是指导,只需要有人说:嘿,去做这五件事,随便哪件做出个有意思的结果给我看。
Yi Tay: 对。如果有人自己想出个点子,做出来的东西让你觉得很有品味(tasteful)、跟实验室里研究员喜欢的东西一致,而且是独立做出来的,那你就知道:产生这个点子的那个"函数"本身是好的。如果你只是去告诉别人做这个,你得到的信号只是"这人能执行"。所以我认为……
Swyx: 有些人身上有价值——他们展示了品味。研究品味(research taste)。对,研究品味。很有意思。我觉得我可以给人……我确实在某种程度上在乎这个。我做的研究方向类的工作就有点这个意思——对我来说问责很低,因为那毕竟只是思想实验。但对很多人来说,他们的职业生涯就取决于:你能不能在这短短三四年里展示出研究品味,然后就这么做出来。
Yi Tay: 嗯,我会说竞争太激烈了,因为每个人都想进 AI。问题更多在于你怎么证明自己。这年头,当一个想证明自己的研究生一定很难。确实更难了,但……嗯。
想进入前沿实验室,路径"超级简单,同时又超级难":把工作做好、放到网上,就会有人联系你。比执行别人的命题更有价值的,是独立做出有品味(tasteful)的工作——这证明产生这个点子的那个"函数"本身是好的。Yi Tay 的招聘标准:要么有 RL 研究的实绩,要么在编程竞赛或某个领域有过杰出成就;只要有很强的工程能力,ML 和 AI 知识都很容易学。
健康是做好研究的一部分
Swyx: 反正不是你的工作。好,就这些了。收尾之前,你还有什么排好队的吐槽或话题吗?
Yi Tay: 没有了。聊得很开心。
Swyx: 聊天很开心,兄弟。
Yi Tay: 很开心。
Swyx: 嗯。上次我们在研讨会上见面,本来要录一期的,结果我们就是闲逛聊天去了。能听听你脑子里正在发生的事情、你世界里的动向,挺好的,因为——兄弟,我们在做的工作真的很重要。
Yi Tay: 跟你聊天、见到你总是很开心。
Swyx: 嗯,聊得好。最后说几句你的减肥和健身之旅吧,因为那对你也是件大事。
Yi Tay: 我觉得健康对做好研究很重要。我现在大概处于身体最健康的巅峰状态。
Swyx: 嗯,你看起来很棒。
Yi Tay: 谢谢。而且我觉得它以一种好的方式影响了我的工作。
Swyx: 你做的是那种流行起来的生物黑客(biohacking)式玩法?
Yi Tay: 我没有走太极端,但我相当数据驱动。我有自己的评估(evals),我会追踪这些数据。我本该写一篇博客讲这个的,但我觉得自己还没到终局(endgame),等到了再说。给不知道的人说一声:我今年减了 23 公斤——其实跨度是一年、一年半。
Swyx: 23 公斤?
Yi Tay: 对。
Swyx: 基本上就是从上次播客到现在。
Yi Tay: 是的。现在有个消融实验(ablation study):23 公斤。我的 HRV(心率变异性)上升了两倍,静息心率(resting heart rate)降了 30 次/分钟。
Swyx: 30 次/分钟。
Yi Tay: 原来大概 80、90,现在大概 60。
Swyx: 哦,80、90 也太高了。
Yi Tay: 嗯,我那时候不健康。
Swyx: 嗯。
Yi Tay: 嗯。
Swyx: 当过程很艰难的时候,是什么让你坚持下来的?很多人——包括我自己——可能太专注 AI 了。我优先工作,我享受工作,我不享受健身那部分,但它显然能融入你的智识工作——下线去散个步、吃得好点,诸如此类,它显然是契合的。但人们看到像你这样的正面榜样,会受鼓舞去做同样的事。所以我认为你把自己树立成榜样是好事。
Yi Tay: 我觉得这确实有帮助。当我为健康做这些事的时候,我就把它当成工作的一部分,因为它帮助我把工作做得更好。所以它也很重要。我觉得很重要。
Swyx: 嗯。我喜欢你张口就是 HRV。我完全不知道我自己的 HRV 是多少。但这里有个普遍的问题:什么是生产力,怎么衡量它?什么才是真正重要的?我到现在也不清楚。但我确实认为,总体的精力水平、还有饥饿感——你几乎得体验身体上的饥饿,才会有智识上的饥饿。我不知道这算不算一个说法。
Yi Tay: 不,我饿的时候只想吃的。对我来说饿是破坏性的——饿着很难工作。
Swyx: 好。非常感谢。
Yi Tay: 谢谢。真的很棒。祝你过得愉快。
总结与行动指南
- 像在策略 RL 一样学习。 模仿(SFT)只是起点,真正的泛化来自在策略学习——自己行动、从环境给的奖励中修正自己的路径,无论对模型还是对人。
- 押注通用模型,而非一次性系统。 专用系统可以做出无数个,但能力终将被一个大模型吞并;这正是放弃 AlphaProof、用端到端 Gemini 拿下 IMO 金牌背后的判断。
- 用公开的作品证明研究品味。 把工作做好、放到网上,机会会来找你;独立产生好想法的那个"函数",比单纯的执行力更能证明你。
- 把健康当作工作的一部分。 Yi Tay 一年半减重 23 公斤、HRV 上升两倍、静息心率从 80-90 降到约 60,他把数据驱动的健康管理当作让研究做得更好的基础设施。