洞见·Latent Space·2026.01.23

执掌IMO金牌、深度思考与在策略RL (Yi Tay)

本期对话 Google DeepMind 新加坡 Reasoning and AGI 团队负责人 Yi Tay,回顾端到端 Gemini 拿下 IMO 金牌的全过程,并深入探讨在策略 RL 哲学、推理与潜在思考、AI 编程、注意力架构、数据效率与世界模型、DSI 生成式检索,以及 GDM 新加坡的建队与招聘哲学。

Overview 背景概览

本文译自Latent Space 播客,发布于 2026 年 1 月 23 日,由 Swyx 主持,对话 Google DeepMind 新加坡 Reasoning and AGI 团队负责人 Yi Tay。作为 2025 年 IMO 金牌项目的四位联合负责人之一,Yi Tay 在本期系统回顾了团队放弃 AlphaProof 专用系统、以端到端 Gemini 模型拿下 IMO 金牌的全过程,并深入讨论在策略(On-Policy)RL 哲学、宝可梦长程智能体、推理与潜在思考、AI 编程、注意力架构与硬件彩票、数据效率与世界模型、DSI 与生成式检索,以及 GDM 新加坡的建队与招聘哲学。

▍嘉宾 Yi Tay,Google DeepMind 新加坡 Gemini 团队(Reasoning and AGI)负责人,2025 年 IMO 金牌项目四位联合负责人(co-captain)之一。他此前是 Reka 联合创始人兼首席科学家,更早任职于 Google Brain,是 PaLM 2 架构联合负责人,曾参与 UL2、T5 与 DSI(生成式检索)等工作。

▍关于 本期对谈是 Yi Tay 时隔一年半重返播客。与上次在 Reka 时期不同,这次他回到 Google DeepMind 并在新加坡组建团队,身份也转变为 IMO 金牌项目的联合负责人。节目中他详细拆解了在策略与离策略之争、一周内训出 IMO 模型的幕后、四位负责人跨时区"交接棒"的工作方式,以及他对推理、架构、数据效率、世界模型等研究前沿的判断,最后落在 GDM 新加坡的建队思路、招聘哲学与他的健康管理上。

开场:重返 GDM 与 Reasoning and AGI 团队

Yi Tay: 我觉得这些模型总体上最有用的一点是:我手上有一大张装满实验结果的电子表格,我想给它画图,就直接截个图丢给模型,让它"帮我画个图"。我特别讨厌写 matplotlib 那些东西,太烦人了。今年有很多个时刻,AI 突然跨过了那种"涌现"的门槛。为什么?AI 编程就是其中之一,就像我们刚聊到的。还有 Nano Banana 也到了那个程度——以前你用这类模型生成图片,基本就是图个乐、整整朋友什么的,但 Nano Banana 是真的变得特别好了。

Swyx: 欢迎回来。最近怎么样?

Yi Tay: 挺好的,挺好的。

Swyx: 回来真好。已经有一年、一年半了。

Yi Tay: 对,一年半了。

Swyx: 感觉过了很久。上次我们聊的时候,你还在 Reka。然后你又回到了 Google DeepMind(GDM),又跟着 Quoc 干了。

Yi Tay: 对。

Swyx: 最近你又在搞 GDM 新加坡。是叫 GDM 新加坡还是 Gemini 新加坡?不知道你们团队正式起名了没有。

Yi Tay: 我想我们在新加坡有一个 Gemini 团队。

Swyx: 对,新加坡的 Gemini 团队,名字叫"推理与 AGI"(Reasoning and AGI)。

Yi Tay: 对,Reasoning and AGI。

Swyx: 名字里带上 AGI,重要吗?

Yi Tay: 把 AGI 放进去主要是一种氛围(vibe)上的事。

Swyx: 嗯。

Yi Tay: 我们做这些模型的原因之一,就是我们想抵达 AGI。把 AGI 加进招聘启事里,也只是一种氛围上的表达。目前还没有正式的团队名称,但实质上就是 Gemini 新加坡团队。

Swyx: 我觉得大家都在琢磨、在互相参照:Amazon 有个 AGI 团队,你们有个 AGI 团队,然后 Meta 现在又有个超级智能(Superintelligence)团队。大家给团队起这些名字的时候,到底在释放什么信号?是"我们真有一个计划",还是纯粹的氛围?

Yi Tay: 你这是想从我嘴里套点暴论出来。

Swyx: 不是,你的职位头衔里可是官方写着 AGI 的。

Yi Tay: 不,那不是一个正式的名字,也不是团队名。我们只是想表明那颗北极星——我们要把这个模型做到 AGI。

Swyx: 好吧,我真不是在套话,不谈政治。说回来,你重新加入了 GDM。

Yi Tay: 对。

Swyx: 我把上次那期完整重听了一遍,非常精彩。上次你讲到,你当时从 Google Brain 出来,现在又回到了 GDM。

Yi Tay: 对。

Swyx: 我很好奇,重新接回 Google 的基础设施,你总体上有什么感受?

Yi Tay: 回来这件事很有意思,因为回到 Google 的感觉就像——你的 LDAP、你的用户名,全都还在原样。就像你玩宝可梦(Pokémon),放下一阵子,再回来点"继续游戏",读取存档接着玩,就是那种感觉。当然,我离开的一年半里,很多东西变了,Brain 现在并入了 GDM 之类的。所以确实有很多变化,但总体来说回归非常顺滑。我本来就很喜欢 Google 的基础设施,TPU 也很棒。总之很高兴能回到 Google 的技术栈。

Swyx: 你回来的时候就打算做深度思考(Deep Think)吗?

Yi Tay: 并没有。我那时非常想念研究——不是说特别基础的研究,而是贴近模型的研究。我真的很怀念站在前沿、并试图越过前沿的感觉。所以我特别想念那个状态。我回来的时候,Deep Think 还不存在,我觉得也没有任何相关计划,就是先回去做研究,看看会发生什么。

Swyx: 但我猜应该是有某种倾向的:推理(Reasoning)是下一个前沿,而且这显然是最有回报的研究方向,尤其是今年。

Yi Tay: 对,如今推理和强化学习(RL)基本就是一回事——推理很大程度上来自 RL。我过去花了很多年做架构和预训练(Pre-training),我管那叫"前世"。但现在我更多转向了 RL 研究——不是老派的 RL,而是面向智能体的 RL,老派 RL 是另一回事。说实话,我回来的时候几乎没有 RL 背景。但如今 RL 是主要的建模手段,所以重新上手其实挺容易的。研究里的很多基本功是通用、普适的,即使在一个你不太熟悉的工具集里,要做出创新也并不难。总之,RL 基本就是我们现在日常摆弄的主要建模工具集。

在策略 RL 哲学:从蒙特梭利到学习率

Swyx: 表面上看,你在 UL2 和 T5 的工作里,对目标函数(objective)的关注、对"你到底想激励模型学什么"的关注,跟现在是有一些重合的。我本来会猜重合度比你说得更高,不过这挺有意思,我理解你的意思。

Yi Tay: 目标函数确实是目标函数,两者是有些重合。但关键的区别在于设计这些东西时的在策略(On-Policy)与离策略(Off-Policy)之分,这也会改变学习算法本身。

Swyx: 给不熟悉这套 RL 术语的听众简单解释一下吧。我确实觉得很多人都在试图理解:这一代 RL 研究到底什么在起作用。对了,Jason(Jason Wei)有篇很有意思的文章,我记得你也是认同的——核心观点是:你永远应该保持在策略上,而不是模仿别人的成功轨迹;采取你自己的动作,从环境给的奖励中学习。说白了就是修正自己的路径,而不是试图复制别人的路径。

Yi Tay: 对,对。

Swyx: 首先,他写得真的很好,我希望更多人像他那样写。不知道你对此有什么感想,或者有什么要补充的?

Yi Tay: 在策略和离策略最大的类比是:离策略基本上就是你做监督微调(SFT)的时候——你拿来一些别的模型、更大的模型生成的东西,说白了就是用别人生成的输出、轨迹什么的。而在策略是现代大模型 RL 的核心思想:让模型自己生成,然后根据它自己的生成结果给它奖励,再让模型在自己的生成结果上训练。所以从某种程度上说,这有点像自蒸馏(Self-Distillation):模型生成自己的输出,你给它奖励,再让它在自己的输出上训练。"在策略性"(on-policy-ness)基本就是这么个理念:模型在自己的输出上训练,让模型生成自己的轨迹,再让某种奖励来验证它,然后模型在自己的输出上继续训练。我认为这总体上更具泛化性。关于 SFT 和 RL 之间的差距,仍然有很多科学问题有待研究,但说白了就是在策略与离策略之分。把这个类比带回现实生活:在策略性更像人类——我们更像是在策略的,我们在世界里闯荡,犯错,然后"啊,好吧,原来是这样"。而模仿学习(Imitation Learning)大多不是第一性原理的:别人告诉你该怎么做,然后你照抄。所以,把这种哲学带回生活,是相当有力量的。我现在有孩子了,我希望我的孩子自己去尝试,然后你告诉他:这一步哪里错了、哪里做对了——而不是"你就照抄别人做的一切"。

Swyx: 蒙特梭利(Montessori)教育基本就是这样,对吧?非常非结构化的学习,你自己探索自己的路径,我们只是给你一个安全的环境去做这件事。那么,应该在什么时候从模仿切换到在策略?我自己在这个问题上也是反复摇摆。

Yi Tay: 你说的是人类,对吧?不是模型?

Swyx: 在模型上,似乎一直有一条很明确的路:先模仿——也就是预训练——最后再上 RL。

Yi Tay: 严格说 SFT 仍然是模仿。但对人类来说,确实也有这么一点味道。拿运动来说吧:你做一项运动,一开始是硬核模仿——我不知道这个类比好不好——看大量教学视频之类的东西更像模仿,你试着学会某些动作。但在策略性就像是亲自上场比赛,从比赛中获得奖励信号。所以我认为人类确实需要某种形式的模仿学习,每个人都是先模仿起步的。不过话说回来,人类和模型之间——做类比是好玩,但我们不该太当真。

Swyx: 其实我还挺认真的,我是那种会把机器学习的洞见认真套用到人类学习上的人。

Yi Tay: 我们现在就是从模型身上学东西。

Swyx: 因为我认为机器学习是人类有史以来研究"学习"这件事最科学的方式。

Yi Tay: 这倒是真的。

Swyx: 在机器学习里,我们得从零发明课程(curriculum)。

Yi Tay: 对,确实。

Swyx: 还有学习率(Learning Rate)这种东西:学习率太高会怎样怎样,太低又怎样怎样。

Yi Tay: 人类真的有学习率吗?

Swyx: 我确实会告诉别人,要意识到自己有一个学习率,并且警惕它过低。比如说,如果你错了一次,你应该问:我还在哪些地方错了?通常来说,人们在发现自己错了之后,更新得比应有的慢。

Yi Tay: 那叫什么?固执?

Swyx: 可能是固执吧,我不知道这个词对不对。也可能是他们太贝叶斯了——实际上他们的先验假设就是错的,需要把之前的假设整个扔掉,因为一个反例就可以让全部既往经验失效:你的整个世界模型(World Model)都是错的,扔掉它。所以贝叶斯式更新反而是错的。假设你在某种假设下生活了十年,然后出现一个打破你叙事的例子,你不该想"好,那我更新 2%"——不,你应该想:"一定是出了什么大变化,我过去十年假设的一切可能都是错的。我还在哪些地方错了?"然后更新 20%、更新 50%,而不是 2%。这就是我的"学习率"理论。我自己的直接例子就是进入 AI 这行的经历:我看了十年的 GAN——有十年吗?2012、2013 年开始。

Yi Tay: 时间过得真快。

Swyx: 对,我一直在看 GAN,心想:挺酷,细节越来越多了,但也没那么惊艳。然后突然之间 Stable Diffusion 出来了,而且能在笔记本上跑。那就是我的学习率时刻:靠,我关于生成式图像的心智模型里根本不包括这种东西。所以我意识到:我错得很离谱,我需要把一切转向。Latent Space 就是这么开始的。

Yi Tay: 所以这说明你的学习率高?

Swyx: 对,我会把它往上调。因为一个世界模型被推翻了,所以我会重新安排自己的学习节奏。

Yi Tay: 我觉得这是个好策略。这也引出一个话题:当新范式出现时,人们采纳它的速度有多快,或者说推翻自己既有理解的速度有多快。作为科学家,随着领域的进展,我们确实常常必须不断推翻自己的世界模型——可能长期以来你一直认为某件事就该这么做,然后突然冒出一个东西把它推翻了。

Swyx: 你可以为你的先验非常自豪,直到它变成你的监狱——那其实很危险。好吧,这有点跑题了,不知道我们怎么聊到这儿的。你之前推荐过 Denny(Denny Zhou)关于大模型推理的讲座,他梳理了 LLM 推理的思想史,从思维链(Chain of Thought)一路讲到强化学习。我还想顺带问一下自洽性(Self-Consistency)——这个概念大家大概都知道。我觉得 OpenAI 的实现比你们的粗糙,他们就是直接跑八次推理,然后投票或者让评判器来判之类的。但我确实认为这跟在策略蒸馏也有关系:八条不同的路径,全部来自同一个模型。你帮我验证一下我的直觉:你刚才说的"为什么在策略很重要",再加上用一个外部验证器来改进推理——这事用并行推理其实也能做。

Yi Tay: 对。我们训练 RL 模型的时候,本来就会采样多次。所以某种程度上确实包含某种形式的自洽性。

Swyx: 那直接就是自洽性,对吧?

Yi Tay: 自洽性要更……更细腻的版本是——你跟 Denny 聊的话,他会告诉你,它肯定不是简单多数投票,而是更……

Swyx: 我同意。

Yi Tay: 对,它是更细腻的版本。不过我认为并行思考(Parallel Thinking)确实跟自洽性有关。

Swyx: 说到这个,OpenAI 其实也发过几篇有趣的论文,讨论多数投票和其他形式的多输出共识。最高级的做法是用一个真正的大模型评判器(LLM Judge)来判定:基于某种内部一致性、或者直接检视思维链,这条轨迹确实更有价值、更站得住脚。我们能训练模型来做这件事,这本身就很酷。

Yi Tay: 当然。自洽性是一个重大的基础性思想。思维链本身也是一个大思想,自洽性同样是现代 LLM 文献里的一个重大基础思想。

IMO 金牌:一周训出的端到端模型

Swyx: 好,那我们进入正题。这期播客的头条之一大概就是要深入聊聊国际数学奥林匹克(IMO)的事。时间大概是五月、三月……七月,你们官宣了。这里有一张很棒的照片——我刚才一直在看——应该是在伦敦拍的,你们去了 Dishoom(那家餐厅)。

Yi Tay: 对,Dishoom。哈,你得出现在合影里才能算拿到功劳(credit)。

Swyx: 这也太扯了吧?搞什么?

Yi Tay: 开玩笑的,开玩笑的。

Swyx: 贡献者名单可比这照片长多了。

Yi Tay: 对对,不过他们当时就在说,"哦,你应该去……"

Swyx: 才能拿到一块字面意义的金牌。

Yi Tay: 不是不是,是说要想在 IMO 项目的贡献名单里挂上号、名字排进去,得如何如何。就是个玩笑。

Swyx: 好吧。你能讲讲这个 IMO 项目的故事吗?据说只用了一周就做完了。

Yi Tay: 让我先把一些事情讲清楚。

Swyx: 好。

Yi Tay: IMO 这个方向的投入其实已经持续很久了。Thang(Thang Luong)、还有 Quoc,去年就一直在做这件事。去年他们拿了银牌——那会儿我还没回 Google——他们有 AlphaGeometry 那套东西,还有 AlphaProof。所以这是一条延续了很久的路线。但今年我们想尝试的是:真正把 Gemini 作为一个端到端(End-to-End)模型来用。

Swyx: 不再有第二套系统。

Yi Tay: 没有第二套系统,就是一个端到端模型。

Swyx: 即便这个决定本身也很反直觉。我报道过去年的银牌成绩,当时我想:离金牌就差一分,再努把力不就拿到了?所以放弃那条路线的决定,我觉得相当大胆。

Yi Tay: 我个人一直相信——事后诸葛亮当然好当——但这有点像是:如果模型拿不到 IMO 金牌,那我们还能到 AGI 吗?所以在某个节点上,我们必须让这些模型去闯一闯奥林匹克竞赛。今年的目标之一就是:好,我们要做一个端到端的模型。这也是我参与进来的契机。我其实只参与了模型训练那一段——得说清楚,IMO 这件事大部分是 Thang 做的,我只是和一队人一起把模型训出来。我们做的事情就是为真正的 IMO 比赛准备好模型检查点(checkpoint)。这也是 IMO 这件事容易被忽视的一点:很多时候你刷基准测试(benchmark),是可以一直跑、一直迭代、一直爬山(hill climbing),直到刷上去为止。但 IMO 是一场现场比赛:团队里一些成员人就在澳大利亚,事情正在现场实时发生。

Swyx: 很有 AlphaGo 的感觉:你拿到赛题,把它输进系统,然后……

Yi Tay: 对对对。Thang 团队的一些教授亲自去了 IMO 现场——我也不知道 IMO 算不算"会议",反正澳大利亚那边有人。这是现场直播式的事:有人的工作就是对放出来的 IMO 第 1 题到第 6 题跑推理,而且这些题是分不同天放出来的,第一天一套、第二天一套,类似这样。最好玩的是,我对 IMO 一无所知,我小时候没参加过 IMO,我当年没那个水平——我是弹钢琴的。我只知道的是:好,我们交付了检查点,那个检查点被用来拿到了 IMO 金牌。然后在伦敦有那么一周,所有人聚在一起——大家都飞去了伦敦,那张照片就是在那儿拍的。你能看到各个部分如何拼到一起,还能跟其他几位联合负责人(co-captain)待在一个屋子里,感觉有点像黑客松(hackathon)。所以,这个 IMO 模型的训练过程本身大概就一周左右,而不是整个项目从头到尾。

扔掉 AlphaProof:一个模型吞并一切

Swyx: 我真正的问题是:我还是没放下"扔掉 AlphaProof"这个决定。

Yi Tay: 嗯。

Swyx: 我觉得这非常重大。我理解你们有 AGI 这个目标,显然在某个节点上,一个模型应该包办一切。但如果你在 2024 年拿枪指着我说:要做 IMO、IOI、ICPC 和你们做成的所有这些事,需要什么?我会说:你需要一个会操作电脑、会写 Lean、会跑 Lean 验证器的大模型推理系统。而你们实际上是把 Lean 验证器揉进了思维链里——这件事能做到,本身就完全不显然。

Yi Tay: 所以你的意思是:这些东西以某种方式被编码进了模型里?

Swyx: 对。

Yi Tay: 说到底,就是你是否相信"一个模型、大量参数"这条路线。当然也有工具调用(Tool Use)这条路,之类的。但我认为某种程度上,模型应该能走到那一步:LLM 刚出现的时候,模型连计算器都当不了,现在它多少能当计算器了。所以严格说,计算器这样的工具已经在某种程度上被编码进了模型参数里。我认为我们最终会走到那一步。"有没有什么是永远无法表达进模型参数的",这是一个开放问题,我们不知道极限在哪里,但我们会一直把这个极限往前推。所以无论是 Lean 这样的系统,还是解决其他问题的物理引擎之类的,我们都会继续推这个边界。不过我当时其实并不知道有没有过很多关于"符号系统(Symbolic System)对……"的争论——

Swyx: 对,就是这个——符号系统。

Yi Tay: 我真的不知道有没有争论过。对我来说就是:"哦,那就训模型吧。"有人让我训模型,然后我就训了。反正这个决定是统筹 IMO 项目的人做的。而且我也认为,那些专用系统都是一次性的系统:你可以做一个化学引擎、一个数学引擎,做各种各样的东西。但说到底,你想要的是一个包办一切的模型。所以这个方向更符合那个目标。而且这个模型后来也以 Gemini Deep Think 的形式发布了,就是一个通用的 Gemini Deep Think。

Swyx: 所以它基本没改,可能只是把一些配置调低了一点。

Yi Tay: 对。推理时的配置——给大多数用户服务的那个版本是不一样的。完整的 IMO 推理配置只给了一些数学家用,因为推理成本的问题。但那个版本已经足够好,可以当通用模型了。我的看法是:正是这种直觉,让我们走向"一个模型",而不是——因为专用系统这条路是没有尽头的。

Swyx: 对。

Yi Tay: 你可以做出无数个专用系统。

Swyx: 是的。

Yi Tay: 我能看到的最远未来是:会有一个模型,如果真有什么东西是模型无法吞并的,那就用个工具之类的。但我的预测是:大多数东西都能被模型吞并。AI 研究员是很擅长爬山的。

Swyx: 历史会给你很多支持证据。这是模型的输出吗?就是这个,对吧?

Yi Tay: 这是什么?哦对,这就是模型的输出。

Swyx: 你看着这个输出的时候,看到了什么?显然它看起来像一份写得很好的证明,像一个真正的人类数学家会写的东西。有人拿你们的和 OpenAI 的版本对比过,OpenAI 的更"生",他们还得清理一下自己的版本。我们可以不聊 OpenAI。我是想问:当你看到这种输出时,什么让你觉得有意思?

Yi Tay: 我得先做个特别的免责声明:我对数学一窍不通。这就是 LLM 时代的美妙之处:你可以是一个 AI 研究员或工程师,不具备任何领域知识,却仍然能拿到金牌。这是一个你一无所知的通用工具。这些题我是肯定做不出来的,它们对我来说完全是天书。

Swyx: 不过,证明也许是一种特殊形态的思维链。另外一件有意思的事:你的一些合作者提到过——这大概是"推理首次进入一个不可验证(non-verifiable)领域"的例子。但对我来说,证明按定义就是可验证的呀。我就是抛几个话题,看有没有值得展开辩一辩的。

Yi Tay: 我认为,除了证明之外,还有很多领域是不可验证的,或者说不容易验证。人们说"不可验证",意思是"验证起来不平凡(non-trivial)",或者说不像检查一道数学题的答案那么容易。因为证明是长文本(long-form),所以验证起来很不平凡——除非你把它转成 Lean,再做各种各样的处理。所以在这些不可验证领域还有大量工作要做。好吧,我开始进入"不确定哪些能说、哪些不能说"的地带了。

Swyx: 好,那没关系。另一个公开争论的话题是:到底做了多少领域特定的工作或后训练(Post-training)?因为你们后来又用同一个模型去做了 IOI 和 ICPC,对吧?

Yi Tay: 我没有直接参与 ICPC,但多少有点关联。我能说的就这么多。

Highlights 核心亮点

Yi Tay: "如果模型拿不到 IMO 金牌,那我们还能到 AGI 吗?所以在某个节点上,我们必须让这些模型去闯一闯奥林匹克竞赛。" Yi Tay: "你可以是一个 AI 研究员或工程师,不具备任何领域知识,却仍然能拿到金牌。这是一个你一无所知的通用工具。"

四位负责人、IMOcat 与肾上腺素飙升的等待

Swyx: 还有什么值得特别一提的吗?比如团队方面,你特别提到 Jonathan 是这个项目的联合负责人之一。这个项目的人员构成是怎样的?

Yi Tay: IMO 项目一共有四位负责人:两位在伦敦,Jonathan 在山景城,我在新加坡。我们四个人一起把这个模型训了出来。我记得 Thang 说过一个很有意思的点:我们全都在不同时区。还有一件很有意思的事是"交接棒":负责人之间并没有什么固定的工作流,完全是很即兴的——"我要登机了,接下来 12 小时 AFK(不在线)",然后就得有人顶上。

Swyx: 所以有时候你们就是在"看孩子"一样看着训练任务。

Yi Tay: 会有 bug,任务偶尔会挂掉。所以一切都非常即兴,负责人之间怎么配合非常、非常随意,大家自己商量着来。但那段时间也挺有意思的,因为我们都在飞:伦敦的同事不用飞,但我要飞,Jonathan 也要飞。而且你去另一个国家出差、访问一个办公室,就会有一堆会,所以我当时会议进进出出,挺忙的。还有一点:当时没人真的知道我们能不能拿到金牌,因为 IMO 还没开赛。那段时间很有意思、很刺激。然后是等待 IMO 委员会验证结果的整个过程——你懂的,"好吧,但我们还是别去现场了"。我也因此学了很多 IMO 的运作方式:原来金牌线甚至不是一个固定分数,是按比例划的(类似钟形曲线)。所以那段时间你就盯着分数看,我甚至会去看人类选手的表现、看他们的得分,因为 Gemini 能不能拿金牌,取决于人类选手考得怎么样。你就在那儿看百分比到了什么位置……

Swyx: 某种程度上,这完全不在你的掌控之中。

Yi Tay: 对,但你就是好奇嘛。我得说,这绝对比跑个基准测试、拿个数字更刺激、更肾上腺素飙升,而且这整个过程也持续了一段时间。总之,如果你有具体的问题也可以问。但对我来说,这整件事、这个 IMO 项目,是一段高光时刻。

Swyx: 我得说,如果两年前你问大多数人,一个模型能不能拿 IMO 金牌,他们会说:不可能。

Yi Tay: 对。

Swyx: 去年的银牌起了铺垫作用。但你们能把那套系统整个扔掉,直接拿现成的 Gemini,把 Deep Think 扩展上去,然后就在 IMO 上拿了金牌——相比去年,我觉得这也是非常非共识(non-consensus)的。

Yi Tay: 确实,某种程度上是的。我觉得研究员们也很惊讶——与其说是惊讶,不如说是一种"拍拍肩膀"式的惊喜:我们真的取得了很大的进步——这里说的"我们"是集体,是所有在 Gemini 上工作的工程师和研究员。看看我们一年走了多远。而且我还想说,不用两年前,就五年前——你想象一下这个结果,看看 AI 现在的状态:IMO 金牌、ICPC 金牌,甚至还有 Nano Banana 这样的东西。如果你拿现在的 AI 进展跟五年前比,人们会觉得我们已经达到了 AGI。

Swyx: 某种形式的 AGI。

Yi Tay: 某种形式的 AGI。

Swyx: 我们只是不断把标准往前挪。

Yi Tay: 如果你带着这些检查点穿越回五年前——真该有人把这拍成一部剧。这个领域进步的速度,真的非常惊人。

Swyx: 你会说,最难的部分是推理扩展(scaling inference)吗?

Yi Tay: 你指哪个方面?推理难?

Swyx: 或者说"贵"意义上的难——也许是团队消耗脑力最多的部分。我看到一些评论说:最难的其实是推理优化,或者说 Deep Think 相比普通 Gemini 所需的超长程(long-horizon)推理,诸如此类。

Yi Tay: 推理时扩展(Inference-time Scaling)不是我做的,所以这块我真不了解。

Swyx: 那部分基本就是这样。哦对了,还有件事:据说当时的代号叫 IMOcat,是你起的名。

Yi Tay: 这个嘛,其实算不上——我后来也发过推文讲这件事。IMOcat 说白了……它不是什么官方代号,只是那个训练任务的配置文件叫 IMOcat。就是这样。

Swyx: 你总得给任务起个名字。

Yi Tay: 对,我就是……我喜欢猫嘛。

Facts 客观事实

2024 年 GDM 凭借 AlphaGeometry 与 AlphaProof 的组合拿到 IMO 银牌;2025 年团队放弃专用系统,改用端到端的 Gemini 模型拿到金牌,模型本身的训练过程约一周。IMO 项目共有四位负责人,分别位于伦敦(两位)、山景城(Jonathan)和新加坡(Yi Tay),靠跨时区"交接棒"推进;训练任务的配置文件名为 IMOcat。该模型随后以 Gemini Deep Think 的形式发布,完整的 IMO 推理配置因推理成本仅向部分数学家开放。

宝可梦图鉴:长程智能体的未解难题

Swyx: IMO 的话题基本就这些,除非你还有什么想说的。我们还有其他研究向的话题。不过在进入那些之前,我想先把舞台留给你:关于 GDM 正在进行的推理方向的投入,大家还应该知道些什么?

Yi Tay: 让我想想从哪儿说起。大家需要知道什么?它真的很强。对,这就是大家需要知道的。

Swyx: 也许有个简单的开场:两年前大家可能还在盯学术基准测试,去年可能是 LM Arena,今年是宝可梦。宝可梦是非常有意思的推理、视觉推理,以及广义的长程智能体规划……

Yi Tay: 对。

Swyx: ……基准。而且我感觉你特别关注它,Gemini 也做得非常好。显然这是个很好聊的话题。

Yi Tay: 我大概应该说一句:我们其实没有为宝可梦专门做任何事——当然,真的没有专门为宝可梦做什么。Logan(Logan Kilpatrick)最近有条推文,讲 Gemini 3 玩《宝可梦水晶》(Pokémon Crystal)……

Swyx: 那件事讨论度特别高。

Yi Tay: 我觉得宝可梦——我以前经常玩宝可梦,总的来说是个大宝可梦迷。就像你说的,它是一个很棒的长程基准。而且我觉得,隔一段时间在这种基准上校准一下挺好的——这种基准几乎不会被污染,也没人专门花时间去爬它。有些人那种"你在做什么?哦,我在刷 AIME,我在刷 HLE,我在刷宝可梦什么榜"——就有点好笑。

Swyx: 我们采访过那个基于 Claude 的宝可梦 AI 的作者,我记得他叫 David。那个项目暴露出 Anthropic 在屏幕理解、视觉能力上的严重缺陷:字面意义上的——它想翻过这堵墙,但它不知道墙在那儿,于是一直往墙上跑。它完全没有任何空间推理能力。

Yi Tay: 这里面有一部分可能是 harness(外挂框架)的问题,也跟模型能不能拿到游戏状态信息有关——还是说它只能看到纯视觉画面。

Swyx: 对,Claude 那套实现非常依赖游戏状态,他们实际上是把模拟器里正在发生的一切内存状态全导出来了。

Yi Tay: 这样啊。我不知道是不是又跑题了。我觉得"通关宝可梦"这件事,关键会变成你通关得有多快。而我至今还没看到的是:模型能不能集齐宝可梦图鉴(Pokedex)。

Swyx: 为什么集齐图鉴更有挑战性?

Yi Tay: 集齐图鉴太难了。你需要规划,需要查资料。有些事如果你不上网,模型永远不可能知道——它需要一点"深度研究"(Deep Research)的能力。比如有些宝可梦必须通信交换才能进化,模型得能上网、去论坛发帖、找到人问:"嘿,能跟我交换一下吗?"有些宝可梦就是必须交换才能进化的。

Swyx: 对,或者靠生蛋繁殖。

Yi Tay: 对。反正,我还没见过有模型能集齐图鉴。"集齐"对模型来说是真的难。所以我觉得这其实是很有意思的一个方向。

Swyx: 我在想,它在现实世界里的对应物是什么。假设我们有一个能做到这件事的模型,我们能让它做出哪些今天做不到的事?

Yi Tay: 这里面涉及大量规划,是真正的深度研究式的规划。宝可梦游戏本身是很线性的,而图鉴涉及大量的回溯(backtracking)、大量的研究。所以它的性质本身就不太一样。

Swyx: 那这件事对你来说,有没有像 AI for Science 领域里很多人在做的那种"发现你查不到的东西"一样有趣?

Yi Tay: 新知识(novel knowledge)。

Swyx: 对,新知识。因为你刚才说的本质上是:我们还没走到那一步。我们还处在"模型连查到的知识都没法稳定运用"的阶段。对吧。就比如你给 Gemini 接上网络搜索,然后说,好,去把宝可梦图鉴(Pokedex)里的所有宝可梦(Pokémon)都收集齐。你对它能做到这件事并没有多大信心。我不知道有没有人真试过。可能有吧。也可能没有。

Yi Tay: 没有。我觉得真正的难点其实在于如何把网页上的知识综合起来,然后应用到游戏本身里面。要面对那么多不断变化的视觉状态之类的信息。这个问题大概迟早会被解决——目前还没有。

Swyx: 这挺有挑战性的。

Yi Tay: 也不能说有挑战性,但就是没那么有意思。

Swyx: 因为它本质上就是……这个任务实际上就是:你能不能查到攻略,然后能不能照攻略执行?就这样。你知道什么比这更智能吗?写出攻略。成为第一个搞明白怎么写出攻略的人。那是什么?

Yi Tay: 哦,对,对。但说到这个,目前主流做法还是穷举搜索那一套。模型像人一样不断尝试,然后形成攻略。对。

Swyx: 好,所以那对你来说反而没那么有意思。有意思。

Yi Tay: 嗯,其实吧,仔细想想,它算不上特别、特别有意思,但也还行。反正我还没见过有模型真正尝试做这件事。

Swyx: 是的。我觉得对新想法空间的高效搜索才是有意思的。显然任何东西都可以暴力破解,但我们说的不是暴力破解,我们说的是尝试造出一个 AI 科学家(AI Scientist)。

Yi Tay: 不过新知识确实是个有意思的东西,我觉得它会成一件大事。能够生成全新的……

Swyx: Google 在这方面做过一些东西——你可能跟那些团队走得不太近——就是做过 AI 科学家方向的工作。

Yi Tay: 这方面有一些事情是这样的。比如说,你把模型权重冻结在 2015 年,把时间冻结在 2015 年,然后就算用现在的模型……好,我们假设不存在信息泄漏。如果你问这个模型,最好的机器学习……好吧,不是 2015 年,就 2012 年吧,它大概只会告诉你 SVM 是最强的。对吧。这在当时就是机器学习的基本面貌。对吧。那么问题来了:它能发明出 Transformer 吗?对吧。它可能做不到。哪怕是今天的模型,可能也发明不出 Transformer。如果你把时间冻结在某个时点,哪怕你把技术……我是说,模型本身就是 Transformer。所以我就说,假设不存在泄漏问题——虽然这根本不可能。所以我认为,模型到底能不能真正创新、生成真正的新知识,仍然有很多悬而未决的问题。

推理祛魅与潜在思考(Latent Thinking)

Swyx: 是的,这引出了一个相关的问题,我觉得和 Danny 那篇论文也有关,就是人们对"推理"(reasoning)这个词有一种神秘化倾向。但如果你真正去祛魅,推理无非就是发生在思维链(Chain of Thought)标签内部的那些东西。

Yi Tay: 没错。

Swyx: 而你不过是从预训练语料里已经潜在存在的东西中,把这种推理行为激发出来——这是对这件事的一种解读版本。

Yi Tay: 我觉得现如今"推理"这个词本身非常含糊、非常开放。基本上不同的人对推理是什么有不同的定义。对吧。所以我同意,思维链基本上就是人们想到推理时联想到的东西,显然它就是"思考"(thinking)里发生的那些事情,好,那就是推理。对吧。但我觉得现如今——这个我之前也说过——推理和强化学习(RL)基本上就是:任何为了激发能力而做的后训练(post-training),基本上就是用 RL 和后训练去激发能力。所以我认为推理的实际技术定义,就是通过思考和后训练让模型变得或多或少更好。对。所以基本上就是用 RL 让模型更会思考,而"思考"更像是思考轨迹(thinking traces)、思维路径之类的东西。另外还有一条研究路线是潜在思考(Latent Thinking)之类的,比如潜在思考和离散 token 思考将来会不会变成同一件事。这是个开放问题,意思是给……

Swyx: 给你的词表加一些额外的 token,用来表示……

Yi Tay: 我忘了叫什么名字了。就是那些学术论文里做的循环式的做法,或者 pause token 之类的。基本上就是:与其解码出离散 token,你实际是在潜在空间(latent space)里模拟这个过程。

Swyx: 对。

Yi Tay: 所以当你做思维链、思考和推理的时候,你基本上是多解码出一些 token,把它们藏在思考标签里,然后再解码出内容。而潜在思考基本上就是你不解码 token,干脆不碰这一步。

Swyx: 也许思考的母语本来就是数字,不需要经过英语这层滤镜。而且有时候模型可能会开始用中文或者别的什么语言思考。

Yi Tay: 是的,总的来说我并不认为模型的思考必须和人类的思考一样。其实在机器学习这件事上,我一贯属于"让模型想干嘛就干嘛"那一派。

Swyx: 总体上,之前有过一场讨论。有一篇柏拉图表征假说(Platonic Representation Hypothesis)的论文,我觉得如果你还没读过的话,你可能会挺认同的——至少在我看来它是显而易见的。基本上,图像模型对"笔记本电脑"的概念,和文本模型对"笔记本电脑"的概念,会是一样的。它们会收敛到同一个潜在表征上,而且显然你可以把它们对齐,可以对它们做各种操作。所以它们的概念就是一个代表"笔记本电脑"的数字向量,这完全说得通。这就是概念本身。是的。好,也许不同模型对"笔记本电脑"的理解会有一些数值上的差异,但大体上是一样的。对,非常有意思。我真正想引出来的问题是:我们现在处在这样一个时代,LLM 生成的文本也进了我们的训练语料,这就有点像一个递归循环。对吧。推理 token 现在满世界都是。所以预训练模型本身、预训练基座模型也具备了推理能力,而且随着越来越多的推理文本进入语料,它们会越来越强。这件事是有意思呢,还是令人担忧呢?

Yi Tay: 你在互联网上真的看到很多推理轨迹吗?反正我从来没见过,虽然我……

Swyx: 我会说,在 Hugging Face 上有。对。人们专门在发布这类东西。至于研究人员到底有没有把它们放进训练语料,谁知道呢,对吧。那是他们的选择。但我会说,Common Crawl 里含有思维链 token 的比例,已经从 0 涨到了 0.001%,而且只会随着时间继续往上涨,因为人们在不断发布它们。

Yi Tay: 是的,不过我觉得如果来源很清楚的话,你其实可以把这些东西过滤掉。因为通常人们会把它放在 GitHub 上,或者放在……

Swyx: 你想过滤掉吗?也许你并不想。

Yi Tay: 这是可以选择的。

Swyx: 对,确实可以选。说来,这个话题我们之前那部分没聊到——两年前很多人都在说,哦,你只要往预训练语料里多加代码 token 就行了。

Yi Tay: 但推理 token 和代码 token 还是不一样的。

Swyx: 代码 token 可以泛化到代码之外的推理上。

Yi Tay: 哦,那听起来像……

Swyx: 你不信这个说法?

Yi Tay: 不不不。我觉得……我不知道这个说法今天还成不成立,不过我明白你的意思了。

AI 编程:从氛围编程到氛围训练

Swyx: 好,以上就是我们对推理这个话题的总体覆盖。我会说这方向有很多有意思的工作,也还有很多可做。也许我还可以聊一件我知道你有切身体会的事,就是你已经开始用 AI 编程了。

Yi Tay: 哦,对。其实我过去基本不怎么用 AI 编程,但我觉得我们已经到了 AI 编程开始变得真正好用的阶段。好,在 AI 编程之前,我觉得这些模型对我最有用的场景是:我有一大张装满各种结果的电子表格,然后我需要把它画成图。我觉得模型可以很直接地……给我截一张这个的图出来。我特别讨厌写 matplotlib 那套东西,太烦人了。好,但这基本上就是我能想起来的、我过去使用 AI 的方式。但我觉得 AI 编程已经到了这样一个程度:我跑一个任务,遇到一个 bug,我几乎连看都不看这个 bug,直接把它粘贴进 Antigravity,告诉它帮我修掉,然后我把任务重新跑起来。这已经超越了氛围编程(vibe coding),更像是氛围训练(vibe training)、氛围 ML 之类的东西。我得说大多数时候它干得相当不错。而且实际上有一整类问题,我总体知道它特别擅长,事实上可能比我做得更好——换我自己得花 20 分钟去找出问题、修好、再重新加载。

Swyx: 是的,这个很有意思,因为我会说,一级氛围编程是你其实知道该怎么做,你只是太懒了。对。就是"啊,帮我做了吧,这种事我做过一千遍了,直接去修,我很清楚该怎么做"。而你说的是下一个层级:你其实并不知道,它在替你调查。只要答案看起来是对的,你就直接 ship 了。

Yi Tay: 一开始我还有点……我会检查它,把什么都看一遍。然后到了某个时候我就想,好吧,也许模型看得比我准。所以我就放手让它干,然后基于模型给的修复方案重新跑任务。而且我觉得模型只会越来越聪明。对。所以这确实……对。我还觉得,最近有了 Antigravity。这些工具以前在 Google 的基础设施里不是这样……也没那么容易用上。我不太熟悉外面都有什么可用的工具。而且我在创业公司那段时间也没有真的……我觉得一年半以前模型还没这么好。所以这也算是一个助推,大家都在说,哦,试试 Antigravity,它是改变游戏规则的东西之类的。好。所以我就开始用了,然后……是的。

Swyx: 嗯。你最近还跟 Varun 待过一段时间。

Yi Tay: 哦不,我确实跟 Antigravity 打过交道了。对。

Swyx: 我记得你之前跟我说,你是个连 AI 都不怎么用的 AI 研究员,而现在作为用户,你是真的被 AI"洗礼"了。

Yi Tay: 今年有太多这样的时刻:AI 突然跨越了那个涌现的临界点。我觉得 AI 编程就是其中之一,就是我们刚讨论的这个。我觉得 Nano Banana 也到了那个程度——以前如果你做这种图片,基本就是图一乐,拿去整蛊朋友之类的。但 Nano Banana 真的好用到你可以把它用在正事上,你可以用它做……基本上,是的。所以它变得非常好用。而且我觉得,是的,今年这些东西……甚至以前这些模型会疯狂幻觉,但现在我基本上默认就信它。我觉得我们只是……大家就是在享受这些模型带来的效用。所以现在我就是这样,我一直是 AI 的拥趸。AI 是好事,我不明白这有什么可反对的。

Swyx: 是的。而且你是把它用在你自己高度专业的领域上,也就是你自己的机器学习工作上。

Yi Tay: 是的。

Swyx: 顺带一问,你内部用的 Gemini 是有什么我们拿不到的特供版吗?还是说就是公开版 Gemini?

Yi Tay: 应该就是公开版 Gemini。对。

Swyx: 我只是想说,专门训练一个只针对你们代码库和你们工作的内部版 Gemini,是完全合理的。

Yi Tay: 哦,其实我不确定。这些东西对我来说就是拿来即用的。

Swyx: 但显然,如果它能把你的生产力提升,比如说 10%,那就值了。对吧。所以我认为这很有意思。还有个有意思的问题是信任的层级:你对它信任到什么程度?你把自己多少工作自动化掉、不再亲自做?我猜还有个问题:如果大家不再需要初级员工了,后来的人怎么成长、怎么在这个领域里得到训练?因为 Gemini 就是你的初级员工了,研究员先生。所以我认为这些都是很有意思的问题。

Yi Tay: 我想先快说一点。关于模型能不能顶一个初级员工之类的。对吧。我觉得可以这样看:如果一份工作、一个人的工作量,可以被模型本身替代……但假设你是个管理者,对吧?你追踪的目标、你关心的指标是你的时间。如果你有一个模型,它能帮你省下的时间,等于你下属干那些活要花的时间——但你实际上并没有裁掉某一个人,而是……

Swyx: 从每个人身上都省一点。

Yi Tay: 对,没错。那我完全同意:把净节省的时间加起来,有些时候模型修掉的 bug,本来可能要花掉我一天。一天是很可观的。这些东西绝对……我不知道有没有人对此做过真正的指标评估,但如果你把时间当作真实指标,而不是按"哦,也许三小时"这种口径来算,对吧。这些东西并不会真的取代某一个人,它更像一个被动光环,用游戏术语说,就是给全队加 buff。对吧?是的。

Swyx: 我经常把自己当成一个吟游诗人,因为我负责讲故事,还能给身边所有人加增益。在一个 DND 小队里,这对我来说是理想位置。

Yi Tay: 好。我不玩 DND,不过行吧。那他们就是辅助之王。

Swyx: 英雄辅助位。

Yi Tay: 没错。

Swyx: 是的。好,AI 辅助这个定位我觉得非常让人鼓舞。那我想问:有什么地方它还是不灵?你试过之后觉得,唉,我本以为它会更好的。

Yi Tay: 哦。有些时候模型会犯懒,想糊弄着修点东西——它们还是会犯懒,然后试图"煤气灯"我,让我以为 bug 已经修好了。所以还是存在这样几类问题:有些问题对模型来说非常容易、对人类来说非常难;也有些事情对人类来说非常容易、对机器来说非常难——这就是莫拉维克悖论(Moravec's Paradox)那套东西。所以还是很难把这些问题规整地划分到清晰的象限里去。所以我会说,现在模型的能力已经好到真的能帮上忙了,但还是有点……还是有一些毛病。不过,是的,我觉得这个问题……我不认为有什么办法可以专门"集火"解决它们。这更像是通用能力提升的事:模型随着时间推移变得更好,这些毛病自然就会消失。

Swyx: 你这么说……好,是的,我觉得显然从大局来看,就是相信过程,在每个维度上继续扩展,问题自然就会消解,能力会涌现出来。但你以前也说过——我记不清具体是哪条推文了——大意是每多一个数据集,效果都会随时间复利累积,虽然每次只是很小的增量。而我会说,当你说"集火解决某些问题"的时候,你会想到那些"对人容易、对机器难"的事情,那些就是低垂的果实:你直接加一个针对性的数据集去集火解决它。爬山算法(hill climbing)不就是一连串这样的动作,一路爬到 AGI 吗?

Yi Tay: 好,我明白你的意思。我觉得确实,很多时候整体上的进展就是一连串小的增量改动堆出来的。我觉得这个描述是准确的,是事实。也确实有很多看似微不足道的小改动——找不到更好的词了——把 AI 推到了今天这个阶段。所以我绝对同意。我没有任何针对那些喜欢"集火"的人的意思,只是说,当我说集火的时候,要集火那些不太好刻画的东西可能并不容易。所以只有当问题足够明确的时候,对吧——好,我想提升这个能力,那就加点数据。我觉得定义评测(eval)就是定义问题,就是把它刻画清楚。如果能刻画清楚,那好,没问题。但我想说的是编程那个例子:这些东西甚至……我不做编程方向,但有些问题类别……做编程的人可能知道,他们对不同类型的失败有自己的术语。所以也许某个地方正有人在集火解决这类问题,让模型变得更好。那对所有人都是好事。

Swyx: 是的。这就是为什么需要一千号人才能把所有这些拼到一起。

Yi Tay: 如今的 AI 绝对是一项庞大的集体工程。它是一台大机器。是的。

注意力架构与硬件彩票

Swyx: 真的很疯狂。好。接下来我想把话题放宽一点,聊聊社区里大家在讨论的研究方面的东西——我也知道你现在非常专注,不一定读过所有论文,但我们可以随便聊聊想法。你显然也可以问我是怎么看的。"注意力就是你所需要的一切"(Attention Is All You Need)吗?

Yi Tay: 注意力(Attention)和 Transformer 是近年的核心思想。预训练和规模化(scaling)是让注意力和 Transformer 真正大放异彩的东西。对吧。因为没有……我觉得第一篇 Transformer 论文是讲机器翻译的。然后基本上是 GPT 和 BERT 真正展示了这个思想的全部潜力。所以,注意力真的就是我们所需要的一切吗?可能不是。但我觉得它是……从架构的角度看,也许也不是,但它虽然不是全部,我们绝对需要它。

Swyx: 在同一个层级上你还在想什么别的?你是说 MoE 之类的东西吗?你说"它不是你所需要的一切"是什么意思?

Yi Tay: 你肯定需要预训练的规模。你需要所有的 token。你需要 RL。我觉得当人们……

Swyx: 当人们说"注意力就是你所需要的一切"时,他们主要是……

Yi Tay: 从架构的角度说的。

Swyx: 但 Transformer 能带我们一路走到 AGI 吗?对吧。我猜问题在这。

Yi Tay: 所以基本上,问题是你怎么算到达 AGI。

Swyx: 到时候它还会是 Transformer 架构吗,还是会变成某种明显不同的东西?

Yi Tay: 它还会是 Transformer。我觉得这真的取决于你怎么称呼它。但我觉得,除非范式彻底转移——作为科学家,你不能把话说死,说这永远不会发生。但我的感觉是,从 Transformer 2017 年出来到现在已经多久了,差不多 10 年了,Transformer 已经九年了。我觉得我们并没有替换掉自注意力(self-attention)——顶多是它的某种形式。你可以给它改个名,你可以叫它别的什么。有时候你可以做局部、全局、滑窗注意力。对,但它归根到底还是 Transformer。我觉得它不会消失。除非连反向传播(backprop)这整套东西都变了,整个东西彻底变了,那就是另一个故事、另一场讨论了。但如果还是在同一个范畴和边界之内……所以我花了很多时间思考架构,思考有没有替代架构之类的。好。在序列处理这个层面,就像那个终极的……

Swyx: 对,就是序列到序列(sequence-to-sequence)的 Transformer。

Yi Tay: 自注意力大概是……曾经有一整个时代,我也参与其中——那个时代人们想尽办法削弱注意力:试图移除它、简化它、让它更高效。就是整个"高效注意力"(efficient attention)时代。到头来,结果永远都是:哦,我们把注意力全删了,但还留了一层自注意力在那儿,然后它照样 work。故事的结尾永远都是……

Swyx: 甚至 Noam(Shazeer)本人也发表过一些东西,讲他用某种比例去混合局部注意力和全局注意力。对吧。基本上还是注意力,只是做了相当大的改动。

Yi Tay: 我会把局部注意力和全局注意力仍然算作注意力。

Swyx: 只是你跳过多少的问题。

Yi Tay: 对。唯一的问题是,如果形式变化太大,你的 QKV 变成 ABCD、FG 之类的东西了,那……

Swyx: 也许我可以给你一些做这件事的现实动机。你们对超过 18 万 token 的上下文还在收两倍的价——还是 24 万来着,差不多这个数。而理论上限是 200 万 token,对吧?那如果我们需要 2 亿呢?会不会到某个点上,连"输入 token 上下文"这个概念本身都变得无关紧要?因为你在做持续学习(Continual Learning)之类的东西,你把它建模为……好,AGI 将通过序列到序列的变换来实现,而注意力是最好的序列到序列模型或架构,所以注意力就是你所需要的一切。但我觉得另一些人的看法是:序列到序列并不能准确刻画智能。

Yi Tay: 但这其实和序列到序列关系不大,更多是整个梯度设计和反向传播的问题。对吧。这不是架构本身的问题。我们面临的这个问题更多是学习范式本身的问题,而不是架构本身。我觉得架构基本上就是学习算法和 token 之间的接口。我觉得这更多关乎学习算法本身。还有持续学习这个……关于如何处理大到离谱的上下文,比如 2 亿、10 亿 token 之类的,有很多种思考方式。对吧。不管是哪一种——比如你有一种新的学习算法,每次跑推理的时候你都在它上面学习。对吧。那样你技术上就有了某种记忆,就像我现在跟你说话的同时也在学习一样。对吧?所以这也是一种方式。另一种方式是,可能有人会说,好,注意力对 2 亿、10 亿的上下文来说实在太贵了,所以我们需要新架构。也会有人说,哦,我们直接改进芯片、改进加速器就行了。所以我觉得有很多种解读方式。但我认为,如果问题是关于……有很多根本性的东西。如果是关于持续学习之类的,那学习算法本身也有很多根本性的问题。

Swyx: 那些东西也必须跟着变。

Yi Tay: 我觉得学习范式和架构这些东西是相辅相成的。而且随着领域发展,想法是一个叠一个堆起来的。所以还有这么一件事:新提出的想法必须和之前已经做过的所有工作兼容,才能发光。这有点像 Sara Hooker 那个"硬件彩票"(Hardware Lottery)的变体——不是我写过的那个 GPU 掉链子的硬件彩票,而是最原始的那个硬件彩票。但它更像是一种"彩票":新提出来的东西必须和以前提出来的东西配合得好。所以在某种程度上,这有点像一路走进了一个局部最优。我们现在就处在"Transformer 统治一切"的局部最优里。一切皆是如此。对吧。也许要完全跳出来并不容易,因为大量的投入和优化都已经做完了。能玩得转的东西,必须和以前的那些想法配合得好。而依我现在看来,要从中跳出来是非常难的。

想法依然重要:封闭与开源的差距在扩大

Swyx: 好,我不完全确定我听懂了你的意思,但我们就管它叫生成式 AI(Gen AI)吧——我超恨这个词。这仍然是一个非常年轻的领域。所以,是的,Transformer 上已经有八年的工作了,但放到大局里这算什么?也许我们确实在一个局部最优里,得想办法把自己推出去。我想把这个问题留着不下结论,我也没有答案。我确实觉得人们正处在 Ilya Sutskever 所说的"研究的时代"(age of research)。

Yi Tay: 对吧?

Swyx: 我们就像是:好,能扩的我们都扩了。我们知道在我们已知的每个维度上,再扩一到两个数量级大概是什么样。但下一个要扩的维度是什么?

Yi Tay: 这里有个小小的误解,就是"哦,过去五年只是在扩规模"。扩规模。

Swyx: 好,请展开讲讲。对,你之前还开过那个玩笑,说现在轮到扩研究员的薪水了。

Yi Tay: 好,这个就不展开说了。但我认为想法是重要的,而且我认为过去五年有很多好想法。只是也许它没有那么……它不是盲目地……如果你拿一个 MLP,对吧,没有自注意力。好,我往这东西上砸 100 万亿美元,把它扩起来,然后这东西……

Swyx: 永远不可能 work。

Yi Tay: 永远不可能 work。

Swyx: 对,对。

Yi Tay: 所以并不存在……这里面也有一部分是……我觉得"苦涩的教训"(The Bitter Lesson)被用得太滥了,被太随手地到处引用了。但实际上也有一点——不止一点——也有一条"甜蜜的教训"(Sweet Lesson),那就是想法是重要的。而且我觉得直到今天,对吧,人们仍然在贬低想法的价值之类的。

Swyx: 你觉得新想法的产出速度——不用具体说是什么想法,显然你不能透露——但想法的产出速度是变快了还是变慢了?因为按理说有收益递减的规律,至少应该是变慢了。

Yi Tay: 我觉得想法的数量永远和钻研某个问题的研究员数量成正比。所以按定义它应该是增加的。但我认为真正奏效的想法的数量并没有下降,和过去相比……我们现在还没进入收益递减的时代。所以我认为想法仍然非常重要,而且仍然有非常好的、改变游戏规则的想法正在被发明出来。

Swyx: 这个问题我想我已经知道答案了。封闭实验室相对开源的优势是在扩大还是在缩小?比如中国的实验室,他们一直在发布开源模型,一些美国实验室也在发布开源模型。你会说,我在那里看到的想法——Nvidia 有 Nemotron,OpenAI 有 GPT-OSS——这些基本上就是截至今年为止、公开已知的模型训练技术的一个个存档点?

Yi Tay: 哦,好,好。

Swyx: 因为人人都……

Yi Tay: 对,好。

Swyx: 是的,人人都这么做。

Yi Tay: 我认为差距在扩大。

Swyx: 我觉得从你之前说过的话里并不能完全预见到这个结论。

Yi Tay: 我认为差距绝对在扩大。

Swyx: 是的,我觉得这正好证明了研究员的价值。不然养研究员干嘛?不就是为了找到那些能随时间复利累积的新技巧吗?

Yi Tay: 但我确实认为差距在扩大。

Swyx: 好,我岔开一个话题。不知道你对此有没有看法?这和 Nvidia 最近收购 Groq 的事关系很大——我不知道你有没有观点,因为你是非常 TPU 体系的人。但我们的瓶颈到底是内存还是算力?这也和我们刚才聊的 Transformer 讨论相关,具体到 serving 上。我觉得经典观点是我们受算力约束(compute bound),因为预训练和 RL 需要更多算力,然后推理也需要。但我要提的反对论点是:我手头其实有这些摩尔定律的图表——真希望我能随手调出来——算力的扩展、内存的扩展、网络和带宽的扩展,各自的摩尔定律曲线。算力扩展的斜率比另外两个高得多。

Yi Tay: 内存。你是说便宜的内存?说实话,我不太想内存约束(memory bound)这个问题。也许它不……对。所以我不同意这个看法,但我对此的把握也不大。

Swyx: 因为你主要在做研究,不太碰推理侧。

Yi Tay: 对,也许搞推理的那帮人会说……我又不是每天一睁眼就想着 serving。所以,对,也许我确实不太想推理这块。对。

Swyx: 我之前在这方面的思路是:Nvidia 收购 Mellanox 非常有远见,因为网络才是规模化真正的瓶颈,它的"摩尔定律"斜率最低。而接下来第二个就是内存,这非常有意思。

Yi Tay: 好,好。但说实话,我确实不怎么会去想这个。这个我确实想得不多。对,我理解。

Inverse 逆向思考

"苦涩的教训"(The Bitter Lesson)被引用得太多、太随手了。Yi Tay 认为还存在一条"甜蜜的教训":想法是重要的。过去五年并非只是盲目扩规模——给一个 MLP 砸 100 万亿美元也永远不可能 work。真正奏效的想法数量并没有进入收益递减的时代,改变游戏规则的想法仍在被发明出来。

数据效率与世界模型

Swyx: 好。数据效率(data efficiency)。这本来是个玩笑,但言下之意是数据暴露量存在某种上限。对吧。以前我会说,很多训练范式都是"一个 epoch 就是你所需要的一切"(one epoch is all you need)这个思路。我会说真实数字可能在三到四个 epoch 之间。而且我确实想知道,从训练和压缩的角度看,模型数据效率的理论极限应该是多少。我不知道这意味着什么,数据……

Yi Tay: 效率——但你这个问题其实是在问:重复多少次是可以容忍的?

Swyx: 能不能容忍,取决于它是否真的有实质提升。这不是说你要为了重复而重复,但我确实认为存在这个问题。另外就是,用有限的数据我们究竟能学到多少东西。这么说吧:假设你不受算力约束,也不受内存约束,但假设你受数据约束。上次我们录播客的时候,聊过 Chinchilla 最优(Chinchilla-optimal)训练。但现在我觉得很多人甚至在讨论数据最优训练(data-optimal training):给定有限的数据集,你能从中学到多好?我觉得这是个有意思的研究方向,讨论的人还不够多。也许在实验室内部这已经是常识了,但在我看来很清楚的一点是:我们从数据中学到的东西,远远没有优化到位。我就把这个观点放这儿。

Yi Tay: 我觉得总体上,从每个数据点里榨取更多东西肯定是有价值的。但我也觉得这和我们正在把全世界的 token 用完这个事实有关。我不做预训练数据这块,而且我说的这些只代表行业的一般状况,不代表……对吧。所以我认为我甚至不知道数据这块是不是已经分化……这些事情的各家做法是不是已经在实验室之间分化得太厉害了,而且并不公开。

Swyx: 各家之间肯定有很多交叉授粉。

Yi Tay: 交叉授粉。好,好。对。但我确实不太想数据这块,就是预训练数据这块。

Swyx: 今年上半年早些时候,我可能还会说预训练已死,所有人都把全部工作往 RL 上堆。我们之前看到过 Grok 的一张图,非常有意思,显示他们在 RL 上投入的算力已经和……你觉得那是心理战吗?

Yi Tay: 不,我不知道。我完全没概念。

Swyx: 是的,我觉得大家是当真的。他们的态度是,对,好,管它呢。尤其是那些 Agent 实验室,像 Cognition、Cursor,他们拿别人的开源模型,然后在上面做——姑且叫它预训练规模的 RL。如果他们真有那个量级的内部数据——他们确实有——那就非常有意思了,我会说。对。这个数据效率的论点。对。我觉得对我来说,它更多是要发现新的学习范式,好走到我们所有人都想去的地方。而存在性证明就是人类。对吧。你两岁的女儿在某些事情上比 LLM 能干得多,而她见过的数据少了大概八个数量级。这非常有意思。

Yi Tay: 是的。把人类学习和机器学习放在一起比……

Swyx: 纯粹是作为一个存在性证明:我们大概可以做得更好。比如只看三四个狗的例子,再来一只没见过的动物,我作为人类大概能认出那是条狗。但经典的做法是机器要 20 个……

Yi Tay: 人类的数据效率绝对比模型高得多。对。唯一的问题是:这东西到底从哪来?是真的要在每个 token 上砸更多 FLOPs 吗?还是说又回到了 Transformer 是不是最优架构的问题?也许问题在反向传播,也许在"湿件"(wetware),也许在离策略性(off-policy-ness),也许……bug 到底在哪?对吧。

Swyx: 正是。

Yi Tay: 但也可能这是个特性而不是 bug。我不知道。

Swyx: 好,我们大概把问题识别出来了。我费了不少劲才把意思传达到。这就是我所说的那种数据效率。我觉得它正在浮现。基本上每年年底我都会试着下注:好,明年的大主题会是什么。我觉得这就是其中之一,人们真的会开始聚焦它,因为大家都感觉到了数据紧缩,尽管所有人还在往数据上投钱。对了,我还忘说了:我之前说"预训练已死"是错的。是的。我现在已经见过 Anthropic 和 OpenAI 两边的预训练负责人了,最近也看了 DeepMind 那个人的演讲。所以所有人都还在往预训练上投钱,这挺好的。

Yi Tay: 可没人说过预训练已死啊。

Swyx: 我知道。不,这只是一个我们想证实或证伪的说法。总之,我觉得……好,让我绕回我的总体思路。对。数据效率看起来值得做。你的态度大概是:好,那你告诉我 bug 在哪,我去修。但我们不知道 bug 在哪,我们只有"可以做得更好"的存在性证明。然后我觉得对我来说,这条逻辑链的最后一环是:所有人都在聚焦某种"世界模型"(World Model)的概念,把它当作这种更高效学习的一种形态,而它可能不会以序列到序列 Transformer 的形式出现。我不知道那要怎么运作,这绝对有点超出我的知识范围了。在我看来,它之所以更高效,是因为每个世界都必须是内部自洽的。如果下一条新证据进来,推翻了某些世界,那你就永远不需要再走那些路径了,你可以直接收敛到你识别出的那个世界上。所以对我来说,这就是学习:你在学习拟合世界模型。对。所以,是的,也许你可以把学习过程看作曲线拟合。

Yi Tay: 是的。所以你学的是世界,而不是在学世界模型——对,是在学世界模型。对吧。好。方法是采样出多个世界模型,然后找出哪个最拟合数据。

Swyx: 我想我的问题是这样——大家谈论的其实是这些东西(你尽管反驳,我只是抛砖引玉,这是我和很多人聊下来听到的):你们说世界模型(World Models),到底在说什么?数据效率、学习效率又在说什么?这些东西怎么拼成一个连贯的、关于未来的图景,让我们真正能……

Yi Tay: 那先说说,世界模型的定义是什么?一开始的定义?

Swyx: 对。有三种。

Yi Tay: 好,你继续。

Swyx: 第一种是 Veo 那种,或者说另一个叫什么来着——Genie,DeepMind 的那个——也就是视频世界模型那一类。你用某种高斯泼溅(Gaussian Splatting)之类的东西建模一切,然后你仿佛栖身在那个 3D 空间里。

Yi Tay: 嗯。

Swyx: 第二种,姑且叫它 Yann LeCun 的 Meta 学派吧——不知道你熟不熟。他发表了 JEPA 架构;另外 FAIR 还发表了代码世界模型(Code World Models),专门针对代码的,非常有意思。你执行代码,逐行执行的同时,建模执行环境的内部状态。

Yi Tay: 好。

Swyx: LLM 实际上学会了预测这些东西,而且在他们测试过的规模上,看起来效率高得多,这很酷。

Yi Tay: 你锚定的是哪个定义?

Swyx: 第三个,代码那个。

Yi Tay: 代码世界模型是第二个。

Swyx: 那两个我捆在一起说了。JEPA 的粉丝现在大概很恨我,因为我把 Meta 的所有工作都归到同一个学派下面了,但无所谓。

Yi Tay: 好。

Swyx: 第一种是 Veo、Genie、超级空间智能(Spatial Intelligence)那类基于视频的世界模型。第二种是某种执行过程,或者说在你遍历语料时做某种显式建模。然后我觉得第三种是个很不定形的东西——我觉得大家真正想逼近的,是我说的那种"可能世界的分辨率",你在学习、在推理的过程中不断做曲线拟合。

Yi Tay: 嗯,但世界模型本身到底是什么?它是像……

Swyx: 它是一个关于"一切都在哪、你认为世界如何运转"的心智模型。我认为就是你对一切的认知。

Yi Tay: 但技术上它总得是个具体的东西。

Swyx: 在潜在空间(latent space)里。

Yi Tay: 好。所以简单点说,它可以就是一个介于……之间的 Transformer 模型,然后……

Swyx: 这是最贴合当前范式的形态——你确实可以在现有的 Transformer 里做这件事。我认为训练它的方式可能必须有所不同。

Yi Tay: 好,我懂了,我懂了。

Swyx: 我这里没有任何结论。我只是把它抛出来,因为我知道你对这类东西感兴趣,而我也没那么多懂行的人可以聊这个。

Yi Tay: 不,我并不常思考世界模型。我觉得是因为世界模型这个东西从一开始就没有被很好地定义。

Swyx: 嗯,但重点不一定是世界模型本身。问题在于学习效率,可能还有准确率,或者说在我们当前的 scaling 路径上不容易被解锁的那种 AGI 能力。

Yi Tay: 嗯,说到数据效率,我觉得核心命题更像是找到办法在每个 token 上花更多的 FLOPs。因为基本上,如果你受数据约束(data bound),你就想要更高的数据效率——你能从每个数据点学到更多,把它榨出更多东西。所以那些能提取更多、能在每个 token 上用更多 FLOPs 的方法,绝对就是数据效率的一种形式。然后是学习算法的问题。有一张著名的图,人类、机器、狗、猫,各自有一条不同的 scaling law 曲线。这两件事并不是完全不同的东西,因为有可能所谓"更好的架构"其实只是在每个 token 上花了更多 FLOPs。所以如果你处在一个数据非常受限、但算力完全不受限的点上,你就去找那些在每个 token 上花大量算力的算法。所以我认为总括性的论点就是:数据效率本质上是学习算法的问题;而正确的做法到底是不是就在每个 token 上施加更多 FLOPs、从每个数据点里榨出更多——这是个问题。另外,你说人类"接触的数据更少",这本身也很含糊,因为严格来说人是 24/7 全天候在线的,而且大部分是视觉输入,有各种各样不同类型的输入。而他们对听到的每样东西是不是花了更多 FLOPs,也是个问题——也许他们只是效率高?总得有人去数一数大脑处理这些东西用了多少 FLOPs。也许他们只是在每个 token 上花了更多算力,也许学习算法确实不一样。但我同意数据效率非常重要,因为我觉得世界上可用的数据是有限的。

RL 环境、DSI 与生成式检索

Swyx: 在聊 DSI 之前还有一件事。我们刚才在聊 RL,你也在做 RL 相关的工作。为什么大家愿意花大价钱买 RL 环境(RL environments)?

Yi Tay: 等等,谁在花钱买 RL 环境?

Swyx: 至少 OpenAI 这个话题上——没人提过 DeepMind 什么。很多不是你们的模型实验室,出了名的会花至少七位数美元,让外部初创公司给他们搭建用于训练的 RL 环境。

Yi Tay: 哦。

Swyx: 我觉得问题在于:如果你的模型编程那么强,为什么不自己做?我认为这其中有相当多的人类专家专长被蒸馏进了 RL 环境,然后你就可以让智能体在里面撒野。但我很好奇除了这个之外还有没有更深的洞见,因为我对我自己的解释并不满意。

Yi Tay: 蕴含大量领域专长的 RL 环境,可能确实非常有价值。其实我并不清楚大家具体在买什么样的 RL 环境。你对你自己的解释不满意的是哪一点?

Swyx: 它既然这么值钱——而很多人都在说:你看,那不过是一个 Docker 容器里的 Next.js 应用,你往里送输入,它就记点日志出来。那你自己内部大概也能做。为什么要花那么多钱给一家你不认识的初创公司来做?

Yi Tay: 说真的,我完全不知道为什么会这样。毫无头绪。

Swyx: 一个经典的例子:如果你想做一个在电商场景买东西的计算机使用智能体(computer use agent),你会想要能完美复刻前 1000 个电商网站的 RL 环境,然后在所有环境上并行 rollout。这听起来有意义吗?

Yi Tay: 我不知道。

Swyx: 行吧,酷。那聊 DSI 和 LLM 推荐系统(RecSys)。今年我为自己的大会下的一大赌注,就是我们开始聚焦 LLM RecSys。

Yi Tay: 做 LLM RecSys 背后的动机是什么?

Swyx: 我认为 RecSys 是消费级 AI 里的王者问题,是单一最有价值的东西。你所有的信息流(feed),甚至搜索,都是 RecSys。

Yi Tay: 基本上,搜索、检索就是那个"上帝问题"。

Swyx: 对。因为 RecSys 是排序(ranking),但也是过滤、也是个性化、也是重索引和性能。它是上帝问题,而且做好它能赚大钱。工程师们对它却不怎么兴奋,这很奇怪——他们中很多人不做 RecSys,可能永远也不会做,但他们看不到一个好的 RecSys 能带来的金钱价值。另外我这边的两个新动态——我之前其实都不知道 DSI 跟这个直接相关——第一个是 Twitter 公开把他们的信息流算法换成了 LLM。

Yi Tay: 现在 RecSys 用 LLM 已经到处都是了。但它是不是真的大 LLM、是不是那种通用检索式的模型,这是另一个问题,对吧?是这样吗?

Swyx: 我们不知道。我们只知道他们说过,已经把现有的 RecSys 换成了基于 LLM 的 RecSys,他们就是这样披露的。但真正发表了论文的是 YouTube——他们在 YouTube 的 RecSys 里采用了语义 ID(Semantic IDs)。而 YouTube 显然是件大事。

Yi Tay: 这是公开信息?

Swyx: 是。

Yi Tay: 哦,好。

Swyx: 他们来我们这儿讲过。然后今年还发表了 V2,更多信息。我就是想——上次你上播客的时候我们没怎么聊 DSI,但你其实有信息检索(IR)的背景。你在乎 IR 吗?

Yi Tay: 不,我不在乎 IR,但我觉得 DSI……好吧,DSI 或者说生成式检索(Generative Retrieval / DSI),算是我以前最喜欢的作品之一。我有 IR 背景:读博的时候我做过一些 RecSys 的工作,做过检索结合 RecSys 之类的东西,所以我有 IR 和 RecSys 两方面的背景。现在生成式检索和生成式 RecSys 被混为一谈,但 DSI 一开始是个检索方向的工作。我们做的是 Natural Questions 那样的任务:对索引排序、对文档排序,诸如此类。其实我和 Don 还接受过 Yannick 的采访,那篇论文很久以前就出来了。当时我们想重新想象检索和搜索。那时候我们还在用 T5 模型,还没有进入 LLM 时代,是 pre-LM 时代,就是"预训练很灵"的那个阶段,周围有一些预训练模型。所以我们想重新想象检索。但说到底,检索和 RecSys 都是同一个范式:排序问题、检索问题。于是我们开始把检索想象成一个把一切编码进记忆里的巨型模型。那条路上我们试了非常多种不同的语义 ID 方案——其实是我的合作者 Vin 想出了那些点子。整个生成式检索的起点,说白了真的就是给文档一个标识符(identifier),然后直接硬预测——纯粹的暴力预测。它居然真的有效,因为模型能记住东西。你回头看文献,从很早一直到 Doc2Vec 之类的东西,那些词其实没有意义,它们只是词表里的 ID,甚至不是数字。而技术上模型确实有足够容量去预测。但我认为语义 ID 的想法在于:你有某种语义关联,然后尝试把搜索空间层级化地拆解。后来这个方向是怎么发展到 RecSys 领域的呢——DSI 出来之后,Mahesh 他们那个团队做了一些把 DSI 应用到 RecSys 的探索,那篇生成式 RecSys(生成式推荐系统)的论文就是这么出来的。说来好笑,当事人自己当时都不知道自己被卷进了这件事。

Swyx: 挺疯狂的。

Yi Tay: 那基本上就是我们把这套东西迁移过去的过程。DSI 有效,我们就把它试在 RecSys 上。我觉得推荐系统领域的人做语义 ID 的方式略有不同,但那只是因为领域略有不同。那之后,我觉得我们在这个方向上的发明创造部分已经做完了。

Swyx: 剩下的都是细节。

Yi Tay: 剩下的都是细节。后来我也离开了 Google。这些年这些东西各自演化了一点。我还看到 Spotify 也在用类似的东西——YouTube、Spotify 都在用这种语义 ID、这种 DSI 式的模型。我认为从研究社区的角度看,DSI 是第一个提出并解码语义 token 的工作。但后来——我不知道——这个圈子的风气有点怪,他们会说"哦,这是生成式检索,不是生成式 RecSys",就是搞这种莫名其妙的划界,挺奇怪的。总之这就是生成式检索的整个历史。显然现在也有很多人在做,我其实完全没跟进了,这事根本不在我脑子里。有一次我在新加坡办公室,还真有人在做生成式检索——我不知道他们现在还做不做——我碰到一个人试图给我解释生成式检索,挺搞笑的,毕竟这东西算是我参与共同发明的。整个 IR 这个领域……对我来说那只是个有趣的阶段。我绝对认为 DSI 是我做过的最有创造力的工作之一,而且它跟 LLM 没什么关系。

Swyx: 但按照"把 ML 应用到一切"的大原则,如果 Google 内部有人在做通用检索,那会不会就是 AI Overviews 之类的东西?是类似的吗?

Yi Tay: 我完全不知道。

Swyx: 好。跟听众说一下,我在大会上设了一个相关 track,你搜 AI Engineer 就能找到。是 YouTube 的人讲怎么用 Gemini 做 RecSys——抱歉,是 YouTube 的人,不是 Gemini 的人。我不知道用的 Gemini 是多大尺寸,他没讲。但这已经是公开的工作了:基本上每个上传的 YouTube 视频都会被编码进某种码本(codebook),他们用某种批处理任务每天重新训练。

Yi Tay: 嗯。

Swyx: 挺有意思的。所以你大概也不知道 Gemini 被用在什么地方。

Yi Tay: 我这些日子确实不跟进了。

Swyx: 我是这么想的——对还没听懂的人解释一下:把智能、把 LLM 的通用智能用到检索和推荐任务上,意味着你能处理那些非常古怪的推荐需求、非常古怪的查询,而传统系统根本处理不了。而且我觉得这在某种意义上是涌现的(emergent):你用 T5 的时候,在一个普通的 BM25 检索技术之上其实加不了多少价值。你觉得这么说准确吗?这不只是改写(paraphrasing)的问题,而是理解查询意图(query intent)的问题。

Yi Tay: BM25 是个非常强的基线。说真的,BM25 真的很强。

Swyx: 抱歉,我不知道你们当时 T5 相对 BM25 的比较增量是多少,但我预计不会很高;而我预计一个真正基于 LLM 的做法会高得多——当然取决于查询集。

Yi Tay: 我以前没这么想过。因为我在很多不同领域做过建模,包括搜索、IR 社区。那边也有一些基准,大家在上面刷榜爬山(hill climbing),有一些像……我现在都记不清叫什么了。但总体来说,IR 任务的建模动力学跟 RecSys 任务很不一样,跟标准的语言任务、视觉任务也都很不一样。我们爬山式优化 LM、训练模型的方式,以及模型与环境交互的方式,都完全不同。所以我说实话——我很讨厌做 RecSys 和检索的东西。回想当年,你做 T5,改改架构,想办法降 perplexity,刷 SuperGLUE——那是上古时代。就算现在训练 LLM,你也就是做做 zero-shot、few-shot 这类事。作为研究员或工程师,你就是这样跟环境大量交互——有点像在这个环境里做 RL。但 RecSys 和 IR 有一种非常奇怪的感觉,奇怪在于它感觉像"怎么都行"。就像你身处一个重力不一样的世界,那些凭直觉成立的建模直觉在那里统统不成立。所以那是个很奇怪的空间。我当年也写过一些 RecSys 的论文,每次跑 RecSys 的建模实验,我都不享受。感觉那个环境很"无礼",氛围就是不对。

Swyx: 怎么个无礼法?就是感觉很事务性(transactional)?

Yi Tay: 不是事务性。我不知道怎么形容。打个比方,你打网球或者羽毛球,击中球的时候有种非常好的感觉——打中甜区(sweet spot)的感觉。你在传统领域做建模,拿到反馈的时候,你会觉得一切都对、一切都顺。但 RecSys 和 IR 就像——你击打羽毛球,却听到一声玻璃碎裂的怪响。你就是会莫名感到一种因果关系错位的诡异感。

Swyx: 因果之间离得太远了。

Yi Tay: 就是感觉奇怪。而且有时候指标——RecSys 用的都是 NDCG 这类指标——然后 BM25 又很强,你做出来的东西还不如 BM25。想当年,你把 2 层 LSTM 堆到 3 层,都会激动:"哇,我看到生命了。"

Swyx: 就是个回报感很低的领域。

Yi Tay: 就是很奇怪。而且 IR 社区、检索社区总是落后于主流,现在因为 LLM 这波东西,差距可能还更大了。好,我要开始发表暴论了:有些会议就是落后于 NeurIPS、ICML 这些,有些会议就是把别人做的东西拿过来套。

Swyx: 它们是下游。

Yi Tay: 是下游,是下游。

Swyx: 嗯。

Yi Tay: 所以做这些东西总感觉很不振奋人心。

Swyx: 是啊,怪不得你——

Yi Tay: 离开了。不过那也就是个支线任务(side quest),我是把它当支线来做的。

Swyx: 好,我懂。我仍然认为那是个重要的商业问题,哪怕作为一个研究领域回报感不高。

Yi Tay: 我多少能理解为什么。因为那些任务的学术基准跟工业界的现实脱节得太远了。我没在工业界做过这些,只从学术角度接触过。

Swyx: 哦,那你需要的只是在线评估(online evaluation),对吧?A/B 测试之类的。

Yi Tay: 那大概会是完全不同的体验。

Value 商业价值

推荐系统(RecSys)是消费级 AI 的"王者问题":搜索、排序、过滤、个性化本质都是检索,被 Swyx 称为"上帝问题",做好它能赚大钱。Twitter 已公开将信息流算法换成基于 LLM 的 RecSys,YouTube 则在其推荐系统中采用语义 ID(Semantic IDs)——而后者正是 Yi Tay 早年 DSI(生成式检索)工作向 RecSys 迁移的延伸。

GDM 新加坡:人才密度与研究品味

Swyx: 好,研究话题和各方面覆盖得差不多了。最后用一个很简单的问题收尾:关于 GDM 新加坡(Google DeepMind Singapore)——你在这里组织了一场研讨会(symposium),请来了 Jeff Dean、Quoc 和其他人。创办 GDM 新加坡的总体愿景或动因是什么?

Yi Tay: 先讲那场活动吧。那场活动主要是——Quoc 和我要组建一个团队,在我回来之前我们已经讨论了一段时间,Jeff 非常支持。就在我准备回来的前后,他多次来这个地区,去了越南、新加坡。所以这场活动本身,是趁着 Quoc 和 Jeff 来访,我们想激励一下本地的社区。我觉得这也有点像是——用个软件的说法——定个基调(setting the tone),为 Gemini 新加坡团队的开局定调。我觉得这是很难得的场合:Jeff 和 Quoc 这样真正的世界级 AI 先驱同处一室——你当时也在场。很多人跟我说……

Swyx: 别抬举我,我不是什么 AI 先驱,我当时是去现场发推的。

Yi Tay: 嗯,把他们聚在一个房间里分享想法——很多人事后找我说,他们在场这件事本身、他们出现在这个地区,就让人深受鼓舞。组建团队、开创新局面,也并不是"按下一个按钮就开始了"的某个瞬间,而是一个过程。

Swyx: 对。

Yi Tay: 我们招人,人一个接一个加入,诸如此类。所以我觉得这场活动更多是营造氛围(set the vibe)。我相信新加坡是有可能贴近前沿(frontier)的。有真正的 AI 先驱在场,我们想传递的更多是一种鼓舞,同时也让 Quoc 和 Jeff 见见这里的人。Jeff 去年来过,但 Quoc 有一阵没来了,而他以后要在这里带团队,所以带他转转、见见本地的人也挺好。活动非常棒。我们还见了李显龙——

Swyx: 很多人不知道他有计算机科学学位,是少数有 CS 学位的总理之一。

Yi Tay: 嗯。我会说那次会面的背景,部分是他想多了解一些 IMO(国际数学奥林匹克)的事。

Swyx: 哦,真的?

Yi Tay: 还有关于 Jeff……

Swyx: 哦,是因为他们邀请你的时候不知道这些人会来,还是怎样?

Yi Tay: 就是 Jeff、Quoc 和我去总统府(Istana)拜访、聊天。我们聊了一会儿深度思考(Deep Think),聊了一会儿 IMO。然后剩下的部分更多是 Jeff 和李显龙在谈——话题变得不那么关于 AI,更多是宏观经济、政治层面的事。那是我很不熟悉的领域,所以我就……

Swyx: 你还穿了西装。

Yi Tay: 我就只聊 Deep Think、IMO 这些。但他看起来真的挺惊讶 AI 已经发展到这个程度。总之我觉得那次会面很有意思。

Swyx: 对听众来说——你做了一件新加坡历史上迄今独一无二的事:在新加坡建立一个前沿研究实验室(frontier research lab),这本身就是一项成就。另外我还在琢磨的一件事是:地理位置真的重要吗?你们都在一个团队里工作,你有伦敦的人、山景城的人,反正你主要就是跟他们协作,你一辈子都是这么跟他们协作的。说到研究、或者泛泛地说 AI,我都快不知道"国家"意味着什么了,因为这件事从根上就是国际化的。

Yi Tay: 这是个很好的问题。它也和身份认同(identity)有关——你自己也在旧金山和新加坡之间来回搬。我一两周前还在山景城,现在就在这里。但几乎——除了家人之外,我聊的所有人某种程度上都在湾区,就是因为工作的原因。我认为地理位置确实重要。首先最实际的是时区问题。

Swyx: 所以你字面上想要全球 24 小时覆盖。

Yi Tay: 有它的好处。不,我想说的是:差别可能更多在于——某种程度上是人定义了地点,而不是地点定义了人。时区的问题我们稍后再谈,各有利弊。我觉得是有利有弊的。

Swyx: 所以你看好亚洲、看好新加坡的人才池。

Yi Tay: 我觉得我们找到了非常优秀的人。但我也必须说,这种事更多是"人才吸引人才"。我觉得大多数时候大家都很兴奋,我感受到的氛围是:人们非常兴奋,因为这是 Quoc 的团队和我的团队,我们在做跟 AGI 非常核心相关的事。所以我们能从本地区招到的人才真的很棒。但那是因为是我们——是我们才能解锁这些人才,否则他们可能就去了别的地方。

Swyx: 是的,搬去美国。

Yi Tay: 关于身份认同,我很同意你说的"这有什么重要"。新加坡本身——或者说任何地方——的优势在于:世界连接得很好,技术上你想跟谁互动都可以,你也可以飞过去。但我认为新加坡有这个优势:你既可以离得近,也可以离得远。湾区太……我有在伦敦和纽约的朋友,他们就是绝对不会搬去湾区。我不是反对湾区,湾区是个好地方。但那里就是 AI、AI、AI,到处都是 AI。有时候你需要一点心理空间和精力去接触一些别的文化——伦敦、新加坡、纽约都有自己的文化。但湾区的文化就是 AI。你走到哪里都听到 AI,连广告牌都是。

Swyx: 是有点太多了。

Yi Tay: 嗯。

Swyx: 不过我在这边也看到了一些广告牌。我当时想:这是什么文化在向外传染?

Yi Tay: 我确实认为,某种程度上,想做研究,你需要在某个地方有一点安静和平和。这座岛也许适合这个,但我们依然能保持连接。所以主要就是人才方面——我觉得这里的人很强。

Swyx: 离得足够远,但依然保持连接,人才也强。你们在招什么样的人?你还在招人,对吧?

Yi Tay: 我们在招。我的团队会为 Gemini 和 Gemini Deep Think 做 RL 和推理(reasoning)。我们现在更看重人才密度(talent density),所以也不会扩得很大,先保持小团队——因为人均算力(compute per capita)可能很重要。这基本上就是我们现在的招聘方向。我个人收到很多私信(DM)……总体上有很多非常能干的人。但我主要想找的是:要么你有 RL 研究的实绩(track record);要么甚至不一定是 RL——在编程竞赛上有过杰出成就,或者在某个领域有过杰出成就。这就是我们想要的人。

Swyx: 对,因为你并不硬性要求背景对口。我记得你在 Reka 的时候说过,你喜欢从零开始培养年轻人。

Yi Tay: 我忘了我说没说过这话。但某种程度上是。某种程度上,我觉得我们绝对会非常喜欢那些"属性值"很高的人——哪怕没有太多统计知识……不不,不是统计(statistics),是属性点(stats)。就像游戏里加点,智慧(WIS)、智力(INT)点得很高的那种人。就是纯粹的高智商、高技术天赋的人。我认为只要有很强的工程能力,ML 很容易学,AI 知识也很容易学。

Swyx: 嗯。这件事的另一个版本是:学生的预算还能做出东西吗?用学生的预算还能做出有意思的东西吗?跟这个相关的一点是,现在会议更冷清了。我采访过一位最佳论文得主,他们做的是千层神经网络(thousand-layer neural network)之类的工作,就是在学生预算下完成的,执行得非常干净,论文扎实,发现也很好。我不确定生产模型会不会真的做到一千层,但他们把它往一个有趣的方向拉伸了,得出了一些好的结论。那个人立刻被 OpenAI 招走了。我觉得这对市场上的研究生是个鼓舞——他们会想:我是不是得认识在这些实验室工作的人才进得去?比如我叔叔在那工作,我才能拿到实习。其实不是,你真的可以用学生的预算、配上好的导师做出来。

Yi Tay: 哦,我觉得一件有意思的事是:大多数我亲自去招的人——你看到他们的工作,然后给他们发私信。我收到很多……不不,是说一般性的招聘。总的来说,接着你的话说:你几乎可以——你只需要做好工作、放到网上,然后就会有人联系你。这事超级简单,同时又超级难,因为我可以告诉你……

Swyx: 我跟一些研究生聊过,他们不知道什么叫"好的工作"。因为有太多事情——他们的教授有自己的议程,强加在他们身上,而那可能并不对,因为教授们自己也不知道该做什么。所以,他们需要的只是指导,只需要有人说:嘿,去做这五件事,随便哪件做出个有意思的结果给我看。

Yi Tay: 对。如果有人自己想出个点子,做出来的东西让你觉得很有品味(tasteful)、跟实验室里研究员喜欢的东西一致,而且是独立做出来的,那你就知道:产生这个点子的那个"函数"本身是好的。如果你只是去告诉别人做这个,你得到的信号只是"这人能执行"。所以我认为……

Swyx: 有些人身上有价值——他们展示了品味。研究品味(research taste)。对,研究品味。很有意思。我觉得我可以给人……我确实在某种程度上在乎这个。我做的研究方向类的工作就有点这个意思——对我来说问责很低,因为那毕竟只是思想实验。但对很多人来说,他们的职业生涯就取决于:你能不能在这短短三四年里展示出研究品味,然后就这么做出来。

Yi Tay: 嗯,我会说竞争太激烈了,因为每个人都想进 AI。问题更多在于你怎么证明自己。这年头,当一个想证明自己的研究生一定很难。确实更难了,但……嗯。

Tips 实践建议

想进入前沿实验室,路径"超级简单,同时又超级难":把工作做好、放到网上,就会有人联系你。比执行别人的命题更有价值的,是独立做出有品味(tasteful)的工作——这证明产生这个点子的那个"函数"本身是好的。Yi Tay 的招聘标准:要么有 RL 研究的实绩,要么在编程竞赛或某个领域有过杰出成就;只要有很强的工程能力,ML 和 AI 知识都很容易学。

健康是做好研究的一部分

Swyx: 反正不是你的工作。好,就这些了。收尾之前,你还有什么排好队的吐槽或话题吗?

Yi Tay: 没有了。聊得很开心。

Swyx: 聊天很开心,兄弟。

Yi Tay: 很开心。

Swyx: 嗯。上次我们在研讨会上见面,本来要录一期的,结果我们就是闲逛聊天去了。能听听你脑子里正在发生的事情、你世界里的动向,挺好的,因为——兄弟,我们在做的工作真的很重要。

Yi Tay: 跟你聊天、见到你总是很开心。

Swyx: 嗯,聊得好。最后说几句你的减肥和健身之旅吧,因为那对你也是件大事。

Yi Tay: 我觉得健康对做好研究很重要。我现在大概处于身体最健康的巅峰状态。

Swyx: 嗯,你看起来很棒。

Yi Tay: 谢谢。而且我觉得它以一种好的方式影响了我的工作。

Swyx: 你做的是那种流行起来的生物黑客(biohacking)式玩法?

Yi Tay: 我没有走太极端,但我相当数据驱动。我有自己的评估(evals),我会追踪这些数据。我本该写一篇博客讲这个的,但我觉得自己还没到终局(endgame),等到了再说。给不知道的人说一声:我今年减了 23 公斤——其实跨度是一年、一年半。

Swyx: 23 公斤?

Yi Tay: 对。

Swyx: 基本上就是从上次播客到现在。

Yi Tay: 是的。现在有个消融实验(ablation study):23 公斤。我的 HRV(心率变异性)上升了两倍,静息心率(resting heart rate)降了 30 次/分钟。

Swyx: 30 次/分钟。

Yi Tay: 原来大概 80、90,现在大概 60。

Swyx: 哦,80、90 也太高了。

Yi Tay: 嗯,我那时候不健康。

Swyx: 嗯。

Yi Tay: 嗯。

Swyx: 当过程很艰难的时候,是什么让你坚持下来的?很多人——包括我自己——可能太专注 AI 了。我优先工作,我享受工作,我不享受健身那部分,但它显然能融入你的智识工作——下线去散个步、吃得好点,诸如此类,它显然是契合的。但人们看到像你这样的正面榜样,会受鼓舞去做同样的事。所以我认为你把自己树立成榜样是好事。

Yi Tay: 我觉得这确实有帮助。当我为健康做这些事的时候,我就把它当成工作的一部分,因为它帮助我把工作做得更好。所以它也很重要。我觉得很重要。

Swyx: 嗯。我喜欢你张口就是 HRV。我完全不知道我自己的 HRV 是多少。但这里有个普遍的问题:什么是生产力,怎么衡量它?什么才是真正重要的?我到现在也不清楚。但我确实认为,总体的精力水平、还有饥饿感——你几乎得体验身体上的饥饿,才会有智识上的饥饿。我不知道这算不算一个说法。

Yi Tay: 不,我饿的时候只想吃的。对我来说饿是破坏性的——饿着很难工作。

Swyx: 好。非常感谢。

Yi Tay: 谢谢。真的很棒。祝你过得愉快。

总结与行动指南

Takeaway 行动指南
  • 像在策略 RL 一样学习。 模仿(SFT)只是起点,真正的泛化来自在策略学习——自己行动、从环境给的奖励中修正自己的路径,无论对模型还是对人。
  • 押注通用模型,而非一次性系统。 专用系统可以做出无数个,但能力终将被一个大模型吞并;这正是放弃 AlphaProof、用端到端 Gemini 拿下 IMO 金牌背后的判断。
  • 用公开的作品证明研究品味。 把工作做好、放到网上,机会会来找你;独立产生好想法的那个"函数",比单纯的执行力更能证明你。
  • 把健康当作工作的一部分。 Yi Tay 一年半减重 23 公斤、HRV 上升两倍、静息心率从 80-90 降到约 60,他把数据驱动的健康管理当作让研究做得更好的基础设施。