Day 24 · 强化学习
强化学习 RL:深度推理与长链条慢思考的觉醒
从 OpenAI o1、o3 到 Kimi K3,整个 AI 行业在过去一年迎来了真正的范式跃迁(Paradigm Shift):大模型不仅能靠直觉脱口而出(快思考 System 1),还能在心里反复推演、自我纠错、尝试多种分支(慢思考 System 2)! 这种超越人类示范的推理能力,不是靠背题(SFT)学来的,而是靠强化学习(RL) 在黑暗中自我摸索出来的。
学完你能回答
为什么单纯模仿(SFT)无法产生超越人类的推理?
学完你能回答
RL 是怎么让大模型学会「自我修正与回溯」的?
学完你能回答
K3 的推理力度(Reasoning Effort)与沙箱状态机制?
1 起点:这些你早就会了
强化学习的逻辑,就像棋手在棋盘上的自我博弈与解题思考:
你已经会的 AI 世界里对应的东西
背棋谱只能成为熟练工,反复下棋复盘才能成为九段大师 SFT vs RL :SFT 只能拟合人类上限,RL 靠环境反馈探索全局最优解
解奥数题时在草稿纸上反复划掉重写:「咦,这样不行,换个思路」 思维链(Chain-of-Thought, CoT)与自主回溯 :RL 激发出的慢思考
编译代码:写完运行一下,报错了就修,全绿通过就得分 RLVR(可验证奖励强化学习) :依靠代码沙箱与数学判定器提供硬反馈
考试时间分配:简单题 1 秒出答案,压轴题深思熟虑 30 分钟 测试时计算缩放(Test-time Compute) :K3 的推理力度 max 动态思考预算
语数外各有私教单独授课,最后把各科笔记融成自己的一套功夫 多教师在线策略蒸馏(MOPD) :把 9 个领域专家模型的本领合体进一个统一模型
2 模仿的极限:为什么 SFT 无法突破天花板?
在传统的 SFT 训练中,模型的损失函数是交叉熵(Cross-Entropy) ——只要模型写出的每一个 token 和人类标注有一点点偏差,就会被惩罚。
两大学习模式对比
•
SFT 的死胡同(死记硬背) :
一道奥数压轴题有 5 种不同解法。如果标注员写的是解法 A,而模型自己灵光一闪找到了更简妙的解法 B,SFT 会因为“token 不匹配”而
强行惩罚模型的创新思维 !这导致模型不敢自由探索,一旦遇到新题就满盘皆输。
•
RL 的广阔天地(结果导向与自由探索) :
RL 根本不在乎你中间写的过程长什么样!它只在最后把答案扔进
编译器(Code Sandbox)或数学验证器 里检验:
只要最终答案正确、代码跑通,中间无论你怎么自我怀疑、怎么推翻重来,都给予巨大奖励(Reward = +1)!
严格来说 :SFT 并非一无是处——它是 RL 的冷启动基础,报告 §4.1.1 说 SFT 为 RL「建立高质量的冷启动策略」;RL 也不是完全不看过程:K3 会把思考超出预算的轨迹直接判负(§4.1.2),防止模型没边儿地想下去。
3 顿悟的诞生:自我纠错与「慢思考」的涌现
在大规模强化学习的迭代过程中,模型在没有受到任何人类强制指令的情况下,自发涌现出了令人惊叹的行为:
思考链中的自发回溯模式
• 假设验证 :「让我们先尝试代入 x = 0……得到矛盾,说明假设错误。」
• 主动回溯 :「等等,刚才第三步的符号展开好像漏了一个负号,让我重新核算一遍。」
• 多路对比 :「方法一比较繁琐容易出错,改用反证法来证明。」
这就是 Test-time Compute(测试时计算)的本质 :大模型的输出不再是固定长度的脱口而出,而是用更长的思考 token(Thinking Tokens)换取更高的解题正确率 !
严格来说 :这些「自我纠错」不是模型真的有了人的意识,而是「写出验证与回溯步骤的轨迹更容易拿到奖励」这件事被反复强化的结果;而且想得久不等于想得对——方向错了,想再久也可能白搭。
强化学习驱动的思考-试错-纠错闭环
输入问题,生成带思考链的候选解,经沙箱执行测试,获得奖励更新策略
RLVR(可验证强化学习)闭环探索
输入复杂任务
编程/数学/智能体
自主长链条思考 (CoT)
自发尝试、验证、纠错
吐出最终代码/方案
环境执行与判题
代码沙箱 / 编译器
Reward: +1 / -1
策略强化
强化有效路径
图 24.1:可验证强化学习(RLVR)的数据流动。 通过真实环境的客观结果反馈,激发模型的自主推理与探索。
4 Kimi K3 的百万 token 智能体强化学习
在《Kimi K3 技术报告》§4.1.2 和 §4.2 中,K3 团队把强化学习推向了全新的高度——长周期智能体 RL(Long-horizon Agent RL) :
真实沙箱持久化(Stateful Sandbox) :让模型在配备 Python 解释器的隔离沙箱里,自主编写并执行几十上百步代码;
长上下文 Rollout :结合百万 token 上下文,模型能在遇到 Bug 时不断翻阅错误日志、搜索资料并修改代码,直到测试通过;
推理力度分级(Reasoning Effort) :支持从 low 到 max 多档推理力度,按题目难度调配思考预算;K3 的全部评测均在推理力度 max 下进行(§6.1),并在 FrontierSWE、Terminal-Bench 2.1 等编程基准上达到前沿水平。
5 九位专家合体:MOPD 蒸馏
上一节还埋着一个细节:K3 的 RL 练出来的不是一个模型,而是 9 个 。报告 §4.1.2 写得很清楚:RL 在三大领域上分别展开——通用任务、通用智能体、编程智能体——每个领域再按 low / high / max 三档推理力度各训一个专家,3 × 3 = 9 个专家模型 。
问题来了:总不能让用户面对 9 个模型、做题前先自己挑一个吧?K3 的解法就是报告 §4.1.3 的多教师在线策略蒸馏(MOPD) ——把 9 位专家的本领合体进一个统一模型。报告原话:「我们采用多教师在线策略蒸馏(MOPD),将这些跨推理力度的领域专用能力整合进统一模型。」
私教带徒弟
MOPD 就像请 9 位私教轮流传授同一个徒弟:轮到哪门课(领域)、上什么强度(推理力度),就由对应的那位老师带。徒弟(学生模型)每次自己先作答,老师在旁边逐 token 把关:「这一步换作是我,会不会也这么写?」分歧大的地方就化成奖励信号,把徒弟往老师的写法上推。九门功课轮完,徒弟一个人就有了九位老师的本事。
严格来说 :徒弟并不是照抄老师的答案——「在线策略」的意思是答案由学生模型自己生成,老师只在学生写出的每个 token 上打分纠偏;而且每位老师只在自己擅长的领域和力度档位上「代课」,不越界。
进阶小注 · MOPD 的打分信号是逐 token 的:老师在每个位置上比较「自己会怎么写」和「学生实际怎么写」,差距折算成奖励(报告 §4.1.3 的式 (15) 就是这个奖励的定义,还被裁剪在 ±R_max 以内,防止极端信号带崩训练)。这比「只在结尾给一个总分」的信号密得多——知道有这个东西即可。
6 面试视角
面试视角 · 高频考点
面试官可能会问:「为什么强化学习(RL)能激发大模型的深度推理能力?它与传统 SFT 的本质区别是什么?」
八股答 「SFT 是监督学习,只能模仿人类标注;RL 靠奖励信号自主探索,能产生思维链(CoT)和自我纠错,突破人类上限。」——点出了核心结论,若能结合 Test-time Compute 和搜索空间解释则更硬核。
本课答 「核心是局部 token 监督与全局轨迹(Trajectory)奖励的范式差异 :① SFT 的局限 :SFT 采用逐 token 极大似然估计,对未见解题路径施加惩罚,压制了模型的探索自由度;② RL 的探索跃迁 :在数学/代码等具备明确判定性环境(Verifier)的任务中,RL 仅依据最终结果(如代码是否编译通过、答案数值是否正确)给予标量 Reward,使模型能在解空间中自由进行采样式多轨迹探索;③ 自发涌现的慢思考(System 2) :在探索过程中,产生长链条推导、假设验证、反思纠错的思考轨迹能够获得显著更高的正向预期收益,从而被策略梯度牢牢强化,实现了 Test-time Compute(测试时算力换准确率)的智能觉醒。」
7 映射到原文:K3 报告 §4.1.2 强化学习
技术报告原文对照 · 《Kimi K3 技术报告》摘要(§4.1.2 强化学习的总纲)
「后训练的重点是横跨通用、智能体与编程领域、覆盖多个推理力度等级的强化学习(RL),从而实现组合式泛化与稳健的长周期执行。」
逐词翻译:
「横跨通用、智能体与编程领域」 :不是一个 RL 模型包打天下,而是分成三大领域各自练兵(§4.1.2 里的通用任务、通用智能体、编程智能体)——第 5 节那 9 个专家模型就是这么来的。
「多个推理力度等级」 :就是 low / high / max 三档思考预算——简单题少想省 token,难题把预算拉满多想。
「组合式泛化与稳健的长周期执行」 :把不同领域、不同力度学到的本领组合起来对付没见过的题(组合式泛化);在沙箱里连续执行几十上百步操作也不中途跑偏(长周期执行)。
9
RL 练出的领域专家模型数 3 领域 × 3 档推理力度(§4.1.2)
low→max
推理力度三档 low / high / max(§4.1.2)
81.2%
长周期编程基准 FrontierSWE 成绩 排名第二(§6.1.4)
51,219,741
训练与评测全程 创建的沙箱总数(§5.3.2)
8 自测题(先自己答,再点开看解析)
Q1 为什么代码和数学任务特别适合做强化学习(RL)?
解析: 因为它们的结果具备绝对客观的「可验证性(Verifiable)」——代码能用编译器和测试用例自动跑出通过/失败,数学题能自动比对最终数字,无需昂贵且易主观失真的人工打分。
Q2 什么是「思维链(Chain-of-Thought, CoT)」?它是被强制教出来的吗?
解析: 思维链是模型在输出最终答案前,生成的一段长篇中间推导步骤。在大规模强化学习下,写出思考推导能大幅提高做对题拿到奖励的概率,因此模型会自发涌现并演化出深入的慢思考。
Q3 什么是 Test-time Compute(测试时算力扩展)?
解析: 指在推理阶段给模型分配更多的计算预算(允许它生成更多思考 token、搜索更多解题分支或调用工具多次回溯),从而显著提升单道难题的解决成功率。
Q4 K3 的「推理力度 max」是什么?训练时的沙箱为什么还要能「存档」?
解析: 推理力度是模型思考预算的档位(low / high / max),max 即把思考预算拉满、允许充分的长链条反思与沙箱试错,K3 的全部评测都在这一档下进行(§6.1.3)。而「沙箱状态机制」指 AgentENV 沙箱能把执行现场做检查点存档、随时恢复(延迟分别低至 133 ms 与 49 ms,§5.3.2)——长周期任务的轨迹横跨多次训练迭代,有了存档,被暂停的 rollout 下次迭代就能接着跑,不必从头重来。
Q5 用一句话总结 SFT 与 RL 的本质分工。
解析: SFT 负责教会模型「听懂人话、遵守对话格式」,RL 负责激发模型「攻克难题、深度探索与自我纠错」。
明天 · Day 25原生多模态:文本与视觉的统一接龙 大模型是怎么同时看懂文字和图片的?MoonViT-V2 是如何把图片无缝切成 token 喂进大模型的?
进入 Day 25 →