Hexo

凡事预则立,不预则废


  • Home

  • Tags

  • Archives

  • Navigation

  • Search

NLP——Reasoning2Agentic-Credit-Assignment

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始论文:(Reasoning2Agentic-Credit-Assignment)From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models, 20260410-20240413, Independent Researcher
      • 注:作者是独作,且为独立研究者
    • 代码地址:github.com/xxzcc/Awesome-Credit-Assignment-in-LLM-RL
      • 注:该地址维护了一个精选论文列表

Paper Summary

  • 本文对 LLM 强化学习中的 Credit Assignment 进行了专门的综述,追溯了从 Reasoning RL 到 Agentic RL 的演变,并讨论了驱动方法论创新的根本挑战
  • 针对 LLM 的 RL 越来越依赖稀疏的、结果层面的奖励
    • 确定长轨迹中的哪些行为导致了该结果非常困难
    • 这个信用分配(Credit Assignment, CA)问题体现在两种情形中:
      • Reasoning RL(reasoning RL):信用必须分配到单个思维链生成(500-30K+ token)中的 token 和步骤上
      • Agentic RL(agentic RL):多轮环境交互引入了随机转移、部分可观测性以及 100+ 轮(100K-1M token)的时域
        • 使得 Episode 层面的信用越来越缺乏信息量
  • 本文调研了 47 种信用分配方法(41 种核心方法,6 种相邻使能方法),这些方法发表于 2024 年至 2026 年初
    • 作者按两个维度的分类法对它们进行了组织:
      • 分配粒度(token、segment、step、turn、multi-agent)
      • 方法论(Monte Carlo、时序差分、基于模型、博弈论、信息论)
    • 除了调研本身,作者还贡献了三个可复用的资源:
      • (1)一个结构化的、机器可读的论文清单,其中包含分类标签、基线族和证据等级
      • (2)一个针对未来 CA 论文的报告清单,该清单根据已审文献进行了验证,以识别系统性的方法论空白
      • (3)一个基准测试协议规范,包含任务族、元数据需求和受控分岔任务,并附带一个方法选择决策树
  • 从推理到 Agentic RL 的转变使得信用分配问题更加复杂并重塑了其格局:
    • 推理 CA 正围绕过程奖励模型(Process Reward Model, PRM)
    • 无 critic 的组比较方法趋于成熟,而 Agentic CA 则催生了真正的新方法
      • 事后反事实分析(hindsight counterfactual analysis)
      • 特权非对称 critic(privileged asymmetric critic)
      • Turn-level MDP 重构
    • 这些方法在 Reasoning RL 中没有直接先例
  • 五个关键要点(用 Evidence-level 注释:[SE] = 强经验性,[LS] = 有限但具有启发性,[AS] = 作者综合):
    • 1)Credit Assignment 是 LLM RL 的核心挑战 [SE]
      • 而且 Credit Assignment 的重要性随着从推理环境转向 Agentic 环境而增长
      • 从单次生成轨迹 ( \(\sim 1\text{K} - 30\text{K}\) 个 Token) 到多轮 Agent 交互 ( \(\sim 100\text{K} - 1\text{M}\) 个 Token) 的转变,将 Credit Assignment 从优化便利性转变为训练必要性
    • 2)在 Reasoning RL 中,Credit Assignment 正在成熟 [SE]
      • Token-level (VinePPO)、Segment-level (SPO, SCAR) 和 Step-level (PURE, HICRA, SPRO) 方法在转移是确定性的、轨迹是单次生成且结果可验证时提供了有效的解决方案
      • PRM 范式和无需 Critic 的组比较代表了鲁棒、可扩展的方法
    • 3)在 Agentic RL 中,Credit Assignment 尚处起步阶段 [LS]
      • 质量上更困难挑战需要新的方法
        • 挑战包括:随机环境、部分可观测性、异质 Action、超长时域和不可验证的中间状态
      • 事后/反事实方法 (HCAPO, C3, CCPO) 和分层架构 (ArCHer, CARL) 代表了社区的新兴回应,但仍有许多工作要做
    • 4)LLM-as-Critic 似乎是一个独特的范式 [LS]
      • 在经典 RL 中没有直接镜像
      • 使用 LLM 对中间状态进行语义评估的能力 (CAPO, SWEET-RL, LaRe, HCAPO, CriticSearch) 开辟了一个似乎是 LLM 时代特有的方法论轴心
      • 这种方法是否会被证明比传统的基于价值的方法更有效,仍然需要继续探索
    • 5)该领域正在加速发展 [AS——文献计量学观察]
      • 仅 2026 年 3 月一周内就出现了三篇关于反事实 Credit Assignment 的独立论文,本文的分类法包含了仅两年(2024–2026 年)内发表的 47 种方法(41 种核心 CA,6 种辅助使能技术)
      • 多 Agent Credit Assignment(现在作者的清单中有 6 篇专门论文)已从一个新兴领域发展成为一个活跃的研究前沿
  • 随着 LLM 从推理引擎演变为在真实环境中运行的自主 Agent
    • Credit Assignment 的问题从 “哪个推理步骤是正确的?” 转变为 “哪个 Action 以正确的方式改变了世界?”
  • 本 Survey 的核心论点
    • 作者认为,从 Reasoning RL 到 Agentic RL 的转变不仅仅是将现有方法扩展到更困难的任务
      • 这个转变实质性地重塑了 Credit Assignment 问题
    • 推理 CA 在一个相对温和的环境中运作(确定性转移、可验证步骤、较短的时域)
    • Agentic CA 在一个更具挑战性的环境中运作(随机环境、不可验证状态、\(100+\) 轮时域)
    • 这种质的转变正在产生真正的新方法:
      • 事后反事实分析、特权非对称 Critic、基于熵的关键 Action 识别以及 Turn-level MDP 重构
      • 作者预计 2026–2027 年该领域的活动将不断增加

Introduction and Discussion

  • LLM 强化学习的两波浪潮
    • 第一波浪潮:Reasoning RL
      • 展示了 RL 可以显著提升 LLM 解决数学问题、编写代码以及执行逻辑推理的能力(2025;2024)
      • 像 DeepSeek-R1 和 OpenAI 的 o1 这样的模型表明,使用结果层面的奖励(“最终答案是否正确?”)进行训练可以激发复杂的思维链推理
    • 第二波浪潮:Agentic RL
      • 此范式扩展到多轮交互式任务:浏览网页(2024a)、使用工具(2024)、编写和调试代码以及与其他 Agent 协作的 LLM Agent
      • 从推理到 Agentic(agency)的转变代表了 RL 问题复杂性的一次质的飞跃
    • 这两波浪潮的核心是一个共同的瓶颈:信用分配
    • 当唯一的反馈是一个稀疏的终端奖励(“问题解决”或“任务完成”)时,如何确定中间行为(哪些 token、哪些推理步骤、哪些工具调用)如何影响了结果呢
  • 信用分配问题是核心瓶颈,且信用分配问题的严重性随轨迹复杂度而增大:
    • 在 Reasoning RL 中,一条典型轨迹是单个 LLM 生成
      • 范围从 \(\sim 500\) 个 token(GSM8K 级别的问题)到硬性竞赛数学题的 10,000-30,000+ 个 token
        • 例如,在 AIME 2025 上,DeepSeek-R1 平均约 \(\sim 23\text{K}\) 个 token(2025)
      • 这种情况下,信用必须分配到 token 和推理段上
      • 像 GRPO(2024)和 REINFORCE 这样的 Episode-level 方法将相同的优势分配给每个 token(这种粗略的近似对于较短的轨迹有效)
    • 在 Agentic RL 中,轨迹跨越 10-100+ 轮,每轮都涉及一次 LLM 调用加上环境交互
      • 总 token 数通常达到 100K-500K+
        • 例如,在一个报告的 SWE-bench 设置中,Agent 平均约 \(64\) 轮,消耗约 \(131\text{K}\) 个 token(2025d)
      • Episode-level 信用变得越来越没有信息量:
        • 在第 3 轮的一个错误工具调用会与几十个正确的后续行为受到相同的惩罚
  • 在 2024 年至 2026 年初期间,47 篇论文(41 篇提出核心 CA 方法,6 篇贡献 CA 相关的使能方法)提出了各种方法,从 Monte Carlo Token-level 价值估计(2025)到基于 Shapley 值的奖励分解(2025;2026b),从过程奖励模型(2025;2025)到事后反事实分析(2026;2026;2026c)
    • 仅在 2026 年 3 月的一周内,出现了三篇关于反事实/事后信用分配的独立论文,这表明学术界对这个问题越来越感兴趣

Scope and inclusion criteria

  • 本文核心纳入的文章是主要贡献是为 LLM RL 提供新颖信用分配机制 的方法
    • 核心 CA 方法(core CA methods):提出跨行为分配信用的新算法(例如,VinePPO、HCAPO、CARL)
    • CA 相关使能方法(CA-adjacent enablers):解决相关问题(训练基础设施、奖励 shaping、Agent 框架),其中信用分配是几个组成部分之一(例如,Agent Lightning、RAGEN、PRS)
  • 以上这两类都会被回顾,但在本文比较表和论文计数中会标记其区别
    • 当引用“47 种方法”时,指的是这两类的并集
    • 参见后面第 1.1 节了解完整的搜索和筛选方案

Scope and narrative

  • 与将信用分配视为子主题(2025a)或关注经典 RL(2023)的现有工作不同,本文以信用分配为中心视角来审视 LLM RL
  • 本文的叙述脉络是:
    • 经典 RL(Classical RL)\(\rightarrow\) Reasoning RL(Reasoning RL)\(\rightarrow\) Agentic RL(Agentic RL)\(\rightarrow\) 未来:多 Agent 系统(Future: Multi-Agent Systems)
  • 在每个阶段,信用分配问题都变得更加困难,并且出现新的方法来应对挑战

Contributions

  • 本文做出了三种不同类型的贡献:
I. Survey with taxonomy,带分类法的调研
  • 1)专门分析:本文提供了一个专注于 LLM RL 中信用分配的专门调研,涵盖了推理和 Agentic 两种设置(第 3 节和第 5 节)
  • 2)二维分类法:本文按粒度 \(\times\) 方法论组织了 47 种方法,揭示了系统性的模式和空白(第 2.4 节)
  • 3)推理 \(\rightarrow\) Agentic 分析:本文明确刻画了为什么 Agentic RL 使信用分配在质量上更加困难,以及这需要哪些新技术(第 4 节)
  • 4)系统比较:本文在计算成本、辅助模型需求、适用场景和实证性能方面比较了各种方法,包括一个结构化的 GRPO 系列元比较(第 7 节)
II. Reusable structured artifact,可复用结构化 Artifact
  • 5)机器可读清单:提供了所有 47 种方法的结构化清单,包含分类标签、基线族、证据等级和主要基准测试(第 B 节),设计用于直接复
    • 所有结构化数据将在发表后以可下载的 CSV/JSON 格式发布(见第 9.5 节)
III. Standardization proposals,标准化 Proposal
  • 6)报告清单:为未来的 CA 论文提出了一个具体的报告清单,并根据现有文献进行了验证,以识别最常见的方法论空白(第 C 节)
  • 7)基准测试协议:概述了信用分配评估套件的最低规格,包括任务族、所需元数据和受控分岔任务(第 9 节)
  • 8)研究路线图:识别了前沿的开放问题——多 Agent 信用、超长时域、探索-信用 interplay——并将 Agentic RL 视为未来创新的可能驱动力(第 9 节)

Relation to existing work

  • A Survey of Temporal Credit Assignment in Deep Reinforcement Learning, 2023, University College London & Google DeepMind 对经典深度 RL 中的时域信用分配进行了极好的回顾(56 页,2023),但完全早于 LLM 时代
  • The Landscape of Agentic Reinforcement Learning for LLMs: A Survey, 20250902-20260417, Oxford & Shanghai AI Lab & NUS提供了针对 LLM 的 Agentic RL 的全面概述(100 页,500+ 篇论文),但仅将信用分配作为众多子主题之一处理,缺乏深度
  • 几篇关于 Reasoning RL 的工作(2025b)广泛涵盖了 RL 算法,但未聚焦于信用分配
  • 现有工作没有系统地审视跨推理和 Agentic LLM RL 的信用分配问题

Paper organization

  • 第 2 节介绍背景、问题表述和分类法
  • 第 3 节回顾 Reasoning RL 的信用分配方法
  • 第 4 节刻画为什么 Agentic RL 使信用分配问题复杂化并重塑其格局
  • 第 5 节回顾针对 Agentic 的信用分配方法
  • 第 6 节涵盖多 Agent 信用分配
  • 第 7 节提供系统比较
  • 第 8 节将信用定位置于更广泛的 Agentic RL 训练流程中
  • 第 9 节讨论开放问题和未来方向
  • 第 10 节总结

How to use this survey

  • 本文旨在以不同方式服务不同读者:
  • 为特定任务选择 CA 方法的从业者:从决策树(图 4)和推荐表(表 8)开始,然后阅读相关方法章节获取详细信息
  • 寻求开放问题的研究人员:阅读第 4 节了解核心挑战,然后阅读第 9 节了解研究路线图
    • 基准测试协议(第 9 节)和报告清单(第 C 节)可能有助于设计实验
  • 评审者和元研究人员:结构化清单(第 B 节)提供了所有 47 种方法的机器可读元数据
    • 清单验证(第 C 节)记录了当前的报告空白
  • LLM RL 信用分配的新入门者:阅读第 2 节了解基础知识,然后跟随第 3 节和第 5 节的叙述脉络

1.1 Literature Coverage, 文献覆盖范围

  • 本文涵盖了 2024 年 1 月至 2026 年 4 月期间发表的针对 LLM RL 的信用分配方法
  • 通过在 arXiv、Semantic Scholar 和 Google Scholar 上进行关键词搜索来识别论文,将信用分配术语(“credit assignment”,“process reward”,“reward decomposition”,“turn-level reward”)与 LLM/RL 术语相结合
  • 通过从基础工作(VinePPO、ArCHer、GRPO、DeepSeek-R1)向前/向后追溯引用,以及系统性地监控主要会议(NeurIPS、ICML、ICLR、ACL 2025)和 HuggingFace Daily Papers 来补充这些搜索
  • 本文纳入那些主要贡献是新颖信用分配机制的方法,并区分核心 CA 方法(41 篇论文)和 CA 相关使能方法(6 篇论文)
    • CA 相关使能方法中的信用分配是多个组成部分之一
    • 如果一篇论文的主要算法贡献是一种将稀疏奖励分配到行为上的新方法,则将其归类为“核心”
    • “相关”论文为 CA 生态系统(基础设施、奖励 shaping、Agent 框架)做出贡献,但没有提出新的分解算法
    • 边界情况(例如,跨越推理/Agentic 设置的方法)在第 9.4 节中讨论
  • 所有 47 篇论文的完整清单及其分类标签在第 B 节中提供
    • 包括详细搜索查询和筛选决策在内的补充材料将在发表后发布(第 9.5 节)
  • 作者承认,作为单人调研,本文的覆盖范围可能存在空白
    • 详见第 9.4 节的讨论

Background and Problem Formulation

From Reasoning RL to Agentic RL: A Brief History

  • RL 在 LLM 上的应用经历了几个不同的阶段,每个阶段都引入了新的信用分配挑战
阶段 1:RLHF(2022-2023)
  • InstructGPT(2022)提出了 RLHF(基于 PPO)
  • 这个场景中,轨迹是中等长度(\(\sim 500\) 个 token)的单轮响应,奖励模型为整个响应提供一个密集的标量信号
  • 此时的信用分配是隐式的:
    • PPO 学习到的价值函数提供 Token-level 基线,尽管这些基线在高维 LLM 行为空间中的质量仍有争议
阶段 2:Reasoning RL(2023-2025)
  • 一个突破:使用可验证的结果奖励(没有任何奖励模型)通过 RL 训练 LLM 可以激发复杂的推理行为
  • DeepSeek-R1(2025)证明,在数学问题上使用带有二元正确性奖励的 GRPO 可以产生能够进行扩展思维链推理的模型
    • OpenAI 的 o1 和 o3 模型展示了类似的能力
  • 这个场景下,轨迹是单次生成,范围从 \(\sim 500\) 个 token(简单数学)到 30,000+ 个 token(困难竞赛题;在 AIME 上,DeepSeek-R1 平均约 \(\sim 23\text{K}\) 个 token(2025))
    • 奖励纯粹是终端奖励(正确或错误)
  • 此时信用分配是:
    • 单个结果奖励应如何分配到数千个推理 token 上?
    • 这个问题催生了第一波针对 LLM 的 CA 方法,包括过程奖励模型(2024;2024)、 Token-level 价值估计(2025)和步骤级优势计算(2025)
  • 图 1:用于 LLM 的 RL 的演化及相应的信用分配挑战
    • 每个阶段都引入了更长的轨迹、更复杂的环境和更困难的信用分配问题
    • 从推理到 Agentic RL 的转变代表了 CA 难度的一次质的飞跃
阶段 3:Agentic RL(2024-至今)
  • Agentic RL 阶段将 RL 扩展到多轮、环境交互的 Setting 中
  • ArCHer(2024c)在 2024 年初开创了用于 LLM Agent 的分层多轮 RL
  • 2025 年,Agentic RL 爆炸式增长:
    • 系统训练了用于网页导航(2024a)、软件工程(SWE-bench)、科学实验和多 Agent 协作的 Agent
  • 在这个场景中,轨迹跨越 10-100+ 轮,每轮之间有环境交互,总 token 数达到 \(10^{5} - 10^{6}\),奖励保持稀疏和终端
  • 信用分配问题现在在质量上更加困难(见第 4 节),这推动了第二波创新浪潮:
    • 专注于 Turn-level 和基于 hindsight 的方法(2026;2026;2026c;2025;2025;2025b)

Problem Formulation: Two MDP Abstractions

Reasoning RL as a token-level MDP
  • 在 Reasoning RL 中,模型针对一个 Prompt \(x\) 生成单个响应 \(y = (y_{1}, y_{2}, \ldots , y_{L})\)
  • 这可以建模为一个 MDP,其中:
    • 状态 \(s_{t} = (x, y_{1}, \ldots , y_{t - 1})\) 是提示加上迄今为止生成的 token
    • 行为 \(a_{t} = y_{t}\) 是下一个 token
    • 转移是确定性 的(自回归生成)
    • 奖励 \(R\) 仅在终端状态给出(例如,答案正确性)
  • 这里的信用分配意味着:推理链中的哪些 token(或 token 组)促成了正确答案?
Agentic RL as a turn-level POMDP
  • 在 Agentic RL 中,模型与环境在 \(T\) 轮中进行交互:
    • 状态 \(s_{t}\) 包括对话历史、环境状态(部分可观测)和检索到的上下文
    • 行为 \(a_{t}\) 是模型在第 \(t\) 轮的完整响应(其本身包含许多 token)
    • 转移是随机 的:环境响应取决于工具执行、网页状态等
    • 奖励 \(R\) 是稀疏且终端的(任务成功/失败)
  • 这种场景下,信用分配是双重分层的:
    • (1) 哪一轮是关键?
    • (2) 在该轮中,哪些 token 重要?
  • 表 1:本文使用的主要符号总结
  • The multi-granularity action hierarchy
    • 此时是 多粒度行为层次结构
      $$\tau_{\text{Episode} } = \underbrace{[\text{Turn}_{1},\ldots,\text{Turn}_{T}]}_{\text{Turn level} } = \underbrace{[\text{Seg}_{1,1},\ldots]}_{\text{Segment level} } = \underbrace{[a_{1,1,1},\ldots]}_{\text{Token level} } \tag {1}$$

Why GRPO’s Episode-Level Credit is Insufficient,Why Episode-level 信用不够

  • GRPO 估计器(2024)计算一个组优势:
    $$\hat{A}_i^{\text{GRPO} } = R(\tau_i) - \frac{1}{G}\sum_{j = 1}^{G}R(\tau_j) \tag {2}$$
    • \(\tau_{i}\) 中的每个 token 都收到相同的优势 \(\hat{A}_i^{\text{GRPO} }\)
  • 对于一个长度为 \(L\) 的轨迹:
    • Reasoning RL(\(L \sim 10^{3} - 10^{4}\) 个 token,1 轮): Episode-level 方法(GRPO,REINFORCE)工作得相当好,因为“关键决策”的数量相对于总 token 数较少,且信噪比保持在可控范围内
    • Agentic RL(\(L \sim 10^{5} - 10^{6}\) 个 token,10-100+ 轮): Episode-level 方法将一个关键的“选择正确的 API”行为和一个琐碎的“格式化输出”行为分配相同的信用
      • 信噪比崩溃
      • 问题:如何理解这里的信噪比?
        • 理解:信噪比(Signal-to-Noise Ratio, SNR)是一个从通信和信号处理领域借用的概念,主要用来衡量模型在处理信息或进行训练时,“有用的目标信息(信号)”与“无用的干扰信息(噪声)”之间的比例
  • 实证上,Zhou 等人(2024c)表明
    • 使用 Episode-level 奖励的标准 PPO 未能学习有效的多轮策略
    • 使用分层信用的方法成功了
    • Wang 等人(2025d)报告了类似的发现,将其失败归因于他们所谓的“回声陷阱”(echo trap)
  • 更正式地,在带有基线 \(b\) 的 REINFORCE 估计器中,单个行为 \(a_{t}\) 的策略梯度方差与 \((R(\tau) - b)^{2}\) 成比例
    • 当相同的基线应用于所有 \(T\) 个行为时,总梯度方差按 \(\mathcal{O}(T \cdot \text{Var}[R])\) 缩放
    • GRPO 和其他 Episode-level 方法通过组归一化部分缓解了这个问题,但根本问题仍然存在:
      • 对于 \(T = 100\) 轮和二元奖励,每个行为的信噪比大约比单轮推理设置差 \(100\) 倍
    • 实证上,Wang 等人(2025d)通过“回声陷阱”现象证明了这一点:
      • 在 Episode-level 信用下,Agentic 模型收敛到重复行为,因为梯度信号太嘈杂,无法区分有成效的行为和冗余的行为

Taxonomy Overview

  • 本文沿着两个正交轴组织方法(图 2):
    • 1)粒度轴(Granularity axis):信用在哪个级别分配?
      • Token-level (Token-level):生成过程中的单个 token
      • Segment-level (Segment-level):语义上有意义的跨度(例如,一个推理步骤)
      • 步骤/ Turn-level (Step/Turn-level):一个完整的 LLM 响应或工具调用周期
      • 多 Agent 级(Multi-agent level):跨协作 Agent 的信用分解
    • 2)方法论轴(Methodology axis):信用如何计算?
      • Monte Carlo (MC):从中间状态进行 Rollout
      • 时序差分(Temporal Difference, TD):学习到的价值函数与自举
      • 基于模型 / LLM 作为 Critic(Model-based / LLM-as-Critic):LLM 评估中间状态
      • 博弈论(Game-theoretic):Shapley 值,反事实基线
      • 信息论(Information-theoretic):信息增益,基于熵的度量

Classical Credit Assignment: A Brief Primer,经典信用分配简要入门

  • 在 LLM 时代之前,深度 RL 为信用分配开发了丰富的工具包,许多针对 LLM 的方法直接建立在这些基础之上
    • 注:本文简要介绍,关于更全面的内容推荐参考 A Survey of Temporal Credit Assignment in Deep Reinforcement Learning, 2023, University College London & Google DeepMind
Temporal Difference learning and value baselines
  • 最广泛使用的方法估计一个状态价值函数 \(V(s)\) 并使用优势 \(A(s,a) = Q(s,a) - V(s)\) 来分配信用
  • GAE(Generalized Advantage Estimation)(2016)通过参数 \(\lambda\) 在高偏差(TD(0))和高方差(MC)估计之间插值:
    $$\hat{A}_t^{\text{GAE}(\gamma ,\lambda)} = \sum_{l = 0}^{\infty}(\gamma \lambda)^l\delta_{t + l},\quad \delta_t = r_t + \gamma V(s_{t + 1}) - V(s_t) \tag {3}$$
  • 在 LLM 设置中,AgentPRM(2025)直接应用 TD+GAE 来学习 Agent 的 Turn-level 价值函数,而 ArCHe(2024c)使用带有 TD 更新的 off-policy critic
Return decomposition,Return 分解
  • RUDDER(2019)通过训练一个序列模型从部分轨迹预测回报,将 episodic 回报分解为每个步骤的贡献
  • 步骤 \(t\) 的贡献是预测回报的变化:
    $$c_{t} = \hat{R} (s_{0:t}) - \hat{R} (s_{0:t - 1})$$
  • 这个想法直接启发了 LLM 方法,如 RED(2024a)( Token-level 再分配)、SPA-RL(2025b)(基于 MLP 的进度估计)和 IGPO(2025a)(信息增益作为信用)
Hindsight credit assignment
  • HCA(2019)根据观察到的结果重新加权过去的行为,利用“知道未来会改变作者对哪些过去行为重要的估计”这一见解
  • 这种“向后看”的原则是 HCAPO(2026)的核心,它通过生成式验证将事后信用扩展到 LLM Agent
Counterfactual baselines, 反事实
  • 差异奖励通过将实际结果与反事实基线进行比较来评估一个行为的贡献:
    • “如果这个行为被默认行为替换,会发生什么?” 这需要环境重新执行或基于模型的近似
  • 在 LLM 设置中,C3(2026)和 CCPO(2026c)通过对 Agent 轮次进行留一分析来实现反事实信用,而 SCAR(2025)使用 Shapley 值——反事实基线的博弈论泛化
Key mapping to LLM RL
  • 经典范式映射到特定于 LLM 的方法如下:
    • TD/GAE \(\rightarrow\) 学习到的 critic(ArCHer, AgentPRM)
    • 回报分解 \(\rightarrow\) 奖励再分配(RED, SPA-RL)
    • 事后(hindsight)\(\rightarrow\) 回顾性分析(HCAPO)
    • 反事实(counterfactual)\(\rightarrow\) 留一和 Shapley(C3, SCAR)
  • LLM Setting 引入了一个经典 RL 中不存在的独特能力:
    • LLM 本身可以作为 critic,提供对中间状态的自然语言评估(2025;2025;2025)
    • 这种 LLM-as-Critic 范式没有直接对应的经典类比,并代表了信用分配方法论的一个独特轴
  • 图 3:本调研中回顾的所有 47 种信用分配方法的分层分类法
    • 方法按设置(Reasoning / Agentic / Multi-Agent)组织,然后按方法论族组织
  • 缩写的方法论标签显示在括号中
    • 详情见表 5
  • Process Reward Models Are Credit Assignment
    • 一个关键的概念澄清:过程奖励模型(Process Reward Models, PRMs)不仅仅是一种奖励建模技术
      • PRMs 从根本上说是一种信用分配机制:一个为每个推理步骤 \(i\) 打分 \(r_i\) 的 PRM 正在对终端奖励 \(R(\tau)\) 执行步骤级的信用分解
      • 因此,PRM 文献(Math-Shepherd, OmegaPRM, PURE)和 CA 文献(VinePPO, SPRO, SCAR)是同一潜在问题的两个视角
    • 在本文采用 CA 视角,将 PRM 视为分配信用的几种方法论之一

RL Algorithms for LLMs: A Brief Overview

  • 信用分配方法不是孤立运作的
    • 信用分配是更广泛 RL 算法内部的组成部分
  • 本节简要回顾用于 LLM 训练的主要 RL 算法,重点说明每个算法与信用分配的关系
PPO
  • PPO 是 RLHF 的主力,用于 InstructGPT、ChatGPT 和 Claude
  • PPO 训练一个学习到的价值函数 \(V_{\phi}(s)\) 作为基线,通过 GAE 计算 Token-level 优势
  • 价值函数本身就是一个信用分配机制(其质量直接决定了训练效率)
  • 问题:为 LLM 规模的状态空间训练一个准确的价值函数是出了名的困难:
    • 价值网络必须处理数千个 token 的序列并产生可靠的标量估计,这一挑战催生了无 critic 的替代方案
REINFORCE and REINFORCE with baseline
  • 最简单的策略梯度方法,REINFORCE 计算
    $$ \nabla_{\theta}J = \mathbb{E}[\sum_{t}\nabla_{\theta}\log \pi_{\theta}(a_{t}|s_{t})\cdot R(\tau)]$$
    • 将完整回报作为信用分配给每个行为
  • 添加一个基线 \(b\)(例如,平均回报)可以减少方差,但不能提供每个行为的信用区分
  • 因为这类方法实现简单,带有学习到基线的 REINFORCE 被用于最近的一些 LLM RL 系统中,尽管它的信用分配是所有方法中最粗糙的
GRPO
  • GRPO(2024)与 DeepSeek-R1 一起推出,用组比较基线取代了学习到的价值函数:
    • 对于来自同一提示的一批 \(G\) 条轨迹,优势为
      $$\hat{A}_{i} = R(\tau_{i}) - \frac{1}{G}\sum_{j}R(\tau_{j})$$
    • 这完全消除了对 critic 网络的需求,使 GRPO 在计算上很有吸引力
  • 但 GRPO 仅提供 Episode-level 信用(一条轨迹中的每个 token 都收到相同的优势)
    • 这是本文中提到的大多数方法旨在改进的信用分配限制
DPO
  • DPO(2023)通过直接从偏好对优化策略来绕过显式的奖励建模
    • 正如 “From \(r\) to \(Q^{*}\)”(2024)所示,DPO 隐式地学习了 Token-level Q 值,提供了一种隐式的信用分配形式
    • 像 iStar(2025)和 ITPO(2026)这样的方法利用这一见解,从经过 DPO 训练的模型中提取步骤级的信用,而无需显式的奖励计算
The credit assignment perspective on RL algorithms,RL 算法上的信用分配视角
  • 从 CA 的角度来看,这些算法形成了一个谱系:
    • REINFORCE/GRPO 提供 Episode-level 信用(最粗糙)
    • PPO 通过学习到的 critic 提供 Token-level 信用(更精细但近似)
    • DPO 提供隐式的 Token-level 信用(理论优雅但难以提取)
  • 本文调研的方法可以看作是对这些基础算法的信用分配质量的增强,例如:
    • VinePPO 用 MC 估计取代了 PPO 的学习到的 critic
    • HCAPO 在 GRPO 之上增加了事后分析
    • CARL 在任何基础算法中选择性地应用信用
Other related algorithms
  • 在 LLM 训练中使用的其他几种 RL 和自我改进算法没有被深入覆盖,因为它们的信用分配特性属于上述范围之内
  • RLOO(REINFORCE Leave-One-Out)使用留一基线
    $$ b_{i} = \frac{1}{G - 1}\sum_{j\neq i}R(\tau_{j})$$
    • 这是一种与 GRPO 的组基线密切相关的方差 reduction 技术
    • 从 CA 的角度来看,它仍然是 Episode-level
  • REINFORCE++ 向 REINFORCE 添加了一个 Token-level KL 惩罚
    • 介于 REINFORCE 和 PPO 之间,但没有引入新的信用分解机制
  • Online DPO、IPO 和 KTO 是偏好优化变体,它们共享 DPO 的隐式信用结构
    • 它们的 CA 属性继承自上述的“From \(r\) to \(Q^{*}\)”分析
  • ReST、Expert Iteration 和 STaR 是迭代式的自我改进方法,它们基于结果质量过滤或精炼训练数据
    • 它们间接地与信用分配交互(通过策划要从中学习的轨迹),但不会分解轨迹内的信用
  • 本文关注 PPO、GRPO、REINFORCE 和 DPO
    • 它们涵盖了信用分配方法设计空间的核心部分

Credit Assignment in Reasoning RL

  • 在 Reasoning RL 中
    • LLM 生成单条思维链响应
    • 轨迹是一次生成中的 token 序列
  • 这里的 credit assignment 方法在 Token-level 和 segment/ Step-level 上运作,将结果奖励分配到整个推理链中

Token-Level Methods

Monte Carlo Token-Level Estimation
  • VinePPO
    • VinePPO (ICML 2025) 将 PPO 中学习到的价值网络替换为 Token-level 无偏蒙特卡洛价值估计
    • 关键 Insight:对于自回归 LLM,从任何中间前缀生成 rollout 都非常便宜(只需从模型中继续采样即可)
    • 在每个 token 位置 \(t\),VinePPO 分叉出 \(K\) 条独立的延续(“藤蔓”),根据结果奖励评估每条延续,并估计
      $$ V(s_t) \approx \frac{1}{K} \sum_{k = 1}^{K} R(\tau_k^{(k)})$$
    • Token-level 优势为
      $$\hat{A}_t = R(\tau) - V(s_t)$$
      • 这提供了无偏的优势,没有学习到的 critic 的函数近似误差
  • 在 GSM8K 和 MATH 上,VinePPO 显著优于使用学习到的价值函数的标准 PPO,证明了 credit assignment 质量(而非策略优化)是主要的瓶颈
  • 主要的限制是计算成本:每个训练轨迹需要 \(\mathcal{O}(K \cdot L)\) 次额外的前向传播,其中 \(L\) 是序列长度
Reward Redistribution
  • RED
    • RED(Reward Redistribution to Token Level)采用了一种务实的方法:
      • 给定一个为 RLHF 训练的现成 RM,它通过线性回归探测 RM 的内部表示来估计 Token-level 奖励贡献
      • 具体做法:训练一个轻量级探针(问题:似乎不需要重新训练吧,即使训练也没有中间标记的样本啊),利用 RM 的隐藏状态来预测每个 token 对整体奖励分数的边际贡献
      • 设生成序列长度为 \( T \),\( \mathcal{R}_{\phi}(x, y_{\leq t}) \) 为奖励模型对前 \( t \) 个 token 的输出分数,定义 token 级别的奖励为:
        $$
        \tilde{r}_t^{RM} = \mathcal{R}_{\phi}(x, y_{\leq t}) - \mathcal{R}_{\phi}(x, y_{\leq t-1}), \quad \text{for } 0 \leq t \leq T
        $$
        • 其中令 \( \mathcal{R}_{\phi}(x, y_{\leq -1}) = 0 \),则有:
          $$
          \sum_{t=0}^{T} \tilde{r}_t^{RM} = \mathcal{R}_{\phi}(x, y_{\leq T})
          $$
          • 即所有 token 奖励之和等于原序列的整体奖励
      • RED 方法可与 PPO、RLOO 等 RL 算法无缝集成,最终每个 token 的奖励为:
        $$
        r_t^{\text{final} } = \tilde{r}_t^{RM} - \beta \cdot r_t^{KL}
        $$
    • 注:不需要额外的 RL 训练(再分配完全是事后进行的)
    • RED 提供了一种 surprisingly effective 的 Token-level 信号,相比均匀 credit assignment 能改善 PPO 训练,这表明预训练的奖励模型已经编码了丰富的、未被充分利用的 credit assignment 信息
  • T-REG
    • T-REG(Token-Level Reward Regularization)在没有任何外部模型的情况下生成 Token-level 奖励信号
    • T-REG 使用一种对比性自提示策略:
      • 对于一个给定的问题,模型生成正确和不正确的解决方案,然后比较 Token-level 对数概率差异,以识别哪些 token 最具区分性
      • 在正确和错误解决方案之间差异最大的 token 获得更高的 credit
      • 这种自监督方法非常简洁,不需要奖励模型、critic 或额外的 rollout
Implicit Token-Level Credit,隐式 Token-level Credit
  • From \(r\) to \(Q^*\)
    • 这项工作为偏好训练模型中的隐式 credit assignment 提供了理论基础
    • 文章表明:DPO 隐式地学习了一个 Token-level Q 函数:
      • 在训练模型和参考模型之间,每个 token 位置的对数概率比率对应于贝尔曼方程下的 soft Q 值
        $$
        Q^{*}(s_t, a_t) = \beta \log \frac{\pi_{\theta}(a_t | s_t)}{\pi_{\text{ref} }(a_t | s_t)} + \beta \log Z(s_t)
        $$
        • \(\beta\) 是 DPO 温度参数,\(Z\) 是一个归一化配分函数
    • 这一 Insight 意味着
      • 任何经过偏好训练的 LLM 已经内在地编码了 credit assignment 信息,而提取这种隐式 credit 可能比学习显式的奖励模型更高效
      • 注:这个 Insight 的实际意义是深远的:credit assignment 可能是对齐训练的一个“免费”副产品

Segment-Level Methods

  • SPO
    • SPO(Segment Policy Optimization)在 Token-level 和 Episode-level credit 之间找到了一个实用的中间地带
    • SPO 将推理链在“切割点”处划分为语义上有意义的 segments(即按照一些转义 Token 等来划分)
      • 这些 Segment 划分边界位置是推理在不同子问题或方法之间过渡的地方(例如,在建立方程和解方程之间)
      • 对于每个 segment,SPO 通过比较共享该 segment 之前相同前缀的轨迹的结果来计算 MC 优势
      • 这种 segment 级别的粒度自然地与数学推理的结构对齐,其中每个“步骤”是一个连贯的单元,同时避免了 Token-level MC 估计的过高成本
  • TEMPO
    • TEMPO(Tree-Structured Credit Assignment)将推理的线性链结构推广到树
    • 在模型本可以采取不同路径的决策点
      • TEMPO 将轨迹分支成一棵树,每个分支代表一个备选延续
      • 然后应用分支门控 TD 校正:
        • 叶节点(完成的轨迹)上的 MC 估计通过使用 TD 风格的自举在内部节点向上传播
    • 这种混合方法结合了叶节点的 MC 无偏性和内部节点的 TD 方差减少
    • 注:TEMPO 是无 critic 的
      • TEMPO 不需要学习价值函数,而是使用树结构本身来提供多分辨率 credit 信号
  • SCAR
    • SCAR(Shapley Credit Assignment Rewards)将合作博弈论引入 credit assignment
    • SCAR 将推理链视为一个联盟博弈,Shapley Value 的解释见:Math——博弈论-Shapley-Value
      • 其中每个 segment 是一个“玩家”,结果奖励是博弈的价值
      • 每个 segment 的 credit 是其 Shapley 值
        • 即在所有可能的 segments 排序中,其平均边际贡献
      • Shapley 值是唯一满足效率(credits 总和等于总奖励)、对称性(平等贡献者获得平等 credit)和虚拟玩家属性(非贡献者获得零 credit)的归因方法
      • 主要挑战是计算量:对于 \(n\) 个 segments,精确的 Shapley 值需要评估 \(2^{n}\) 个联盟
      • SCAR 使用基于抽样的近似,用精确性换取可处理性
      • SCAR 提供了一个理论上严谨的 credit assignment,可以作为评估更便宜的启发式方法的黄金标准参考

Step-Level Methods in Reasoning

  • 这些方法将每个“推理步骤”(例如,一行数学推导)视为 credit 的单位
Process Reward Models, PRMs
Background: Math-Shepherd and OmegaPRM
  • 过程奖励模型 (PRM) 范式最初是为推理验证引入的,为 Step-level credit assignment 提供了一个自然的框架
    • Math-Shepherd (2024) 开创了自动化的 Step-level 标注:对于每个推理步骤,它对多个 continuations 进行采样,如果有足够比例的 continuations 能到达正确答案,则将该步骤标记为“正确”
    • OmegaPRM (2024) 使用分治策略扩展了这种方法,该策略有效地探索了可能的延续树
    • 这些 PRM 基础为下游 CA 方法构建所依赖的 Step-level 监督提供了基础,并且它们基于 MC 的标注策略直接与经典的回报分解范式相关联
PURE
  • 原始论文:(PURE)Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning (ICML 2025)
  • PURE 对基于 PRM 的 credit 做出了一个微妙但重要的理论贡献
  • 标准 PRM 将 Step-level 价值分配为未来奖励的期望总和:
    $$ V(s_{t}) = \mathbb{E}[\sum_{t^{\prime} = t}^{T}r_{t^{\prime} }]$$
    • 理解:状态价值等于未来奖励的总和的期望
    • PURE 认为这种“求和形式”的 credit 容易受到 Reward Hacking 的影响
      • 模型可以学习产生“安全”的中间步骤来增加期望总和,而实际上并不对正确性做出贡献
    • PURE 提出了最小形式 credit:
      $$ V(s_{t}) = \mathbb{E}[\min_{t^{\prime} \geq t} r_{t^{\prime} }]$$
      • 含义:状态的价值由最差的未来步骤决定
        • 问题:比如未来如果有一步会导致得到 0 分,那么前面的状态价值就是 0 分
      • 问题:这改变了 RL 最大化未来累计奖励的目标
      • 这可以防止模型将错误“隐藏”在高分步骤之后,并提供更稳健的 Step-level credit 信号
    • 理论分析表明,最小形式 credit 能导致更好校准的过程奖励并减少过度优化
SPRO
  • 原始论文:(SPRO)Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning, 20250703, Terminus Group & HKUST
  • SPRO(Self-Guided Process Reward)引入了一种自监督的 Step-level credit 方法,不需要外部 PRM 或奖励模型
  • SPRO 核心机制是掩码步骤优势:
    • 在解决方案中,对于每个步骤 \(i\),SPRO 掩码(移除)该步骤并重新评估解决方案达到正确答案的可能性
    • 步骤 \(i\) 的 credit 是其移除导致的性能下降:
      $$ c_{i} = P(\text{correct}|\text{full solution}) - P(\text{correct}|\text{solution without step } i)$$
    • 这种留一法方法提供了对每个步骤必要性的直观衡量
    • SPRO 报告称,与标准 GRPO 相比,训练效率提高了 \(3.4 \times\),表明即使是简单的自监督 credit 信号也能极大地加速学习
FinePO
  • FinePO (2026) 是用于图表理解的 SketchVL 框架的一部分
  • FinePO 证明了 PRM 范式可以在特定领域设置中被推到子步骤粒度
  • 在一个视觉推理流程中,FinePO 对每个推理步骤中 的单个操作 进行评分,提供了比标准 Step-level PRM 更精细的 credit 信号
  • FinePO 是为特定领域(图表和图示理解,而非一般数学推理)开发的,但其 credit assignment 机制(将 Step-level 奖励分解为子步骤贡献 )说明了一个可能推广到其他推理步骤具有内部结构的设置的方向
PRL
  • PRL(Process Reward Learning, 2026)在过程奖励与最优策略的结构之间提供了一个理论上优雅的联系
  • PRL 从熵正则化 RL 目标的分解中推导出 Step-level 过程奖励,表明在熵正则化最优策略下,每个步骤的最优过程奖励等于优势函数
  • 这种理论依据意味着 PRL 的 credit 信号不是启发式的,而是在特定假设下被证明是最优的,为 Step-level credit assignment 提供了一个有原则的基础
InT
  • InT(自我提出干预,Self-Proposed Interventions, 2026)在推理 credit assignment 中采用了一种独特的方法:
    • 模型自己提出干预:
      • 对特定推理步骤的反事实修改,并评估这些干预是否会改变结果
    • 给分:
      • 那些改变结果的步骤获得高 credit
      • 那些无关紧要的步骤获得低 credit
      • 理解:这里指的 Credit 不是奖励,而是造成当前结果的影响权重(所以 高 credit 不意味着高 Reward,也可能是更置信的 低 Reward 结果)
    • 这种自我提出的干预机制提供了一种有原则的、模型内在的步骤重要性度量,无需外部奖励模型
Attribution-Based and Curriculum Methods,基于归因和课程的方法
ACPO
  • ACPO(Attribution-based Credit for RLVR,2025)将 credit assignment 与课程学习相结合
  • ACPO 使用归因方法(例如,基于梯度的显著性)计算分解的层次化奖励,将结果奖励分解为步骤贡献,然后使用这些 Step-level 信号构建一个难度感知的训练课程
  • credit 集中在少数步骤上(清晰的分叉点)的问题在训练早期被优先考虑,而 credit 分散的问题(许多步骤贡献相等)在后期引入
  • credit assignment 和数据选择之间的这种协同作用体现了一个更广泛的趋势:
    • CA 不仅仅是关于奖励再分配,而是关于使整个训练流程更高效
LLM-as-Critic for Reasoning
CAPO
  • CAPO(Credit Assignment Policy Optimization, 2025)利用了 LLM 设置中独有的能力:
    • 模型可以作为自己的 critic
  • CAPO 使用 LLM 作为生成式 PRM (GenPRM)
    • 给定一个推理轨迹,同一个 LLM(或其 Prompted 版本)会生成对每个步骤的自然语言批判,评估其正确性、相关性和对最终答案的贡献
    • 这些批判被转换为标量的 Step-level 奖励,用于驱动策略优化
  • 主要优势是自包含:
    • 不需要单独的奖励模型、critic 网络或 MC rollouts
  • 主要风险是:
    • 自我评估偏差(模型可能系统地高估自己的步骤)
    • 注:CAPO 通过校准技术来缓解这一点
Hierarchy-Aware Methods in Reasoning
HICRA
  • HICRA(层次感知 Credit Assignment,2025)研究了 RL 如何在 LLM 中发展层次化推理
  • HICRA 识别出一个两阶段的学习动态:
    • 模型首先获得 procedural 技能(常规计算),然后发展出 Strategic Planning(高层次的问题分解)
  • HICRA 建议将 credit 集中在高影响力的规划 token 上,而不是均匀地分布学习信号,表明这种层次感知的方法显著优于平坦的 credit assignment
  • HICRA 是在 Reasoning RL 背景下开发的,但其 Insight 与 Agentic Setting 高度相关(见第 5.4 节),Agentic Setting 中战略决策和常规执行之间的区别甚至更为明显
    • Insight 内容:Token 的不同功能角色(planning vs. procedural)应该得到不同的 credit 处理

Discussion: The State of Credit Assignment in Reasoning RL

  • 本节回顾的方法揭示了一个成熟的格局,具有清晰的权衡:
    • Token-level 方法(VinePPO,RED,T-REG)提供了最精细的 credit 粒度,但面临计算挑战
      • VinePPO 的 MC 方法在理论上严谨但代价高昂
      • RED 和 T-REG 提供了更便宜的替代方案,但代价是信用信号的严谨性较低
    • Segment/ Step-level 方法代表了当前的主流
      • PRM(PURE,SPRO)和层次感知方法(HICRA)在 credit 质量和计算成本之间提供了实用的平衡
      • FinePO (2026) 这样的特定领域扩展表明,在结构化领域中,子步骤粒度是可行的
    • LLM 作为 Critic 范式(CAPO)正在成为一种独特的、LLM 原生的方法,在经典 RL 中没有直接的类似物
  • 一个关键的观察是,所有 Reasoning RL credit assignment 方法都隐式地依赖于三个假设:
    • 1)确定性转移 :从前缀生成下一个 token 总是产生相同的状态,这使得廉价的 MC 估计成为可能
      • 否则随机性比较高的 Setting ,方差较大,需要采样更多的样本才能做较为准确的 MC 估计
    • 2)单次生成轨迹 :整个轨迹是一次自回归生成,没有环境交互
    • 3)可验证的结果 :最终答案(以及通常的中间步骤)可以根据 ground truth 进行检查
  • 当这些假设中的任何一个被违反时(就像在 Agentic RL 中那样),上述方法就会面临根本性的限制:
    • VinePPO 的藤蔓扩展需要重新执行环境交互
    • PRM 需要步骤级验证,但 Agentic 任务很少能提供这种验证
      • 理解:更多是需要最后才知道是否成功
  • Reasoning RL 中 credit assignment 的成功提出了一个自然的问题:
    • 问题:当 LLM 与现实环境交互时,同样的方法能否工作?
    • 回答:回答基本上是否定的,Agentic RL 引入了质的不同挑战,需要不同的方法

Why Agentic RL Fundamentally Reshapes Credit Assignment,Agentic RL 重塑 Credit Assignment

  • 本节回答是什么使得 Agentic RL 中的 credit assignment 与 Reasoning RL 有质的不同

Challenge 1: Stochastic Environment Transitions

  • 在 Reasoning RL 中,转移函数是确定性的:
    • 给定一个前缀 \((x,y_{1},\ldots ,y_{t - 1})\),生成 token \(y_{t}\) 后的下一个状态就是 \((x,y_{1},\ldots ,y_{t})\)
    • 这种确定性是 credit assignment 的强大推动因素
      • 像 VinePPO (2025) 这样的方法可以通过从任何前缀分叉多条延续来廉价地估计 \(V(s_{t})\),因为知道“环境”(LLM 自身的生成)是完全可控和确定性的
  • 在 Agentic RL 中,这个假设从根本上被打破了
    • 在 Agent 发出一个动作(例如,工具调用、网络请求、代码执行命令)后,环境的响应是随机的:
      • API 调用可能失败、超时或返回限流响应
      • 自上次访问以来,网页可能已经更改,或者由于 A/B 测试而加载不同
      • 代码执行可能产生非确定性输出(例如,浮点变化、竞态条件)
      • 在对话设置中,用户的响应本质上是不可预测的
  • 这种随机性对 credit assignment 有直接的影响
    • 基于 MC 的方法需要从中间状态重新执行环境交互,这通常是昂贵的(需要沙盒环境)或不可能的(环境状态可能无法被 checkpoint)
      • 个人补充:随机也会导致方差变大,从而需要采样更多样本用于 MC 估计才合适?
    • 基于 TD 的方法必须应对 TD 误差中更高的方差
      $$ \delta_{t} = r_{t} + \gamma V(s_{t + 1}) - V(s_{t})$$
      • 因为 \(s_{t + 1}\) 现在是一个随机变量
  • 这就是为什么 Agentic CA 方法越来越青睐事后分析(hindsight)方法 (2026)
    • 在收集完轨迹后进行分析,而不是需要反事实重新执行

Challenge 2: Partial Observability,部分可观测性

  • Reasoning RL 在一个完全可观测的 MDP 中运行:
    • 状态(提示 + 到目前为止生成的 token)对模型是完全可见的
  • Agentic RL 本质上是一个部分可观测的 MDP (POMDP)
    • Agent 通过一个通常是损失性的文本观测函数 \(o_{t} = \mathcal{O}(s_{t})\) 来感知环境:
      • 数据库的完整状态是不可见的(Agent 只看到查询结果)
      • 文件系统内容只能通过显式的 ls 或 cat 命令来观测
      • 在多 Agent 设置中,其他 Agent 的内部状态和推理是隐藏的
      • 网页状态包括不可见元素(JavaScript 状态、会话数据、服务器端逻辑)
  • 部分可观测性从根本上使 credit assignment 复杂化,因为它在决策质量和信息可用性之间引入了模糊性
    • 一个事后看来“糟糕”的动作(例如,调用了错误的 API)可能基于 Agent 当时的信息是最优的
    • 一个正确的 credit assignment 系统必须区分:
      • 1)决策错误 :Agent 拥有足够的信息但做出了糟糕的选择
      • 2)信息差距 :Agent 缺乏关键信息,并且没有可用的行动可以弥补这一差距
      • 3)探索性动作 :Agent 正确地选择了收集信息,即使即时的结果是负面的
  • 大多数当前的 CA 方法没有明确地处理这种区分,而是根据结果而不是相对于可用信息的决策质量来分配 credit
    • 解决这个差距是一个重要的开放问题(见第 9 节)

Challenge 3: Vastly Longer Horizons,更长的视野

  • Reasoning RL 和 Agentic RL 之间在轨迹长度上的定量差异是巨大的:
  • 表 2:推理和 Agentic RL 设置中的轨迹复杂性
    • Agentic 任务涉及更多的 turns、tokens 和决策点,为 credit assignment 带来了质的变化
  • 这不仅仅是一个数量上的差异:这为 credit assignment 创造了一个质的障碍
    • 具有常数基线的 REINFORCE 估计器的方差缩放为
      $$ \mathcal{O}(T\cdot \text{Var}[R]) $$
      • \(T\) 是决策点的数量
    • 从 \(T = 10\)(简单推理)到 \(T = 100\)(复杂 Agentic,例如 SWE-bench)会使梯度方差增加 \(10 \times\),需要成比例更多的 rollouts 才能达到相同的梯度质量
      • 在实践中,这表现为训练不稳定、 Reward Hacking 和 Echo Trap (2025d),即 Agent 收敛到重复的安全行为
  • 此外,长视野创造了一个时间距离问题:
    • 早期决策(例如,在第 1 轮选择问题解决策略)的影响在许多轮之后才会显现
    • 动作和结果之间的因果链变得越来越间接,使得 MC 和 TD 方法都效率降低

Challenge 4: Heterogeneous Action Types,异构动作类型

  • 在 Reasoning RL 中,动作是同质的:
    • 每个动作都是“生成下一个 token”或“产生下一个推理步骤”
    • 动作的 credit 分布相对均匀(每个步骤都对解决方案做出增量贡献)
  • Agentic RL 引入了根本性的动作异质性,在单个轨迹中,一个 Agent 可能执行:
    • 规划动作 :制定高层次策略(“我应该先搜索 API 文档,然后编写测试,然后实现函数”)
    • 工具选择 :选择调用哪个工具(搜索 vs. 计算器 vs. 代码执行)
    • 工具参数化 :决定如何调用工具(搜索什么查询,运行什么代码)
    • 通信 :向用户或其他 Agent 发送消息
    • 错误恢复 :检测失败并决定如何重试或转向
    • 记录性动作 :格式化输出、更新内部状态、记录进度
  • 这些动作类型具有截然不同的“credit 分布”
    • 在关键时刻选错工具可能是灾难性的(导致完全错误的解决路径),而次优的输出格式则是微不足道的
      • 注:之前的 Episode-level credit 对两者赋予相同的权重
    • 这种异质性催生了一些新的方法:
      • CARL (2025) 这样的方法,使用动作熵 来识别高影响力的决策点并将 credit 集中于此
      • HICRA (2025c),它在推理设置中区分了“Planning tokens”和“Procedural tokens”

Challenge 5: Non-Verifiable Intermediate States,不可验证的中间状态

  • Reasoning RL 中 credit assignment 的一个关键推动因素是步骤级别的可验证性
    • 在数学推理中,每个中间步骤通常可以被检查:
      • “这个代数操作正确吗?”
      • “这个方程是从前一个推导出来的吗?”这种可验证性支撑着整个过程奖励模型 (PRM) 范式 (2024;2024;2025),
      • 步骤级别的标签 \((+ / - )\) 为 credit assignment 提供了密集的监督
  • 在 Agentic RL 中,中间验证几乎是不可能的:
    • 工具调用 :“search(‘Python web scraping’)” 是一个好动作吗?这完全取决于搜索返回什么,这在执行前是未知的
    • 代码生成 :生成的代码正确吗?只有在执行后才能验证,即使那样,部分正确性也难以量化
    • 导航 :点击链接 X 是否有效?取决于它指向哪里
    • 通信 :“向用户寻求澄清”有帮助吗?主观且依赖于上下文
  • 缺乏中间可验证性意味着在 Reasoning RL 中最成熟的 PRM 风格方法无法直接迁移到 Agentic 设置
    • 这种差距推动了替代方法的发展:
      • 基于事后分析的 credit (2026)(在结果出现后评估动作)、通过 DPO 的隐式 credit (2025)(完全避免显式的步骤级评估)以及特权 critic (2025)(使用仅在训练时可用的信息来提供步骤级信号)
  • 个人理解:这里的挑战其实两者都有,且 Agentic 中也有类似可以验证的中间步骤,比如最经典的问题 “带领阿根廷获的 2022 年世界杯冠军的队长,其出生年份中国的 GDP 是多少?”
    • 中间奖励可以是:是否定位到这个队长是梅西;是否定位到 1987

Challenge 6: The Bifurcation Point Problem,分叉点问题

  • Reasoning RL 中,分叉点是中等频率的(Moderate frequency)
  • Agentic RL 中,分叉点是稀有的,但往往是决定性的(Rare but decisive)
  • 将分叉点 定义为一个状态,其中 Agent 的动作对轨迹结果产生超大的影响
    • 一个“道路的岔路口”,不同的选择会导致截然不同的结果
    • 在 Agentic RL 中,分叉点具有独特的特征:
      • 稀有性 :Agentic 轨迹中的大多数动作都是“常规的”
        • 遵循明显的后续步骤、格式化输出、进行标准的 API 调用
        • CARL (2025) 中的实证分析表明,分叉点可能只发生在决策点的一小部分
      • 决定性 :尽管稀有,但分叉点可能占结果方差的绝大部分
        • 选择正确的调试策略、为任务选择正确的工具或制定有效的搜索查询,通常是区分成功与失败的动作
      • 非显而易见性 :分叉点通常无法提前识别
        • 分叉点的重要性只有在事后回顾轨迹如何展开时才变得清晰
  • Episode-level credit (GRPO) 对分叉点是盲目的:
    • GRPO 对关键的工具选择和琐碎的格式化动作赋予相同的 credit
  • 这激发了两种互补的策略:
    • (1) 识别分叉点并将 credit 集中于此
      • CARL (2025) 使用动作熵作为代理
      • HICRA (2025c) 区分 Planning 动作和 Procedural 动作
    • (2) 事后评估分叉点
      • HCAPO (2026) 使用事后分析
      • C3 (2026) 使用反事实比较

Summary: The Agentic Credit Assignment Gap,Agentic Credit Assignment 差距

  • 表 3:Credit assignment 挑战: Reasoning RL vs. Agentic RL
  • 理解:
    • 中间状态验证(Intermediate verification)部分,其实部分场景的 Agentic RL,如 Search Agent 中也可以通过只是图谱等方式拆解出来一些中间验证步骤
    • 分叉点(Bifurcation points)部分,Reasoning RL 中应该也有,但是不清晰(比如类似 But,So 等连词)

Credit Assignment in Agentic RL

  • 本节总结专门为 Agentic RL 设计或适用于 Agentic RL 的方法,其中多轮环境交互是核心
  • Agentic RL 方法总结:

Turn-Level Process Reward Models

AgentPRM
  • AgentPRM (2025) 通过用 \(TD + GAE\) 值的估计取代基于 MC 的步骤标记(labeling),将 PRM 范式从推理适应到 Agentic 设置
  • AgentPRM 的关键洞察在于,MC 标记在 Agentic 设置中代价非常高
    • 因为它需要重新执行环境交互(启动沙盒环境、发起真实 API 调用等)
    • 注:这里 MC 标记指的是从每个步骤采样 continuations 以估计步骤正确性
  • AgentPRM 使用时序差分学习来训练一个步骤级 Critic:
    $$ V(s_t) \leftarrow V(s_t) + \alpha [r_t + \gamma V(s_{t + 1}) - V(s_t)]$$
    • 并使用 GAE 进行优势估计
  • AgentPRM 应用于工具使用、代码生成和网页导航任务,AgentPRM 报告称与基于 MC 的 PRM 训练相比,样本效率提高了 \(8 \times\)
  • 这项工作表明,当环境重执行代价高昂时,TD 范式(尽管通过 bootstrapping 引入了偏差)在实践中是必需的
SWEET-RL
  • SWEET-RL(Meta/FAIR,2025)引入了特权(非对称)Critic 的概念,用于多轮 LLM Agent 训练
    • 特权 Critic:Privileged Critic
  • SWEET-RL 的核心思想利用了训练/推理的不对称性:
    • 在训练时,可以访问 Agent 在推理时没有的信息
    • 信息包括:ground truth 答案、完整的未来轨迹,以及可能的环境状态变量
  • SWEET-RL 训练一个以这些特权信息为条件的 Critic,以提供高质量的 Turn-level 奖励信号,然后这些信号被用于 Actor 的 DPO 风格优化(Actor 仅能看到标准观测)
  • 这种方法巧妙地规避了不可验证性的挑战(第 4.5 节):
    • 即使中间状态无法从 Agent 的视角进行验证,特权 Critic 也可以使用仅在训练时可用的信息来评估它们
    • 非对称设计确保了:
      • Actor 的策略针对实际的(部分可观测)Setting 进行优化(所以训练完不需要 Privileged 信息就能使用)
      • credit 信号则受益于训练期间可用的完整信息
Turn-Level Reward Design
  • Turn-Level Reward Design (NeurIPS 2025)提出了一种混合奖励设计,将奖励类型与动作类型相匹配
  • 对于输出可验证的轮次(例如,代码执行结果、数据库查询输出、数学计算),Turn-Level Reward Design 使用自动验证来提供精确的 Turn-level 奖励
  • 对于输出主观或难以验证的轮次(例如,规划、信息综合、通信),Turn-Level Reward Design 采用 LLM-as-Judge 来提供近似的 Turn-level 分数
  • Turn-Level Reward Design 框架将多轮 Agent 训练形式化为一个具有异构奖励源的 MDP
    • 结果表名:这种混合方法显著优于纯基于验证的和纯基于 LLM-judge 的奖励 ,因为每种奖励类型都应用在它 Most Reliable 地方
Turn-PPO
  • Turn-PPO(2025 & EACL 2026)将多轮 Agent RL 重新表述为一个 Turn-level MDP
    • 其中每一轮(完整的 LLM 响应 + 环境反馈)被视为单个宏动作
  • 在这个表述下,Turn-PPO 使用 Turn-level 值函数计算 Turn-level 优势估计,用 Turn-level 重要性比率取代了标准的 Token-level 重要性采样
  • 这种重新表述消除了在多轮间由 Token-level credit 引入的巨大方差
  • 在 WebShop 和 Sokoban 上的评估表明
    • Turn-PPO 比标准 PPO 具有更好的稳定性和最终性能,证实了轮次是多轮 Agent credit 的自然原子单元
SORL
  • SORL(Stabilizing Off-Policy RL for Long-Horizon Agent Training,2025)解决了多轮 Agent RL 中由两个来源引起的不稳定性:
    • (1) Token-level 优化与轮次结构化交互之间的粒度不匹配
    • (2) 来自 off-policy 采样的高方差梯度更新
  • SORL 提出了 Turn-level 重要性采样结合裁剪触发归一化,以两种算法实例化(SO-PPO 和 SO-GRPO),使策略优化与多轮交互的结构对齐,并自适应地抑制不可靠的 off-policy 更新
  • 在多轮搜索基准上的评估表明,SORL 为 “为什么 Turn-level CA 需要专门构建的优化算法而不是简单地应用标准 PPO 或 GRPO” 提供了理论基础
TARL
  • TARL(Turn-level Adjudicated Reinforcement Learning,Turn-level 裁决 RL, 2025)为交互式多模态工具使用 Agent 提出了一个过程监督的 RL 框架
  • TARL 核心机制采用 LLM as a Judge 在训练期间提供 Turn-level 评估,解决了长时域 Agentic 任务中的 credit 分配挑战
  • 实验:结合一个混合任务训练课程(该课程整合了数学推理问题),TARL 报告称:
    • 在 \(\tau\)-bench 基准测试上,与强 RL 基线相比,任务通过率提高了 \(6% +\),证明了 Turn-level 过程监督对多模态 Agent 的价值
ITPO
  • 原始论文:(ITPO)Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction, Meta AI, 20260321
  • ITPO(Implicit Turn-Level Process Rewards,隐式 Turn-level 过程奖励,202603)从稀疏的结果信号中推导出隐式 Turn-level 过程奖励,无需训练单独奖励模型
  • 基于 “From \(r\) to \(Q^{*}\)” 的洞察 (2024),ITPO 从模型自身在各轮次间的对数概率变化中提取 Turn-level 奖励,将策略本身视为一个隐式 Critic
  • 实验:应用于主动式多轮交互设置(辅导、推荐),ITPO 表明:
    • 隐式 Turn-level credit 与显式训练的 Turn-level Critic 相比具有竞争力,而计算成本仅为其一小部分

Hindsight and Counterfactual Methods,事后和反事实方法

  • 这些方法利用了事后分析的一个关键优势:轨迹完成后,可以回溯并思考哪些因素是重要的
HCAPO
  • HCAPO(Hindsight Credit Assignment for Policy Optimization,用于策略优化的事后 Credit 分配,202603)通过回顾性分析直接解决了 Agentic RL 的不可验证性挑战
  • 在收集到一条轨迹后,HCAPO 使用一个 LLM Critic,在知晓完整轨迹结果的情况下 评估每一轮的贡献
    • 该 Critic 执行生成式验证:
      • 对于每一轮 \(t\),它生成反事实的 continuations(“如果这一轮的动作不同了会发生什么?”)并比较预期的结果
      • 这种事后方法对于 Agentic RL 尤其强大,因为它不需要环境重执行(反事实分析完全在 LLM 的“想象”中执行)
    • 关键 Insight:事后 credit 比前向 credit 提供更多信息:
      • 知道结果使得 Critic 能够区分偶然成功的动作(尽管次优但碰巧有效)和真正好的动作(有决定性因果关系地促成了成功)
C3
  • C3(Contextual Counterfactual Credit Assignment,上下文反事实 Credit 分配,202603)
    • 通过一个留一法框架形式化了 credit 分配
  • 对于一条有 \(T\) 轮的轨迹,轮次 \(t\) 的 credit 被估计为实际结果与将轮次 \(t\) 的动作替换为“默认”动作后期望结果之间的差值:
    $$ c_{t} = R(\tau) - R(\tau_{t})$$
    • 其中 \(\tau_{t}\) 表示反事实轨迹
  • 由于为每个反事实重新执行环境代价高昂,C3 使用基于模型的近似:
    • 一个 LLM 通过推理 “如果没有轮次 \(t\) 的特定动作轨迹将如何展开” 来估计 \(R(\tau_{t})\)
    • C3 最初为多 Agent LLM 协作开发,其框架自然扩展到将轮次视为合作博弈中“玩家”的单 Agent 设置
CCPO
  • CCPO(Counterfactual Credit Policy Optimization,反事实 Credit 策略优化,202603)为 Agentic credit 分配提供了一个正式的结构因果模型视角
  • CCPO 将轨迹建模为一个结构因果模型(SCM),其中每一轮的动作是处理变量,结果是效应
    • Turn-level credit 则是每个动作的平均处理效应(ATE),通过 do-演算(do-calculus)或实际近似来估计
  • CCPO 的形式化框架在特定的因果假设下(轨迹内没有未观测的混杂因素,当完整对话历史可用时这是合理的)提供了 credit 准确性的理论保证
  • 原文讨论:在 2026 年 3 月的一周内同时出现三篇独立的事后/反事实论文(HCAPO, C3, CCPO)是社区趋同的一个显著信号:
    • 该领域已共同将回顾性反事实分析确定为 Agentic credit 分配的自然范式
CriticSearch
  • CriticSearch(2025)将回顾性 credit 分配专门应用于搜索 Agent
    • 即发出搜索查询、处理结果并迭代优化其答案的 LLM
  • 冻结的、非对称的 critique LLM 使用特权信息(完整轨迹和 golden 答案)回顾性地评估每个搜索轮次,将这些评估转换为密集的、 Turn-level 奖励
    • 这与 SWEET-RL 的特权 Critic 设计(第 5.1 节)密切相关,但专门针对每个轮次涉及独特查询-结果周期的搜索领域
  • CriticSearch 报告称,在多跳推理基准测试上提高了收敛速度和稳定性,证明了回顾性 Critic 即使在以信息检索为中心的 Agent 任务中也是有效的

Critic-Free Step-Level Methods

GiGPO
  • GiGPO(组中组策略优化,NeurIPS 2025)以一种优雅的、无需 Critic 的方式,将 GRPO 的组比较原则从 Episode-level 扩展到了步级
  • GiGPO 引入了一个两层的优势估计:
    • 在外层,轨迹像标准 GRPO 一样被分组和比较
    • 在内层,单条轨迹内的步骤通过锚定状态分组进行比较
      • 共享相似前缀(锚定状态)的步骤被分到同一组,每个步骤的优势相对于其组均值计算
    • 这种“组中组”结构在不需学习值函数的情况下提供了步级 credit
  • 在 Agentic 基准测试(ALFWorld, WebShop)上的评估表明,GiGPO 相比 GRPO 分别取得了超过 12% 和 9% 的提升,证实了无需 Critic 的步级 credit 能够显著改善多轮 Agent 训练
POAD
  • POAD(Policy Optimization with Action Decomposition,带动作分解的策略优化,2024)解决了 Agentic RL 中一个细微的问题:
    • 动作级和 Token-level 优化之间的差异
      • 在 Agentic Setting 中,每个“动作”(例如,一个工具调用或响应)是一个可变长度的 Token 序列,然而标准 RL 将其视为原子操作
  • POAD 推导了带动作分解的 Bellman Backup,它将 credit 分配在两个层面上进行整合:
    • 动作内部(将 credit 分配到单个动作内的各个 Token)
    • 动作之间(将 credit 分配到序列化的动作之间)
  • 这种分解在 PPO 内部实现,增强了学习效率和泛化能力
  • POAD 是早期(2024 年 5 月)形式化 LLM Agent 的动作到 Token credit 分解问题的方法之一,值得关注

Hierarchical Methods

  • Agentic 任务具有自然的层级结构(计划 \(\rightarrow\) 执行 \(\rightarrow\) 验证),这些方法利用了这一结构
ArCHer
  • ArCHer(ICML 2024)是用于多轮 LLM Agent 的层级 credit 分配的开创性工作
  • ArCher 引入了一个明确的两层架构:
    • 一个高层的 off-policy Critic,学习一个 Turn-level Q-函数
      $$ Q^{H}(s_{t},a_{t})$$
      • 其中 \(a_{t}\) 是第 \(t\) 轮的完整 LLM 响应
    • 一个低层的 on-policy Actor,它优化每一轮内的 Token-level 策略
      $$\pi_{\theta}(y|s_{t})$$
      • 高层 Critic 通过 off-policy TD 更新进行训练,能够从过往轨迹的回放缓冲区中高效学习
    • 低层 Actor 使用高层 Q-值作为 Turn-level 奖励进行 on-policy 优化
    • 这种解耦架构直接解决了双重层级的 credit 分配挑战:
      • 高层 Critic 处理哪些轮次是重要的,而低层 Actor 处理这些轮次中的哪些 Token 是重要的
      • ArCHer 是第一个正式认识到多轮 LLM RL 需要与单轮 Reasoning RL 根本不同的 credit 分配的方法
  • 注:在第 3 节中回顾的 HICRA (2025c),为层级感知的 credit 分配提供了 Reasoning RL 的基础,这直接为本节的 Agentic 方法提供了信息
    • 其对 Planning Token 和 Procedural Token 的区分为理解 Agentic 轨迹中的功能角色提供了概念基础
PilotRL
  • PilotRL (Global Planning-Guided Progressive RL, 2025) 将分层原则扩展为一个三阶段渐进式框架:
    • (1) plan-level RL,即 credit 被分配给高层级的 plan 组件
    • (2) step-level RL,即 credit 在每个 plan 组件内部进行细化
    • (3) token-level RL,即 credit 进一步级联到单个 Token
  • credit 在各个阶段之间从粗粒度流向细粒度,每个阶段为下一阶段提供 reward 信号
    • 这种级联方法专为在执行任务前明确制定 plan 的 Agent 而设计(例如:“步骤 1:搜索相关文件;步骤 2:理解代码库;步骤 3:实现修复”)
CARL
  • CARL (NeurIPS 2025) 针对异构动作问题(第 4.4 节)提出了一种非常简洁的解决方案
  • CARL 与为每个动作分配细粒度 credit 不同,CARL 识别出关键动作(即 Agent 的决策对结果产生巨大影响的分叉点)
    • 并仅在这些点上进行 RL 更新
  • 其识别机制基于动作熵:
    • 在每个决策点,CARL 测量策略动作分布的熵 ( H(\pi(\cdot|s_t)) )
      • 高熵状态是“关键的”(模型不确定,因此选择很重要)
      • 低熵状态是“常规的”(模型很确信,因此任何一个合理动作都足够)
  • 通过将梯度更新限制在熵最高的少数动作上,CARL 实现了减少 72% 的梯度更新且性能无下降(如作者所述)
  • 这一结果表明,绝大多数 Agentic 动作可能具有可忽略的 credit,优化它们会浪费计算资源

Information-Theoretic Methods

  • IGPO(信息增益策略优化,Information Gain Policy Optimization, 2025)采用信息论的方法进行 Turn 级信用分配
    • 对于每个 Turn \( t \),IGPO 将信用定义为关于任务成功的信息增益:
      $$c_t = \log P(\text{success}|h_{1:t}) - \log P(\text{success}|h_{1:t-1}) \quad (4)$$
      • \( h_{1:t} \) 表示到 Turn \( t \) 为止的历史
      • 直觉解释:如果一个 Turn 能够显著提高任务成功的概率(即它提供了朝向目标的“有用信息”),那么它就会获得高信用
      • 这种公式化方法天然适用于 Agentic 环境,其中每个 Turn 都会逐步揭示关于任务状态的信息(例如,一个搜索查询揭示了相关文档,一次代码执行揭示了 Bug)
    • 概率 \( P(\text{success}|h) \) 由一个学习到的验证器或 LLM 本身来估计
  • IGPO 的主要局限性:
    • 它要求在每个 Turn 都有一个可靠的 Success 概率估计器 ,而这对于所有 Agentic 任务来说可能并不都可用

Implicit and DPO-Based Methods

  • iStar(Implicit Step Rewards, 2025)解决了在不存在中间验证器的 Agentic 环境中提供 Step-level 信用的挑战
  • iStar 利用轨迹级的 DPO:
    • 给定成对的轨迹(一条成功,一条不成功),iStar 通过比较每个 Turn 的对数概率比来提取隐式的 Step-level Reward
  • 基于 “From \( r \) to \( Q^* \)” 的 Insight (2024)
    • Turn \( t \) 的隐式 Advantage 是从模型自身的概率评估中推导出来的
  • iStar 进一步引入了多级 Advantage 融合,通过加权聚合的方式结合了 Turn 级和 Token 级的隐式信号
  • iStar 主要优势在于 iStar 不需要显式的 Reward 模型、Critic 或环境重执行,使其适用于所有其他信用分配机制都过于昂贵的 Agentic 任务

StepAgent

  • StepAgent (2024) 将隐式 RL 与逆强化学习(Inverse RL)相结合,用于 Agentic 环境中的 Step-level 反馈
  • 给定专家演示(成功的轨迹),它使用逆强化学习来推断专家隐式优化的 Step-level Reward ,然后使用这些推断出的 Reward 来训练 Agent
  • 随着 Agent Step-level 表现的提高,一个从新手到专家的课程逐渐增加任务的难度
  • 这种方法特别适用于那些有专家演示可用(例如,记录的人类与工具或网站的交互)但显式 Reward 函数难以定义的 Agentic 任务

Infrastructure and Practical Methods

Agent Lightning
  • Agent Lightning(Microsoft Research)为基于 RL 的 LLM Agent 训练引入了一种解耦的训练架构
  • Agent Lightning 的核心贡献是 LightningRL 算法
    • LightningRL 算法将 Agent 轨迹分解为带有专用信用分配模块的训练 Transition
  • Agent Lightning 框架将 Agent 执行与训练完全解耦,支持与流行的 Agent 框架(LangChain, AutoGen)集成,而无需修改 Agent 的推理代码
  • 在 Text-to-SQL、检索增强生成和数学工具使用任务上的评估表明
    • 将“信用分配到哪里”的问题与“如何生成轨迹”的问题分离开 可能与信用分配算法本身同样重要
    • 问题:如何理解这里这句话?
RAGEN/StarPO
  • RAGEN(2025) 引入了 StarPO(Star 策略优化,Star Policy Optimization)框架来训练推理 Agent,并提供了关于为何 Episode-level 信用在 Agentic 环境中会失败的最详细的实证分析之一
  • RAGEN 核心贡献是识别出了“回声陷阱”(echo trap):
    • 当使用 GRPO 训练时,Agent 会收敛到重复的 Action 序列(例如,使用相同参数反复调用同一个工具),因为嘈杂的 Episode-level 梯度无法区分高效的探索与冗余的重复
  • StarPO 通过基于不确定性的过滤来解决这个问题:
    • 在其信用估计中具有高不确定性的 Action 在策略更新期间会被降低权重,从而防止噪声信号破坏训练的稳定性
    • RAGEN 还提供了开源的基准测试和训练框架,后续几个 Agentic CA 论文都基于此构建
SPA-RL
  • SPA-RL(Stepwise 进度归因,Stepwise Progress Attribution, 2025)训练一个轻量级的 MLP 进度估计器,它将中间状态映射到一个标量的“进度”分数
    $$ p_t \in [0, 1] $$
  • 然后 Step-level 信用就是进度增量:
    $$ c_t = p_t - p_{t-1} $$
  • 这种方法受到 RUDDER 的 Return 分解 (2019) 的启发,但针对 LLM Agent 进行了调整
    • MLP 与策略一起进行端到端训练,终端 Reward 提供监督信号 \( (p_T = R(\tau)) \)
  • SPA-RL 的主要优势是极高的计算效率:
    • 与 LLM-as-Critic 方法相比,一个小型 MLP 增加的开销可以忽略不计,使其适用于大规模训练,在这种训练中每一次浮点运算都很宝贵
SCRIBE
  • SCRIBE(2026)通过结构化的中级监督(structured mid-level supervision)来提供信用
  • SCRIBE 维护一个“技能原型”(skill prototypes)库
    • 常见 Agentic 子任务(例如,“搜索并提取信息”、“编写和测试代码”、“格式化并提交输出”)的模板,每个模板都关联着预期的 Reward 特征
  • 当 Agent 执行一个 Action 时,SCRIBE 将其与最近的技能原型进行匹配,并根据该 Action 在多大程度上满足原型的预期行为来分配信用
  • 这种方法在单个 Token 和完整轨迹之间的语义层级上提供信用,将信用信号建立在关于“良好”Agent 行为看起来是什么样的结构化知识之上
LaRe
  • LaRe(AAAI 2025)通过使用 LLM 生成自然语言的信用解释来桥接 LLM 推理和信用分配
    • 对于轨迹中的每一步,LaRe 会提示一个 LLM 来解释该 Step 为何是有帮助或有害的,产生一个文本的理由,然后将其转换为标量 Reward
    • LaRe 的方法最初是为符号化 RL 任务(例如,网格世界、简单游戏)开发的,它在概念上适用于任何 Action 具有 LLM 可以评估的语义含义的 Agentic 环境
    • 自然语言解释也提供了可解释性,使从业者能够理解为什么某些 Action 会获得高或低的信用,这对于调试 Agent 行为非常有价值
PRS + VSPO
  • PRS(Progressive Reward Shaping, 2025)通过课程式的 Reward 演化来解决信用问题
    • 在训练初期,密集的 Reward 关注格式正确性
    • 在后期阶段,Reward 转向任务准确性
  • VSPO(Value-based Sampling Policy Optimization)通过优先训练那些信用信号信息量最大的轨迹来补充 PRS
    • PRS 是一种 Reward 塑形方法而非纯粹的信用分配算法,但 PRS 渐进的 Reward 密集化过程在训练过程中有效地执行了从粗到细的信用分配
Adaptive Segment-Level Reward
  • Adaptive Segment-Level Reward(2024) 使用语义分割来将轨迹划分为长度均衡的 Segment ,而不管其长度如何 ,从而确保 Reward 粒度的一致性
  • 自适应分割防止了病理情况 ,即长轨迹获得实际上均匀的信用 ,而短轨迹获得过于嘈杂的信用

Discussion: Emerging Patterns in Agentic CA

  • Agentic 信用分配的格局揭示了几种将其与 Reasoning RL 区分开来的独特模式:
    • 1)Hindsight 正成为一种突出的方法
      • 三种最新的方法(HCAPO、C3、CCPO)都使用了事后回顾分析
      • 这种趋同性表明,在 Agentic RL 中,后向分析(“鉴于所发生的事情,这个 Action 有多重要?”)可能比前向预测(“这个状态有多大的价值?”)更实用,后者由于随机转移和部分可观测性而不可靠
    • 2)LLM-as-Critic 显得特别强大
      • 与经典 RL 不同(其中 Critic 是学习得到的、推理能力有限的神经网络),LLM Agent 可以利用 LLM 本身(或另一个 LLM)来对中间状态执行复杂的语义评估
        • CAPO、SWEET-RL、HCAPO、CriticSearch 和 LaRe 都利用了这种能力
      • LLM-as-Critic 范式在经典 RL 中没有直接的对等物,它代表了一个似乎是 LLM 时代所特有的方法论轴
    • 3)层级结构至关重要
      • ArCHer、PilotRL 和 CARL 都表明,尊重 Agentic 任务的层级结构(规划 \( \rightarrow \) 执行 \( \rightarrow \) 验证)能够改善信用分配
      • HICRA(2025)虽然是为 Reasoning RL 开发的,但提供了为这些 Agentic 方法提供信息的基础性 Insight
        • 将所有 Action 一视同仁的扁平化方法会遗漏重要的结构信息
    • 4)关键 Action 识别优于均匀信用分配
      • CARL 中有一个发现:将信用集中在高熵 Action 上可以在远少于全信用分配所需的更新次数下达到匹配的性能
        • 这表明 Agentic CA 的目标不必是为每个 Action 分配完美的信用,而是要识别并关注那些重要的 Action
        • 这种“稀疏信用”的视角比密集信用分配更高效,也可能更鲁棒
    • 5)实际考虑因素占主导地位
      • Agent Lightning、SPA-RL 和 RAGEN 表明,在生产环境中,简单高效的方法 (解耦的训练架构、基于 MLP 的进度估计、基于不确定性的过滤)可能与复杂的信用算法同等重要
      • 信用质量与计算成本之间的权衡是 Agentic CA 的一级设计考量

Multi-Agent Credit Assignment

  • 随着 LLM 系统向多 Agent 架构演进(编排器 + 专家 Agent、辩论框架、协作推理),credit 除需在时间维度上分解外,还必须在 Agent 之间进行分解

Multi-Agent Methods

M-GRPO
  • M-GRPO(Multi-Agent GRPO, 2025)将 GRPO 框架扩展到多 Agent LLM 系统
  • 在一个具有一个主 Agent 和 \(K\) 个子 Agent 的系统中,M-GRPO 引入了一个两层的 credit 分解:
    • (1)Agent 间 credit:一个元级优势,用于确定每个 Agent 对团队结果的总体贡献,通过比较不同团队组成下的结果来计算
    • (2)Agent 内 credit:每个 Agent 轨迹内部的标准 GRPO 风格优势
  • M-GRPO 支持解耦训练:
    • Agent 可以使用它们的 Agent 间 credit 作为奖励信号独立更新,避免了联合优化的协调开销
LLM-MCA
  • LLM-MCA(2025)用一个基于 LLM 的集中式 Critic 取代了传统的多 Agent credit 分配机制(QMIX, VDN, COMA 混合网络)
  • 给定所有 Agent 的完整交互历史,LLM Critic 阅读对话,识别每个 Agent 的贡献,并生成关于每个 Agent credit 的自然语言评估
    • 然后将这些评估转换为标量奖励用于策略更新
  • 关键优势在于语义理解:
    • LLM Critic 能够以纯数值混合函数无法做到的方式,推理 Agent 角色、通信质量和战略贡献
QLLM
  • QLLM(2025)采用了一种 Meta-level 方法:
    • QLLM 不让 LLM 评估 credit,而是让 LLM 生成 credit 分配函数本身
  • 给定一个任务描述和示例轨迹,QLLM 提示一个 LLM 编写一个 Python 函数,该函数计算每个 Agent 的 credit 分数
    • 这个生成的函数随后以零边际成本应用于所有训练轨迹
  • QLLM 方法无需训练且高度灵活,尽管其质量取决于 LLM 生成正确 credit 函数的能力
  • 理解:QLLM 方法本身很有想法,相当于允许 LLM 去通过调用或编写脚本来判断 Critic,但这可能导致得到的结果不太符合预期,对 LLM 的代码能力要求很高
SHARP
  • SHARP(Shapley Credit-based Optimization,基于 Shapley Credit 的优化,202602)将原则性的 Shapley 值分解引入多 Agent LLM 系统
    • 对比之前的方法 SCAR:
      • SCAR(第 3.2 节)将 Shapley 值应用于推理段
      • SHARP 将其应用于 Agent 之间
  • SHARP 框架将奖励分解为三个部分:
    • (1)用于整体任务完成的全局 broadcast-accuracy 奖励
    • (2)通过 coalition 分析计算每个 Agent 特定贡献的、基于 Shapley 的边际 credit 奖励
    • (3)用于执行效率的工具过程奖励
  • 通过对轨迹组进行 Agent 特定优势的归一化来稳定训练
  • SHARP 报告称,相比单 Agent 基线平均提高了 23.7%,相比多 Agent 基线提高了 14.1%,为迄今为止基于 Shapley 的 credit 能改善多 Agent LLM 训练提供了最强有力的实证证据
MAPPA
  • MAPPA(Multiagent Per-Action Process Awards,多 Agent 每个动作的过程奖励,202601)通过提供来自 AI 反馈的每个动作的过程奖励,解决多 Agent 微调中的 credit 分配和样本效率问题
  • MAPPA 不等待终端任务结果,而是使用一个 AI Judge 单独评估每个 Agent 的动作 ,从每次 rollout 中提取最大的训练信号
  • MAPPA 在数学竞赛中表现:
    • 在 AIME 上达到了 \(+5.0 - 17.5\) 个百分点
    • 在 AMC 上达到了 \(+7.8 - 17.2\) 个百分点的提升
  • 在数据分析任务上 MAPPA 成功率提高了 \(+16.7\) 个百分点
  • 这些是多 Agent CA 方法中报告的最大增益之一,证明了每个动作的粒度对于多 Agent 系统至关重要
Dr.MAS
  • Dr.MAS(202602)识别出将 GRPO 扩展到多 Agent 系统时的一个特定失败模式:
    • 全局归一化基线偏离了异构 Agent 的奖励分布,造成梯度不稳定
  • 解决方案是 Agent 级别的优势归一化
    • 每个 Agent 的优势使用该 Agent 自身的奖励统计量 而非全局统计量进行归一化
    • 这使得梯度规模在不同 Agent(例如,一个代码专家 vs. 一个搜索专家)之间得到校准 ,减少了梯度尖峰
  • Dr.MAS 报告称在数学任务上获得了 \(+5.6%\) 的平均@16 性能,同时实现了稳定的收敛,而标准的多 Agent GRPO 则会发散

C3(再次讨论) (2026). C3 的反事实框架自然扩展到多 Agent credit:Agent \(k\) 的 credit 为 \(c_{k} = R(\tau) - R(\tau_{k})\),其中 \(\tau_{k}\) 是没有 Agent \(k\) 的反事实轨迹。这种留一法方法提供了满足自然公平属性的清晰分解

Discussion: Multi-Agent CA as an Emerging Frontier, 多 Agent CA 作为一个新兴前沿领域

  • 多 Agent credit 分配已从一个新兴领域发展为一个快速发展的领域,在本文的盘点中有 6 篇专门论文(M-GRPO, LLM-MCA, QLLM, SHARP, MAPPA, Dr. MAS),加上 C3 的跨场景框架
  • 目前,Multi-Agent CA 关键的开放问题包括:
    • 通信 credit: Agent 是否应该因发送有用消息而获得 credit?
      • 当前方法仅将 credit 分配给与任务相关的动作,忽略了 Agent 间的通信价值
    • 异构架构: 当 Agent 具有不同的能力时(例如,一个代码专家和一个搜索专家),应如何公平地分解 credit?
    • 可扩展性: 对于 \(K\) 个 Agent,留一法方法需要 \(K\) 次反事实评估
      • 对于拥有数十个 Agent 的系统,需要可扩展的近似方法
    • 与经典 MARL 的联系: 经典的多 Agent RL 拥有丰富的 credit 分配文献(QMIX, COMA, MAPPO),但这些都假设动作空间是固定维度的
      • 将它们适应于可变长度的文本动作并非易事
  • 随着多 Agent 系统在生产环境中的快速部署,面向 LLM 的多 Agent credit 分配将在 2026-2027 年成为一个重要的增长领域

Systematic Comparison

Unified Comparison Table

  • 注:原文这里确少内容

Benchmark Landscape

Reasoning RL benchmarks
  • Reasoning RL 的 Credit Assignment 方法受益于完善的基准测试:
    • GSM8K(小学数学,8.5K 个测试问题)
    • MATH(竞赛数学,5 个难度级别的 5K 个问题)
    • AIME(美国 Invitational 数学考试)
    • CodeContests(编程竞赛)
  • 这些基准测试提供了可验证的真实结果,使得能够直接比较 CA 方法
  • 几篇论文 (VinePPO, PURE, SPRO) 在重叠的子集上报告了结果,尽管基础模型、训练数据和超参数的差异使得完美比较变得困难
Agentic RL benchmarks
  • Agentic CA 的基准测试格局明显更加碎片化:
    • 网页导航:WebArena (2024a), Mind2Web, WebShop
    • 工具使用:ToolBench, API-Bank, Gorilla
    • 交互式编码:SWE-bench, HumanEval+, MBPP+
    • 具身/模拟:ALFWorld, ScienceWorld, Minecraft
    • 多 Agent (Multi-Agent):ChatDev, MetaGPT 评估套件
  • 很少有 Agentic CA 论文使用相同的基准测试,这使得系统比较几乎不可能
  • 这种碎片化本身就是进步的主要障碍:没有共享的评估,社区就无法确定哪些 CA 方法真正更好,而哪些只是受益于有利的基准测试选择
  • 理解:主要还是 Agentic RL 场景太多,大家都更多只关注自己的领域吧,而且像 SWE-Bench 等其实已经比较广泛被关注和使用了,应该是会覆盖到的?

Quantitative Performance Comparison,定量性能比较

  • 尽管基础模型和训练配置存在差异,本文仍整理了可用的定量结果,以提供 CA 方法所实现收益的具体情况
  • 表 6 和表 7 总结了原始论文中报告的结果
    • 注意:不同基础模型的结果不能直接比较;相对于每篇论文自身基线(通常是 GRPO 或 PPO)的增益是最有意义的比较
  • Descriptive Pattern: CA Improvements and Trajectory Length,描述性模式:CA 改进与轨迹长度
    • Evidence-level:有限但具有启发性 (Agentic RL 方向有 6 中方法,跨 6 种方法,异质条件)
    • 在基于 GRPO 基线的方法中,Agentic 子集显示出比推理子集更高的平均 \(\Delta\)
      • Agentic:\(+8.5\), \(n = 5\), 2 种方法
      • Reasoning:\(+6.0\), \(n = 8\), 4 种方法
      • 该现象对单一异常值剔除是稳健的
        • 修正后的差距: \(+7.5\) vs. \(+4.5\)
        • 这与理论预期一致,尽管并非证明,即 Episode-level Credit 随着轨迹长度的增加而更严重地退化
    • 其他关键混淆因素:
      • (1) 不同的基础模型
      • (2) 推理基准测试可能具有较低的提高空间
      • (3) Agentic 子集由 GiGPO 主导 (3/5 个数据点)
    • 本文仅将此作为对本文叙述性主张的粗略压力测试,而不是单独作为充分的证据
      • AgentPRM 的 \(+19.0%\) (相对于 ORM 基线) 和 SWEET-RL 的 \(+6.0%\) (相对于 DPO 基线) 被排除在外,但与该模式一致

Key Trade-offs Across the Spectrum,整个范围内的关键权衡

  • 本文的分析揭示了四个基本权衡,它们构成了 CA 方法的设计空间
  • 本文用 Evidence-level 注释每一点:
    • [SE] = 强经验性(Strong Empirical),[LS] = 有限但具有启发性(Limited but Suggestive),[AS] = 作者合成(Authors’ Synthesis)
  • 本文的标准:
    • [SE] 需要来自 \(\geq 3\) 篇独立论文的趋同发现,或 \(\geq 2\) 篇具有多基准评估和明确消融研究的论文
    • [LS] 表示 1-2 篇论文、狭窄的基准测试或实质性的混淆因素
    • [AS] 表示未经比较性证据直接建立的概念性综合
Granularity vs. computational cost [SE]
  • 粒度 vs. 计算成本
  • 更细的 Credit 粒度(Token-level)提供更精确的训练信号,但计算成本更高
    • VinePPO 需要 \(\mathcal{O}(K\cdot L)\) 次额外的 Forward Pass
    • SCAR 需要指数级的联盟评估
  • Turn-level 方法 (CARL, SWEET-RL) 为 Agentic RL 提供了一个实用的最佳平衡点
  • Episode-level 方法 (GRPO) 最便宜但信息量最少
Forward estimation vs. hindsight analysis [AS]
  • 前向估计 vs. 事后分析
  • 前向方法 (PRM, VinePPO, AgentPRM) 从当前状态估计价值,需要环境重新执行或学习到的近似
  • 事后方法 (HCAPO, C3, CCPO) 在轨迹收集后分析 Credit
  • 事后方法具有严格的信息优势,但引入了延迟,并可能遭受事后偏差
Auxiliary model requirements [SE]
  • Auxiliary model requirements 方法涵盖了一个广泛的范围:
    • 有些不需要辅助模型 (CARL, iStar, GiGPO)
    • 有些需要轻量级辅助模型 (SPA-RL 的 MLP)
    • 有些需要单独 Critic 或 PRM (ArCHer, AgentPRM, PURE)
    • 还有一些需要 LLM 规模的评估 (CAPO, HCAPO, LLM-MCA)
  • 辅助模型需求直接影响可扩展性
Reasoning-specific vs. agent-general [LS]
  • 在 Reasoning RL 背景下开发的方法 (VinePPO, PURE, HICRA) 利用了在 Agentic 环境下会失效的假设(确定性转移、可验证步骤)
  • 为 Agentic RL 开发的方法 (HCAPO, SWEET-RL, CARL, GiGPO) 做出的此类假设较少

Practical Guidance: Matching Methods to Scenarios,实践指导:根据场景匹配方法

  • 表 8 提供了一个基于任务特征选择 CA 方法的实用指南
    • 这些建议反映了本文作者对文献的综合,实际性能可能因基础模型、数据分布和训练基础设施而异
  • 图 4 提供了一个补充的决策树,将表 8 操作化为一个逐步选择过程
Retrospective validation,回顾性验证
  • 本文作者追踪了 6 个已知的(任务,方法)对通过决策树:
    • SPO 在 GSM8K 上
    • HICRA 在 AIME’24 上
    • VinePPO 在 MATH 上
    • GiGPO 在 ALFWorld 上
    • SWEET-RL 在 ColBench 上
    • HCAPO 在长时域 Agentic 任务上
  • 所有 6 个都被成功回溯 (6/6)
    • 这验证了内部一致性

Credit Assignment in the Agentic RL Training Pipeline

  • Credit Assignment 不是孤立运作的
    • Credit Assignment 是一个五阶段流程中的一个组件:
      • (1) 环境构建(沙盒执行)
      • (2) Rollout 生成(多轮 Agent-环境交互)
      • (3) 奖励计算(Terminal 任务成功)
      • (4) Credit Assignment(本文的重点)
      • (5) 策略更新 (PPO/GRPO/DPO)
  • 本节关注 CA 与其他阶段之间的交互,这些交互经常被忽视

Interactions Between Credit Assignment and Other Pipeline Components

CA × Rollout efficiency,效率
  • 更好的 Credit Assignment 会减少有效学习所需的 Rollout 数量
    • CARL (2025) 直接证明了这一点:
      • 通过将 Credit 集中在关键 Action 上,以 \(72%\) 更少的梯度更新实现了等效性能,这转化为比例更少的 Rollout
  • 更广泛地说,细粒度的 Credit 降低了梯度方差,使得更小的批量大小和更快的收敛成为可能
    • 这创造了一个良性循环:
      • 将计算投入更好的 CA(例如,运行 VinePPO 的 Vine 扩展)可以通过减少 Rollout 需求来回收
    • 在 “更多 Rollout 配合粗糙 Credit” 和 “更少 Rollout 配合精确 Credit” 之间计算的最佳分配是一个关键的空缺问题(见第 9 节)
      • 理解:即把时间/算力更多分配给 Rollout 还是 Credit 是一个需要谈的问题
CA × Reward Design
  • Credit Assignment 方法有时会隐含地重新定义奖励函数
    • PRS (2025) 明确地用渐进式密集奖励替换了 Terminal 奖励
    • IGPO (2025a) 将二元成功信号转换为信息增益增量
  • 这模糊了“奖励设计”和“Credit Assignment”之间的界限
    • 两者都是为策略优化器提供有用训练信号的机制
  • 本文作者观点:CA 不应被视为对固定奖励的后处理步骤,CA 应被视为奖励工程的一个组成部分
CA × Exploration
  • Credit 信号原则上可以指导探索:
    • Agent 应优先探索 Credit Assignment 不确定(Credit 估计的高方差)的状态,因为这些状态是需要更多信息来改进策略的状态
    • IGPO (2025a) 通过信息论的术语定义 Credit,朝这个方向做出了示意,但目前没有方法明确使用 CA 不确定性来驱动探索
  • 这是一个重大的错失机会

Infrastructure Challenges Specific to Agentic RL

  • Agentic RL 训练面临 Reasoning RL 中不存在的、直接影响 Credit Assignment 的基础设施挑战:
    • 环境重置成本 (Environment reset cost)
      • 重置一个沙盒环境(启动 Docker 容器、初始化浏览器会话、加载代码库)可能需要数秒到数分钟
      • 重置一个沙盒环境 比“重置”一个推理任务(加载一个新的 Prompt)的可忽略成本高出几个数量级
      • 后果:基于 MC 的 CA 方法(需要从中间状态重新执行环境)尤其昂贵
    • 不可微的转移 (Non-differentiable transitions)
      • 环境交互(API 调用、代码执行)中断了计算图,阻止了基于梯度的 Credit 归因
      • 所有 CA 方法必须与黑盒环境转移一起工作,依赖价值估计、事后分析或基于 LLM 的评估,而不是梯度流
      • 理解:在 Agentic RL 中,不可微分的外部操作(如 API 调用、代码执行、用户交互)切断了从最终成败结果反向追溯到具体 Action 参数的自动微分路径
        • 导致:不能用简单的反向传播训练:因为梯度传不回来,所以不能像训练神经网络那样直接训练 Agent 做决策,必须使用 RL 的 Credit 分配
    • 训练期间的安全性 (Safety during training)
      • Agentic RL Rollout 可能有现实世界的影响:发送实际的 API 请求、修改文件、发布到网络
      • 训练 Rollout 期间的安全约束可能与探索要求冲突,并且对于“安全但次优”与“有风险但信息丰富”的 Action 的 Credit Assignment 是一个未被充分探索的挑战
    • 异步训练 (Asynchronous training)
      • 现代 Agentic RL 系统 (AReaL, Laminar) 使用异步 Rollout 生成和策略更新来最大化 GPU 利用率
      • 异步训练引入了策略滞后:
        • 当 Credit 被计算时,策略可能已经改变
        • CA 方法必须对这种陈旧性具有鲁棒性,偏爱 Off-policy 兼容的方法 (ArCHer 的 Off-policy Critic,重要性采样校正)

Open Problems and Future Directions

The Agentic Frontier: Where Credit Assignment Must Go, Agentic 前沿:CA 的未来

Ultra-Long Horizon Agents,超长时域 Agent
  • 当前的 Credit Assignment 方法已在 5-30 轮的轨迹上进行了评估
  • 现实世界的 Agent 会更多,比如处理 SWE-bench 问题的软件工程助手通常会执行 50-100+ 轮,消耗 100K-500K 个 Token (2025d; 2025),自主研究 Agent 进行多天实验,桌面自动化 Agent 需要 50-100 步及大量上下文
  • 在这些规模下,即使是 Turn-level Credit Assignment 也可能不足:
    • 轮数之多使得每轮 Credit 估计计算量巨大且统计上不可靠
  • 本文作者推测分层方法 (ArCHer, HICRA, PilotRL) 代表了最有前途的方向,但当前的层次太浅(通常为 2 层)
    • 超长时域 Agent 可能需要更深、更灵活的层次结构,能够动态适应任务复杂性
    • 或许可以 Mirroring Agent 自身使用的分层规划结构
Open-World Agents Without Verifiable Rewards,没有可验证奖励的开放世界 Agent
  • 大多数 Credit Assignment 方法假设可以访问二元或标量的 Terminal 奖励(任务成功/失败)
  • 这个假设对于定义良好的任务(数学、编码、具有明确目标的网页导航)成立,但对于开放世界 Agent 则失效:
    • 个人助手(“用户满意吗?”)
    • 创意写作 Agent(“这个故事好吗?”)
    • 研究助手(“这个实验有信息量吗?”)
  • 在这些设置中,Terminal “奖励”本身是不确定的、主观的,或无限期延迟
    • 在奖励模型本身具有显著不确定性的情况下进行 Credit Assignment 基本上仍未解决
    • 一个有希望的方向是将 CA 方法与 RLHF 奖励模型连接起来,使用奖励模型的置信度作为 Credit 信号的加权因子
Multi-Agent Systems at Scale
  • 如第 6.2 节所讨论的,多 Agent Credit Assignment 尚处起步阶段
  • 随着 LLM 系统扩展到数十个具有不同专长的协作 Agent,Credit 分解问题呈指数级增长
  • 三个具体挑战尤为突出:
    • (1) 可扩展分解:基于 LOO 的方法 (C3) 需要 \(K\) 次反事实评估来处理 \(K\) 个 Agent;需要亚线性近似
    • (2) 沟通的 Credit:当前方法仅对任务 Action 进行 Credit 归因,忽略了 Agent 间消息的价值
    • (3) 部分团队可观测性下的 Credit:每个 Agent 仅看到自己的交互,使得在分散部署中进行集中式 Credit 计算具有挑战性

Theoretical Frontiers

Credit Assignment Meets Exploration
  • 更好的 Credit Assignment 应该能够实现更有针对性的探索,然而当前的方法将 CA 和探索视为独立的问题
  • 这种联系是自然的:
    • Credit Assignment 最不确定的状态正是 Agent 应该探索的状态,因为需要更多信息来解决模糊性
  • IGPO (2025a) 通过信息论的术语定义 Credit 提供了一个起点,但目前没有方法明确使用 Credit 不确定性来驱动探索
  • 本文作者认为这是最有前途的研究方向之一,因为它可以同时提高样本效率和 Credit 质量
Formal Guarantees,形式化保证
  • 大多数用于 LLM RL 的 Credit Assignment 方法缺乏形式化的收敛保证
    • VinePPO (2025) 证明了其 MC 估计是无偏的
    • PURE (2025) 分析了在特定条件下 Min-form Credit 的最优性
    • CCPO (2026c) 在因果假设下提供了保证
    • 但大多数方法(特别是 LLM-as-Critic 方法 (CAPO, HCAPO, LaRe))只有经验验证
  • 在基于 LLM 策略的 POMDP 中发展 Credit Assignment 质量的理论分析是一个完全开放的挑战
    • 关键问题包括:
      • 在什么条件下,近似的 Credit Assignment 能收敛的策略优化?
      • 从 imperfect Credit 信号中学习的样本复杂度是多少?
The Computation-Signal Trade-off,计算-信号权衡
  • 一个基本问题贯穿整个领域:
    • 给定固定的计算预算,下面那个选项更好:
      • (a) 生成更多 Rollout 配合粗糙的 Episode-level Credit (GRPO)
      • (b) 生成更少 Rollout 配合精确的细粒度 Credit (VinePPO, HCAPO)
    • 这就是“CA 效率前沿”,类似于改变了监督学习的计算最优 Scaling Laws
    • 没有论文提供系统的答案
  • 本文作者推测,随着轨迹长度的增加,最优分配会向细粒度 Credit 转移:
    • 对于短推理任务,更多 Rollout 可能更有效
    • 对于长 Agentic 任务,更好的 Credit 可能值得其成本

Practical Frontiers

Unified Benchmarks for Credit Assignment
  • 缺乏评估 CA 方法的标准基准测试是进步的主要障碍
  • 论文使用不同的任务、基础模型、训练配方和评估指标,使得比较几乎不可能
  • 本文作者呼吁建立一个统一的 CA 基准测试套件,涵盖:
    • (1) 具有已知真实步骤 Credit 的推理任务(通过穷举 MC 评估)
    • (2) 具有受控分叉点的 Agentic 任务(可计算“正确” Credit 的合成环境)
    • (3) 具有设计好的 Credit 结构的多 Agent 任务
  • 这样的基准测试将能够实现同类比较并加速方法论进展
Credit Assignment and Memory
  • 长上下文 Agent 越来越多地使用记忆机制(显式检索、草稿本、长期数据库)
  • 应如何对与记忆相关的 Action(存储信息、检索过去上下文、更新摘要)进行 Credit Assignment?
  • 一个在第 5 轮看似无用的检索 Action 可能在第 25 轮当存储的信息变得相关时被证明至关重要
  • 这种记忆 Credit 的时间跨度远远超过了当前 CA 方法的典型前瞻范围,需要全新的方法
    • 可能借鉴经典 RL 中的资格迹,并将其扩展到 LLM Agent 的语义记忆
From Reasoning to Agentic: Transfer and Adaptation
  • 推理 CA 方法能否有效地适配到 Agentic 环境?
    • VinePPO 的 Vine 扩展可以应用于 Agentic 轮次(在轮边界而非 Token 位置分支),但需要环境检查点
    • PURE 的 Min-form Credit 可以扩展到用于 Agent 的 Turn-level PRM
    • HICRA 的规划-程序性区分可以应用于 Agentic 轨迹,其中功能区分更加显著
  • 系统地研究哪些推理 CA 技术可以迁移到 Agentic 环境(以及需要什么修改)将是一个有价值的贡献,连接起本文分类法的两半

Threats to Validity

  • 对本 Survey 结论有效性的几个威胁:
    • 预印本波动性 (Preprint volatility)
      • 所审查的论文大多数是尚未经过同行评审的 arXiv 预印本
      • 它们的方法、结果甚至标题都可能改变
      • 本文将分析快照定格在 2026 年 4 月
    • Selection bias
      • 尽管采用了系统的搜索协议(第 1.1 节),但可能遗漏了非索引场所、行业报告或作者截止日期后的并发预印本中的相关工作
    • Non-comparability of results,不可比结果
      • 定量表格汇集了来自不同基础模型、基准测试和训练配置的结果
      • 跨论文比较是说明性的,而非受控实验
    • Taxonomy boundary ambiguity,分类方法边界模糊
      • 本文将方法分类为推理 vs. Agentic RL,以及核心 vs. 辅助,涉及判断
      • 一些方法跨越边界
    • Single-coder limitation
      • 所有的筛选、分类和 Evidence-level 编码均由单一作者完成?【真厉害】

Supplementary Material Release

  • 为了最大化本 Survey 的复用价值,作者承诺在发布时提供以下补充材料:
    • 结构化清单 (CSV 和 JSON) :包含所有 47 篇论文的完整清单,包含所有分类法标签、基线系列、 Evidence-level 、主要基准测试和 arXiv 标识符,采用机器可读格式,适用于程序化分析、筛选和扩展
    • 筛选日志 (Screening log) :来自作者搜索协议(第 1.1 节)的候选论文完整列表,包含包含/排除的决定和理由,使得能够验证和扩展作者的覆盖范围
    • 分类法标签 (Taxonomy labels) :每种方法的粒度 \(\times\) 方法论分类,采用允许自动生成分类法网格(图 2)和比较表(表 5)的格式
    • 报告检查表模板 (Reporting checklist template) :一个独立的 PDF/LaTeX 模板的报告检查表(表 11),作者可以在论文投稿中作为补充自查包含
    • 基准测试协议模式 (Benchmark protocol schema) :用于提议的基准测试元数据格式(第 9 节)的 JSON schema 文件,使得 CA 评估结果的标准化报告成为可能
  • 注:所有材料将托管在一个公共 GitHub 仓库上

附录 A:方法快速参考索引

  • 表 9 提供了本文回顾的所有方法的字母顺序索引,包含全名、arXiv 标识符(如有)以及章节参考,方便快速查阅
    缩写 全名 参考文献 章节
    ACPO Attribution-based Credit for RLVR Yin 等 (2025) §3.3
    AgentPRM Process Reward Model for LLM Agents Xi 等 (2025) §5.1
    ArCHer Actor-Critic with Hierarchical Evaluation Zhou 等 (2024c) §5.4
    C3 Contextual Counterfactual Credit Chen 等 (2026) §5.2
    CAPO Credit Assignment Policy Optimization Xie 等 (2025) §3.3
    CARL Critical Action Reinforcement Learning Shen 等 (2025) §5.4
    CCPO Counterfactual Credit Policy Optimization Li 等 (2026c) §5.2
    CriticSearch Retrospective Critic for Search Agents Zhang 等 (2025c) §5.2
    Dr. MAS Stable RL for Multi-Agent LLMs Feng 等 (2026) §6
    FinePO Fine-Grained Process Reward (SketchVL) Huang 等 (2026) §3.3
    From r to Q* Implicit Token-Level Credit via DPO Rafailov 等 (2024) §3.1
    GiGPO Group-in-Group Policy Optimization Feng 等 (2025) §5.3
    HCAPO Hindsight Credit Assignment PO Tan 等 (2026) §5.2
    HICRA Hierarchy-Aware Credit Assignment Wang 等 (2025c) §3.3
    IGPO Information Gain Policy Optimization Wang 等 (2025a) §5.5
    InT Self-Proposed Interventions for CA Yang 等 (2026) §3.3
    iStar Implicit Step Rewards Liu 等 (2025) §5.6
    ITPO Implicit Turn-Level Process Rewards Wang 等 (2026) §5.1
    LaRe Latent Reward Qu 等 (2025) §5.7
    Lightning Agent Lightning / LightningRL Luo 等 (2025) §5.7
    LLM-MCA LLM-based Multi-Agent CA Nagpal 等 (2025) §6
    M-GRPO Multi-Agent GRPO Hong 等 (2025) §6
    MAPPA Multiagent Per-Action Process Awards Li 等 (2026a) §6
    PilotRL Global Planning-Guided Progressive RL Lu 等 (2025) §5.4
    POAD Policy Optimization with Action Decomposition Wen 等 (2024) §5.3
    PRL Process Reward Learning Yao 等 (2026) §3.3
    PURE Min-Form Process Reward Cheng 等 (2025) §3.3
    QLLM LLM-Generated Credit Functions Li 等 (2025c) §6
    RAGEN/StarPO Star Policy Optimization Wang 等 (2025d) §5.7
    RED Reward Redistribution to Token Level Li 等 (2024a) §3.1
    SCAR Shapley Credit Assignment Rewards Cao 等 (2025) §3.2
    SHARP Shapley Credit-based Multi-Agent Optimization Li 等 (2026b) §6
    SCRIBE Structured Mid-Level Supervision Jiang and Ferraro (2026) §5.7
    SPA-RL Stepwise Progress Attribution Wang 等 (2025b) §5.7
    SPO Segment Policy Optimization Guo 等 (2025) §3.2
    SPRO Self-Guided Process Reward Fei 等 (2025) §3.3
    SORL Stabilizing Off-Policy RL (SO-PPO/SO-GRPO) Li 等 (2025a) §5.1
    StepAgent Step-Wise IRL Agent Deng 等 (2024) §5.6
    SWEET-RL Privileged Critic for Multi-Turn Agents Zhou 等 (2025) §5.1
    TARL Turn-Level Adjudicated RL Tan 等 (2025) §5.1
    TEMPO Tree-Structured Credit Assignment Tran 等 (2025) §3.2
    T-REG Token-Level Reward Regularization Zhou 等 (2024b) §3.1
    Turn-PPO Turn-Level Optimized PPO Li 等 (2025b) §5.1
    VinePPO Monte Carlo Token-Level PPO Kazemnejad 等 (2025) §3.1

附录 B:完整论文清单

  • 表 10 提供了本 Survey 回顾的所有 47 篇论文的完整清单,并附有分类标签和结构化元数据
    • 类型: C = 核心 CA 方法, E = CA- 相关辅助方法
    • Setting: R = Reasoning RL, A = Agentic RL, M = 多 Agent
    • BL (Baseline Family): G = GRPO, P = PPO, D = DPO, O = ORM, T = TD
    • Ev. (Evidence Level): S = 强实证, L = 有限但有启发性, A = 主要为分析性
  • 分类说明: 回顾的 47 篇论文包括 41 篇核心 CA 方法(#1-35, #42-47)和 6 篇 CA 相关辅助方法(#36-41)
    • 分类编码由本文作者完成
    • 本文作者在第 9.4 节中承认这是一个局限性,并且这个分类不是唯一有效的
    • 基础性论文(Math-Shepherd, OmegaPRM, GRPO, DeepSeek-R1)在背景章节中讨论,但不计入 47 种回顾方法中
  • Complete paper inventory with taxonomy labels (41 core + 6 adjacent = 47 total)
    # 方法 类型 Setting Gran. 方法论 BL Ev. 主要 Benchmarks
    Reasoning RL — 核心 CA 方法 (15)
    1 VinePPO C R Token MC P S GSM8K, MATH
    2 RED C R Token Redistribution P L MATH
    3 T-REG C R Token Self-generated P L GSM8K, MATH
    4 From r to Q* C R Token Implicit D A 理论分析
    5 SPO C R Segment MC G S MATH-500, GSM8K
    6 SCAR C R Segment Game-theoretic G L MATH
    7 TEMPO C R Token/Segment Tree-TD P L MATH, GSM8K
    8 PURE C R Step Min-form PRM G S MATH-500, AIME’24
    9 SPRO C R Step Masked Adv. G S MATH-500, AMC
    10 CAPO C R Step LLM-as-Critic G S MATH-500, AIME’24
    11 ACPO C R Step Attribution G L MATH
    12 HICRA C R Step Hierarchy G S AIME’24, AIME’25
    13 PRL C R Step Entropy-RL G L MATH, GSM8K
    14 InT C R Step Intervention G L MATH
    15 FinePO C R Sub-step Fine PRM — L 特定领域 (visual)
    Agentic RL — 核心 CA 方法 (20)
    16 ArCHer C A Turn TD (hierarchical) T S 多轮对话
    17 StepAgent C A Step Implicit+IRL G L 工具使用任务
    18 POAD C A Token/Turn Action Decomp. P S 交互式任务
    19 GiGPO C A Step MC (group) G S ALFWorld, WebShop
    20 SWEET-RL C A Turn Privileged Critic D S ColBench Backend
    21 AgentPRM C A Step TD+GAE O S WebShop, TextCraft
    22 Turn-Level C A Turn Hybrid G L Web 导航
    23 Turn-PPO C A Turn Turn-level MDP G S WebShop
    24 SORL C A Turn Bias-corrected G L 多轮搜索
    25 TARL C A Turn LLM-Judge G S τ-bench
    26 ITPO C A Turn Implicit D L 对话任务
    27 IGPO C A Turn Info-theoretic G L Agentic 任务
    28 CARL C A Step Entropy-based G S HotpotQA, 2WikiMQA
    29 iStar C A Step Implicit DPO D L 轨迹对
    30 PilotRL C A Step Progressive G L Agentic 规划
    31 LaRe C A Step LLM-Critic G L 符号 + Agentic
    32 HCAPO C A Turn Hindsight G S Agentic 任务
    33 C3 C A/M Turn Counterfactual G L 多 Agent + Agentic
    34 CCPO C A/M Turn Counterfactual G L Agentic 任务
    35 CriticSearch C A Turn Retrospective Critic G S 多跳 QA
    Agentic RL — CA-相关辅助方法 (6)
    36 SPA-RL E A Step MLP estimator G L Agentic 任务
    37 Lightning E A Step Decoupled Arch. G L 多轮 Agent
    38 RAGEN E A Step Uncertainty G S Benchmark 套件
    39 SCRIBE E A Step Skill-prototype G L Agentic 任务
    40 PRS E A Step Progressive G S 渐进式任务
    41 AdaptSeg E A Segment Segmentation G L Agentic 任务
    多 Agent — 核心 CA 方法 (6)
    42 M-GRPO C M Multi-Agent Hierarchical G L 多 Agent 任务
    43 LLM-MCA C M Multi-Agent LLM-Critic G L 多 Agent 评估
    44 QLLM C M Multi-Agent LLM-generated G L 多 Agent 任务
    45 SHARP C M Multi-Agent Shapley G S 多 Agent 任务
    46 MAPPA C M Multi-Agent Per-action PRM G S AIME, AMC
    47 Dr. MAS C M Multi-Agent Agent-wise Adv. G S 数学任务
    背景 / 基础性 (不计入 47 种方法)
    Math-Shepherd — R Step MC labeling — S GSM8K, MATH
    OmegaPRM — R Step MC labeling — S MATH
    GRPO — R Episode Group baseline — S 数学, 代码
    DeepSeek-R1 — R Episode GRPO — S AIME, 数学, 代码

附录 C:未来 Credit Assignment 论文的报告清单

  • 注:详情见原文

NLP——LLM对齐微调-Rethinking-OPD

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始论文:(Rethinking-OPD)Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe, THU, 20260414-20260415

Paper Summary

  • 整体说明:
    • 本文对 On-policy distillation(OPD) 进行了系统分析,OPD 的成功需要满足两个条件:
      • 思维模式一致性 (thinking-pattern consistency)
        • 理解:学生和教师应共享兼容的思维模式(thinking pattern)
      • 存在超越学生训练所见范围的真正新知识 (genuinely new knowledge)
        • 理解:即使思维模式一致且得分更高,教师也还必须提供学生在其训练中未曾见过的真正新能力
    • 当上述条件不满足时可以有一些补救措施:
      • Off-policy 冷启动
        • 注:附录 C.1 中证明了:SFT 冷启动导致了 student 和 teacher 之间更好、更稳定的匹配
      • 教师对齐的 Prompt 选择 (Teacher-aligned prompt selection)
        • 注意:这里的 Prompt 不是数据(Query),是 Prompt 模板
        • 从实验看,这里的 Prompt Template 对 OPD 的影响不小,详情见 6.2
    • 其他:OPD 在长轨迹上会发生奖励退化现象
      • 本文观点:OPD 中看似免费的密集 Token-level 奖励是有代价的,OPD 在长轨迹上会消失
      • 理解:教师遇到学生的长文时,是懵的,因为他自己不一定会生成这个前缀(没人考核他的这个能力),所以教师此时的信号对学生的可参考性不高,继续训练可能导致模型崩溃
        • 举例:学生做数学题时,如果已经写了很多错误的步骤了,老师可能也看不懂了,不知道怎么教导学生了
        • 注:这在长 CoT 和 多步 Agentic 场景中要尤为注意
      • Agentic 中的一个改进思路:
        • 推测:如果教师具备从错误步骤中恢复的能力(即不管从哪里续写都可以成功的教师),那么这种教师应该不太会受这种情况影响
        • 训练教师时就给教师一些从错误中恢复的能力,这样可以避免遇到错误的步骤,教师不知道怎么办
    • 本文的有趣实验:
      • 从弱到强的反向蒸馏实验:
        • 从学生视角看,同家族的 1.5B 和 7B 教师在分布上是不可区分的
        • 从 Token 层面看,成功的 OPD 的特点是在学生访问的状态上,高概率 Token 的渐进对齐,以及一个集中的共享 Token 集,该集合集中了绝大部分(97%-99%)的概率质量
  • 个人思考:
    • 可以考虑提出一种新的方法,针对不同长度的 Token 使用不同的 Advantage,比如前面的 Token 使用 OPD 的损失,后面的 Token 使用传统的 GRPO Advantage?

Introduction and Discussion

  • Qwen3 (2025)、MiMo (2026) 和 GLM-5 (2026) 等都在其后训练流程中采用了 OPD
  • Thinking Machines Lab (2025) 以极小的 RL 计算成本复现了 Qwen3 OPD 的配方,独立证实了同策略、密集的监督是一种实用高效的替代方案
  • OPD 的一个失败模式:
    • 一个更强的教师可能反而无法改进学生
    • 注:很少有研究探讨为什么教师的 Token-level 信号能将学生分布导向期望的方向,或者它失败的条件

Phenomenology,现象学

  • 本文第三节识别了 OPD 成功的关键因素:
    • (i) 思维模式一致性(thinking-pattern consistency) :
      • 学生和教师应共享一致的思维模式(例如,它们在 Top-\(k\) Token 分布上有更高的重叠率)
      • 即使教师获得了更高的基准分数,不匹配的思维模式会产生较低的重叠率,且训练无法完全恢复
    • (ii) 更高的分数 不等于 新知识 :
      • 即使思维模式一致且基准分数更高,教师也应提供学生尚未获得的知识
      • 当两个模型在相同的数据和配方上训练 时,它们会收敛到各自规模下的相似分布 ,导致 教师几乎没有可迁移的信号
      • 只有当教师拥有学生未曾见过的知识时,OPD 才能产生显著的收益
  • 本文通过反向蒸馏实验验证了这两个条件
    • 说明 OPD 学习的是思维模式,而不仅仅是受益于模式一致性,并且训练动态可以完全与基准分数解耦

Mechanism

  • 本文第四节进行了 Token-level 机制研究
  • 成功的 OPD 都表现出一个一致的特征(在所有研究的设置中):
    • 在学生访问的状态上,学生和教师的分布变得越来越相似
    • 高概率 Token 越来越多地重合(重叠率从 \(72%\) 上升到 \(91%\)),两个分布之间的熵差距缩小,且共享的 Top-\(k\) Token 集中了 \(97 - 99%\) 的组合概率质量
    • 成功模式的表现总结:重叠率稳步上升, Token-level 优势改善,熵差距缩小
  • 失败的运行从一开始就表现出停滞的重叠率和持续的熵不匹配
    • 将监督限制在重叠 Token 上就能匹配完整的 Top-\(k\) 性能,证实了重叠集是 OPD 梯度信号的主要作用点

Recipe

  • 第五节提出了两种互补的策略,可以在原本失败的配置中恢复 OPD:
    • (i) Off-policy 冷启动(off-policy cold start)
      • 在 OPD 之前,在教师生成的 Rollout 上进行一个预热 SFT 阶段,通过提高初始重叠率来弥合思维模式差距
      • 附录 C.1 中证明了:SFT 冷启动导致了 student 和 teacher 之间更好、更稳定的匹配
    • (ii) 与教师对齐的 Prompt 选择(teacher-aligned prompt selection)
      • 使用来自教师 Post-training 数据的 Prompt,以锐化高概率 Token 上的对齐
      • 注:但代价是学生熵显著降低,需要与分布外的 Prompt 混合使用
    • 在这两种情况下,恢复后的运行都表现出与 第四节 中自然成功的运行相同的动态特征:重叠率稳步上升, Token-level 优势改善,熵差距缩小

OPD 密集监督的代价

  • 奖励质量随着轨迹深度系统地下降,并且不稳定性起源于较后的 Token,然后反向传播到整个轨迹
  • 即使是失败的教师也能提供与 Rollout 正确性全局相关的奖励 ,这表明失败的原因不在于信号质量,而在于局部优化几何
  • 一个较大的教师可能诱导出一个在学生策略周围局部平坦的奖励景观,使得 Token-level 梯度无效(尽管存在一个信息丰富的全局信号)
  • 这些发现揭示了监督密度和监督可靠性之间的基本矛盾,并指出了当前 OPD 在长时程推理和 Agentic 设置中的局限性

Preliminaries

Notation

  • 令:
    • \(x = (x_{1},\ldots ,x_{n})\) 表示一个输入 Prompt
    • \(y = (y_{1},\ldots ,y_{m})\) 表示一个 Response
  • 将 \(y_{< t}\) 记为到第 \(t\) 步为止的前缀:
    $$ y_{< t}\triangleq (y_{1},\ldots ,y_{t - 1}) $$
  • 考虑两个 LLM:学生 \(\pi_{\theta}\) 和教师 \(\pi_{T}\)
    • 每个都定义了一个在词表 \(\mathcal{V}\) 上的下一个 Token 分布 \(\pi (\cdot \mid x,y_{< t})\)
  • 将 \(y\sim \pi_{\theta}(\cdot \mid x)\) 记为从学生自回归采样得到的一个 Response
    • \(\mathcal{D}\) 为 一个固定的,包含教师生成的输出的 Prompt-Response 对数据集 :
      $$\mathcal{D} = \{(x^{(i)},y^{(i)})\}_{i = 1}^{N}$$
      • 理解:\(y^{(i)}\) 是教师生成的
    • \(\mathcal{D}_x\) 为对应的 Prompt 集合:
      $$ \mathcal{D}_x\triangleq \{x^{(i)}\}_{i = 1}^{N} $$
  • 知识蒸馏(knowledge distillation,KD)通过最小化两个分布之间的散度来将知识从 \(\pi_{T}\) 转移到 \(\pi_{\theta}\)
    • 一个标准的选择是 Kullback-Leibler(KL)散度,对于 \(\mathcal{V}\) 上的两个分布 \(P\) 和 \(Q\),定义为
      $$ D_{\text{KL} }(P| Q) = \sum_{v\in \mathcal{V} }P(v)\log \frac{P(v)}{Q(v)} $$

On-Policy Distillation

  • OPD 在当前学生 \(\pi_{\theta}\) 采样的轨迹上计算监督
  • 给定一个 Prompt
    $$ x\sim \mathcal{D}_x$$
  • 学生采样一个 Response
    $$ \hat{y} = (\hat{y}_1,\ldots ,\hat{y}_T)\sim \pi_{\theta}(\cdot \mid x)$$
    • 其中 \(T\triangleq |\hat{y} |\) 表示 Rollout 长度
  • 然后在学生生成的前缀 \(\hat{y}_{< t}\) 上评估两个模型,在每个步骤 \(t\) 产生两个下一个 Token 分布:对于 \(\nu \in \mathcal{V}\),有
    $$
    p_t(\nu)\triangleq \pi_{\theta}(\nu \mid x,\hat{y}_{< t})\\
    q_t(\nu)\triangleq \pi_T(\nu \mid x,\hat{y}_{< t})
    $$
  • 一个标准的公式是在学生生成的轨迹上最小化序列级别的反向 KL:
    $$\mathcal{L}_{\text{OPD} }(\theta) = \mathbb{E}_{x\sim \mathcal{D}_x}\left[D_{\text{KL} }(\pi_{\theta}(\cdot \mid x)\parallel \pi_T(\cdot \mid x))\right] \tag {1}$$
  • 利用自回归分解,这个序列级别的目标允许精确的 Token-level 分解:
    $$\mathcal{L}_{\text{OPD} }(\theta) = \mathbb{E}_{x\sim \mathcal{D}_x,\hat{y}\sim \pi_{\theta}(\cdot |x)}\left[\sum_{t = 1}^{T}D_{\text{KL} }(p_t| q_t)\right] \tag {2}$$
  • 实践中不同的实现在如何计算这个精确的 Per-Token 反向 KL 上有所不同:
    • 全词表(Full-vocabulary) OPD 直接优化公式 (2)
    • Sampled-token OPD 使用 Per-Token-level KL 项的无偏蒙特卡洛估计
    • Top-\(k\) OPD 则用基于子集的近似替换全词表 KL
Sampled-Token OPD
  • 最轻量级的变体仅评估学生采样的 Token,也是先前同策略蒸馏工作中最常见的实现 (2025; 2026; 2026b)
  • 给定 \(\hat{y}_t\sim p_t\), Per-Token 的损失是
    $$ \ell_t^{\text{sample} }\triangleq \log p_t(\hat{y}_t) - \log q_t(\hat{y}_t)$$
  • 聚合为:
    $$\mathcal{L}_{\text{OPD} }^{\text{sample} }(\theta) = \mathbb{E}_{x\sim \mathcal{D}_x,\hat{y}\sim \pi_{\theta}(\cdot |x)}\left[\sum_{t = 1}^{T}\ell_t^{\text{sample} }\right] \tag {3} $$
  • 此时每个 \(\ell_t^{\text{sample} }\) 都是 Token-level 反向 KL 的一个无偏单样本估计量
    • 证明:
      $$ \mathbb{E}_{\hat{y}\sim p_t}[\ell_t^{\text{sample} }] = D_{\text{KL} }(p_t| q_t)$$
      • 注:这里的 \(p_t\) 就对应上述的 Student 模型 \(\pi_\theta(\cdot|x)\)
Full-Vocabulary OPD
  • Full-Vocabulary 在每个前缀上计算整个词表上的散度:
    $$\mathcal{L}_{\text{OPD} }^{\text{full} }(\theta) = \mathbb{E}_{x\sim \mathcal{D}_x,\hat{y}\sim \pi_{\theta}(\cdot |x)}\left[\sum_{t = 1}^{T}D_{\text{KL} }(p_t| q_t)\right] \tag {4} $$
    • 与 Sampled-Token OPD 相比,这产生了更密集的梯度,但代价是对于批次大小 \(B\)、序列长度 \(T\) 和词表大小 \(M = |\mathcal{V}|\),需要 \(O(BTM)\) 的内存
Top-\(k\) OPD
  • Top-\(k\) OPD 通过在子集 \(S_t\subseteq \mathcal{V}\) 上限制散度计算,提供了 Sampled-Token 和全词表 OPD 之间的中间设计
  • 这里关注学生 Top-\(k\) 变体,选择在学生下概率最高的 \(k\) 个 Token,即
    $$ S_t = \text{TopK}(p_t,k)$$
    • 注:(Revisiting-OPD)Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes, 20260326, CASIA(解读博客见:NLP——LLM对齐微调-Revisiting-OPD)中还消融了其他版本,最终结论是各有优劣:
      • Teacher top-K 具有竞争力
      • Student top-K 在几个单独的数据集上表现强劲(平均值优于 Teacher Top-K)
      • Teacher top-K 加上 Sampled-token 在比较中取得了最佳平均分
  • 定义在 \(S_t\) 上重新归一化的学生和教师分布为:
    $$\bar{p}_t^{(S_t)}(\nu) = \frac{p_t(\nu)\mathbf{1}[\nu\in S_t]}{\sum_{u\in S_t}p_t(u)},\qquad \bar{q}_t^{(S_t)}(\nu) = \frac{q_t(\nu)\mathbf{1}[\nu\in S_t]}{\sum_{u\in S_t}q_t(u)}。$$
  • 然后通过最小化子集 KL 散度 \(D_{\text{KL} }(\bar{p}_t^{(S_t)}| \bar{q}_t^{(S_t)})\) 来进行蒸馏,得到轨迹级别的目标:
    $$\mathcal{L}_{\text{OPD} }^{\text{top - k} }(\theta) = \mathbb{E}_{x\sim \mathcal{D}_x,\hat{y}\sim \pi_{\theta}(\cdot |x)}\left[\sum_{t = 1}^{T}D_{\text{KL} }(\bar{p}_t^{(S_t)}| \bar{q}_t^{(S_t)})\right] \tag {5} $$
    • 这个公式丢弃了 \(S_t\) 之外的质量,因此仍然是全词表反向 KL 的一个近似,但它显著降低了教师查询成本,同时保留了学生高概率区域上的多 Token 监督

Dynamic Metrics

  • 在第 \(t\) 步将学生和教师的 Top-\(k\) 集定义为 \(S_t^{(p)} = \text{TopK}(p_t,k)\) 和 \(S_t^{(q)} = \text{TopK}(q_t,k)\)
  • 在后续实验中将在整个 OPD 训练过程中监控以下指标
    • 重叠率(Overlap Ratio)
      • 量化学生和教师候选空间之间的对齐程度,定义为同时出现在学生和教师 Top-\(k\) 集中的 Token 的平均比例:
        $$\mathcal{M}_{\text{overlap} }\triangleq \mathbb{E}_t\left[\frac{|S_t^{(p)}\cap S_t^{(q)}|}{k}\right] \tag {6} $$
      • 低重叠率表明学生的概率质量集中在与教师不相交的 Token 集上,表明显著的政策差异或“模式不匹配”
      • 接近 1.0 的比率意味着学生已成功定位到教师支持的 Region
    • 重叠 Token 优势(Overlap-Token Advantage)
      • 为衡量重叠 Token 内的分布一致性,定义
        $$ A_{t}(\nu) \triangleq \bar{p}_{t}(\nu) (\log \bar{q}_{t}(\nu) - \log \bar{p}_{t}(\nu))$$
        • 其中 \(\bar{p}_{t}, \bar{q}_{t}\) 是在 \(S_{t}^{(p)} \cap S_{t}^{(q)}\) 上重新归一化的学生和教师分布
      • 该指标平均了这个量:
        $$\mathcal{M}_{\text{adv} }\triangleq \mathbb{E}_{t}\left[\frac{1}{|S_{t}^{(p)}\cap S_{t}^{(q)}|}\sum_{\nu \in S_{t}^{(p)}\cap S_{t}^{(q)} }A_{t}(\nu)\right] \tag {7} $$
      • 接近零的值表示高质量的对齐,即学生以适当的置信度将质量放在教师偏好的 Token 上
      • 大的负值表示在交集内,与教师相比学生过于自信(高 \(p_{t}\) 但较低的 \(q_{t}\))
    • Entropy and Entropy Gap
      • 为监控策略的分布特性,追踪学生的熵 \(H(p_{t})\) 和教师的熵 \(H(q_{t})\) 在学生 Rollout 上的情况,并定义熵差距为:
        $$\Delta H_{t} = |H(q_{t}) - H(p_{t})| \tag {8} $$
      • \(\Delta H_{t}\) 是模式对齐的一个特定状态指标
        • 大的差距表明在相同访问状态上,学生和教师在置信度和多样性方面存在显著的不匹配,而收敛到零表明学生已经匹配了其生成轨迹上教师的不确定性剖面

Phenomenology of On-Policy Distillation,OPD 的现象学

  • 在调查 OPD 的 Token-level 机制之前,本文首先提出一个更广泛的问题:
    • 什么条件决定了 OPD 的有效性?
    • 一个自然的假设是更强的教师应该总是产生更好的蒸馏结果,然而本文观察到一些配置中情况并非如此
  • Takeaways
    • 思维模式一致性
      • 学生和教师应共享兼容的思维模式
      • 即使教师获得了更高的基准分数,大的不匹配也会削弱 Token-level 蒸馏信号(第 3.1 节)
    • 更高的分数 不等于 新知识
      • 教师应提供学生在训练中未见过的知识
      • 即使思维模式一致且分数更高,教师也可能没有提供真正的新知识,使得 OPD 缺乏驱动信号(第 3.2 节)

Thinking-Pattern Consistency

  • 本节研究 OPD 是否要求学生和教师之间具有兼容的思维模式
    • 更强的教师并不能保证更好的蒸馏:推理模式上的巨大不匹配会削弱蒸馏信号,无论教师的基准优势如何
Setup
  • 使用 Qwen3-1.7B-Base (2025) 作为学生,并比较两个教师:
    • Qwen3-4B(Non-thinking) (2025)
    • GRPO 教师:Qwen3-4B-Base-GRPO (这是通过对 Qwen3-4B-Base 应用 Zero-RL(使用 GRPO (2024))获得的(详细的训练设置在附录 A.1 中提供)
      • 问题:这里所说的 Qwen3-1.7B-Base 和 Qwen3-4B-Base-GRPO 都是 Thinking 模型吗?推测不是使用 Thinking 模式?
  • 由于学生也是一个 Base 模型,这里期望其思维模式更接近经过 GRPO 训练的教师
  • 使用 DAPO-Math-17K 数据集 (2025) 进行了两个 OPD 实验,仅在教师模型的选择上有所不同
  • 所有实验都使用附录 A.2 中描述的默认超参数(另有不同的点会指明),并在 AIME 2024 (2024)、AIME 2025 (2025) 和 AMC 2023 (2024) 上进行评估
    • 每个问题采样 16 个 Rollout
    • 温度为 0.7
    • Top-\(p\) 为 0.95
    • 最大验证 Response 长度为 31,744 个 Token
    • 本文报告 16 个样本的平均准确率(avg@16)作为主要评估指标
Results
  • 如图 2 所示,来自 Qwen3-4B-Base-GRPO 的蒸馏始终优于来自 Qwen3-4B(Non-thinking)的蒸馏
    • 注:Qwen3-4B(Non-thinking)自身的 Accuracy 是高于 Qwen3-4B-Base-GRPO 的(图 2 左)
  • GRPO 教师在基准测试中表现不佳(图 2 左),但 GRPO 教师表现出更高的初始重叠率(图 2 右)
    • 表明 GRPO 教师 思维模式与学生更一致
    • 问题:这里 GRPO 教师思维模式与学生更一致的原因是两者都是 Base 模型吗?Qwen3-4B 是 Instruct 模型
  • 两个重叠曲线在训练后期趋于收敛(重叠率差异几乎消失),但性能差距持续存在
    • 表明早期思维模式的不匹配导致了蒸馏效益的损失,且无法在后期恢复
  • 附录 A.3 中分别报告了每个基准的验证准确率,相同的总体趋势在所有数据集中都成立

New Knowledge, Not Just Scale

  • 仅凭思维模式一致性并不能解释所有的观察结果
    • 即使教师得分更高且与学生共享一致的思维模式,OPD 仍然可能失败
Setup
  • 在不同模型家族中构建了两个受控比较
    • 在 DeepSeek 家族中,使用 DeepSeek-R1-Distill-Qwen-1.5B(R1-Distill-1.5B) (2025) 作为学生,并比较两个教师:
      • DeepSeek-R1-Distill-Qwen-7B(R1-Distill-7B) (2025)
      • Skywork-OR1-Math-7B (2025b)(通过对 R1-Distill-7B 应用 RL 后训练获得的)
    • 在 Qwen 家族中,使用 Qwen3-1.7B(Non-thinking) (2025) 作为学生,并比较两个教师:
      • Qwen3-4B(Non-thinking)
      • Qwen3-4B-Non-Thinking-RL-Math (2026b)(通过在 DeepMath (2025c) 的 57K 子集上对 Qwen3-4B(Non-thinking)应用 RL 获得的)
  • 在这两种设置中,关键对比在于来自相同训练流程的教师与通过进一步 RL 获得了额外能力的教师之间
    • 所有运行都使用与之前相同的数据集和训练配方
Results
  • 如图 4 所示,两个家族都表现出一致的模式
    • 相同流程的教师带来的改进有限, Post-trained 教师在所有基准测试中都产生了显著更强的收益
  • Post-trained 教师不仅取得了更高的绝对性能,而且通过差距恢复率衡量,恢复了更大比例的师生差距,其中差距恢复率定义如下:
    $$ (\text{Acc}_{\text{after OPD} } - \text{Acc}_{\text{before OPD} })/(\text{Acc}_{\text{teacher} } - \text{Acc}_{\text{before OPD} }) $$
  • 这表明:
    • 这些教师获得的额外能力通过 OPD 实现了迁移
  • 注:由于 Post-trained 教师源自相同的基础检查点,它们的思维模式仍然大致对齐(这也通过重叠率动态观察到),从而让学生学习到了教师通过 RL 获得的新能力

Validation via Reverse Distillation

  • 本文设计了一个反向蒸馏(reverse-distillation)实验作为同时验证这两个条件的比较,并揭示了对 OPD 本质的更深入见解
Setup
  • JustRL-DeepSeek-1.5B(JustRL-1.5B) (2025a) 是通过对 R1-Distill-1.5B 应用 RL 获得的
    • 本文现在反转这个方向,使用 JustRL-1.5B 作为学生,并从 R1-Distill-1.5B(其自身的 RL 前检查点)进行蒸馏
      • 理解:R1-Distill-1.5B 作为教师,JustRL-1.5B 作为学生,JustRL-1.5B 是 基于 R1-Distill-1.5B 训练的
    • 比较组:使用 R1-Distill-7B 作为教师进行比较
      • 注:R1-Distill-7B 的基准分数略高于 JustRL-1.5B,而 R1-Distill-1.5B 则明显更弱
Results
  • 图 5 揭示了两个惊人的现象
    • 第一:将 JustRL-1.5B 向其自身的 RL 前检查点 R1-Distill-1.5B 蒸馏,导致学生几乎完全回归到其 RL 前的性能,消除了通过 RL 获得的所有收益
    • 第二:当用 R1-Distill-7B(一个来自同一家族的规模明显更大甚至略强的模型)替换教师时,训练轨迹几乎无法区分:
      • 在基准测试中得分高于 JustRL-1.5B,但 R1-Distill-7B 却将学生驱动到与较弱的 1.5B 教师相同的回归水平
      • 注:从图 5 中可以看到,R1-Distill-7B 本身的性能非常高,(特别是在 AIME 2025 上比 JustRL-1.5B 还高,但是 JustRL-1.5B 无法从 R1-Distill-7B 上通过 OPD 学到知识)
        • 理解:我的推测是有两种情况:
          • 可能一:这里应该是短期内出现的坍缩现象,由于学生模型和教师模型差异过大,导致训练中途时,模型短期内被拉到了一个既不像学生,又不像教师的中间地带,只要学生的分布是不断接近教师的,继续训练下去,分数会逐渐回来(后续有资源可以考虑继续实验)
          • 可能二:学生模型在当前评测的这些指标上过拟合了,让他学习教师模型反而导致短期内的下降
    • 由于 OPD 在学生生成的轨迹上最小化反向 KL 散度,这种收敛意味着这两个教师在学生访问的状态上诱导出几乎相同的局部目标分布,尽管它们的规模不同
  • 这些结果得出几个结论:
    • 思维模式很重要,并且 OPD 从根本上学习思维模式
      • 从 R1-Distill-1.5B 蒸馏到 JustRL-1.5B 导致 JustRL-1.5B 回归到其 RL 前的性能
      • 这表明 OPD 主动获取教师的思维模式并覆盖学生自身的模式
      • 这正是思维模式一致性重要的原因:如果差距太大,学生可能无法有效学习
      • 问题:这里有点不好理解,只能说明 从 R1-Distill-1.5B 蒸馏到 JustRL-1.5B 导致 JustRL-1.5B 回归到其 RL 前的性能,并不能说明思维模式很重要啊!这里的思维模式定义是什么?应该是两者的 top-k Token 重叠率这样的指标吧
    • 基准性能不能预测 OPD 的结果
      • R1-Distill-7B 得分高于 JustRL-1.5B,但蒸馏没有产生改进,反而导致回归
      • 这表明 OPD 的训练动态可以完全独立于教师的基准性能,甚至可能向相反方向移动
      • 理解:这里可以理解为,如果教师和学生的思维模式(覆盖度)相差过大,那么朴素而鲁莽的把学生往教师的分布上拉动,收益可能是负的(学生会走到既不像自己,又不像教师的尴尬境地,至少在短时间内,学生没有完全学到教师的分布之前,下游评测分数应该是下降的)
        • 问题:这里 In-Domain 的分数应该是上涨的吧,OOD 的分数倒是应该是下降的?
    • 更高的分数并不意味着 OPD 的新知识
      • R1-Distill-7B 和 R1-Distill-1.5B 属于同一模型家族,仅在规模上有所不同
      • 这两个模型对学生产生无法区分的影响已经证实了:
        • (i) 更高的分数(R1-Distill-7B)可能仅仅反映了对相同数据的不同程度的拟合,而不是真正新颖的能力
          • 为了使 OPD 产生收益,教师应该拥有学生在其训练中尚未见过的知识
          • 问题:这里应该是因为 R1-Distill-7B 跟 学生 JustRL-1.5B 的思考模式差异过大?所以 没法用 R1-Distill-7B 作为教师教授学生 JustRL-1.5B
        • (ii) 规模不同,R1-Distill-7B 和 R1-Distill-1.5B 表现出相同的思维模式
      • 吐槽:这个结论 基准性能不能预测 OPD 的结果 的结论类似,都是想表明 R1-Distill-7B 的指标不错,但无法蒸馏到 JustRL-1.5B 上
  • 反向蒸馏实验以及第 3.1 和 3.2 节中的正向比较巩固了这两个条件
    • 思维模式一致性与更高的初始重叠率和更强的 OPD 结果相关
    • 新知识(例如来自进一步的后训练)即使在重叠率已经很高时也能实现更大的可迁移收益

Mechanism of On-Policy Distillation

  • 第 3 节确定了两个条件,即思维模式一致性和超出相同模型家族的新知识,它们决定了 OPD 的有效性
  • 本节研究在训练过程中这些条件得以体现的 Token-level 机制
    • 通过比较成功和失败的 OPD 运行,本文表明有效的蒸馏 是由高概率 Token 上的渐进对齐 驱动的
  • Takeaways
    • 渐进对齐 (Progressive alignment)
      • 在学生访问的状态下,学生和教师的高概率 top-\(k\) Token 之间的重叠在整个训练过程中稳步增加
      • 失败的运行从一开始就表现出停滞的重叠
    • 重叠充分性 (Overlap sufficiency)
      • 几乎所有优化的效果 都集中在共享的 top-\(k\) Token 上
      • 仅优化这些重叠 Token 就足以匹配标准的 OPD(即:非重叠 Token 的贡献很小)

Progressive Alignment of High-Probability Tokens,高概率 Token 的渐进对齐

  • 比较在相同设置下,从两个不同教师蒸馏同一个学生的动态,一个产生了明显的改进,而另一个没有产生任何改进
    • 发现:成功的 OPD 本质上是由学习学生和教师之间共享的高概率 Token 驱动的
Setup
  • 选择 R1-Distill-1.5B 作为学生,并比较两个教师:
    • JustRL-1.5B(在 R1-Distill-1.5B 进一步训练的模型)
    • R1-Distill-7B
    • 注:这两个教师表现出相当的数学性能,R1-Distill-7B 略强一些
  • 使用与之前相同的 DAPO-Math-17K 数据集和训练设置,并在训练期间监控三个动态指标
Results
  • 图 6 显示了截然不同的结果
    • 从 JustRL-1.5B 蒸馏带来了持续的收益,最终学生恢复了超过 \(80%\) 的与教师的性能差距
    • 从 R1-Distill-7B 蒸馏则未能带来任何改进(尽管教师整体上更强)
  • 训练动态(图 6,底部)揭示了潜在的差异
    • 在成功的运行中,重叠率稳步上升,重叠 Token 优势向零改善,熵差距缩小
      • 表明学生逐渐定位了教师的高概率区域,在该区域内校准其质量,并匹配了教师的局部置信度
    • 在失败的运行中,所有三个指标都停滞不前
      • 个人补充:熵差距还是缩小了一些的,但是会波动
  • 有两个观察值得强调
    • 第一:在整个训练过程中,重叠 Token 承载了两种模型总概率质量的 \(97% - 99%\)(见附录 B.1)
      • 因此不断上升的重叠反映了概率上占主导地位的 Token 上的对齐,而不仅仅是集合层面的重合
    • 第二:重叠 Token 优势的改善表明 OPD 的主要优化信号在于在重叠区域内重新分配概率,而不是在区域外的 Token 上
  • 附录 B.2 中报告了辅助优化指标(策略损失、梯度范数和极端优势 Token 概率差异),这些指标显示了一致的次要模式:
    • 成功的运行表现出递减的损失和持续的梯度幅度
    • 失败的运行则显示出微弱的梯度和持续的概率差异
  • 附录 B.3 中进一步验证了这些发现在不同的模型对之间具有普遍性
    • 使用 R1-Distill-7B 作为学生,在相同设置下使用两个不同的教师

Optimizing Shared Tokens Alone Suffice,仅优化共享 Token 就够

  • 上述分析表明,高概率 Token 对齐与 OPD 成功相关
  • 本节进一步研究这种相关性是否具有因果性:
    • 重叠区域是否不仅是对齐出现的地方,而且是驱动优化的区域
  • 本文设计了一个有针对性的消融实验,将 top-\(k\) 支持分解为其重叠和非重叠部分,并单独对每个部分进行训练
Setup
  • 使用第 4.1 节中成功的 OPD 设置 (JustRL-1.5B \(\rightarrow\) R1-Distill-1.5B),本文比较了三种变体,它们的区别仅在于蒸馏损失覆盖哪些 Token:
    • (i) Student Top-\(k\):在完整的 student top-\(k\) 支持 \(S_{t}^{(p)}\) 上进行优化
    • (ii) Overlap Top-\(k\):将优化限制在 student 和 teacher top-\(k\) 集合的交集 \(S_{t}^{(p)}\cap S_{t}^{(q)}\) 上
    • (iii) Non-Overlap Top-\(k\):将优化限制在它们的对称差集 \(S_{t}^{(p)}\Delta S_{t}^{(q)}\) 上(即 学生独有支持集)
  • 补充:将默认的 \(k\) 设置为 16
Results
  • 如图 7 所示,仅优化重叠区域就足以在所有三个基准测试上恢复标准 Student Top-\(k\) OPD 的几乎全部收益,而 Non-Overlap Top-\(k\) 则始终较弱
    • 这表明 OPD 的主要收益来自于共享高概率区域上的梯度,而不是非重叠 Token
    • 这也解释了为什么 Student Top-\(k\) 和 Overlap Top-\(k\) 表现得如此相似
      • 学生独有支持中的额外 Token 携带的概率质量非常少
    • Student Top-\(k\) 和 Overlap Top-\(k\) 的重叠 Token 优势曲线几乎无法区分,Non-Overlap Top-\(k\) 的幅度则小得多
      • 表明在重叠 Token 上的有效梯度要弱得多(更正错误:这里是 非重叠 Token 吧)
  • 重叠优化是自我强化的 (self-reinforcing)
    • Student Top-\(k\) 和 Overlap Top-\(k\) 都将重叠率从约 \(72%\) 稳步提高到 \(91%\) 以上
      • Non-Overlap Top-\(k\) 先下降,然后仅部分恢复(图 7,左下)
    • 这揭示了一种自我强化的动态:
      • 一旦一个 Token 进入共享的高概率区域并受到教师青睐,reverse-KL 更新就会将更多的质量集中在它上面,逐渐将竞争性的非重叠 Token 推出学生的 top-\(k\) 集合
      • 因此,重叠区域的扩大并非与优化过程相悖,反而正是优化所导致,由此形成一个良性循环,在整个训练过程中持续维持对齐。
  • 这些结果支持了 OPD 的一个统一机制:
    • OPD 主要效果是在学生访问的状态下,逐步优化学生在教师支持的高概率 Token 上的分布
    • 这种对齐既是 OPD 成功的标志,也是其操作的核心所在,其中仅优化重叠 Token 就足够了,而非重叠 Token 贡献很小
      • 当满足第 3 节中确定的条件时,这种自我强化的动态驱动着稳定的改进
      • 当不满足时,重叠停滞,训练无法取得进展

Practical Recipe

  • 第 3 节确定了成功进行 OPD 的两个条件
  • 拥有新知识是教师的内在属性,但教师和学生之间的思维模式差距可以通过训练设计来缩小
  • 本节提出了两种互补的策略,通过改善重叠动态来恢复在其他情况下会失败的 OPD 配置
  • Takeaways
    • Off-policy 冷启动
      • 在 OPD 之前,对学生在教师生成的 Rollout 上进行微调,可以弥合初始的思维模式差距,从而从一开始就获得更高的重叠率和持续更强的最终性能
    • 教师对齐的提示
      • 使用来自教师后训练数据的 Prompt 可以加强在高概率 Token 上的对齐
        • 注:单独使用教师后代价是学生熵显著降低,需要将此类 Prompt 应与分布外的 Prompt 混合使用,以防止熵崩溃

Off-Policy Distillation from Teacher Rollouts as Cold Start

  • 当学生和教师具有显著不同的思维模式时,纯粹的 OPD 可能无效,因为教师提供的 Token-level 监督信号难以被学生从其初始策略中利用
  • 为了减轻这种不匹配,本文提出可考虑一个两阶段框架:
    • 第一阶段:通过 SFT 学生在教师生成的 Rollout 上来进行 off-policy 蒸馏,使其更接近教师的思维模式
    • 第二阶段:使用标准 OPD 继续训练
Setup
  • 模型选择:使用 Qwen3-1.7B-Base 作为学生,Qwen3-4B (Non-thinking) 作为教师
  • 数据选择:使用 OpenThoughts3-1.2M (2025) 的数学领域子集作为 SFT 的 Prompt 来源
  • 具体做法:
    • 教师在此数据集的一个子集上生成 200K 个 Response,使用这些教师 Rollout 对学生进行 SFT 作为冷启动,得到 Qwen3-1.7B-SFT
    • 从该 SFT 初始化开始,使用在排除 SFT Prompt 子集 后剩余的 OpenThoughts Prompt(约 30K 个 Prompt)继续进行 OPD 训练
    • 对照组:一个纯 OPD 基线,该基线直接从 Qwen3-1.7B-Base 开始,使用相同的教师和 OPD Prompt 集,但在 OPD 之前不进行冷启动蒸馏
      • 详细的离线 Rollout 和 SFT 配置在附录 C.1 中提供
Results
  • 如图 8 所示,两阶段方法显著优于纯 OPD
  • 从 Qwen3-1.7B-SFT 开始始终比直接从 Qwen3-1.7B-Base 开始产生更好的验证性能
  • 性能差距在整个训练过程中持续存在,表明 off-policy 冷启动不仅改善了早期的优化,还提高了后续 OPD 的最终性能上限
    • 问题:
      • 看着图 8 中,各种指标都是 SFT 带来的,SFT 的样本太多了吧,导致整体效果其实在 SFT 后就收敛到 Teacher 上了,表现在 Overlap Ratio 其实一直处于收敛的情况(也就是说 Student 已经被 SFT 大幅拉倒 OPD 上了)
      • 而且 SFT 看到的数据,纯 OPD 看不到,也不够公平
  • 重叠动态支持了相同的结论:
    • SFT-initialized 学生开始时具有高得多的重叠率,并保持平滑、稳定的轨迹,而基础初始化的学生起点较低,并在逐渐恢复之前表现出明显的不稳定性
  • SFT-initialized 学生的熵差距也小得多
    • 表明从一开始 SFT-initialized 学生就与教师的置信度分布更匹配
  • 结论:
    • off-policy 蒸馏减少了初始的模式不匹配,使得一旦 OPD 开始,教师的 Token-level 监督信号就可以立即被利用
    • 附录 C.2 中对重叠质量动态进行了更详细的分析

Leveraging Teacher Post-Training Prompts

  • 由于教师的策略受到后训练期间所见 Prompt 的影响,在 OPD 期间使用与教师对齐的 Prompt 可以产生更有效的监督
Setup
  • 本文在两个粒度上进行实验:
    • 匹配 Prompt 模板是否重要
    • 匹配 Prompt 内容是否重要
Prompt template
  • 教师是 JustRL-1.5B,学生是 R1-Distill-1.5B

  • Prompt 集是 DAPO-Math-17K,仅 Prompt 模板不同

  • 原始模板是之前所有实验中使用的标准 DAPO 格式(除非另有说明),而与教师对齐的模板则与 JustRL 后训练期间使用的格式相匹配:

    • Original DAPO Template:

      1
      2
      3
      4
      Solve the following math problem step by step. The last line of your response should be of the form Answer: 
      $Answer (without quotes) where $Answer is the answer to the problem.
      {Question}
      Remember to put your answer on its own line after “Answer:”
    • Teacher-Aligned Template

      1
      {Question} Please reason step by step, and put your final answer within \boxed{}.
    • 两次运行(消融 Prompt 模板)包含相同的数学问题,但任务呈现给模型的方式不同

      • 这种设计隔离了 Prompt 模板与教师对齐的影响,同时保持底层问题内容不变
Prompt Content
  • 教师是第 3.1 节中介绍的 Qwen3-4B-Base-GRPO,学生是 Qwen3-1.7B-Base
  • 比较两个大小匹配的 Prompt 集:
    • DAPO-Math-17K(与教师的 RL 训练数据集对齐)
    • DeepMath 的一个子集(该子集与 DAPO-Math-17K 去重(见附录 C.3))
    • 此设计测试了 OPD 是否受益于使用与教师后训练数据完全相同的 Prompt,而不仅仅是领域内的 Prompt
Results
  • 图 9 中的 Prompt 模板设置显示,仅仅切换到与教师对齐的模板就能提高在所有三个基准测试上的验证性能
  • 重叠动态支持了这一结果:
    • 与教师对齐的模板运行开始时具有更高的重叠率,并收敛到更高的水平
    • 这表明即使是 Prompt 模板的微小变化,也能通过使学生生成的状态与教师更兼容,从而显著影响 OPD
    • 附录 C.4 中的基准测试详细分解显示了相同的趋势
  • 图 10 中的 Prompt 内容设置显示了类似的 downstream 优势,但有一个细微差别:
    • 与教师对齐的 Prompt 在整个训练过程中产生的重叠率较低
    • 但学生在重叠 Token 上的累积概率质量显著更高,表明学生将其质量集中在更少但共享程度更高的 Token 上
    • 即使重叠集更小,高概率 Token 上的有效对齐也更强
  • 观察:使用与教师对齐的 Prompt 会导致训练期间学生的熵显著降低
    • 这表明,仅在教师后训练期间见过的 Prompt 上进行 OPD 可能并不总是理想的,因为它会过度降低策略熵
    • 在实践中,一个更稳健的策略可能是将与教师对齐的 Prompt 与教师后训练数据之外的 Prompt 混合,以保持策略熵并维持学生的探索能力
  • 这些结果表明 OPD 不仅受益于合适的教师,还受益于匹配良好的 Prompt 集
    • 更接近教师后训练数据的 Prompt 可以提高下游性能,并加强在最重要的共享 Token 上的对齐,但应谨慎使用,以避免过度抑制学生的熵

Discussion

  • OPD 的吸引力在于其密集的监督信号,即 Per-Token 都从教师那里获得一个奖励信号
    • 这与 RL 中使用的稀疏的 Outcome-level 奖励形成对比
  • 但这种增加的监督密度是有代价的
    • 上述所有章节都隐含地依赖于教师在学生访问的状态下的 Token-level 奖励是可靠的,但本文已经看到这个假设可能会失效
    • 本节研究奖励信号本身,并考察其属性和局限性

Reward Quality Degrades with Trajectory Depth,奖励质量随轨迹深度退化

  • 本节研究教师的奖励质量如何随响应长度变化
响应长度存在一个最佳区间 (sweet spot)
  • 位置 \(t\) 的监督依赖于教师在学生生成的 Prefix \(y_{< t}\) 下的条件概率 \(\pi_{T}(y_{t} \mid x, y_{< t})\)
    • 而该 Prefix 可能会偏离教师自然产生的轨迹
  • 本文在六种最大响应长度下,针对 JustRL-1.5B 训练 R1-Distill-1.5B 200 步
  • 如图 11(a) 所示
    • 非常短的响应 (0.5K 和 1K) 提供的监督 Token 太少,无法进行样本高效的学习,而中等长度 (3K 和 7K) 产生了最强的结果
    • 超出此范围 (10K 和 15K),性能趋于平稳或下降
  • 图 12 中的训练动态证实
    • 中等长度产生平滑的重叠率增长,而 10K 和 15K 则表现出后期崩溃,重叠率急剧下降,同时伴随着学生熵和梯度范数的峰值
不稳定性源于较后的 Token (later tokens)
  • 这种崩溃从何开始?在 15K 设置中,分析整个训练步骤中作为输出位置函数的学生熵,揭示了一个清晰的从后向前的模式:
    • 如图 13 所示,高熵首先出现在响应的末端,并在训练过程中逐渐向前面的 Token 传播
    • 教师熵表现出类似的从后缀到前缀的趋势 (见附录 D.1)
      • 这与教师在较后位置遇到越来越不熟悉的 Prefix 并使产生的奖励噪声更大 ,进而破坏学生的稳定性 这一观点一致
教师延续 (teacher continuation) 能力随 Prefix 深度增加而下降
  • 本文通过测试当从学生生成的 Prefix 开始时,教师是否仍然能够改进学生的延续来进一步探究这一点
  • 从 DAPO-Math-17K 中采样 2K 个 Prompt,生成完整的学生 Rollout,并选择那些超过 16K Token 的 Rollout
    • 然后在多个位置截断每个 Rollout,并让教师从生成的 Prefix 继续生成
    • 图 11(b) 显示,教师的准确率优势单调下降,从 1K Prefix 处的 \(+0.37\) 下降到 16K Prefix 处的仅 \(+0.02\)
  • 这些结果揭示了 OPD 的 Token-level 监督中的一个基本权衡
    • 密集奖励在中等长度的推理轨迹上有效,但其可靠性随深度增加而下降,因为学生 Prefix 会进一步偏离教师熟悉的 States
    • 这表明 OPD 可能无法干净地扩展到更长 Horizon 的设置,例如扩展的 Chain-of-Thought 或 Agentic 多轮交互
  • 理解:教师遇到学生的长文时,是懵的,因为他自己不一定会生成这个前缀(没人考核他的这个能力),所以教师此时的信号对学生的可参考性不高,继续训练可能导致模型崩溃
    • 举例:学生做数学题时,如果已经写了很多错误的步骤了,老师可能也看不懂了,不知道怎么教导学生了

Globally Informative Reward Does Not Guarantee Local Exploitability,全局信息性奖励不能保证局部可利用性

  • 上一小节表明奖励质量随轨迹深度而下降
    • 一个自然的问题是:在失败的 OPD 配置中,奖励信号是根本无信息量的,还是失败的原因在于其他地方?
Setup
  • 重新审视第 4.1 节中的控制比较,以 R1-Distill-1.5B 为学生,两个教师:
    • JustRL-1.5B (成功 OPD)
    • R1-Distill-7B (失败 OPD)
  • 对于每个学生 Rollout \(y\),计算序列平均奖励 (基于 Sampled-Token OPD )
    $$\begin{array}{r}\bar{r} (y) = \frac{1}{T}\sum_{t = 1}^{T}\left[\log \pi_{T}(y_t\mid x,y_{< t}) - \log \pi_{\theta}(y_t\mid x,y_{< t})\right] \end{array}$$
    • 接下来比较正确和错误 Rollout 之间 \(\bar{r} (y)\) 的分布
    • 注:上述序列平均奖励仅仅是用来统计了对比的,不是损失函数
Global reward structure is preserved in both settings,全局奖励结构在两种设置中都得以保留
  • 图 14 显示
    • 对于两个教师,正确的 Rollout 始终获得比错误 Rollout 更高的序列平均奖励,具有可比的 AUROC 值 (JustRL-1.5B 为 0.73,R1-Distill-7B 为 0.75)
      • 理解:这说明对于两个教师,均有教师在正确 Rollout 上的输出概率比学生更高(符合预期)
    • 失败的 7B 教师并未产生更弱的全局信号,该信号与 Rollout 正确性的相关性同样高
      • 理解:
        • 这里的相关性是指:即使在失败的 7B 教师上,也能看到其在正确 Rollout 上的输出概率比学生更高
        • 这里的 全局信号是使用上述 Sequence 平均奖励来评估的

A hypothesis on local optimization geometry,关于局部优化几何的假设

  • 如果奖励在两种情况下都是全局信息性的,那么为什么 OPD 在 7B 教师时会失败?
    • 第 4.1 节的训练动态提供了一个线索
  • 如图 6 所示
    • 当 R1-Distill-7B 作为教师时,在训练的后期阶段,Overlap-Token Advantage 的幅度比 JustRL 教师时的更大,然而梯度范数仍然持续较小 (见附录 B.2)
      • 理解:图 6 中第二行第二列的图所示,这里的 幅度是偏离 0 的程度,看着图中是负的,所以深红色的线幅度更大
  • 一种可能的解释是:
    • 7B 教师 的 Per-Token 优势虽然个体较大,但在每个序列内的不同位置之间是各向异性的 (anisotropic)
      • 当这些异质信号聚合成一个梯度更新时,它们会部分抵消,导致尽管 Per-Token 的奖励很大,但有效的梯度却很小
      • 理解:说明部分 Token 被鼓励,部分 Token 被打压,且针对同一个参数也有不同的反馈信号,导致参数的有效梯度信号变小
    • 与学生具有兼容思维模式的 JustRL-1.5B ,可能将其优势集中在更连贯的 Token 子集上
      • 由此产生的梯度,虽然由更小的 Per-Token 信号组成,但指向一个一致的方向,反向 KL 可以通过其 Mode-seeking 行为放大该方向
      • 理解:比如一个序列上的每个 Token 都被鼓励,从而整体梯度方向也在提升,导致有效梯度信号相对较大
  • 注:本文尚未直接验证这个各向异性假设,这样做需要分析 Per-Token 梯度的方向结构,本文作者将这个问题留给未来的工作
    • 高 Per-Token 优势 与低梯度范数 同时出现是暗示性的,并指出了一个重要的区别:
      • 全局信息性奖励并不能保证局部可利用的奖励
    • 理解 OPD 奖励 landscape 的几何结构,以及开发能够利用各向异性奖励结构的目标函数,仍然是一个悬而未决的问题

Sampled-Token Reward Is Already Sufficient,Sampled-Token Reward 已经足够

  • 关于 OPD 的奖励,一个自然的问题是每个位置需要多少个 Token 来计算有用的梯度
  • Top-\(k\) OPD 将每个位置上 \(k\) 个最高概率 Token 的奖励聚合起来,人们可能期望更大的支持集总能带来更好或更稳定的学习
  • 通过改变 \(k\) 并将其与更简单的 Sampled-Token OPD 进行比较来研究这一点
    • 注:Sampled-Token OPD 在每个位置仅使用从学生分布中抽取的单个 Token
Setup
  • 本文使用 R1-Distill-1.5B 作为学生,JustRL-1.5B 作为教师,并将 Top-\(k\) OPD (\(k \in \{1, 4, 16, 64\}\)) 与 Sampled-Token OPD 进行比较,保持所有其他超参数固定
Results
  • 图 15 显示,在三个基准测试的平均值上, Sampled-Token OPD 实现了与 Top-\(k\) 设置相当的性能
    • 唯一明显更差的配置是 Top-1,其表现始终不佳
    • 将 \(k\) 增大到超过 4 会带来可忽略不计的额外收益,同时导致更大的计算开销
      • 理解:这里说的超过 4 是指,Top-8 和 Top-16 相对 Top-4 收益几乎可忽略(甚至微降)
      • 结论:Top-4 就够了
  • 图 16 显示了训练动态,并揭示了差异产生的地方
    • Top-1 表现出不稳定的重叠增长,伴随着熵和梯度范数的急剧峰值
    • Top-4 明显更稳定,但仍显示出后期下降
    • Top-16 和 Top-64 在整个过程中保持平滑
    • 结论:Top-K 的 K 越大,训练越稳定,上和梯度都没有峰值(注意:梯度范数和熵的 spike 趋势是一致的)
    • 思考:正因为 OPD 的 Advantages 均值倾向于小于 0,所以 Student 的熵一般不会降低,甚至会上涨(许多高概率 Token 降低自身概率带来的是熵增),少数 Token 会被提升概率,带来熵减
      • OPD 的 Advantages 均值倾向于小于 0 见本文 图 7 和 图 8 中
      • 注:这一点也可以见 NLP——LLM对齐微调-Revisiting-OPD
  • 这些结果表明,只要避免退化的 Top-1 设置,支持集大小可能不是 OPD 的关键设计选择
    • Sampled-Token OPD 之所以效果良好,尽管每个位置只使用一个 Token,是因为它按比例于学生自身的分布在每一步抽取一个不同的 Token,从而在训练过程中为高概率区域提供无偏覆盖
    • Top-1 则相反,它总是选择 ArgMax Token,从而将奖励集中在一个单一模式上
      • 小的策略变化可能会翻转哪个 Token 占据第一名(理解:比如第一第二名 Token 概率相近时),从而创建一个不稳定的奖励信号,该信号在训练过程中不会平均化
      • 理解:但这里的理解只是相对 Top-K 而言的,相对 Sampled-Token 而言,更多是下面的原因(Top-1 选择本身是有偏的估计,而 Sampled-Token 本身是无偏的估计)
    • Top-1 的失败不在于使用太少的 Token,而在于使用了一个有偏的、集中于单一模式的选择规则

Related Work

Knowledge Distillation

  • 知识蒸馏 (KD) (2015) 通过训练学生网络学习教师的软输出分布,将知识从大模型转移到小模型
  • 对于自回归序列模型,Kim 和 Rush (2016) 将其扩展到序列级蒸馏,通过在教师生成的输出上训练学生,建立了主导的 Off-policy 蒸馏基线 (2020;2019;2020)
  • SFT 已被直接应用于提高各种下游任务的性能 (2024;2021;2021)
  • 所有 Off-policy 方法共有的一个基本限制是训练-推理分布不匹配
  • 学生在教师生成或参考序列上被优化,但在推理时必须从其自身的分布生成,这是暴露偏差 (exposure bias) (2015) 的一个实例,会在长生成过程中累积错误
    • 这种不匹配促使将蒸馏转移到学生自己的 On-policy 分布上,这正是 On-policy 蒸馏的核心思想

On-Policy Distillation

  • MiniLLM (2023) 首次在反向 KL 目标下为 LLM 形式化了 OPD,该目标通过策略梯度进行优化,认为反向 KL 的 Mode-seeking 行为可以防止学生将概率质量分散到教师认为不太可能的区域
  • GKD (2024) 引入了一个统一框架,在多种散度上对 On-policy 和 Off-policy 数据进行插值,展示了相对于其他 KD 基线的一致改进
  • Yang 等 (2026b) 后来在理论上将 OPD 形式化为密集 KL 约束 RL 的一个特例,表明教师的 Per-Token 对数比率构成了一个隐式奖励,并且将此奖励扩展到其标准权重之外可以推动学生超越教师的性能边界
  • OPD 此后已被工业界采纳用于 Post-training 流程 (2026;2026;2026;2026;2025;2026;2025,2026b;2026),并扩展到可扩展的自蒸馏 (Ding,2026;2026;2026;2026;2026;2026;2026;2026a;2026a;2026a),其中单个模型通过以特权信息 (如 Ground-truth 解决方案或执行反馈) 为条件,充当自己的教师
  • 尽管这方面的工作越来越多,但现有研究主要集中在展示 OPD 的前景,例如密集奖励和缓解的暴露偏差,在不同的目标、任务和师生对上,而没有系统地分析 OPD 何时或为何失败

Capacity Gap and Distillability

  • 在知识蒸馏中,一个反复出现的观察是,较大的师生能力差距会降低甚至逆转蒸馏的益处
  • Cho 和 Hariharan (2019) 证明,当教师能力显著更强时,蒸馏可能会损害学生表现,Mirzadeh 等 (2020) 提出了一个中等规模的教师助手 (teacher assistant) 来弥合差距
  • Busbridge 等 (2025) 通过蒸馏缩放定律 (distillation scaling laws) 提供了定量处理,表明学生损失作为教师质量、学生规模和数据量的幂律函数,识别出一个 U 型能力区域,其中教师能力过强会降低蒸馏效率
  • 对于 LLM 推理,Li 等 (2025) 记录了一个“可学习性差距”,表明在来自强推理教师的长 Chain-of-Thought 轨迹上训练小模型始终不如更简单的方法,这表明教师输出的推理复杂性必须与学生能力相匹配。这些发现提醒人们对蒸馏的普适性持谨慎态度
  • 然而,现有的分析主要集中在 Off-policy 知识蒸馏上。特别是,能力差距和可蒸馏性在 OPD 中的问题仍未得到充分探索

Future Work

Beyond Mathematical Reasoning

  • 注:本工作的所有实验都是在数学基准上进行的
  • 后续开放问题:OPD 的相同条件和 Token-level 机制是否在代码和开放式设置等其他领域中也适用?

Impact of Pre-Training

  • “新知识”条件隐含地依赖于预训练语料库的差异,但隔离这个因素具有挑战性
  • 当前的研究主要依赖于跨家族蒸馏 (例如,Qwen \(\rightarrow\) LLaMA),这混淆了数据差异与 Tokenizer 不匹配和架构差异,而受控的预训练消融研究仍然代价高昂
  • 衡量预训练数据对 OPD 的影响仍然是一个悬而未决的问题

Self-Distillation Dynamics

  • 最近的工作越来越多地采用自蒸馏,其中单个模型在给定特权信息的情况下充当自己的教师
  • 将这些见解扩展到自蒸馏机制 (思维模式一致性得到保证,但知识新颖性源于特权访问而非单独的教师) 是顺理成章的下一步

Long-Horizon and Agentic Settings

  • 第 6 节提到的轨迹长度上限激励了混合方法,该方法将短段上的密集 Token-level 监督与更长 Horizon 的稀疏 Outcome-level 奖励相结合,以及在训练过程中逐步扩展监督 Horizon 的课程学习策略

附录 A:Details for Section 3

A.1. GRPO Training Details

  • Base Model :Qwen3-4B-Base

  • Training Dataset :使用处理后的 DAPO-Math-17K 数据集进行 GRPO 训练

    • 具体来说,每个问题都添加了以下指令:
      • GRPO dataset template
        1
        {Question} Please reason step by step, and put your final answer within \boxed{}.
  • Training and Evaluation Settings

    • 使用 GRPO 训练教师模型
    • 在训练期间,为每个 prompt 采样 \(n = 8\) 个 responses
    • 最大 prompt 长度和最大 response 长度分别设置为 1,024 和 7,168 个 tokens
    • 训练在 8 张 A800 80G GPU 上进行一个 epoch
    • 学习率为 \(1 \times 10^{- 6}\)
    • 将 student 采样温度和 teacher 温度都设置为 1.0
    • 重复惩罚设为 1.0
    • 禁用 KL 正则化
    • 采用 token-mean 损失聚合。主要超参数总结在表 1 中

A.2. Experimental Setup

  • 所有实验均使用表 2 中列出的默认 OPD 超参数(特殊说明除外)

A.3. Benchmark-wise breakdown of thinking-pattern compatibility,思维模式兼容性的基准逐项分解

  • 图 2 展示的是平均结果,这里图 17 展示了基准逐项的分解
  • 从 Qwen3-4B-Base-GRPO 进行蒸馏的优势在各个数据集上普遍存在(不是由单个基准驱动)
    • 在 AMC 2023 和 AIME 2024 上差距更明显,在 AIME 2025 上差距较小但仍普遍存在
    • 这种按基准划分的视图支持了以下解释:
      • 更好的早期思维模式兼容性会导致更好的下游蒸馏性能,而早期不匹配造成的损失在训练后期无法完全恢复

附录 B:Details for Section 4

B.1. Additional Analysis of Token Overlap Mass

  • 为量化每个模型分配给重叠 top-\(k\) 区域的概率质量,本文定义 \(\mathcal{M}_{\text{overlap-mass} }^{(p)}\) 为:
    $$\mathcal{M}_{\text{overlap-mass} }^{(p)} = \mathbb{E}_t\left[\sum_{\nu \in S_t^{(p)}\cap S_t^{(q)} }p_t(\nu)\right] \tag {9}$$
  • 定义 \(\mathcal{M}_{\text{overlap-mass} }^{(q)}\) 为:
    $$\mathcal{M}_{\text{overlap-mass} }^{(q)} = \mathbb{E}_t\left[\sum_{\nu \in S_t^{(p)}\cap S_t^{(q)} }q_t(\nu)\right] \tag {10}$$
  • 这衡量了 student 和 teacher 分别分配给其 top-\(k\) 集合中共享 token 的总概率质量的分数
    • 在本文实验中,如图 18 所示,在整个训练过程中,重叠 token 为两个模型承载了 \(97% -99%\) 的总概率质量

B.2. Auxiliary Optimization Dynamics,辅助优化动态

  • 本节补充第 4.1 节的分析,针对相同的对比设置报告了几个额外的优化诊断指标
  • 固定 student 为 R1-Distill-1.5B,并在相同的 Student Top-\(k\) OPD 训练方案下比较两个 teachers:
    • JustRL-1.5B(产生成功的运行)
    • R1-Distill-7B(在其它匹配条件下产生失败的运行)
    • 这些诊断指标并非主要证据,它们提供了关于成功和失败的 OPD 之间优化信号差异的补充视图
Diagnostics,诊断
  • 监测三个额外的量
    • 第一个是批次平均的 OPD 训练损失,在图 19 中表示为 PG Loss
    • 第二个是梯度范数,它衡量到达 student 的更新信号的整体幅度
    • 第三个是具有最大绝对优势的 token 上的概率差 \(p_t(v) - q_t(v)\)
      • 跟踪 student 是否能够减少在携带最强优化信号的 token 上与 teacher 最显著的局部不一致
  • 这些指标有助于区分成功和失败的 OPD:
    • 在成功 OPD 中,student 接收到可用的信号并逐步减少不匹配
    • 在失败 OPD 中,信号太弱或对齐太差,无法推动实质性改进
Results
  • 图 19 中的趋势与第 4.1 节的主要结论一致
  • 损失视角:
    • 成功 OPD:使用 JustRL-1.5B 的成功运行显示出训练损失在优化过程中显著减少
      • 从一个更大的初始不匹配开始,损失在训练的大部分时间里稳步下降,然后稳定在一个较低的值
    • 失败 OPD:使用 R1-Distill-7B 的失败运行开始时损失小得多,之后变化不大
      • 这种模式表明,失败运行中较小的损失并不表示优化更好
      • 较小的 损失反映了从一开始 teacher 诱导的训练信号就较弱,该信号仍然太小,无法推动显著的政策改进
  • 梯度范数视角:(梯度范数显示了两个运行之间更清晰的分离)
    • 成功 OPD:梯度范数初始很大,并在训练的很大一部分时间里保持较大
      • 表明 student 持续接收到有意义的修正信号
    • 失败 OPD:梯度范数始终小得多,随时间变化也有限
      • 即使在相同算法和训练预算下进行优化,针对 R1-Distill-7B 训练的 student 经历的更新信号要弱得多
    • 这一观察结果与以下发现一致:
      • 失败与高概率 token 上的对齐性差有关
      • 当 student 没有实质性地进入 teacher 支持的区域时,产生的梯度仍然很弱
  • 最大绝对优势的 Token 概率视角:
    • 成功 OPD:成功的运行稳步减少了具有最大绝对优势的 token 上的概率差异
      • 说明:当 OPD 成功时,student 逐步纠正了在 teacher 诱导的优势信号下最重要的局部错误
    • 失败 OPD:失败的运行在整个训练过程中保持了明显更大的差距
      • 说明:当 OPD 失败时,这些高优势的差异持续存在而未能解决
    • 这再次与以下解释一致:
      • OPD 中的决定性信号位于一小部分高概率、高优势的 token 上,当 student 无法有效利用该信号时就会发生失败
  • 以上这些辅助动态强化了第 4.1 节中提出的解释
    • 成功的 OPD 不仅以高概率 token 上的重叠增加为特征,而且还以训练机制为特征
      • 在该机制中,student 接收到足够幅度的梯度,以减少最重要的局部分布不匹配
    • 失败的 OPD 伴随着弱梯度、有限的损失减少以及在具有最强优势信号的 token 上持续存在的分歧
      • 虽然这些诊断指标是支持性的而非核心,但它们提供了一个优化层面的视图,该视图与以下观点完全一致:
        • OPD 有用的学习信号集中在 student 访问状态下的高概率 token 上,当该信号太弱或对齐太差而无法驱动有效更新时,训练就会退化

B.3. Cross-Model Validation of High-Probability-Token Alignment,高概率 Token 对齐的跨模型验证

  • 本节测试第 4.1 节中的现象是否能推广到另一对模型
  • 将 student 模型固定为 R1-Distill-7B,并选择 Skywork-OR1-Math-7B 和 DeepSeek-R1-Distill-Qwen-14B (R1-Distill-14B) 作为 teachers,使用与第 4.1 节相同的训练和评估设置
Results
  • 图 20 显示了与图 6 相同的模式
    • 以 Skywork-OR1-Math-7B 为 teacher,蒸馏提高了 student 的性能,并伴随着重叠率的稳步增加、重叠 token 优势趋近于零以及较小的熵差
    • 以 R1-Distill-14B 为 teacher,训练几乎没有改进,对齐指标仍然较差或不稳定
    • 这提供了额外的证据,表明成功的 OPD 始终与 student 访问状态下高概率 token 对齐的出现相吻合
      • 理解:图 20 中,成功的运行再次伴随着高概率 token 对齐的增加,而停滞的运行则没有

附录 C:Details for Section 5

C.1. Cold-Start Distillation Details

Offline teacher rollout
  • 为了构建冷启动 SFT 数据,本文从 OpenThoughts3-1.2M (2025) 的数学子集中采样了 20 万个数学 prompts,并使用 Qwen3-4B (Non-thinking) 为每个 prompt 生成一个离线 response

  • 对于每个 prompt,作者使用以下模板:

    • Teacher rollout template
      1
      {Question} Please reason step by step, and put your final answer within \boxed{boxed{} }
  • 解码超参:温度 0.7、top-\(p = 0.95\)、top-\(k = - 1\) 和最大生成长度 12,288 个 tokens 进行解码

  • 生成后,过滤掉不完整的 responses(例如,未正确完成的截断输出)和退化的重复 responses

    • 剩余的 prompt-response 对用作监督蒸馏语料库来训练 student
Student SFT
  • 从 Qwen3-1.7B-Base 开始,使用 LLaMA-Factory 框架 (2024) 在过滤后的 20 万个 teacher 生成的样本上进行全参数 SFT,产生 Qwen3-1.7B-SFT
  • 将详细的超参数总结在表 3 中

C.2. Additional Analysis of Overlap Mass,重叠质量的额外分析

  • 为了更好地理解为什么基础初始化的 student 有时会表现出相当甚至稍好的重叠 token 优势 (Overlap-Token Advantage),但整体表现仍不佳,本文进一步从 student 和 teacher 两方面检查重叠集覆盖的概率质量
  • 如图 21 所示
    • SFT-initialized student 在整个训练过程中始终保持 student 重叠质量和 teacher 重叠质量在较高水平
      • 这表明重叠 token 覆盖了 student 和 teacher 分布的大部分高概率区域,表明从 OPD 开始就存在强烈且稳定的对齐
    • 而基础初始化的 student 表现出显著较低且更不稳定的重叠质量,尤其是在训练早期阶段
  • 这种分析有助于解释为什么重叠 token 优势 (Overlap-Token Advantage) 有时可能具有误导性
    • 由于它仅在重叠 token 上平均,即使重叠集本身缺失了相当一部分 teacher 的高概率 token,它也可能看起来相对有利
    • 重叠质量通过揭示共享支持是否真正覆盖了两个分布最重要的部分来补充这一观点
  • 从这个角度来看,SFT 冷启动导致了 student 和 teacher 之间更好、更稳定的匹配

C.3. Deduplication Details for the DeepMath Subset,DeepMath 子集的去重细节

  • 对于跨规模设置,构建了一个与 DAPO-Math-17K 去重后的 DeepMath 子集,以便比较与 teacher 的 RL 后训练数据对齐的 prompts 和仅在领域内的 prompts
  • 本文的去重分两个阶段执行:精确匹配去重和语义去重
Question extraction
  • 对于 DAPO-Math-17K 和 DeepMath,提取问题内容并移除 prompt 中的指令后缀,以便仅基于问题文本进行去重
Stage 1: Exact-match deduplication
  • 将所有提取的 DAPO-Math-17K 问题收集到一个集合中,并移除其提取的问题与该 DAPO 问题精确匹配的任何 DeepMath 样本
Stage 2: Semantic deduplication
  • Stage 2 进一步移除近似重复的 prompts
    • 使用句子嵌入模型 all-mpnet-base-v2 (Reimers and Gurevych, 2019) 对 DAPO-Math-17K 和 DeepMath 的问题进行编码
    • 对嵌入进行 L2 归一化,并在 DAPO 嵌入上构建一个 FAISS 内积索引,使得内积对应于余弦相似度
  • 对于每个 DeepMath 问题
    • 在 DAPO-Math-17K 中检索其最接近的邻居
    • 如果与最近 DAPO 问题的余弦相似度至少为 0.6,将该 DeepMath 样本标记为语义重复并将其移除
Final retained subset
  • 移除任何被精确匹配或语义去重标记的 DeepMath 样本
  • 得到的子集在领域内,但与 DAPO-Math-17K 去重
    • 能够在与 teacher 后训练数据重叠的 prompts 和仅在领域内的 prompts 之间进行受控比较

C.4. Benchmark-wise breakdown of prompt-template alignment,Prompt 模板对齐的基准逐项分解

  • 图 9 中展示的是平均结果,图 22 展示了基准逐项的分解
    • teacher 对齐的模板在各个数据集上产生了一致的改进,在两个 AIME 集上增益更大,在 AMC 2023 上影响较小但仍是正向的
      • 使用 teacher 对齐的模板在三个基准上始终匹配或优于原始 DAPO 模板
    • **使用 teacher 对齐的模板 **还允许 student 恢复 teacher 性能的更大一部分,从大约 \(80%\) 增加到大约 \(85%\)
  • 结合第 5.2 节中的重叠率结果,这表明 prompt 模板对齐通过使 student 生成的状态与 teacher 更兼容来改进 OPD

附录 D:Details for Section 6

D.1. Teacher entropy by output position,按输出位置划分的 Teacher 熵

  • 为补充第 6.1 节中的 student 熵分析,本节可视化了在最大 response 长度为 \(15K\) 的设置下,训练步骤中作为输出位置函数的 teacher 熵(见图 23)
    • 与 student 类似,teacher 熵首先在较后的解码位置增加,然后随着训练的进行逐渐向前面的 token 传播
    • 理解:升高的熵首先出现在后缀部分,然后随着训练的进行逐渐向前面的输出位置传播,说明是后面的 Token 先出现问题(教师信号不置信,逐步引起前面的 Token 崩溃)
1…101112…352
San Ye

San Ye

Stay Hungry. Stay Foolish.

704 posts
53 tags
© 2026 San Ye
Powered by Hexo
|
Theme — NexT.Gemini v5.1.4