Hexo

凡事预则立,不预则废


  • Home

  • Tags

  • Archives

  • Navigation

  • Search

NLP——LLM对齐微调-STEER

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始论文:Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective, ZJU & Tencent, 20251011-20260429
      • ACL Outstanding Paper Award

Paper Summary

  • RLVR 中常常遇到 熵崩溃(Entropy Collapse) 问题:即训练期间策略熵的快速下降(2025b)
  • 熵崩溃会导致:
    • 1)限制探索 :模型生成的推理轨迹趋于同质化,无法发现新颖或正确的解决方案
    • 2)破坏优化 :在 GRPO 这类基于 Group 的算法中,轨迹同质化使得计算出的优势值区分度降低,导致训练停滞
  • 现有方法的局限 :
    • (1) Clip-Higher(更高裁剪),增加重要性采样比率的上界
    • (2) Positive-Reweighting(正向重新加权),降低具有高生成概率的正样本的权重
    • (3) Entropy-Aware Advantage(熵感知优势),为具有高熵的 Token 分配更大的优势
    • 它们基本上是启发式的,对其影响熵的潜在机制的理解很大程度上仍不透明
    • 它们的有效性是有限的,熵仍然只被粗略地控制
  • 本文贡献 :
    • 首次推导出 Token 级熵变化的精确解析近似,揭示了控制熵动态的四个关键因素
      • 基于该理论,统一解释并评估了现有方法的有效性与局限性
    • 提出 STEER(Stabilizing Token-level Entropy-change via Reweighting) ,一种原则性的、细粒度的熵调制方法

Introduction and Discussion

  • RLVR 的一个主要缺陷:熵崩溃(entropy collapse)
  • 本工作对 RLVR 中的熵动态进行了全面的理论和实证分析
    • 仔细审视了每一步训练中细粒度的 Token 级熵变
      • 注:虽然之前的一些工作(2025b)对熵进行了初步探索,但他们的分析依赖于不切实际的假设,导致估计非常不精确(参见第 3 节,Remark 1),并且无法解释现有熵干预方法背后的机制
    • 本文的分析产生了两个主要见解:
      • (1) 推导出了 Token 级熵变的一个精确解析近似,揭示了它由四个关键因素控制
        • 裁剪策略(clipping strategy)、优势(advantage)、Token 概率(token probability)和条件熵(conditional entropy)
        • 进一步阐明了现有方法如何影响这些因素,从而解释了它们的经验成功
      • (2) 识别了先前方法的关键局限性:
        • 它们的启发式调制仅应用于一小部分 Token,忽略了其他可能也经历严重熵崩溃的 Token
        • 而且:它们仅考虑了部分相关因素,这降低了它们的有效性,甚至在某些情况下可能加速熵崩溃
  • 本文引入了 STEER(通过重新加权稳定 Token 级熵变,Stabilizing Token-level Entropy-changE via Reweighting)
    • STEER 是一种简单但基于原则的熵调制方法,植根于本文的理论分析
    • STEER 直接将理论估计的熵变转化为自适应的 Token 级权重
      • 通过降低具有过大熵变的 Token 的权重,STEER 实现了对逐步熵动态的细粒度调制,并有效地引导策略朝向持续探索
    • STEER 评估:
      • 在六个数学推理和三个代码生成基准上实验,STEER 显著且持续地优于最先进的基线方法
      • STEER 还能很好地跨模型规模(1.5B/7B/14B)、模型家族(Qwen/Llama/Mistral)和 RL 算法(GRPO/RLOO/OPO)泛化,持续保持稳定的熵动态并实现更强的性能
  • 主要贡献:
    • 本文推导出了 Token 级熵动态的一个紧致解析近似,揭示了四个控制因素,从而解释了现有启发式熵干预策略的机制
    • 本文提出了 STEER,一种基于理论的熵调制方法,自适应地降低易于发生剧烈熵衰减的 Token 的权重
    • 本文在六个数学推理和三个代码生成基准上全面评估了 STEER,展示了其相对于强基线的优越性,以及跨不同模型和 RL 算法的泛化能力

Preliminaries

RLVR Algorithms

  • 与 PPO 不同, GRPO 通过消除价值模型来减少内存开销,在一个采样组内计算相对优势
    • 令 \(q\) 为从数据集 \(\mathcal{D}\) 中采样的 Query,\(\pi_{\theta}\) 为策略模型
    • GRPO 从参考策略 \(\pi_{\text{old} }\) 中采样一组响应(rollouts)\(\{o_i\}_{i=1}^G\)
    • 对于响应 \(o_i\) 中的第 \(t\) 个 Token \(o_{i,t}\),优势计算如下:
      $$A_{i,t} = \frac{R_i - \text{mean}(\{R_i\}_{i=1}^G)}{\text{std}(\{R_i\}_{i=1}^G)},\tag {1}$$
      • \(R_{i}\in \{1, -1\}\) 表示 \(o_{i}\) 的正确性
      • 此优势 \(A_{i,t}\) 通常对响应内的所有 Token 保持不变
  • 遵循 Token 级公式(2025),GRPO 最大化以下目标:
    $$
    \begin{align}
    \mathcal{J}(\theta) = \mathbb{E}_{q\sim \mathcal{D}, \{o_i\}_{i = 1}^G\sim \pi_{\text{old} }(\cdot |q) } \left[\frac{1}{L}\sum_{i = 1}^{G}\sum_{t = 1}^{|o_i|}\min \left(r_{i,t}A_{i,t}, \text{clip}\left(r_{i,t},1 - \epsilon ,1 + \epsilon\right)A_{i,t}\right)\right].
    \end{align}
    \tag {2}
    $$
    • \(r_{i,t} = \frac{\pi_{\theta}(o_{i,t}|q,o_{i,< t})}{\pi_{\text{old} }(o_{i,t}|q,o_{i,< t})}\) 表示重要性采样比率
    • \(L = \sum_{i=1}^{G}|o_{i}|\) 表示一个组内响应长度的总和
      • 注:这里的 \(L\) 涉及到归一化方式,这里的写法是 DAPO 的设定, 不是原始的 GRPO
    • 注:这里作者遵循 Shao 等人(2024)的做法省略了 KL 散度项,已有研究表明这能带来更好的性能和更广泛的探索(2026;2025)

Policy Entropy of LLMs

  • 香农熵(Shannon entropy)量化了给定状态下策略模型选择动作的不确定性(2018)
  • 对于 LLM,可以在每个 Token 生成步骤量化熵
    • 对于每个采样的响应 \(o_{i}\) 及其第 \(t\) 个 Token 的生成,策略 \(\pi_\theta\) 下的 Token 级熵为:
      $$\mathcal{H}(q,o_{i,< t}) = -\mathbb{E}_{a\sim \pi_{\theta}(\cdot |q,o_{i,< t})}[\log \pi_{\theta}(a\mid q,o_{i,< t})].\tag {3}$$
    • (全局)策略熵衡量模型在 Query 数据集上的生成不确定性(每个 Query 包含一组 Response),可以通过对采样响应上的 Token 级熵进行平均来估计:
      $$\mathcal{H}(\pi_{\theta}) = \mathbb{E}_{q\sim \mathcal{D}, \{o_i\}_{i=1}^G \sim \pi_{\theta}(\cdot|q)}\frac{1}{L}\sum_{i = 1}^{G}\sum_{t = 1}^{|o_{i}|}\mathcal{H}(q,o_{i,< t}).\tag {4}$$
      • 注意:这里是针对一个 Query 的一组 Response 统计的
  • 在实践中,可以使用训练数据集来估计 \(\mathcal{H}(\pi_{\theta})\),经验表明该估计能很好地泛化到未见数据
  • 在 RL 训练期间,维持足够的策略熵对于平衡探索和利用至关重要(2018;2008),但 RLVR 训练经常遭遇熵崩溃,即策略熵迅速下降(2025;2025b;2025b)
    • 这种臭名昭著的现象在两个方面是有害的:
      • (1) 它严重削弱了探索,限制了模型发现信息丰富且可能正确的解决方案的能力
      • (2) 它也破坏了训练效果,对于像 GRPO(2024)这样的基于组的方法,日益同质的 Rollout 产生的相对优势得分 \(A_{i,t}\) 缺乏区分度,导致训练停滞

Analyses on Entropy Dynamics

  • 本节对熵变进行全面的理论和实证分析
  • 本文的研究在细粒度的 Token 级进行,这使得能够精确监控熵动态
  • 为清晰起见,本节主要关注代表性的 GRPO 算法
    • 不失一般性,这些理论结果可以无缝推广到其他高级 RLVR 算法(例如,PPO(2017)、RLOO(2024)和 OPO(2025);参见附录 C.2)
  • 为了定量刻画一次更新后每个 Token 的熵变,本文将 GRPO 策略梯度(公式 (2))重写为:
    $$
    \begin{align}
    \nabla_{\theta}\mathcal{J}(\theta) = \mathbb{E}_{q\sim \mathcal{D}, \{o_i\}_{i = 1}^G\sim \pi_{\text{old} }(\cdot |q) } \left[\frac{1}{L}\sum_{i = 1}^{G}\sum_{t = 1}^{|o_i|}
    \mathbb{I}_{\text{clip} }r_{i,t}A_{i,t}\nabla_{\theta}\log \pi_{\theta}(o_{i,t}\mid q,o_{i,< t}) \right]
    \end{align}
    \tag {5}
    $$
    • 其中裁剪指示器 \(\mathbb{I}_{\text{clip} }\) 源自比率裁剪操作,定义如下:
      $$\mathbb{I}_{\text{clip} } = \left\{ \begin{array}{ll}0, & A_{i,t} > 0 \text{ and } r_{i,t} > 1 + \epsilon ,\\ 0, & A_{i,t} < 0 \text{ and } r_{i,t} < 1 - \epsilon ,\\ 1, & \text{ otherwise }. \end{array} \right.
      \tag {6}
      $$
    • 为简化符号,将状态(即上下文)表示为 \(s\triangleq (q,o_{i,< t})\),并缩写 \(\pi_{\theta}(a\mid s)\) 为 \(\pi_{\theta}\),\(A(s,a)\) 为 \(A\)
  • 然后本文推导出以下关于 Token 级熵变的定理
  • 定理 1 (Token 级熵变,Token-level Entropy Change)
    • 对于一个使用 GRPO 训练、学习率为 \(\eta\) 的 Logit 独立(logit-independent)策略模型 \(\pi_{\theta}\),在状态 \(s\) 上,连续两步之间的 Token 级熵变可以近似为:
      $$\Omega (s)\triangleq -\frac{\eta}{L}\mathbb{E}_{\pi_{\theta}(\cdot |s)}\Big[\frac{\mathbb{I}_{\text{clip} }A}{\pi_{\text{old} } }\pi_{\theta}(1 - \pi_{\theta}) \big(\log \pi_{\theta} + \mathcal{H}(s)\big)\Big] \tag {7}$$
      • 并且近似误差以 \(O(\eta^{2})\) 为界
      • 理解:其中的 \(\pi_\theta(1-\pi_\theta) = \pi_\theta(o|s)(1-\pi_\theta(o|s))\),即:
        $$
        \Omega (s) \triangleq -\frac{\eta}{L}\mathbb{E}_{a \sim \pi_{\theta}(\cdot |s)}\Big[\frac{\mathbb{I}_{\text{clip} }A}{\pi_{\text{old}} (a|s)}\pi_{\theta}(a|s)(1 - \pi_{\theta}(a|s)) \big(\log \pi_{\theta}(a|s) + \mathcal{H}(s)\big)\Big]
        $$
    • 证明见附录 G
    • 该定理并非 GRPO 特有,也适用于其他算法(参见附录 C.2)
  • 关于定理 1 ,本文强调三个重要 Remarks:
  • Remark 1:Accurate Estimator :
    • 在实践中,由于学习率 \(\eta\) 通常很小 \((< 10^{-4})\),定理 1 提供了一个 Token 级熵动态的精确闭式估计器
    • 先前的工作 (Clip-Cov & KL-Cov)The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models, 20250528, Shanghai AI Lab & THU 也探索了熵变,但它假设同一批次内不同 Query 的熵分布是均匀的
      • 这个假设在实践中很少满足,导致对真实熵变的近似不准确
      • 将本文的熵变估计与他们的估计(表示为 Cov)在标准 GRPO 训练过程中进行比较
    • 表 1 报告了真实熵变与估计值之间的均方误差(MSE)、皮尔逊相关系数(PCC)和斯皮尔曼等级相关系数(SRCC)
      • 在所有三个指标上,本文方法都比 Cov 实现了数量级更低的 MSE 以及显著更高的 PCC 和 SRCC
        • 本文估计器的 MSE 在 1e-4 量级,展示了其卓越的精度
  • Remark 2:Four Governing Factors :定理 1 表明,Token 级熵变由多个因素共同决定:
    • 裁剪指示器 \(\mathbb{I}_{\text{clip} }\),它防止具有过大或过小重要性采样比率的 Token 的熵变
    • 优势 \(A\) 和旧策略项 \(\pi_{\text{old} }\),它们作为熵变的加权因子
    • Token 生成概率 \(\pi_{\theta}\)
    • 当前状态的 Token 熵 \(\mathcal{H}(s)\)
      • \(\pi_{\theta}\) 和 \(\mathcal{H}(s)\) 对熵变的贡献可以用以下函数表示:
        $$\delta (\pi_{\theta},\mathcal{H})\triangleq -\pi_{\theta}(1 - \pi_{\theta})\left[\log (\pi_{\theta}) + \mathcal{H}(s)\right].\tag {8}$$
        • \(\pi_{\theta}\) 和 \(\mathcal{H}(s)\) 对函数 \(\delta (\pi_{\theta},\mathcal{H}(s))\) 的影响如图 1 所示
  • Remark 3 (熵变方向,Entropy Change Direction) :本文进一步研究熵变的方向(增加或减少),这由优势(advantage)和 Token 概率(token probability)的联合效应控制
    • 鉴于对于高概率 Token,函数 \(\delta (\pi_{\theta},\mathcal{H})\) 取负值,而对于低策略概率 Token 取正值,作者将这种联合效应概念化为图 2 所示 \((A,\pi_{\theta})\) 空间中的四个定性象限:
      • 象限 I(利用,熵减) :\( A > 0, \delta < 0 \)
        • 高概率的正确 Token 被强化,分布更集中,熵减少
        • 奖励一种专门化的行为会集中概率质量,从而减少熵
      • 象限 II(探索,熵增) :\( A > 0, \delta > 0 \)
        • 低概率的正确 Token 被鼓励,分布更多样,熵增加
        • 奖励一种罕见但正确的行为会使策略多样化,从而增加熵
      • 象限 III(抑制,熵减) :\( A < 0, \delta > 0 \)
        • 低概率的错误 Token 被惩罚,分布更集中,熵减少
        • 惩罚罕见行为会进一步集中概率质量,从而减少熵
      • 象限 IV(纠错,熵增) :\( A < 0, \delta < 0 \)
        • 高概率的错误 Token 被惩罚,分布被“压平”,鼓励探索替代方案,熵增加
        • 惩罚过度自信的错误会使分布变得平坦,以鼓励寻求替代方案,这往往会增加熵
      • 理解:这里没有明确定义高熵和低熵的具体数值,详情见本人之前的推导:Math——多项式分布下的熵变化详细讨论
        • 前提:在 Softmax 分布下调整单一类别的概率
          • 1)如果调整的类别概率非常大(大于 \(0.5\)),压低它必然增熵 ,提升它必然减熵
          • 2)如果调整的类别概率非常小(小于 \(1/n\)),提升它必然增熵 ,压低它必然减熵
          • 3)如果它的概率处于中间地带(在 \(1/n\) 到 \(0.5\) 之间),需要计算剩余类别的熵 \(H_\text{rest}\) 来确定临界点 \(p^*\),再判断它是减熵还是增熵
    • 注:本文进一步通过对每个象限中的样本进行干预来进行实证分析
      • 实证观察与理论发现高度一致*(可参考附录 D.3 了解更多细节和结果)
    • 在 RLVR 过程中,这四个象限级别的动态作为塑造策略的竞争力量共存
      • 全局策略熵源于这些竞争性更新的综合效应
      • 因此,熵崩溃可以被理解为一种状态,即由利用驱动的、减少熵的更新(象限 I 和 III)持续地压倒了由探索驱动的、增加熵的更新(象限 II 和 IV)
    • 个人理解 全局熵崩溃的本质 :当熵减象限(I 和 III)的更新强度持续压倒熵增象限(II 和 IV)时,全局熵就会持续下降,导致崩溃

Analyses on Existing Entropy Intervention Methods

  • 基于上述理论发现,本节对现有的熵干预技术进行全面分析,以揭示其内在机制和局限性

Entropy Effect of Clip-Higher

  • DAPO 将下裁剪边界和上裁剪边界解耦为 \(\epsilon_{\text{high} }\) 和 \(\epsilon_{\text{low} }\),并表明增大 \(\epsilon_{\text{high} }\) 可以缓解熵坍缩
  • 其内在机制可以解释如下:
    • 从重要性比率 \(r = \frac{\pi_{\theta} }{\pi_{\text{old} } }\) 来看,当 \(\pi_{old}\) 相对较小时,该比率更可能取较大的值
      • 因此,裁剪主要针对低概率 Token 触发,这一点在作者图 3a 中的实证观察中得到了证实,该图统计了 GRPO 前 10 步中的裁剪事件
    • 在这种情况下,通过 \(\epsilon_{\text{high} }\) 进行的裁剪充当了一个过滤器,移除了相当数量的低概率正样本,这些样本通常属于第二象限
      • 因此,增大 \(\epsilon_{\text{high} }\) 会减少被过滤的实例数量,允许更多样本对熵增做出贡献,从而缓解坍缩
    • 类似的推理也适用于 \(\epsilon_{\text{low} }\) 的作用:
      • 增大 \(\epsilon_{\text{low} }\) 会减少对第三象限实例的过滤,这反过来会加剧熵坍缩
  • Empirical Evidence
    • 本文通过实证实验进一步验证了这些观察
      • 图 3b 和图 3c 展示了改变 \(\epsilon_{\text{high} }\) 和 \(\epsilon_{\text{low} }\) 的影响
      • 观察结果:增大 \(\epsilon_{\text{high} }\) 可以缓解甚至逆转熵坍缩,而增大 \(\epsilon_{\text{low} }\) 则会加剧坍缩
  • Limitation:
    • 调整裁剪阈值对熵动态的影响可以解释为对图 2 中第二象限和第三象限 Token 的重新加权
    • 但这种启发式方法仍然是粗粒度的:例如,DAPO 试图通过控制第二象限中某些 Token 的更新来影响熵,而没有显式控制其他象限的 Token

Entropy Effect of Re-weighting Positives

  • 近期研究表明,对正样本进行重新加权可以缓解熵坍缩,例如
    • Unlikeliness (2025a) 对第二象限的 Token 进行上加权(增强熵增),对第一象限的 Token 进行下加权(降低熵减)
    • W-REINFORCE (2025) 则在训练中对所有正样本进行下加权
  • Unlikeliness 的效果从图 2 中可以清晰地看出:它增强了熵增象限,削弱了熵减象限,从而增加了 Policy 熵
  • W-REINFORCE 认为 Token 级别的更新由高概率 Token 主导,因为它们更有可能被采样
    • 因此,对所有正样本进行下加权主要削弱了来自第一象限的熵减贡献,从而增加了 Policy 熵
    • 理解:这里对正样本进行降权的操作本质上也会对第二象限进行降权,但是这里应该是对第二象限的影响不如第一象限导致熵增
  • Empirical Evidence
    • 本文在 GRPO 设置中进行了仅正样本和仅负样本的实验,其中 Policy 模型分别仅使用正样本或仅使用负样本进行训练
    • 结果如图 3d 所示,与前面分析一致:
      • 仅在正样本上训练会迅速导致 Policy 熵坍缩
      • 仅在负样本上训练则能持续保持高熵
  • Limitation:
    • 虽然这些正样本重加权方法改善了全局熵,但它们仅对 Token 的一个子集进行重新加权,使得其余 Token 仍然容易发生熵坍缩

Entropy Effect of Entropy-aware Advantage

  • 一些研究提出将熵相关项纳入优势函数以缓解熵坍缩,例如 Entro. Adv. (2026) 和 GTPO (2025)
    • 这些方法为具有较高熵的 Token 分配较大的优势
    • 但本文发现表明这些方法并非普遍有效
      • 事实上,它们有时会加剧而非缓解熵坍缩
  • Mechanism:
    • 基于公式 (8),在图 4a 中绘制了 \(\delta (\pi_{\theta}, \mathcal{H})\) 作为 \(\mathcal{H}\) 的函数
      $$\delta (\pi_{\theta},\mathcal{H})\triangleq -\pi_{\theta}(1 - \pi_{\theta})\left[\log (\pi_{\theta}) + \mathcal{H}(s)\right].\tag {8}$$
    • 可以推断,高熵 Token 倾向于引起较大的熵变
      • 这一机制在图 4b 的训练过程中的经验行为得到了证实,该图跟踪了前 50 个训练步骤的平均熵变:
        • 具有较高熵的 Token 表现出较大的熵变
          • 因此,为高熵 Token 分配更大的优势可能会放大它们的熵变
          • 理解:这里的高熵 Token 并不是一个特定的 Token,而是针对一个特定的前缀而言的策略熵 \(\mathcal{H}(s)\)
        • 当 Policy 进入熵减阶段时,这种放大效应会加剧而非缓解坍缩
  • Empirical Evidence
    • 通过检查图 5 中这些方法的熵动态来验证这一机制:
      • 与 GRPO 相比,当 Policy 进入熵减阶段时,Entro. Adv. 和 GTPO 都表现出更快的熵坍缩
      • 当 Policy 熵开始下降时,这些方法甚至可能加速熵坍缩
  • Limitation:
    • 这一发现揭示了这些方法的一个缺陷:
      • 它们并非可靠地鼓励探索,反而可能加剧熵的下降

Limitations of Existing Methods

  • 虽然上述熵干预策略在实践中可以部分缓解熵坍缩,但它们在很大程度上仍是启发式的,缺乏原则性指导
  • 这些策略仅对公式 (7) 中的一个或两个因素进行定性调整,如表 2 所示,而忽略了其他相关因素,未能捕捉它们对熵动态的联合影响
    $$\Omega (s)\triangleq -\frac{\eta}{L}\mathbb{E}_{\pi_{\theta}(\cdot |s)}\Big[\frac{\mathbb{I}_{\text{clip} }A}{\pi_{\text{old} } }\pi_{\theta}(1 - \pi_{\theta}) \big(\log \pi_{\theta} + \mathcal{H}(s)\big)\Big] \tag {7}$$
  • 它们的干预与实际训练中观察到的熵演化之间存在显著差距,其有效性受到了损害

Stabilizing Token-level Entropy-change via Reweighting,通过重新加权稳定 Token 级别的熵变

  • 本文提出一种细粒度的、有理论依据的方法 STEER
  • STEER 的核心思想是直接利用理论估计的熵变(entropy change) \(\Omega (s)\),将其转换为自适应的 Token 级别缩放权重 \(\lambda (s)\),并融入每个 Token 的损失函数中
  • 对于容易发生剧烈熵衰减的 Token,STEER 主动削弱其梯度贡献,将其熵变从 \(\Omega (s)\) 近似调节为 \(\lambda (s)\Omega (s)\)
  • 这一机制使 STEER 能够执行精确的 Token 级别熵调制,超越了先前方法对全局期望的粗粒度监控
  • 为了实现这一点,本文通过一个简单的指数衰减函数引入 \(\lambda (s)\):
    $$\lambda (s) = \exp \left(-\alpha \frac{|\Omega(s)|}{\max_{s\in B}|\Omega(s)|}\right),\tag {9}$$
    • \(\alpha > 0\) 是控制衰减率的超参数
    • \(B\) 是当前批次的所有 Token 粒度的熵变
    • 该公式满足两个期望特性:
      • (1) 它相对于归一化熵变是单调递减的
      • (2) 指数形式确保所有权重严格为正
    • 这里应用绝对值 \(|\Omega (s)|\) 来衡量熵变的大小,因为大的熵增也可能是次优的
      • 将增加和减少都控制在稳定范围内可以实现更稳定的训练动态
    • 通过批次最大值进行归一化确保了数值稳定性
    • 超参数 \(\alpha\) 控制衰减曲线的斜率
      • \(\alpha\) 决定了最小可达到的权重 \(\lambda_{\min} = \exp (-\alpha)\)
    • 公式 (9) 可以解释为将熵变逆映射到范围 \([\lambda_{\min}, 1]\) 内,熵变越大对应的权重越小
    • 在实践中,调整 \(\lambda_{\min}\) 比调整 \(\alpha\) 更方便,因为它具有更好的可解释性
  • STEER 还具有显著的实用优势,计算成本极低,并且可以轻松集成到现有方法中
    • STEER 仅涉及 \(\Omega (s)\) 的额外计算,其复杂度可以忽略不计
    • STEER 可以无缝应用于各种 LLM 架构和 RL 算法
  • 理解:公式 9 的本质是,熵变越大的(容易发生剧烈熵衰减的)Token,削弱起贡献(Advantage),详细示例见图 9

Experiments and Results

  • 从以下几个方面评估 STEER
    • 首先在六个数学推理基准和三个代码基准上将 STEER 与强基线进行比较
    • 其次检查 STEER 在 RLVR 训练中的熵控制能力
    • 最后测试 STEER 在多种模型规模、模型家族和 RL 算法上的泛化能力
  • 更多结果参见附录 F

Experimental Setup

Training
  • 遵循 verl (2025) 中标准 GRPO 的默认训练方案
    • 为了公平比较,严格遵循近期工作 (2025; 2025a) 中使用的实验设置
  • STEER 引入的唯一超参数 \(\lambda_{\min}\) 设置为 0.7
  • 为确保可靠性,主要实验中报告的所有结果均为两次独立训练运行的平均值
  • 对于数学推理任务
    • 在四种不同的模型上进行实验,包括 Qwen2.5-Math-1.5B/7B、Qwen2.5-14B (2024a) 和 Llama-3.2-3B (2024)
    • 在 DAPO-Math-17k (2025) 上进行训练,该数据集包含 17K 个 Prompt,每个 Prompt 都配有一个 ground-truth 整数答案
  • 对于代码任务
    • 在四种不同的模型上进行对比实验,包括 Qwen2.5-Coder-3B/7B/14B (2024) 和 Mistral-7B (2023)
    • 对于代码生成任务,采用 ArcherCoderR 进行训练
    • 对于代码编辑任务,由于没有大规模开源数据集可用,采用内部的实用代码编辑基准进行训练
Evaluation
  • 对于数学推理任务,在六个广泛使用的数学推理基准上评估作者的模型和基线:AIME24、AIME25、AMC23、MATH-500、Minerva Math 和 OlympiadBench
  • 对于代码生成任务,采用广泛使用的 LiveCodeBench v5 (2024) 进行评估
    • 代码生成任务报告 avg@4,遵循 (2025b)
    • 对于代码编辑,在内部保留的测试集划分和 Zeta (Zed Industries, 2025) 上评估模型
      • 报告代码编辑任务的 exact-match 准确率
    • 本文方法及基线的更多训练和评估细节列于附录 E
Baselines
  • 为了进行全面的比较,在数学推理任务上将 STEER 与 11 个基线进行比较,包括
    • 标准 GRPO (2024)
    • SimpleRL-Zoo (2025)
    • Eurus-PRIME (2025a)
    • OPO (2025)
    • 带 clip-high 的 GRPO (2025)
    • 带熵损失的 GRPO (2017)
    • 带 Fork Tokens 的 GRPO (2025c)
    • W-REINFORCE (2025)
    • Entro. Adv. (2026)
    • Clip-Cov 和 KL-Cov (2025b)
  • 在代码任务上,将 STEER 与 GRPO 进行比较
  • 对于所有基线,RLVR 中的默认训练超参数与 STEER 保持一致,而新引入的超参数则按照原始实现进行配置,详见附录 E.2

Main Results

Math Reasoning Tasks
  • 数学推理任务的主要结果如表 3 所示
    • STEER 在所有数据集上都优于经典的 RLVR 基线和现有的熵干预基线
      • 问题:为什么 添加了熵优化的 Clip-Cov 和 Entro. Adv. 等还比不过 标准的 GRPO?
      • 注:看起来 STEER 也没有比 GRPO 好太多
    • STEER 在所有基线中,平均性能比第二名 (OPO) 提高了 2.2 个百分点,比第三名 (Clip-Cov) 提高了 2.9 个百分点
  • 在 Qwen2.5-14B 上的性能实验如表 4 所示,与表 3 中的前三名竞争者(即 OPO、Clip-Cov 和 Entro. Adv.)进行了比较
    • STEER 也持续取得了最高的平均性能,展示了其在提升数学推理能力方面卓越的泛化能力
  • 除了表 3 中的指标 avg@32 和 avg@1,数学推理中的 Pass@256/512/1024 结果如图 6 所示
    • 可以观察到,STEER 在 AIME24/25 上均提供了最佳的 Pass@256/512/1024 以及最高的平均值
    • 通过显式地调节熵,STEER 保留了足够的探索能力以发现更多信息丰富的轨迹,从而实现了更好的性能
Coding Tasks
  • 表 5 将 STEER 与 GRPO 在三个 Qwen2.5-coder 模型上进行了比较
    • 在每个模型和测试集上,STEER 都比 GRPO 至少高出 \(1%\)。这些结果展示了 STEER 在各种场景下的优越性能
    • 更多性能评估详见附录 F
Training Dynamics
  • 图 7 显示了训练过程中的测试准确率曲线
  • STEER 呈现出稳定的上升轨迹,最终取得了相比基线更优的最终性能
  • 理解:只训练了 150 步,有点短,因为本文的方案理论上可能会影响学习率,所以或许会有一定影响

Empirical Results for Entropy Modulation

  • 为了更好地展示 STEER 在广泛范围内调节熵的能力,本文采用了一种极端的训练设置
    • \(\epsilon_{\text{high} } = 5\) 且 \(\epsilon_{\text{low} } = 0.99\),此时几乎不应用比率裁剪
  • 在这种情况下,由于极端裁剪比率下不稳定的梯度更新,RL 训练是脆弱的
  • 结果如图 8 所示
    • 大多数方法无法维持稳定的熵:
      • GRPO 和 Entro. Adv. 倾向于熵坍缩
      • 添加熵损失会迅速推高熵,导致过度的不确定性
      • Clip-Cov 无法可靠地控制熵
      • STEER 在初始下降后趋于稳定,并在此后保持稳定的熵
  • 本文在此训练设置下测试了熵干预方法,测试集准确率如表 6 所示
    • 观察:即使在裁剪操作几乎完全被移除的训练场景中,STEER 相比其他熵干预方法仍能保持相对稳定的性能,并在所有测试集上取得了最高的准确率
  • 图 9 描绘了前 10 步中平均 Token 权重随绝对 Token 熵变变化的趋势
    • 当熵变较小时,大多数权重保持在 1 附近
    • 只有熵变较大的 Token 获得显著降低的权重,这表明 STEER 在不阻碍学习的情况下稳定了训练

Generalization Study

  • 在额外的 Backbone 上进行了实验,包括用于数学推理的 Llama-3.2-3B-Instruct (2024) 和用于代码编辑的 Mistral-7B-v0.3 (2023)
    • 对于每项任务,使用与主要实验相同的 STEER 超参数,而不是针对每个 Backbone 重新调整
    • 结果见附录 F.3,STEER 产生了一致的性能提升
  • 本文还评估了 STEER 在不同模型规模(包括 1.5B/7B/14B)下的性能
    • 如表 3、表 4 和附录 F.3 所示, STEER 在多种模型规模下都表现出优越的性能
  • 在另外两种代表性的 RL 算法 RLOO (2024) 和 OPO (2025) 上评估了 STEER,使用 verl 实现中的默认设置
    • 结果也显示在附录 F.3 中
    • STEER 将 RLOO 的平均分从 \(45.8\) 提高到 \(46.8\),将 OPO 的平均分从 \(46.4\) 提高到 \(47.5\),表明 STEER 可以有效地应用于其他 RLVR 算法,而不仅限于 GRPO

Limitations

  • 待探索的方向:
    • 没有可验证奖励的 RL 训练
    • Agentic 和 Long-Horizon RL

附录 B:Related Work

B.1 Reinforcement Learning with verlfiable Rewards in LLMs

  • RLVR
  • GRPO
  • PPO
  • DeepSeek-R1

B.2 Entropy-Oriented RL Methods for LLM Reasoning

  • 熵正则化 (2016;2018;2023;2025;2023b) 是传统 RL 中的早期工作,可能会在关键状态下误导动作选择 (2025c),并且已被证明在 LLM 训练中对系数高度敏感 (2026;2025b;2025c;2024b;2025b;2026a;2026)
  • 部分工作 (2025b) 认为 KL 惩罚保留了熵并充当正则化器,确保在线策略接近稳定的参考策略,从而稳定学习并减少对误导性奖励信号的过拟合
    • 在本文的工作中,排除了当前策略 \(\pi_{\theta}\) 与参考策略 \(\pi_{\text{ref} }\) 之间的 KL 散度项
      • 因为近期工作 (2025;2026;2025) 表明,在推理任务中其实际影响通常可以忽略不计甚至适得其反
  • 一种解决熵崩溃的典型方法是在推理过程中提高采样温度
    • 但部分研究 (2025) 的最新发现表明,虽然这种方法可以推迟熵崩溃的发生,但并不能阻止它,因为熵在整个训练过程中持续下降
  • 近期研究试图通过调整策略优化的关键要素来缓解熵崩溃
    • 例如 PPO 风格的比率裁剪 (2025;2025a)、平衡正负样本 (2025) 以及应用 KL 正则化 (2025b)
    • 但这些方法较为宽泛,缺乏 Token 级别的精细控制,其机制往往未能以统一或有原则的方式得到充分解释
  • 一些方法尝试通过基于熵的优势函数 (2026;2025;2025c;2025b;2025) 来鼓励探索
    • 其直觉是强调不确定的状态将促进探索并提高整体策略熵
    • 但在实践中,作者发现这种设计通常无法可靠地缓解熵崩溃,因为它不成比例地增强了高熵 Token 上的学习,从而放大了熵变化,导致熵控制不可靠
  • 尽管先前的工作 (2025b) 考虑了熵变化,但由于其不合理的状态等价假设,所得估计存在偏差
    • 其熵控制方案存在两个问题:
      • (i) 根据熵变化强制执行硬性的二元分割,而不考虑其组内差异
      • (ii) 可能阻碍学习过程,因为对探索有信息量的高熵变化 Token 被过度惩罚

附录 C:Formulations of Entropy Shaping

C.1 A Unified Token-level Gradient Reweighting Framework

  • 现有的熵干预方法尽管设计多样,但都通过修改单一量来运作:Token 级梯度权重
    • 这一统一视角直接联系到定理 1 中确定的四个控制因素
  • 广泛 RL 算法族的策略梯度可以表达如下:
    $$
    \begin{align}
    \nabla_{\theta}\mathcal{J}(\theta) = \mathbb{E}_{q\sim \mathcal{D}, \{o_i\}_{i = 1}^G\sim \pi_{\text{old} }(\cdot |q) } \left[\frac{1}{\sum_{i=1}^{G}|o_i|}\sum_{i = 1}^{G}\sum_{t = 1}^{|o_i|}
    w_{i,t}(q)\nabla_{\theta}\log \pi_{\theta}(o_{i,t}\mid q,o_{i,< t}) \right]
    \end{align}
    \tag {10}
    $$
    • 其中 \(w_{i,t}(q)\) 为:
      $$ w_{i,t}(q) = \mathbb{I}_{\text{clip} }r_{i,t}A_{i,t} + \beta \mathcal{R}(\pi_{\theta}) $$
      • \(r_{i,t}\) 表示重要性采样比率:
        $$ r_{i,t} = \frac{\pi_{\theta}(o_{i,t}|q,o_{i,< t})}{\pi_{\text{old} }(o_{i,t}|q,o_{i,< t})} $$
      • 优势 \(A_{i,t}\) 通过奖励 \(R_{i,t}\) 计算
      • 裁剪指示器 \(\mathbb{I}_{\text{clip} }\) 源自比率裁剪操作,定义如下:
        $$\mathbb{I}_{\text{clip} } = \left\{ \begin{array}{ll}0, & A_{i,t} > 0 \text{ and } r_{i,t} > 1 + \epsilon ,\\ 0, & A_{i,t} < 0 \text{ and } r_{i,t} < 1 - \epsilon ,\\ 1, & \text{ otherwise }. \end{array} \right.
        \tag {6}
        $$
      • \(\mathcal{R}(\pi_{\theta})\) 是一个可选的正则化项,一些算法设置 \(\beta = 0\)
        • 例如本文主要部分的 GRPO
  • 表 7 将每种现有的熵干预方法映射到其对 \(w_{i,t}\) 的具体修改
    • 这些方法仅调整四个控制因素中的一部分,这既解释了它们的部分有效性,也说明了它们固有的局限性
  • 问题:KL Penalty 和 Entropy Regularization 应该是单独的,与目标相对隔离的吧,不会刚添加到 Advantage 那个位置,表 7 中的写法有些问题

C.2 Theoretical Analyses Extended to Other RL Algorithms

  • 虽然本文的主要理论分析是在 GRPO 更新下呈现的,但它们不仅限于 GRPO,还可以扩展到其他策略梯度 RL 算法
  • 本文的推导基于策略梯度的公式化表达,并且可以通过基于公式 (10) 进行微小修改,将 GRPO 策略梯度表达式调整为其他方法
  • 不同的 RL 算法可以通过以下方式恢复:
    • GRPO (2024) : \(A_{i,t} = A_{\text{group} }\)
    • PPO (2017) : PPO 与 GRPO 共享相同的裁剪比率结构;区别在于优势估计器 \(A_{i,t} = A_{\text{GRE} }\)
    • RLOO (2024) : 它是 REINFORCE 风格的算法,带有留一法 (leave-one-out) 基线,即 \(r_{i,t} = 1\) 且
      $$A_{i,t} = R_{i} - \frac{1}{G - 1}\sum_{j\neq i}R_{j}\tag {12}$$
    • OPO (2025) : 它是一种具有最优奖励基线的 On-policy RL 算法,因此通常 \(r_{i,t} = 1\) 且 \(A_{i,t}\) 是基线校正后的优势
  • 将上述广义策略梯度形式代入定理 1 的证明中,可以得到相应的广义熵变估计量:
    $$\begin{array}{r}\Omega (s) = -\frac{\eta}{L}\mathbb{E}_{\pi_{\theta}(\cdot |s)}\Big[\mathbb{L}_{\text{clip} }r_{i,t}A_{i,t}\ \pi_{\theta}(1 - \pi_{\theta})(\log \pi_{\theta} + \mathcal{H}(s))\Big]. \end{array}\tag {13}$$
  • 这表明,对于多种 RL 算法,可以在同一分析框架内推导出统一的熵变估计量,具体优势函数的选择由上述定义给出
    • 因此,为 GRPO 开发的理论见解也适用于其他 RL 算法

附录 D:Supplementary Empirical Analysis for RLVR Entropy

D.1 Empirical Properties of Policy Entropy

  • 本小节展示了 RLVR 中策略熵动态的几个基本经验特性,提供了训练期间熵行为的一个整体视图
  • 图 10 总结了 RLVR 中策略熵的几个经验特性
    • 首先,批次间的连续性(图 1)显示,在标准 GRPO 运行下,策略熵逐步平滑衰减,熵崩溃表现为一个渐进趋势而非突然跳跃
    • 其次,对模型的依赖性(图 2)比较了不同的骨干网络(例如,Qwen2.5-Math-1.5B / 7B 对比 Qwen2.5-7B),并揭示虽然所有模型最终都会经历熵崩溃,但初始水平和衰减速度随模型大小和预训练情况而变化
    • 第三,对数据集的依赖性(图 3)表明,在不同数学数据集(Math-3to5, DAPO-MATH, DeepScaleR)上训练会导致不同的熵曲线,表明熵动态也受数据分布和难度的影响
    • 最后,域内一致性(图 11)显示,在固定训练运行中,在同一领域(Minerva, AMC23, AIME24, AIME25)的多个测试集上测量的熵遵循高度相似的单调递减轨迹,意味着一个单一的全局熵趋势控制着广泛的任务
    • 总结:这些观察结果提供了在应用任何额外干预之前,策略熵在 RLVR 中整体表现的概况

D.2 Entropy Change Estimation Comparison

  • 正文中表 1 在三个指标上的对比结果强力验证了定理 1 中推导的估计器的有效性
  • 这里记录了不同模型和数据集在最初 10 个训练步骤中的 Token 熵变化
  • 图 12 和图 13 显示了在数据集 DAPO-Math-17k 上的结果
    • 曲线表示估计值与真实熵变(左轴),直方图显示每个区间的 Token 数量(右轴)
      • 横轴是预估值,纵轴左边是预估值,可以看到本文的方法预估值和真实值呈现正相关关系(但是似乎不是很准确,比如预估值为 0.1 时的真实值偏低)
    • 可以看出,本文方法展现出与真实熵变明显的正相关性,这有力地支持了作者的理论框架
    • 相比之下,Cui (2025b) 中的估计方案没有显示出明确的相关性

D.3 Influencing Entropy Dynamics by Strengthening or Weakening the Quadrants,通过增强或减弱象限来影响熵动态

  • 本节探究这些关于象限层面趋势的理论发现是否可用于在实践中主动引导熵
  • 根据上述象限层面趋势,本文设计了一个简单的干预措施,对每个象限中 \(10%\) 的 Token 进行操作以增加熵:
    • 对于增加熵的象限(II 和 IV),将其更新权重加倍,而对于减少熵的象限(I 和 III),屏蔽其更新,然后跟踪得到的策略熵
验证 1
  • 如图 14 所示,与标准 GRPO 基线相比,所有四种干预措施均一致地提高了策略熵,支持了本文的分析
    • 具体设定:
      • 随机选择生成概率大于 0.8 且优势大于 0 的样本(第一象限),以及生成概率小于 0.2 且优势小于 0 的样本(第三象限),并随机屏蔽 \(10%\) 的这些 Token
      • 对于生成概率大于 0.8 且优势小于 0(第四象限),或生成概率小于 0.2 且优势大于 0 的样本(第二象限),将 \(10%\) 的这些 Token 的权重设置为原始权重的两倍
验证 2
  • 为了进一步验证图 2 中关于优势与概率的熵变模式,以不同强度增强(提升权重)或削弱(屏蔽)四个象限中的每一个,以分别诱导熵增加或减少
    • 与图 14 中干预 \(10%\) Token 的设置不同,在此提供了更全面的验证
  • 图 15 显示了以标准 GRPO \((\epsilon_{\text{high} } = 0.2, \epsilon_{\text{low} } = 0.2)\) 为基线,对每个象限应用旨在增加熵的干预措施
  • 图 16 以带高裁剪的 GRPO \((\epsilon_{\text{high} } = 0.28, \epsilon_{\text{low} } = 0.2)\) 为基线,展示了旨在降低熵的干预措施
  • 基本结论:
    • 在每种情况下,被屏蔽或上权重的 Token 比例从 \(5%\) 到 \(20%\) 不等
    • 在所有情况下,可以观察到 Token 级干预对熵的影响与本文的定量分析框架一致,并且随着干预比例的增加(从 \(5%\) 到 \(20%\) ),影响变得更加显著

D.4 Entropy Effect of Clipping Operation

  • 本小节调整 GRPO 中的裁剪阈值来引导熵变化,并评估不同熵水平下的 RLVR 性能
  • 裁剪操作引起的熵动态如正文图 3b 和 3c 所示
    • 高裁剪(即 \(\epsilon_{\text{high} }\) ):
      • 所有设置在早期阶段熵都下降
      • 较大的 \(\epsilon_{\text{high} }\) 会在后期导致明显的熵反弹和持续增长
      • 小的 \(\epsilon_{\text{high} }\) 则导致持续衰减和低最终熵
    • 低裁剪(即 \(\epsilon_{\text{low} }\) ):
      • 行为更加分化
        • 当 \(\epsilon_{\text{low} } = 0.1\) 时,熵在训练过程中单调增加
        • 当 \(\epsilon_{\text{low} } \geq 0.2\) 时,驱使熵迅速趋向(接近)零,显示出更强的熵崩溃倾向
  • 不同裁剪操作下的平均数学推理性能报告在表 10 中
    • 在熵崩溃和熵爆炸情况下性能均会下降,而将熵维持在一个稳定范围内则能持续获得更好的结果
    • 这凸显了稳定熵动态的重要性,这与本文提出的 STEER 方法一致
  • 为什么大的熵增长会损害训练?
    • 这种现象可以解释如下:过高的熵使得策略过于随机,降低了采样到能提供有效训练信号的信息丰富推理轨迹的可能性
    • 在 GRPO 风格的训练中,这可能导致大部分 Rollout 获得接近零的奖励,阻碍优化
      • 先前的工作 (2025a) 也对“熵爆炸”提出了类似的担忧
    • 理解:熵太大说明模型本身就没有收敛,Pass@1 的分数不会太高

附录 E:Training Settings

E.1 Detailed Information for Dataset

  • 详情见图表

E.2 作者的方法及基线的训练细节 (Training Details for Our Method and Baselines)

  • 所有算法均基于 veRL 框架内的官方 GRPO 代码库实现
Training settings
  • 生成 Batch Size :512;更新 Batch Size :32;Rollout 数量 :每组 8 个
  • 训练中移除了 KL 散度项和熵损失项(遵循 DAPO 和 DeepScaleR 的做法)
  • Temperature:1.0
  • Top-p:1.0
  • 学习率:1e-6 ,无 Warm-up
  • 最大输入/输出长度:
    • 数学任务为 1024/3072
    • 代码编辑任务为 4096/1024
  • 训练最多 200 个 Rollout 步,每 10 步保存一次 Checkpoint,并选择在 AIME24 上准确率最高的 Checkpoint 进行最终测试
  • 所有实验在配备 NVIDIA H20 GPU 的集群上进行
Evaluation settings
  • 使用 Math-Verify 和 Qwen-Verify 进行验证和最终评估
  • 所有评估均为 Zero-shot ,无额外 Prompt
  • 采样温度:1.0;Top-p:0.7
Specific settings for baselines
  • 表 3 报告了主要结果,本小节详述了所有比较基线的训练设置
  • GRPO :遵循官方 VeRL 训练配方,所有超参数保持不变
  • SimpleRL-Zoo :采用官方仓库的训练配方,但将训练数据替换为 DAPO-Math-17k
  • Eurus-PRIME :直接使用在 Qwen2.5-Math-7B 上训练的公开 Checkpoint
  • OPO :遵循 VeRL 中的参考实现,无新增超参数
  • GRPO w/ clip-high :设置上裁剪阈值 \( \epsilon_{\text{high} } = 0.28 \),其余与 GRPO 一致
  • GRPO w/ Entro. Loss :添加熵损失项,在 \( \{0.01, 0.001, 0.0001\} \) 中调优权重并报告最佳结果
  • GRPO w/ Fork Tokens :仅对熵最高的 Top 20%/30%/40% Token 使用策略梯度,报告最佳配置
  • W-REINFORCE :对正样本分配降低的权重,在 \( \lambda \in \{0.1, 0.2\} \) 中调优并报告最佳结果
  • Entro. Adv. :遵循原始论文,固定 \( \kappa = 2 \),设置 \( \alpha = 0.4 \)
  • Clip-Cov 和 KL-Cov :仅对生成 Token 的一小部分(比例为 0.0002)应用裁剪或 KL 惩罚约束

附录 F:Supplementary Performance Evaluation

F.1 Ablation Study

  • 为了证明 指数映射(Exponential Mapping) 的必要性,作者对比了三种不同的权重映射方式:
    • 1)Exponential(指数映射) :即论文 Eq. (9) 中的 \( \lambda(s) = \exp\left(-\alpha \frac{|\Omega(s)|}{\max_{s \in B} |\Omega(s)|}\right) \)
    • 2)Linear(线性映射) :权重与熵变幅度成线性反比关系
    • 3)Binary(二值映射) :仅对熵变最大的 Top 20% Token 分配 \( \lambda_{\min} = 0.7 \),其余 Token 权重保持为 1
  • 图 17 展示了这三种映射方式的示意图,直观地比较了它们随熵变幅度增加而变化的趋势
  • 表 11 报告了三种映射方式在 Qwen2.5-Math-7B 上的性能对比:
  • 最终结论 :二值映射性能下降明显,线性映射虽不损害性能但不如指数映射
    • 这证明了连续、平滑的 Token 级重加权是必要的,截断式的粗放控制无法精确调控熵变

F.2 Hyperparameter Sensitivity,超参数敏感性

  • 实验结果对公式 (9) 中超参数 \(\lambda_{\min}\) 的敏感性
    • 过小的 \(\lambda_{\min}\) 可能会阻碍模型学习并导致训练不稳定
    • 过大的 \(\lambda_{\min}\) 则会削弱模型控制熵的能力
  • 如图 18 所示,当 \(\lambda_{\min}\in [0.5,0.8]\) 时,本文方法表现 consistently well
  • 图 19 展示了不同超参数下的测试准确率曲线,进一步证明了 STEER 的稳定性和优越性

F.3 Empirical Results Extended to Other Base Models and Other RL Algorithms

  • 本节结论 :STEER 的超参数设置具有良好的可迁移性,其有效性不依赖于特定模型架构(Qwen/Llama/Mistral)、模型规模(1.5B/3B/7B)或 RL 算法(GRPO/RLOO/OPO),充分证明了其强泛化能力
跨基座模型泛化(Cross-Model Generalization)
  • 将 STEER 应用于 Qwen2.5-Math-1.5B、Llama-3.2-3B-Instruct(数学推理)和 Mistral-7B-v0.3(代码编辑),且使用与主实验完全相同的超参数(\( \lambda_{\min} = 0.7 \)) ,未针对各模型重新调参
  • 表 12 报告了 Qwen2.5-Math-1.5B 上的结果。STEER 将平均准确率从 GRPO 的 35.8% 提升至 38.2% ,在所有数据集上均取得最优
  • 图 20
    • 上半部分展示了 Llama-3.2-3B 在数学任务上的性能对比和熵动态
      • STEER 将平均准确率从 19.5% 提升至 21.6% ,并在第 200 步时将熵从 GRPO 的 0.22 显著提升至 0.85
    • 下半部分展示了 Mistral-7B 在代码编辑任务上的结果
      • STEER 在内部测试集上从 12.93% 提升至 14.38% ,在 Zeta 上从 7.64% 提升至 8.35% ,熵值在第 200 步从接近 0(0.04)提升至 0.38
跨 RL 算法泛化(Cross-Algorithm Generalization)
  • 将 STEER 集成到 RLOO(2024)和 OPO(2025)两种 RLVR 算法中,核心设置与主实验保持一致
  • 图 21(Figure 21) 展示了将 STEER 应用于 RLOO 和 OPO 时的性能对比
    • STEER 将 RLOO 的平均准确率从 45.8% 提升至 46.8% ,将 OPO 的平均准确率从 46.4% 提升至 47.5%

附录 G:Theorem Proof Details(待详细推导)

  • 在 RLVR 训练期间,Token logits 由相互纠缠的内部参数所决定,这使得熵变化难以量化
  • 为了捕捉训练过程中分布偏移的本质,采用以下弱假设
  • 假设 1(Parameter-independent softmax)
    • 对于任何上下文(状态) \(s = (q,o_{< t})\) ,词汇表 \(\nu\) 中的每个 Token(动作) \(a\) 都与一个独立的 logit 参数 \(z_{s,a}(\theta)\) 相关联
    • 在训练的第 \(k\) 个更新步骤, \(\pi_{\theta}^{k}\) 的下一个 Token 分布遵循
      $$\pi_{\theta}^{k}(\cdot |s) = \text{softmax}(z^{k}(s)),$$
      • 其中 \(z^{k}(s)\) 是状态 \(s\) 下所有动作的 logit 参数向量
    • 假设 1 表明,对采样 Token 进行的梯度步骤不会实质性地影响词汇表中其他 Token 的 logits
      • 在此假设下,本文推导出以下关于 Token 熵变化的定理
  • 定理 1(First-order entropy change estimation)
    • 设策略模型 \(\pi_{\theta}\) 满足假设 1
    • 对于任何上下文(状态) \(s = (q,o_{< t})\) ,将两个更新步骤之间的 Token 级熵变化定义为
      $$\Delta \mathcal{H}(s)\triangleq \mathcal{H}(\pi_{\theta}^{k + 1}\mid s) - \mathcal{H}(\pi_{\theta}^{k}\mid s).$$
    • 在公式 (2) 中的单次 GRPO 更新下, \(\Delta \mathcal{H}(s)\) 可分解为
      $$\Delta \mathcal{H}(s) = \Omega (s) + \Phi (s),\tag {14}$$
    • 其中一阶估计项为
      $$\Omega (s) = -\frac{\eta}{L}\mathbb{E}_{a\sim \pi_{\theta}^{k}(\cdot |s)}\Big[\frac{\mathbb{I}_{clip}(s,a)A(s,a)}{\pi_{old}(a\mid s)}\pi_{\theta}^{k}(a\mid s)\big(1 - \pi_{\theta}^{k}(a\mid s)\big)\big(\log \pi_{\theta}^{k}(a\mid s) + \mathcal{H}(\pi_{\theta}^{k}\mid s)\big)\Big],\tag {15}$$
    • 高阶余项 \(\Phi (s)\) 满足
      $$|\Phi (s)|\leq C\eta^{2}\left[\frac{A_{\max}r_{\max} }{L}\right]^{2},\tag {16}$$
      • \(L\) 是 GRPO 更新中的总解码长度
      • \(A_{\max},r_{\max}\) 界定了 Token 级优势和重要性比率
      • \(C > 0\) 是一个依赖于策略参数化的常数

定理 1 的证明

  • 分五步证明该定理如下
步骤 1:一阶泰勒展开(First-order Taylor expansion)
  • 对 \(\Delta \mathcal{H}(s)\) 在 \(z^{k}(s)\) 附近进行一阶泰勒展开,有
    $$
    \begin{align}
    \Delta \mathcal{H}(s) &= \mathcal{H}(\pi_{\theta}^{k + 1}\mid s) - \mathcal{H}(\pi_{\theta}^{k}\mid s)\\
    &= \underbrace{\left(\frac{\partial\mathcal{H}(\pi_{\theta}^{k}\mid s)}{\partial z},z^{k + 1}(s) - z^{k}(s)\right)}_{\text{first-order term }\Omega (s)} + \underbrace{\mathcal{O}(| z^{k + 1}(s) - z^{k}(s)|_{2}^{2})}_{\text{higher-order remainder }\Phi (s)}
    \end{align}
    \tag {17}
    $$
    • 其中 \(z(s) = (z_{s,a})_{a\in \mathcal{V} }\) 是状态 \(s\) 下所有动作的 logit 向量
步骤 2:熵关于 logits 的梯度(Gradient of entropy w.r.t. logits)
  • 对于固定的状态 \(s\) ,策略 \(\pi_{\theta}^{k}(\cdot |s)\) 的条件熵为
    $$\mathcal{H}(\pi_{\theta}^{k}\mid s) = -\sum_{a\in \mathcal{V} }\pi_{\theta}^{k}(a\mid s)\log \pi_{\theta}^{k}(a\mid s).$$
  • 在参数独立的 softmax 参数化下,每个 Token \(a\in \mathcal{V}\) 有一个 logit \(z_{s,a}^{k}\) ,并且
    $$\pi_{\theta}^{k}(a\mid s) = \frac{\exp(z_{s,a}^{k})}{\sum_{b\in \mathcal{V} }\exp(z_{s,b}^{k})}.$$
  • 对 \(\mathcal{H}(\pi_{\theta}^{k} | s)\) 关于单个 logit \(z_{s,b}\) 进行微分,使用 softmax 导数,有
    $$\frac{\partial\pi_{\theta}^{k}(a | s)}{\partial z_{s,b} } = \pi_{\theta}^{k}(a | s)\left(1\{a = b\} -\pi_{\theta}^{k}(b | s)\right).$$
  • 然后得到
    $$\begin{array}{rl} \frac{\partial\mathcal{H}(\pi_{\theta}^{k} | s)}{\partial z_{s,b} } & = -\sum_{a\in \mathcal{V} }\left(\log \pi_{\theta}^{k}(a | s) + 1\right)\frac{\partial\pi_{\theta}^{k}(a | s)}{\partial z_{s,b} } \\ & = -\sum_{a\in \mathcal{V} }\left(\log \pi_{\theta}^{k}(a | s) + 1\right)\pi_{\theta}^{k}(a | s)\left(1\{a = b\} -\pi_{\theta}^{k}(b | s)\right) \\ & = -\left(\log \pi_{\theta}^{k}(b | s) + 1\right)\pi_{\theta}^{k}(b | s)\left(1 -\pi_{\theta}^{k}(b | s)\right) + \pi_{\theta}^{k}(b | s)\sum_{a\neq b}\left(\log \pi_{\theta}^{k}(a | s) + 1\right)\pi_{\theta}^{k}(a | s) \\ & = -\left(\log \pi_{\theta}^{k}(b | s) + 1\right)\pi_{\theta}^{k}(b | s)\left(1 -\pi_{\theta}^{k}(b | s)\right) + \pi_{\theta}^{k}(b | s)\left(\sum_{a\in \mathcal{V} }\left(\log \pi_{\theta}^{k}(a | s) + 1\right)\pi_{\theta}^{k}(a | s) - \left(\log \pi_{\theta}^{k}(b | s) + 1\right)\pi_{\theta}^{k}(b | s)\right) \\ & = -\left(\log \pi_{\theta}^{k}(b | s) + 1\right)\pi_{\theta}^{k}(b | s) + \pi_{\theta}^{k}(b | s)\sum_{a\in \mathcal{V} }\left(\log \pi_{\theta}^{k}(a | s) + 1\right)\pi_{\theta}^{k}(a | s), \end{array}$$
    • 其中 \(\mathcal{V}\) 表示词汇表,注意
      $$\sum_{a\in \mathcal{V} }\pi_{\theta}^{k}(a | s) = 1,\quad \sum_{a\in \mathcal{V} }\log \pi_{\theta}^{k}(a | s) \pi_{\theta}^{k}(a | s) = -\mathcal{H}(\pi_{\theta}^{k} | s).$$
  • 因此,
    $$\sum_{a\in \mathcal{V} }\left(\log \pi_{\theta}^{k}(a | s) + 1\right)\pi_{\theta}^{k}(a | s) = -\mathcal{H}(\pi_{\theta}^{k} | s) + 1.$$
  • 代回得到
    $$\begin{array}{rl} \frac{\partial\mathcal{H}(\pi_{\theta}^{k} | s)}{\partial z_{s,b} } & = -\left(\log \pi_{\theta}^{k}(b | s) + 1\right)\pi_{\theta}^{k}(b | s) + \pi_{\theta}^{k}(b | s)\left(-\mathcal{H}(\pi_{\theta}^{k} | s) + 1\right) \\ & = -\pi_{\theta}^{k}(b | s)\left(\log \pi_{\theta}^{k}(b | s) + \mathcal{H}(\pi_{\theta}^{k} | s)\right). \end{array}$$
  • 因此,对于任何 \(a \in \mathcal{V}\) ,
    $$\frac{\partial\mathcal{H}(\pi_{\theta}^{k} | s)}{\partial z_{s,a} } = -\pi_{\theta}^{k}(a | s)\left(\log \pi_{\theta}^{k}(a | s) + \mathcal{H}(\pi_{\theta}^{k} | s)\right).\tag {18}$$
步骤 3:logit 空间中的单步 GRPO 更新(One-step GRPO update in logit space)
  • 公式 (2) 中 GRPO 的策略梯度可以写为
    $$\begin{array}{rl} \nabla_{\theta}J(\theta) & = \mathbb{E}_{q\sim \mathcal{D},\{o_i\}_{i=1}^G\sim \pi_{\text{old} }(\cdot|q)}\left[\frac{1}{\sum_{i=1}^G |o_i|}\sum_{i=1}^G \sum_{t=1}^{|o_i|} \mathbb{I}_{\text{clip} }(t) \frac{\pi_{\theta}^{k}(o_{i,t} | q, o_{i,<t})}{\pi_{\text{old} }(o_{i,t} | q, o_{i,<t})} A_{i,t} \nabla_{\theta}\log \pi_{\theta}(o_{i,t} | q, o_{i,<t})\right], \end{array}\tag {19}$$
    • \(\mathbb{I}_{\text{clip} }(t)\) 是 clipping indicator
    • \(A_{i,t}\) 是 token-level advantage
  • 为简化符号,固定特定的 Token 位置 \((t)\) 并记
    $$s \triangleq (o_{i,<t}),\quad a \triangleq o_{i,t}.$$
  • 我们有
    $$\frac{\partial}{\partial z_{s,a} }\log \pi_{\theta}^{k}(a\mid s) = 1 - \pi_{\theta}^{k}(a\mid s),$$
  • 而同一状态 \(s\) 下非采样动作 \(a^{\prime}\neq a\) 的 logits 的导数被忽略,因此,沿 GRPO 梯度方向、以学习率 \(\eta\) 对 \(z_{s,a}\) 进行的更新贡献为
    $$\begin{array}{rl} & {\frac{z_{s,a}^{k + 1} - z_{s,a}^{k} }{\sum_{i^{\prime} = 1}^{G}\left|\sigma_{i^{\prime} }\right|}\mathbb{I}_{\text{clip} }(i,t)\frac{\pi_{\theta}^{k}(a\mid s)}{\pi_{\text{old} }(a\mid s)} A_{i,t}\frac{\partial}{\partial z_{s,a} }\log \pi_{\theta}^{k}(a\mid s)} { = \eta \frac{1}{\sum_{i^{\prime} = 1}^{G}\left|\sigma_{i^{\prime} }\right|}\mathbb{I}_{\text{clip} }(i,t)\frac{\pi_{\theta}^{k}(a\mid s)}{\pi_{\text{old} }(a\mid s)} A_{i,t}\left(1 - \pi_{\theta}^{k}(a\mid s)\right).} \end{array}\tag {20}$$
  • 通过显式地转换为 \((s,a)\) 符号,我们得到简化的更新式
    $$z_{s,a}^{k + 1} - z_{s,a}^{k} = \eta \frac{1}{\sum_{i^{\prime} = 1}^{G}\left|\sigma_{i^{\prime} }\right|}\mathbb{I}_{\text{clip} }(s,a)\frac{\pi_{\theta}^{k}(a\mid s)}{\pi_{\text{old} }(a\mid s)} A(s,a)\left(1 - \pi_{\theta}^{k}(a\mid s)\right).\tag {21}$$
  • 对于同一状态 \(s\) 下的非采样动作 \(a^{\prime}\) ,其相应的 logits \(z_{s,a^{\prime} }\) 在此更新中保持不变
步骤 4:一阶估计 \(\Omega (s)\)
  • 将 (18) 和 (21) 代入内积,我们有
    $$\begin{array}{rl} & {\Omega (s) = \left\langle \frac{\partial\mathcal{H}(\pi_{\theta}^{k}\mid s)}{\partial z},z^{k + 1}(s) - z^{k}(s)\right\rangle} \\ & {\qquad = \sum_{a\in \mathcal{V} }\frac{\partial\mathcal{H}(\pi_{\theta}^{k}\mid s)}{\partial z_{s,a} }\left(z_{s,a}^{k + 1} - z_{s,a}^{k}\right)} \\ & {\qquad = \sum_{a\in \mathcal{V} }\left[-\pi_{\theta}^{k}(a\mid s)\left(\log \pi_{\theta}^{k}(a\mid s) + \mathcal{H}(\pi_{\theta}^{k}\mid s)\right)\right]\left[\frac{\eta}{L}\frac{\mathbb{I}_{\text{clip} }(s,a)A(s,a)}{\pi_{\text{old} }(a\mid s)}\pi_{\theta}^{k}(a\mid s)\left(1 - \pi_{\theta}^{k}(a\mid s)\right)\right]} \\ & {\qquad = -\frac{\eta}{L}\sum_{a\in \mathcal{V} }\frac{\mathbb{I}_{\text{clip} }(s,a)A(s,a)}{\pi_{\text{old} }(a\mid s)}\left[\pi_{\theta}^{k}(a\mid s)\right]^{2}\left(1 - \pi_{\theta}^{k}(a\mid s)\right)\left(\log \pi_{\theta}^{k}(a\mid s) + \mathcal{H}(\pi_{\theta}^{k}\mid s)\right)} \\ & {\qquad = -\frac{\eta}{L}\mathbb{E}_{a\sim \pi_{\theta}^{k}(\cdot |s)}\left[\frac{\mathbb{I}_{\text{clip} }(s,a)A(s,a)}{\pi_{\text{old} }(a\mid s)}\pi_{\theta}^{k}(a\mid s)\left(1 - \pi_{\theta}^{k}(a\mid s)\right)\left(\log \pi_{\theta}^{k}(a\mid s) + \mathcal{H}(\pi_{\theta}^{k}\mid s)\right)\right],} \end{array}\tag {22}$$
  • 其中 \(L\) 表示 \(\sum_{i^{\prime} = 1}^{G}\left|\sigma_{i^{\prime} }\right|\) 。在最后一行,我们通过将一个因子 \(\pi_{\theta}^{k}(a\mid s)\) 吸收到测度中,将求和重写为在 \(a\sim \pi_{\theta}^{k}(\cdot \mid s)\) 下的期望。这正是公式 (15)
步骤 5:余项 \(\Phi (s)\)
  • 根据多元泰勒定理,高阶余项可以写成 logit 增量的二次型,因此存在常数 \(C > 0\) ,使得对于任何状态 \(s\) ,
    $$|\Phi (s)|\leq C\left| z^{k + 1}(s) - z^{k}(s)\right|_{2}^{2}.\tag {22}$$
  • 对于给定的状态 \(s\) ,只有被采样的动作 \(a\) 具有非零的 logit 更新,因此
    $$\left| z^{k + 1}(s) - z^{k}(s)\right|_{2}^{2} = \left(z_{s,a}^{k + 1} - z_{s,a}^{k}\right)^{2}.$$
  • 记 \(L\triangleq \sum_{i^{\prime} = 1}^{G}\left|\sigma_{i^{\prime} }\right|, r(s,a)\triangleq \frac{\pi_{\theta}^{k}(a\mid s)}{\pi_{\text{old} }(a\mid s)}\) ,并假设重要性比率和 Token 级优势(token-level advantage)是一致有界的:
    $$|r(s,a)|\leq r_{\max},\qquad |A(s,a)|\leq A_{\max}\quad \text{for~all}(s,a).$$
  • 使用公式 (21) 中的 GRPO 更新,我们得到
    $$\begin{array}{rl} \left| z^{k + 1}(s) - z^{k}(s)\right|_{2}^{2} & = \left(z_{s,a}^{k + 1} - z_{s,a}^{k}\right)^{2} \\ & = \eta^{2}\left[\frac{\mathbb{I}_{\text{clip} }(s,a)A(s,a)}{L} r(s,a)\left(1 - \pi_{\theta}^{k}(a\mid s)\right)\right]^{2} \\ & \leq \eta^{2}\left[\frac{\mathbb{I}_{\text{clip} }(s,a)A(s,a)}{L} r(s,a)\right]^{2} \\ & \leq \eta^{2}\left[\frac{A(s,a)r(s,a)}{L}\right]^{2} \\ & \leq \eta^{2}\left[\frac{A_{\text{max} }r_{\text{max} } }{L}\right]^{2}, \end{array}$$
  • 将此界与 (22) 结合,并将所有固定常数吸收到 \(C\) 中,得到
    $$|\Phi (s)| \leq C \eta^{2} \left[\frac{A_{\text{max} } r_{\text{max} } }{L}\right]^{2}.\tag {23}$$
  • 因此,余项为 \(\mathcal{O}(\eta^{2})\) 阶,并且在 GRPO 中进一步被每次更新的归一化因子 \(L^{- 2}\) 所抑制
  • 证毕

NLP——SkillRL

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始论文:SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, 20260209, UNC-Chapel Hill & University of Chicago

SkillRL 简单总结

  • 当前 LLM Agent 在执行任务时存在一个根本性缺陷:每次任务执行都是孤立的事件 ,Agent 无法从过去的成功或失败中学习,这严重阻碍了其演化能力
  • 现有的 Memory-based 方法主要分为两类:
    • 1)原始轨迹存储 :如 ReAct、Reflexion、Mem0、ExpeL 等方法,直接将原始 Trajectories 存入外部数据库,作为未来类似任务的参考
      • 但原始轨迹通常冗长、冗余且含有大量噪声,使得模型难以提取关键信息
    • 2)轨迹压缩与在线更新 :如 MemRL、EvolveR 等方法,尝试压缩 Trajectories 并通过在线训练更新记忆库
      • 然而,这些方法仍然只是“模仿”过去的解决方案,无法提炼出核心原则 ,也无法使 Agent 的内部 Policy 真正适应并利用记忆来指导决策
  • 核心 Insight:有效的经验迁移需要抽象
    • 人类专家不会记住每种情境下的每一个动作,而是发展出 Skills
      • Skills 是一种紧凑、可重用的策略,它们捕捉了如何完成特定子任务的核心本质
    • 受此启发,本文提出了 SkillRL 框架

SkillRL 框架总体设计

框架核心思想

  • SkillRL 通过 自动技能发现 和 递归演化 ,架起了原始经验与 Policy 改进之间的桥梁,其三个核心组件为:
    • 1)基于经验的技能蒸馏机制(Experience-based Skill Distillation)
    • 2)分层技能库 SkillBank(Hierarchical Skill Library)
    • 3)递归技能演化机制(Recursive Skill Evolution)

整体流程概览

  • 如论文 Figure 1(a) 所示,SkillRL 的完整 Pipeline 包括:
    • 1)使用 Base Model 在环境中收集 Trajectories
    • 2)通过 Teacher Model 将 Trajectories 蒸馏为结构化 Skills
    • 3)构建分层 Skill Library(SkillBank)
    • 4)冷启动 SFT(Cold-start Supervised Fine-Tuning)使 Agent 学会使用 Skills
    • 5)基于 GRPO 的 RL 训练,同时进行递归 Skill Evolution

SkillRL 详解

  • SkillRL 整体概览

补充:LLM Agent 形式化

  • 将 Agent 置于交互环境 \(\mathcal{E}\) 中
  • 在时间步 \(t\),Agent 依次
    • 观察状态 \(o_t \in \mathcal{O}\)
    • 选择动作 \(a_t \in \mathcal{A}\)
    • 获得奖励 \(r_t\) 和下一个观察 \(o_{t+1}\)
  • 一个 Trajectory 捕获了一次完整的交互 Episode
    $$ \tau = (o_0, a_0, r_0, \ldots, o_T, a_T, r_T)$$
  • 任务由自然语言描述 \(d\) 指定, LLM Agent 实现了 Policy:
    $$
    \pi_{\theta}(a_t | o_{\leq t}, d, c)
    $$
    • \(c\) 表示额外的上下文(如 Skills、Demonstrations)
  • 目标是最大化期望回报:
    $$
    \max_{\theta} \mathbb{E}_{\tau \sim \pi_{\theta} } \left[ \sum_{t=0}^{T} \gamma^t r_t \right]
    $$
  • 同时受限于上下文长度约束 \(|c| \leq L_{\text{max} }\)

Experience-based Skill Distillation

Trajectory 收集
  • 首先部署 Base LLM Agent \(\pi_{\text{base} }\) 在目标环境 \(\mathcal{E}\) 中收集多样的 Trajectories
    • 与以往只保留成功 Episode 的方法不同,论文刻意同时保留 :
      • 成功 Trajectories:\(\mathcal{T}^+ = \{\tau_i : r(\tau_i) = 1\}\)
      • 失败 Trajectories:\(\mathcal{T}^- = \{\tau_i : r(\tau_i) = 0\}\)
      • 其中 \(r(\tau)\) 表示二值任务成功指示符
    • 失败 Trajectories 揭示了失败模式和边界条件:这些信息很难仅从成功中推断出来
差异化处理策略
  • 对于成功 Trajectories \(\tau^+ \in \mathcal{T}^+\) :
    • 使用 Teacher Model \(\mathcal{M}_T\) 提取导致任务完成的策略模式:
      $$
      s^+ = \mathcal{M}_T(\tau^+, d)
      $$
    • Teacher Model 需要识别:
      • 关键决策点
      • 正确动作背后的推理
      • 超越特定任务实例的可泛化模式
  • 对于失败 Trajectories \(\tau^- \in \mathcal{T}^-\) :
    • 由于直接包含原始 Trajectories 在上下文中不可行(长度和噪声问题),将其合成为简洁的失败教训:
      $$
      s^- = \mathcal{M}_T(\tau^-, d)
      $$
    • 分析需要识别:
      • 1)失败点(Point of Failure)
      • 2)有缺陷的推理或动作(Flawed Reasoning/Action)
      • 3)应该采取的正确做法(What Should Have Been Done)
      • 4)防止类似失败的一般原则(General Principles)
    • 这实际上是将冗长的失败 Episode 转化为反事实(Counterfactuals)
  • 设计思路解读:这种差异化处理的核心设计思路是:
    • 成功提供正样例 :展示“什么该做”以及“为什么这样做有效”
    • 失败提供边界条件 :展示“什么不该做”以及“为什么会失败”
    • 通过 Teacher Model 的抽象能力 ,将冗长的、带噪声的低层交互转化为高密度的、可操作的知识

分层技能库 SkillBank

技能组织架构
  • 遵循 Agent Skills(Anthropic, 2024)的设计原则,SkillBank 分为两个层级:
    • 层级1:通用技能 \(\mathcal{S}_g\)(General Skills)
      • 捕捉适用于环境中所有任务类型的通用策略原则,典型包括:
        • 探索策略(如系统化搜索模式、优先访问未探索位置)
        • 状态管理原则(如在执行动作前验证前置条件)
        • 目标追踪启发式(如维护进度计数器、仅在验证完成后终止)
      • 通用技能提供跨不同任务类别迁移的基础性指导
    • 层级2:任务特定技能 \(\mathcal{S}_k\)(Task-Specific Skills)
      • 为任务类别 \(k\) 编码的专业知识,典型包括:
        • 领域特定的动作序列
        • 任务特定的前置条件和约束
        • 该任务类型独有的常见失败模式
        • 利用任务结构的优化流程
      • 通过在收集时按任务类型组织 Trajectories,可以提取细粒度的、类别特定的策略
  • 完整的技能库为:
    $$
    \text{SkillBank} = \mathcal{S}_g \cup \bigcup_{k=1}^{K} \mathcal{S}_k
    $$
  • 每个 Skill \(s \in \text{SkillBank}\) 都包含结构化信息:
    • 简洁名称(Concise Name)
    • 原则描述(Principle):描述策略内容
    • 适用条件(When-to-apply):指定适用性场景
    • 这种格式既支持高效检索,又为应用提供清晰的指导
技能检索机制
  • 在推理时,给定任务描述 \(d\),Agent 检索相关的 Skills 来增强其上下文:
    • 通用技能 \(\mathcal{S}_g\):始终包含,作为基础性指导
    • 任务特定技能 :通过语义相似度检索:
      $$
      \mathcal{S}_{\text{ret} } = \text{TopK} \left( \{s \in \mathcal{S}_k : \text{sim}(e_d, e_s) > \delta \},\ K \right)
      $$
      • \(e_d, e_s\) 分别是任务描述和 Skill 的 Embedding
      • \(\delta\) 为相似度阈值
      • \(K\) 控制检索的 Skill 数量
  • Policy 在检索到的 Skills 条件下进行决策:
    $$
    a_t \sim \pi_{\theta}(a_t | o_{\leq t}, d, \mathcal{S}_g, \mathcal{S}_{\text{ret} })
    $$
Token 压缩优势
  • Skill 蒸馏相比原始 Trajectories 实现了 \(10-20\times\) 的 Token 压缩 ,同时提升了而非降低原始经验的效用
    • 理解:Skill 本身就比原始历史轨迹更短,所以将轨迹压缩为 Skill 后,上下文就更短了
  • 这种压缩使得 Agent 能够在有限的上下文窗口中利用丰富的经验知识
设计思路解读
  • 分层设计的关键考量:
    • 通用 vs 特定的分离 :通用技能提供稳定的基础,任务特定技能提供针对性的专业知识,二者互补
    • 结构化格式 :Name + Principle + When-to-apply 的三元组结构使得 Skills 既可检索又可解释
    • 语义检索 :通过 Embedding 相似度实现灵活的、任务自适应的 Skill 召回

递归技能演化

  • 这是论文最核心的创新点: 将 Skill Library 视为动态组件而非静态知识源
冷启动初始化
  • 在 RL 训练之前,面临一个关键挑战:Base Agent 尚未学会如何有效利用 Skills :仅仅向未改变的模型提供 Skills 收益有限
  • 论文引入冷启动 SFT 阶段:
    • 1)Teacher Model \(\mathcal{M}_T\) 生成 \(N\) 条 Skill 增强的推理轨迹:
      $$
      \mathcal{D}_{\text{SFT} } = \{(d_i, \mathcal{S}_i, \tau_i^+)\}_{i=1}^N
      $$
      • 这些轨迹展示了如何在决策过程中检索、解释和应用 Skills
    • 2)Base Model 在这些 Demonstrations 上微调:
      $$
      \theta_{\text{sf} } = \arg \min_{\theta} \mathcal{L}_{\text{CE} }(\mathcal{D}_{\text{SFT} }; \theta)
      $$
      • 其中 \(\mathcal{L}_{\text{CE} }\) 为交叉熵损失
    • 3)得到的模型 \(\pi_{\theta_{\text{sf} } }\) 既是 RL 训练的起点,也是 KL 正则化的参考 Policy \(\pi_{\text{ref} }\)
递归技能演化机制
  • 静态 Skill Library 无法预知 Agent 将遇到的所有场景
  • 随着 Policy 改进并探索新的状态区域,Agent 会面临现有 Skills 无法提供充分指导的情况
  • 演化流程如下:
    • 触发条件 :在每个验证 Epoch 后,监控每个任务类别 \(C\) 的成功率 \(Acc(C)\)
      • 只有当 \(Acc(C) < \delta\) 时,才触发该类别的 Skill 演化
    • 失败轨迹收集 :使用多样性感知的分层采样策略收集失败 Trajectories:
      $$
      \mathcal{T}_{\text{val} } = \{\tau_j : r(\tau_j) = 0\}_{j=1}^{M}
      $$
      • 按类别分组 Trajectories
      • 按失败严重程度(负奖励)排序
      • 通过 Round-robin 采样维持类别熵(Categorical Entropy)
    • 新技能生成 :Teacher Model 分析这些样本以识别差距:
      $$
      \mathcal{S}_{\text{new} } = \mathcal{M}_T(\mathcal{T}_{\text{val} }, \text{SkillBank})
      $$
      • Teacher Model 被提示:
        • 1)识别当前 Skills 未覆盖的失败模式
        • 2)提出新 Skills 来覆盖这些差距
        • 3)建议对已证明无效的现有 Skills 进行改进
    • 库更新 :
      $$
      \text{SkillBank} \leftarrow \text{SkillBank} \cup \mathcal{S}_{\text{new} }
      $$
    • 这创造了一个良性循环 :
      • Agent 改进 → 遇到新挑战 → 驱动 Skill Library 扩展 → 支持进一步改进
设计思路解读
  • 递归演化的核心设计哲学:
    • 1)Co-evolution(协同演化) :Skill Library 和 Agent Policy 不是独立优化的,而是相互促进、共同演化
    • 2)失败驱动 :从验证失败中学习,而非仅仅从成功中学习,确保 Skills 不断覆盖失败边界
    • 3)按需扩展 :只对表现不佳的任务类别触发演化,保证 Library 的紧凑性和针对性
    • 4)多样性采样 :通过分层采样确保覆盖多样的失败模式,避免过度专注于某一种失败类型

SkillRL 完整算法流程

  • 论文 Algorithm 1 总结了完整流程:
  • 核心点:
    • 在 RL 训练过程中,根据得到的错误轨迹,会继续添加新的 Skills,从而实现了 Skills 的进化
    • 理解:这里是没有删除 SkillBank 中的 Skills 的,都是合并操作
RL-based Policy Optimization 细节
  • 使用 GRPO 优化 Skill 增强的 Policy,对于每个任务描述 \(d\):
    • 1)检索相关 Skills
    • 2)从当前 Policy \(\pi_\theta\) 采样 \(G\) 条完整 Trajectories
      $$ \{\tau^{(1)}, \ldots, \tau^{(G)}\} $$
    • 3)每条 Trajectory \(\tau^{(i)}\) 获得二值奖励
      $$ R_i = r(\tau^{(i)}) \in \{0, 1\} $$
    • 4)归一化 Advantage:
      $$
      A_i = \frac{R_i - \text{mean}(\{R_j\}_{j=1}^G)}{\text{std}(\{R_j\}_{j=1}^G)}
      $$
    • 5)优化目标:
      $$
      \mathcal{J}(\theta) = \mathbb{E}_{d,\{\tau^{(i)}\} } \left[ \frac{1}{G} \sum_{i=1}^{G} \min \left( \rho_i A_i,\ \text{clip}(\rho_i, 1-\epsilon, 1+\epsilon) A_i \right) - \beta D_{\text{KL} }(\pi_\theta | \pi_{\text{ref} }) \right]
      $$
      • 其中 \(\rho_i\) 是 Skill 增强上下文上的重要性比率
        $$
        \rho_i = \frac{\pi_{\theta}(\tau^{(i)} | d, \mathcal{S}_g, \mathcal{S}_{\text{ref} })}{\pi_{\text{old} }(\tau^{(i)} | d, \mathcal{S}_g, \mathcal{S}_{\text{ref} })}
        $$
    • KL 惩罚锚定到 \(\pi_{\text{ref} } = \pi_{\theta_{\text{sf} } }\),确保 RL 优化在提升任务性能的同时保持已学的 Skill 利用能力

实验

实验设置

  • 环境与任务:论文在 9 个挑战性 Benchmark 上评估:
    • 1)ALFWorld :文本游戏环境,Agent 需要通过文本命令导航和交互完成家庭任务
    • 2)WebShop :模拟在线购物环境,Agent 需要找到并购买满足用户规格的产品
    • 3)Search-augmented QA :7 个数据集
      • Single-hop QA:NQ、TriviaQA、PopQA
      • Multi-hop QA:HotpotQA、2Wiki、MuSiQue、Bamboogle
  • 基线方法:分为四类:
    • 1)Closed-source LLMs :GPT-4o、Gemini-2.5-Pro
    • 2)Prompt-based Agentic/Memory-based :ReAct、Reflexion、Mem0、ExpeL、MemP、SimpleMem
    • 3)RL-based :RLOO、GRPO
    • 4)Memory-augmented RL-based :MemRL、EvolveR、Mem0+GRPO、SimpleMem+GRPO
  • 实现细节
    • Base Model :Qwen2.5-7B-Instruct
    • Teacher Model :OpenAI o3(用于 Skill 蒸馏和 SFT 数据生成)
    • RL 优化器 :GRPO
      • 学习率:\(1 \times 10^{-6}\)
      • Batch size:16
      • Group size:8
      • Gradient accumulation steps:4
    • Skill 检索 :\(K = 6\),\(\delta = 0.4\)

主要实验结果

  • ALFWorld 与 WebShop 性能:
    • 如 Table 1 所示,SkillRL 实现了:
      • ALFWorld:\(89.9%\) 成功率
      • WebShop:\(72.7%\) 成功率
    • 关键 Insight :
      • 1)相比 Prompt-based 方法的显著提升 :SkillRL 大幅超越最佳 Prompt-based 基线
        • 说明 In-context Learning 虽然能利用过去经验,但难以从冗长 Trajectories 中提取可操作知识
      • 2)超越 Vanilla RL :相比 GRPO,SkillRL 表现如下:
        • 在 ALFWorld 上有 \(12.3%\) 的绝对提升(从 \(77.6%\) 到 \(89.9%\))
          • 这直接归因于 Skill 增强机制而非算法差异
        • 在复杂子任务如 Cool 和 Pick2 上,分别提升 \(23.0%\) 和 \(22.8%\)
      • 3)超越 Memory-Augmented RL :相比 Mem0+GRPO(\(54.7%\))和 EvolveR(\(43.8%\))
        • SkillRL 有约 \(35.2%\) 的绝对成功率差距,验证了高层 Skill 抽象和协同演化 Library 的核心假设
      • 4)超越 Closed-source 模型 :用 Qwen2.5-7B 的 SkillRL 显著超越 GPT-4o(+\(41.9%\))和 Gemini-2.5-Pro(+\(29.6%\))
        • 证明有效的 Skill 学习可以弥补模型规模的不足
  • Search-Augmented QA 性能
    • 如 Table 2 所示,SkillRL 实现了 \(47.1%\) 的平均分,显著优于 Search-R1(\(38.5%\))和 EvolveR(\(43.1%\))
    • 关键 Insight:
      • 1)卓越的多跳推理能力 :在 Bamboogle 上超越 EvolveR 达 \(19.4%\)
      • 2)强泛化能力 :尽管只在 NQ 和 HotpotQA 上训练,在 OOD 任务如 TriviaQA 和 2Wiki 上仍保持竞争力

消融与分析

  • 组件消融:
    • 如 Table 3 所示:
      变体 ALFWorld WebShop
      SkillRL(完整) 89.9% 72.7%
      w/o 分层结构 76.8% 61.4%
      w/o Skill Library(原始 Trajectories) 61.7% 50.2%
      w/o 冷启动 SFT 65.2% 46.5%
      w/o 动态演化 84.4% 70.3%
    • 重要 Insight :
      • 1)分层结构至关重要 :移除分层结构导致 ALFWorld 下降 \(13.1%\),说明通用技能提供必要的基础性指导
      • 2)抽象优于记忆 :用原始 Trajectories 替代 Skill Library 导致最大性能下降(最高 \(25%\)),验证了抽象的核心价值
      • 3)冷启动 SFT 不可或缺 :没有 SFT 时性能下降约 \(20%\),说明 Base Model 需要明确的 Demonstration 阶段来学习如何使用 Skills
      • 4)动态演化贡献稳定 :带来约 \(5.5%\) 的提升,确保 Skill Library 是动态组件而非静态数据库
  • Per-Task 分析
    • 在 ALFWorld 上,最大提升在 PickTwo(+\(23%\))、Cool(+\(22%\))和 Heat(+\(15%\))
    • 这些都是需要多步规划和状态跟踪的最具挑战性的任务
    • 任务特定 Skills 在这里特别有价值
  • Skill Library 增长(如 Figure 3 所示):
    • 初始:55 个 Skills(12 个通用,43 个任务特定)
    • 最终(Step 150):100 个 Skills
    • 增长主要由任务特定 Skills 驱动(43 → 80)
    • 通用 Skills 稳步增长(12 → 20)
    • 各任务类别间平衡扩展
  • 上下文效率(如 Figure 4 所示):
    • 原始记忆方法:平均 \(\sim 1,450\) Tokens,高波动
    • SkillRL:平均 \(\leq 1,300\) Tokens,约 \(10.3%\) 的上下文长度缩减
  • 演化动力学(如 Figure 5 所示):
    • SkillRL(无演化):稳步改进
    • SkillRL(有演化):显著更高的学习率和更优的渐近性能
      • 60 步内成功率超过 \(80%\)
      • 基线需约 90 步达到更低峰值
  • 定性分析:
    • 如 Figure 6 所示,Case Study 展示了 Agent 如何:
      • 有效检索和执行来自 SkillBank 的 Skills
      • 在 WebShop 中:调用 “Prioritize Core Keywords” + “Focus Key Query”
      • 在 ALFWorld 中:协调 “Progressive Goal Decomposition” + “No Appliance Before Object”
    • 这证明 Agent 并非记忆 Trajectories,而是发展了结构化的任务逻辑理解

Skill Library 示例

  • ALFWorld Skills(Table 5)
    ID Skill Title Principle When to Apply
    gen_001 Systematic Exploration Search every plausible surface/container once before revisiting Anytime goal count not met and unexplored areas remain
    gen_002 Immediate Acquisition Take required object immediately when visible and reachable Upon first visual confirmation of goal-relevant object
    gen_003 Destination First Policy Navigate directly to known target receptacle after picking up object Holding goal object while target location is identified
    gen_005 Use State-Changing Tools Early Use nearest suitable appliance before placement After picking up object requiring temperature/cleanliness change
    gen_014 Loop Escape Trigger Switch to untried search branch after 3-5 no-progress actions After several consecutive no-progress observations
    gen_015 Pre-Action Sanity Check Confirm prerequisites before manipulative commands Right before commands that could legally fail
  • WebShop Skills(Table 7)
    ID Skill Title Principle When to Apply
    gen_001 Prioritize Core Keywords Include product type, functional attributes, hard constraints Before first search or refining over-specific queries
    gen_002 Iterative Refinement Adjust keywords or filters instead of repeating failed query When results are irrelevant
    gen_003 Scan Before You Click Read titles, thumbnails, prices before opening link On search results pages
    gen_004 Verify Early, Abort Fast Check constraints immediately; leave if violated Within first observation on product detail page
    gen_007 Check Variant Pricing Select exact variant to verify specific price Whenever price changes with variant selection
    gen_013 Purchase Decisively Execute ‘Buy Now’ once all constraints confirmed After validating every constraint

失败模式与缓解策略

  • 论文还提供了对常见失败的系统化分类(Table 6 和 Table 8),例如:
    • ALFWorld 失败 :
      • err_001 Redundant Revisit:缺乏对已探索区域的显式记忆 → 维护探索地图
      • err_006 Skipping State Changes:混淆存在性与目标满足 → 整合状态前置条件检查
    • WebShop 失败 :
      • err_001 Missing Constraints in Query:遗漏规格或价格上限 → 构建完整需求列表
      • err_004 Price Shift Oversight:选择变体后未注意价格变化 → 每次选项变化后重新读取价格
      • err_005 Premature Purchase:未设置必要变体就点击购买 → 验证所有选项已选择

补充:相关工作

LLM Agent

  • ReAct 交织推理和行动
  • Reflexion 引入通过自我反思的言语强化
  • AutoGen 和 CAMEL 展示通用多 Agent 能力
  • 但早期方法主要依赖 In-context Learning,将每次交互视为孤立事件

Agent 中的记忆机制

  • 从静态 RAG 范式和原始轨迹存储(Mem0、SimpleMem),到自改进记忆、将交互蒸馏为高层见解(ExpeL、MemP),再到通过在线训练更新记忆库(MemRL、Mem\(\alpha\))
  • 但现有方法仍难以区分高价值经验和噪声,或无法提炼指导内部决策的核心原则

Agentic Skills 与 RL 的演化

  • 传统 Continual Learning 关注预定义任务中的知识保持,但自演化 Agent 旨在开放环境中主动获取技能
  • RL 被广泛用于对齐 LLM 或通过基于规则的验证器改进推理,但应用于 Agentic Skills 仍面临稀疏奖励和长 Horizon 的挑战
  • SkillRL 的关键区别在于将 Skill Library 作为与 Policy 协同演化的动态组件

附录:值得关注的细节

  • Skill 蒸馏需要 Teacher Model(OpenAI o3),存在 API 调用成本
  • 演化质量依赖于 Teacher Model 的推理能力
1…8910…352
San Ye

San Ye

Stay Hungry. Stay Foolish.

704 posts
53 tags
© 2026 San Ye
Powered by Hexo
|
Theme — NexT.Gemini v5.1.4