Hexo

凡事预则立,不预则废


  • Home

  • Tags

  • Archives

  • Navigation

  • Search

NLP——LLM对齐微调-RDPO

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始论文:
      • Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization, 20260513, LongCat

Paper Summary

  • 整体评价:
    • RDPO(Reward-Decorrelated Policy Optimization) 的目标是解决 LLM RL 中多任务和混合奖励的不稳定性问题
      • 注:不稳定性来源:异质的奖励分布和相关的(correlated)奖励维度 会破坏标量优势的稳定性
    • RDPO 设计围绕以下目标进行(个人理解):
      • Decorrelation:希望各个维度之间的信号不要互相影响
      • 等幅度假设:希望 Prompt 之间的更新权重(幅度)不要有偏(不要太偏向某个 Prompt 的 Rollout)
        • 希望极端值不敏感
      • 其他:希望各个维度奖励之间的信号权重不要有偏(不要过于偏向于某个维度)
    • RDPO 结合了两个创新以稳定混合奖励的 RL:
      • prompt 级别的幅度感知分位数归一化( MAQ 归一化,Magnitude-Aware Quantile normalization)
        • 使得 Prompt 之间等幅度
      • 马氏白化 (Mahalanobis whitening)
        • Decorrelation:实现各个维度之间的信号不要互相影响(使得不同维度奖励相互独立)
    • 实验:在 LongCat-Flash 模型上进行
      • 特别提到在后训练中提升了指令遵循、写作和 ArenaHard v2 的表现,同时在推理和代码评估上取得了广泛有竞争力的结果
  • RDPO 创新点:
    • 利用幅度感知分位数 (MAQ) 归一化 来稳定跨二元、分数和连续奖励的 prompt 级优势分配
    • 在每个活跃奖励子空间内应用 Mahalanobis whitening 来在聚合之前减轻相关性冗余

Introduction and Discussion

  • 本文展示了针对 LongCat-Flash 的 RDPO 后训练实验
  • 考虑一个标准但具有挑战性的强化学习设定:
    • 一次训练运行包含多种任务类型
    • 每个任务提供一组不同的奖励信号,例如正确性、指令跟随、评分标准满足度、偏好模型分数以及 Response 长度
    • 将这些异质信号聚合为单个标量优势常常会导致训练不稳定
    • 这种不稳定性源于这些奖励表现出不同的尺度、多样的分布形状以及非平凡的相关性
  • RDPO 通过一个轻量级的两步奖励处理流程来缓解这一挑战
    • 第一步:幅度感知分位数 (MAQ) 归一化 使 prompt 级优势对二元奖励、平局、偏态分布和异常值更加鲁棒
    • 第二步:Mahalanobis whitening 减少了在给定任务内共同出现的奖励维度之间的冗余方差

Method

Background

  • 实际部署中,LLM 必须同时优化多个目标,例如计算效率 (2025; 2025)、与人类偏好对齐 (2017) 以及 prompt 特定约束 (2025a)
  • 这种内在复杂性推动了近期在多任务和混合奖励设置中 RL 的进展 (2026; 2025; 2025b),其中单次 Rollout 可以产生多样、异质的奖励信号
  • 常用的方法有两种
GRPO
  • 对于给定的 prompt \(i\) 及其 \(G\) 个 Rollout,设第 \(j\) 个 Rollout 接收 \(n\) 个奖励,记为
    $$ r^{(i,j)} = (r_{1}^{(i,j)},\ldots ,r_{n}^{(i,j)})^{T}$$
  • GRPO (2024) 通过对原始奖励求和来聚合混合奖励反馈,然后在进行组级别归一化:
    $$ r_{\text{sum} }^{(i,j)} = \sum_{k = 1}^{n}r_{k}^{(i,j)} $$
    • 虽然当奖励尺度可比较时,这种直接策略是有效的,但当各个奖励维度的尺度和潜在分布不同时,它可能掩盖单个奖励维度的贡献
  • 表 1 奖励处理方法的比较
    • GRPO 直接对原始奖励求和而不进行归一化,掩盖了跨奖励维度的相对性能变化
    • GDPO 应用独立的 Z-分数归一化,但仍然容易受到 prompt 级优势主导和跨维度相关性的影响
    • RDPO 结合了用于稳定优势分配的幅度感知分位数归一化 (MAQ Normalization) 和用于在活跃奖励子空间内减少相关性的马氏白化 (Mahalanobis whitening)
    • 详细分析见第 2.3 节
GDPO
  • GDPO (2026) 通过在聚合之前独立地对每个奖励维度进行归一化来解决这种异质性问题,如表 1 所总结
  • 对于第 \(k\) 个奖励维度,它使用维度级别的 Z-分数归一化来计算优势
    • 然后通过对这些归一化的维度求和并应用 batch 级别的归一化来获得最终的标量优势
  • 尽管这种解耦方法相比原始求和有所改进,但它仍然独立处理每个奖励,使得该方法对非高斯奖励分布和奖励间相关性敏感

Effective Information Efficiency,有效信息效率

  • 本文引入有效信息效率 \((\eta_{\text{eff} })\) 作为一个诊断指标来评估混合奖励聚合
    • 该指标捕捉了混合标量优势的两个互补方面:
      • 聚合是否平衡了各个奖励维度的权重
      • 聚合后的奖励是否包含由相关奖励维度引起的冗余变异
    • 形式上,将其分解如下:
      $$\eta_{\text{eff} } = \eta_{\text{proj} }\times \eta_{\text{corr} }.$$
      • 注:这个分解遵循了有用混合奖励优势的两个基本期望
        • 第一:每个活跃奖励维度应在可比较的标准化尺度上做出贡献
        • 第二:求和后的信号不应重复计算相同的潜在变异
        • 所以 \(\eta_{\text{eff} }\) 可作为聚合质量的方法无关诊断指标
  • 第一项 \(\eta_{\text{proj} }\) 衡量聚合方向与标准化奖励空间中等权重投影的接近程度
    • 对于任意聚合权重向量 \(\mathbf{w}\) ,定义:
      $$\eta_{\text{proj} }(\mathbf{w}) = \cos^2 (\mathbf{w},\mathbf{1}) = \frac{(\mathbf{w}^T\mathbf{1})^2}{n\cdot|\mathbf{w}|^2}.$$
      • \(\mathbf{1}\) 为全 1 向量
      • 理解:\(\eta_{\text{proj} }\) 衡量实际聚合方向 \(\mathbf{w}\) 与等权重方向 \(\mathbf{1}\) 的一致性
        • 取值范围:\([0, 1]\)
          • \(\eta_{\text{proj} } = 1\) 当且仅当 \(\mathbf{w} \propto \mathbf{1}\),即各 Reward 维度权重相等
          • \(\eta_{\text{proj} } \to 0\) 当 \(\mathbf{w}\) 与 \(\mathbf{1}\) 正交或某些维度权重极大、其他极小
            • 注:这一点可通过求极限得出
      • 理解:为什么等权重方向是理想的?
        • 在标准化空间(\(z_k\) 均值为 0、方差为 1)中:
          • 每个 Reward 维度在数值上已经具有可比性
          • 如果某维度被赋予更大的权重,意味着该维度的微小变化会对 Advantage 产生不成比例的影响
          • 理想情况下,我们希望每个 Reward 维度的改善对最终优化的贡献大致相等 ,除非有明确的先验偏好
        • 因此,\(\eta_{\text{proj} }\) 反映了聚合方法是否尊重了标准化后的等重要性原则
  • 第二项 \(\eta_{\text{corr} }\) 量化了在求和相关的标准化奖励后保留的独立信息量
    • 正相关和负相关都意味着奖励维度之间的依赖性
    • 因此,使用逐元素绝对相关矩阵 \(|\Sigma_{z}|\) 来计算这一项:
      $$\eta_{\text{corr} } = \frac{n}{\mathbf{1}^T|\Sigma_z|\mathbf{1} }.$$
      • 理解:\(|\Sigma_z|\) 不是协方差矩阵的行列式,而是 元素级别的绝对相关系数矩阵 , \(\mathbf{1}^T |\Sigma_z| \mathbf{1}\) 是 \(\Sigma_z\) 矩阵的绝对值的元素和
        • 给定:
          • \(\mathbf{z} = (z_1, z_2, \dots, z_n)^T\) 是标准化后的 Reward 向量
            $$ z_{k} = \frac{r_{k} - \mu_{k}}{\sigma_{k}} $$
            • 每个 \(z_k\) 的均值为 0,方差为 1
          • \(\Sigma_z = \text{Cov}(\mathbf{z})\) 是 \(n \times n\) 的相关系数矩阵(因为方差为 1,协方差矩阵等于相关系数矩阵)
        • 则 \(\Sigma_z\) 为:
          $$
          |\Sigma_z| = \big( |\rho_{ij}| \big)_{i,j=1}^{n}
          $$
        • \(|\Sigma_z|\) 就是将 \(\Sigma_z\) 中的每个元素替换为其绝对值后得到的新矩阵
          $$
          |\Sigma_z|_{ij} = |\rho_{ij}| = \left| \frac{\text{Cov}(z_i, z_j)}{\sqrt{\text{Var}(z_i)\text{Var}(z_j)} } \right| = |\text{Corr}(z_i, z_j)|
          $$
        • 进一步,有 \(\mathbf{1}^T |\Sigma_z| \mathbf{1}\) 如下:
          $$
          \mathbf{1}^T |\Sigma_z| \mathbf{1} = \sum_{i=1}^n \sum_{j=1}^n |\rho_{ij}|
          $$
          • 分析:
            • 对角线项:\(|\rho_{ii}| = |1| = 1\),共 \(n\) 项
            • 非对角线项:\(|\rho_{ij}|\) 对于 \(i \neq j\),共 \(n(n-1)\) 项
          • 因此有最终结果:
            $$
            \mathbf{1}^T |\Sigma_z| \mathbf{1} = n + \sum_{i \neq j} |\rho_{ij}|
            $$
      • 理解:对于具有皮尔逊相关系数 \(\rho\) 的两个奖励情况
        • \(|\Sigma_z|\) 为:
          $$
          |\Sigma_z| = \begin{pmatrix} 1 & |\rho| \\ |\rho| & 1 \end{pmatrix}
          $$
        • 进一步有:
          $$
          \mathbf{1}^T |\Sigma_z| \mathbf{1} = 1 + |\rho| + |\rho| + 1 = 2 + 2|\rho|
          $$
        • 最终,有:
          $$\eta_{\text{corr} } = \frac{2}{2 + 2|\rho|} = \frac{1}{1 + |\rho|}.$$
      • 任何强的线性依赖性,无论是正还是负,都会减少求和的优势中存在的有效独立信息量
        • 理解:针对 皮尔逊相关系数 \(\rho\) 取了绝对值,所以负相关也会被累加
  • 现在应用这个指标来分析各种奖励处理策略
    • 在 GRPO 的情况下,可以将每个原始奖励表示为 \(r_k = \mu_k + \sigma_k z_k\),直接奖励求和得到:
      $$\sum_{k = 1}^{n}r_k = \sum_{k = 1}^{n}\mu_k + \sum_{k = 1}^{n}\sigma_kz_k.$$
      • 常数项 \(\sum_{k}\mu_{k}\) 被组级别优势归一化移除
      • 因此,标准化奖励空间中的有效聚合方向完全由 \(z_{k}\) 的系数决定
      • 因此,GRPO 隐式地依赖于权重向量 \(\mathbf{w}_{\text{GRPO} } = (\sigma_1,\sigma_2,\ldots ,\sigma_n)^T\)
      • 这给具有较高原始方差的奖励维度分配了不成比例的大有效权重
      • 将这个权重向量代入 \(\eta_{\text{proj} }\) 得到:
        $$\eta_{\text{proj} }(\mathbf{w}_{\text{GRPO} }) = \frac{(\sum_{k = 1}^{n}\sigma_k)^2}{n\sum_{k = 1}^{n}\sigma_k^2}.$$
        • 这个公式突出了奖励尺度的不平衡如何削弱某些维度的有效贡献
        • 理解:如果每个方差都相等 \(\sigma_k = c\),则 \(\eta_{\text{proj}}\) 的结果为 1
          $$
          \frac{(n c)^2}{n \cdot (n c^2)} = \frac{n^2 c^2}{n^2 c^2} = 1
          $$
    • GDPO 首先将每个奖励维度归一化为 ,然后再求和
      $$ A_{k} = (r_{k} - \mu_{k}) / \sigma_{k} = z_{k} $$
      • GDPO 聚合方向因此是
        $$ \mathbf{w}_{\text{GDPO} } = \mathbf{1}$$
        • 这与等权重参考方向完美对齐,并消除了 \(\eta_{\text{proj} }\) 在奖励维度层面捕捉到的方差缩放损失
      • 本质上,GDPO 做的不仅仅是重新缩放奖励,GDPO 恢复了实际优化方向与预期偏好方向之间的几何一致性
        • 这是其在混合奖励景观中有效性的基础
      • 然而,Z-分数归一化在 prompt 级别仍然可能不稳定
        • 当一个 prompt 级 Rollout 组包含偏态奖励、二元结果、平局或异常值时,GDPO Batch-level 归一化的优势质量可能会集中在一个 Rollout 上,而其余的 Rollout 获得接近零或被抑制的优势
        • 在这种情况下,策略更新实际上是由少数样本驱动的,即使在每个奖励标准化之后,等贡献的假设也变得不太可靠
        • GDPO 还假设奖励维度可以独立聚合,因此无法解决 \(\eta_{\text{corr} }\) 所捕捉的相关性损失
  • RDPO 旨在解决 \(\eta_{\text{eff} }\) 所测量的两种失效模式:
    • 幅度感知分位数 (Magnitude-Aware Quantile, MAQ) 使 prompt 级归一化优势对异质奖励尺度和异常值不那么敏感
    • 马氏白化 (Mahalanobis whitening) 减少了每个活跃奖励子空间中共同出现的奖励维度之间的冗余变异
    • 注:关于此机制的更多细节将在下一节提供
  • 图 1 报告了跨活跃任务子空间的平均 \(\eta_{\text{eff} }\)
    • 如图 1 所示,与 GDPO 归一化基线相比,RDPO 在整个训练过程中保持了更高的有效信息效率
    • 根据上述绝对相关定义,效率值为 1.0 作为独立奖励参考基线,更强的依赖性会单调地降低 \(\eta_{\text{corr} }\)
    • 图 1 中,对于四任务混合,首先评估每个活跃奖励子空间,然后聚合子空间值来计算平均 \(\eta_{\text{eff} }\)

RDPO:Reward-Decorrelated Policy Optimization,奖励 Decorrelated 策略优化

  • Decorrelated 表示 Decorrelated 含义
  • 本文首先为实验选择了四个代表性任务:
    • 指令跟随、通用写作、数学推理和代码生成
      • 注:所有这些任务都在一个统一的后训练运行中进行
    • 每个任务包含两到三个奖励
    • 这种配置使 RDPO 暴露于包含两个和三个奖励的子空间,以及二元、离散和连续奖励分布的混合
MAQ:Magnitude-Aware Quantile Normalization,幅度感知分位数归一化
The Problem
  • 投影项 \(\eta_{\text{proj} }\) 假设活跃奖励维度在聚合之前在可比较的标准化尺度上做出贡献
  • GDPO 尝试通过对每个奖励应用 per-reward Z-分数归一化来满足这一要求
    • 但这种线性变换仍然对每个 prompt 级 Rollout 组的分布形状高度敏感
  • 为了评估每个 prompt 内优势分配的稳定性,本文计算 prompt 级统计量并报告每个任务子空间的平均值
    • 对于归一化后的 Rollout 优势 \(\{A_{j}\}_{j = 1}^{G}\) ,使用 \(p_j\) 来衡量每个 Rollout 在 prompt 级绝对优势质量中的份额
      $$ p_{j} = \frac{|A_{j}|}{\sum_{\ell = 1}^{G}|A_{\ell}|} $$
      • 这给出了两个互补的诊断指标:
        • 优势主导度 \(\max_{j}p_{j}\) 衡量单个 Rollout 是否获得大部分更新信号
        • 有效 Rollout 参与度 \(\frac{1}{G\sum_{j}p_{j}^{2}}\) 衡量优势质量在 \(G\) 个 Rollout 之间的分布均匀程度
      • 这种方法突出了典型的 prompt 行为,而不是依赖于可能被少数极端组严重扭曲的汇集分布
    • 由于本文设置中的潜在奖励可以是二元、分数或连续的,因此即使在 Z-分数归一化之后,诸如偏态分布、平局和异常值等现象也可能将大部分归一化优势质量集中到单个 Rollout 上
    • 注:图 2 说明了这种失效模式:
      • GDPO 频繁表现出高 per-prompt 优势集中度和较低的有效 Rollout 参与度,表明策略更新可能由一小部分 Rollout 驱动,而不是稳定的组级别比较
      • 注:图 2 中,作者比较了 GDPO 的 Z-分数归一化与跨四个活跃任务子空间的 MAQ
        • 左图衡量每个 prompt 的优势主导度,定义为最大 Rollout 在绝对优势质量中所占的份额
        • 右图衡量有效 Rollout 参与度 \(\frac{1}{(G\sum_{j}p_{j}^{2})}\) ,其中 \(p_{j} \) 表示 prompt 内 Rollout \(j\) 的归一化绝对优势质量
        • MAQ 持续降低主导度并增加参与度,表明它使得异质奖励信号更具可比性,而不会让单个 Rollout 不成比例地主导 prompt 级更新
The Solution
  • 为了更好地满足非高斯奖励组下 \(\eta_{\text{proj} }\) 所依据的等贡献假设,本文提出了幅度感知分位数 (Magnitude-Aware Quantile, MAQ) 归一化
  • 当 prompt 级奖励统计量可靠时,Z-分数归一化提供了实现等尺度投影的最清晰的线性途径,但对于二元、平局、偏态或易于出现异常值的奖励,这一假设变得脆弱
  • MAQ 可以看作是一种鲁棒的替代方案
    • MAQ 将每个奖励维度映射到一个共同的有界正态得分尺度,从而使得到的优势在不同维度之间保持大致可比,同时对病态的组统计量不那么敏感
    • 与纯秩变换不同,MAQ 结合了幅度感知的间隙,以保留同一 prompt 内 Rollout 之间有意义的局部定量差异
    • 此外,与标准的 Z-分数归一化不同,它压缩了极端间隙,从而防止单个异常值主导 prompt 级优势分配
  • 对于每个 prompt \(i\) 和奖励 \(k\)
    • 给定一组排序后 的 \(G\) 个 Rollout 分数
      $$ r_1 \leq r_2 \leq \dots \leq r_G $$
    • 1)对数压缩 Gap (Log-compressed gaps) :计算相邻 Rollout 之间的间距:
      $$g a p_{j} = \log \left(1 + \frac{|r_{j + 1} - r_{j}|}{\beta\cdot\sigma_\text{global} }\right) \tag{1}$$
      • 其中 \(j = 1,\ldots ,G - 1\)
        • 特别注意:这里是有序的结果下计算的,不是随机顺序下计算
      • 这里,\(\sigma_\text{global}\) 是全局 batch 中奖励 \(k\) 的四分位距 (IQR,Inter-Quartile Range),作为一个鲁棒的尺度基准,\(\beta >0\) 控制压缩强度
        • 理解:这里用奖励的四分位距(一组数据的四分位距是: \(Q_3 - Q_1\),75 分位点 - 25 分位点),是在整个 Batch(而非单个 Prompt)内,针对同一个 Reward 维度(如 Math Reward、Length Reward),计算所有 Rollout 在该维度上分数的 IQR
        • 理解:相对标准差来说,IQR 是一个稳健的尺度估计量,不会因为少数 Outlier Rollout 而被拉偏
      • 这种对数压缩是鲁棒性的关键:它自然地限制了极端异常值的影响,同时对于小的、密集的间隙保持近似线性,以保留细微的组内差异
    • 2)CDF 分配 (CDF Allocation) :
      • 首先归一化 Gap
        $$ \text{norm_gap}_{j} = \frac{\text{gap}_{j}}{\sum_{j = 1}^{G - 1}\text{gap}_{j}} $$
      • 然后,将累积分布函数 (CDF) 位置 \(u_{(j)}\) 系统地按比例分配给这些归一化的间隙
      • 理解:即累积得到 CDF 位置:
        $$
        u_{(1)} = 0, \quad u_{(j+1)} = u_{(j)} + \text{norm_gap}_j, \quad u_{(G)} = 1
        $$
      • 理解:\(\{u_{(j)}\}_{j=1}^{G}\) 本质是一个从 [0-1] 的有序数组,共 G 个元素,其中间隔是第一步归一化过的 Gap,这里得到的结果是对 奖励 \(\{r_j\}_{j=1}^{G}\) 的 Outlier 不敏感的,且保原始奖励序的
    • 3)逆正态映射 (Inverse Normal Mapping) :最后,通过逆 CDF 将这些值映射到标准正态分布:
      $$A_{(j)} = \Phi^{-1}(u_{(j)}) \tag{2}$$
      • 理解:一般情况下,\(A_{(j)}\) 只是近似服从标准正态分布(不是严格服从),特别地,当 \(u_{(j)}\) 服从均匀分布时,\(A_{(j)}\) 服从标准正态分布
      • 理解:这里的 \(\Phi^{-1}\) 是标准真该分布 CDF 函数的反函数(CDF 的反函数也称为 (Percent Point Function,百分位点函数))
        • 设 \(Z\) 服从标准正态分布 \(N(0,1)\),其 CDF 为:
          $$
          \Phi(z) = P(Z \le z) = \int_{-\infty}^{z} \frac{1}{\sqrt{2\pi} } e^{-t^2/2} dt
          $$
          • CDF 是 从数值到概率 的映射:给定一个 Advantage 值 \(z\),输出在这个值左侧的累积概率(从负无穷到 \(z\) 的面积)
          • PPF 是 从概率到数值 的映射:给定一个累积概率 \(u \in [0,1]\),输出一个临界值 \(z\),使得累积概率恰好为 \(u\)
        • 数学关系:
          $$
          \Phi(z) = u \quad \Longleftrightarrow \quad z = \Phi^{-1}(u)
          $$
        • 直观例子(考试排名),假设某次考试成绩服从标准正态分布:
          • 考了 \(z=0\) 分,超过多少人:函数 CDF \(\Phi(0)\),比如 超过 50% 的人
          • 想超过 95% 的人,需要考多少分:函数 PPF \(\Phi^{-1}(0.95)\),比如 需要考 1.645 分
        • 在 MAQ 中,\(u\) 就是“想达到的排名位置” ,PPF 告诉我们应该分配多大的 Advantage \(A\) 给这个 Rollout
  • 如图 2 所示,MAQ 减少了跨四个任务子空间的 prompt 级优势主导度,并在归一化后保持了高有效 Rollout 参与度
    • 因此,MAQ 的作用不是直接 Decorrelate 奖励维度,而是在聚合之前产生一组更稳定、更具可比性的 per-reward 优势
    • 这支持了由 \(\eta_{\text{proj} }\) 捕捉的投影效率目标,同时将剩余的相关性冗余留给白化阶段
Mahalanobis Whitening,马氏白化
The Problem
  • 尽管 MAQ 在 prompt 级别稳定了单个奖励维度,但它本身并不能使不同的奖励维度相互独立
  • 这个限制正是 \(\eta_{\text{corr} }\) 所衡量的:
    • 如果两个共同出现的奖励包含重叠的信息,对它们求和可能会重复计算相同的变异
    • 如果它们负相关,求和可能会抵消有用的变异
  • 在本文的四个任务混合中,这种依赖性自然地在活跃奖励子空间内产生
    • 例如,数学奖励或代码奖励可能与长度奖励相关,ifeval 奖励可能与评分标准 (rubrics) 奖励相关,而 RM 奖励可能与评分标准奖励和长度奖励都相关
    • 更多细节在第 3.1 节中提供
    • 图 3 显示,在 GDPO 下,这些相关性是不可忽略的,特别是在代码生成、通用写作和数学推理子空间中
      • 图 3 展示了活跃任务子空间内的奖励相关性 (Reward correlation)
        • 每个面板对应一个任务条件下的奖励子空间
        • 本文报告了训练过程中共同出现的奖励维度之间的平均绝对皮尔逊相关系数
        • 与 GDPO 相比,RDPO 通过在 MAQ 归一化后应用马氏白化来降低子空间内的奖励相关性,有助于减少四任务训练混合中由 \(\eta_{\text{corr} }\) 捕捉的冗余
The Solution
  • 为了减轻奖励间相关性引起的冗余,RDPO 在 MAQ 归一化之后应用马氏白化
  • 在 MAQ 之后,每个 Rollout \((i,j)\) 由优势向量表示为:
    $$ \mathbf{A}^{(i,j)} = (A_{1}^{(i,j)},A_{2}^{(i,j)},\ldots ,A_{n}^{(i,j)})^{T}\in \mathbb{R}^{n}$$
    • 理解:\(\mathbf{A}^{(i,j)}\) 表示第 \(i\) 个 Prompt 的第 \(j\) 个 Rollout(response) 的所有奖励类别维度向量(\(n\) 代表奖励类型/维度数量),后续的马氏变换都是对这个向量的处理,最终结果是一个标量,即每个 Rollout \((i,j)\) 都有一个最终的结果
  • 马氏白化变换将其映射到一个 Decorrelated 向量:
    $$\mathbf{W}^{(i,j)} = \hat{\mathbf{\Sigma} }_{t}^{-1 / 2}\mathbf{A}^{(i,j)} \tag{3}$$
    • 其中 \(\hat{\mathbf{\Sigma} }_{t}^{- 1 / 2} = \mathbf{U}\mathbf{A}^{- 1 / 2}\mathbf{U}^{T}\) 通过运行协方差估计 \(\hat{\mathbf{\Sigma} }_{t} = \mathbf{U}\mathbf{A}\mathbf{U}^{T}\) 的特征分解计算
    • 给定一个准确的协方差估计,这个变换的目标是 \(\text{Cov}(\mathbf{W})\approx \mathbf{I}_{n}\) ,使活跃奖励维度趋向于不相关、单位方差的信号
    • 理解:对比 马氏白化和 Z-Score 标准化
      • Z-Score 标准化:减去均值,除以标准差,只消除了各维度的量纲差异
      • 马氏白化:减去均值,除以协方差矩阵的逆平方根,进一步消除了维度之间的线性依赖关系
    • 马氏白化的详细描述见附录:
      • 本文使用的不是原始的马氏白化(因为本文没有减去均值,仅仅除了协方差矩阵的逆平方根),原始的马氏白化是减去均值,除以协方差矩阵的逆平方根
  • Running Covariance Estimation,运行协方差估计
    • 在在线 RL 训练期间,真实的奖励协方差 \(\pmb{\Sigma}\) 是未知的,并且随着策略的演变而不断变化
    • 本文使用训练步骤上的指数移动平均 (Exponential Moving Average, EMA) 来维持一个稳定的估计:
      $$\hat{\mathbf{\Sigma} }_{t} = (1 - \alpha)\hat{\mathbf{\Sigma} }_{t - 1} + \alpha \hat{\mathbf{\Sigma} }_{\text{batch} } \tag{4}$$
      • \(\hat{\Sigma}_{\text{batch} }\) 是从当前 mini-batch 的 MAQ 归一化优势计算的样本协方差
      • \(\alpha \in (0,1)\) 是 EMA 衰减率
        • EMA 平滑了 batch 级别的噪声,并使白化矩阵能够跟踪缓慢演变的奖励相关结构
      • 为了在应用变换之前确保可靠的协方差估计,白化只在 \(T_{\text{warm} }\) 步的预热阶段之后才开始
      • 在本文的实现中,本文使用前五个训练步骤进行此预热
  • Subspace Whitening for Heterogeneous Tasks,针对异构任务的子空间白化
    • 在多任务设置中,单次 Rollout 很少能同时观察到所有 \(n\) 个奖励维度
      • 注:\(n\) 是指整个训练任务中所有可能的 reward 类型的总数
    • 当前的训练混合由四个活跃奖励子空间组成:{math, length},{code, length},{ifeval, rubrics} 和 {length, rm, rubrics}
      • 理解:接下来的归一化是分别在子空间上做的,对每个子空间分别进行马氏白化,所以虽然有求逆矩阵的过程,复杂度其实不会太高
      • 理解:对于每个子空间,每个奖励维度都有一个向量/变量,这个向量是所有这个子空间下,当前 Batch 的所有 Rollout 构成的,于是接下来才可以求不同维度之间的协方差,协方差矩阵的维度数就是 该子空间下的奖励维度数
    • 为了适应这种异构性,我们仅在观测到的子空间上应用白化:
      • 对于具有活跃奖励集 \(\mathcal{S}\) 的 Rollout
        $$\mathcal{S}\subseteq \{1,\ldots ,n\} $$
        • \(n\) 是指整个训练任务中所有可能的 reward 类型的总数
        • \(m\) 当前 rollout 实际观测到的 active reward 维度数
      • 提取主子矩阵
        $$\hat{\Sigma}_{\mathcal{S} }\in \mathbb{R}^{|\mathcal{S}|\times |\mathcal{S}|}$$
      • 并独立计算
        $$\hat{\Sigma}_{\mathcal{S} }^{- 1 / 2}$$
      • 这种方法确保仅当奖励维度在同一个任务内共同出现时才应用 Decorrelation,避免了从从未重叠的维度之间引入人为的协方差估计
  • Final Advantage
    • 用于 PPO/GRPO 策略梯度更新的标量优势通过对白化后的维度求和获得:
      $$A_{\text{sum} }^{(i,j)} = \sum_{k = 1}^{n}W_{k}^{(i,j)} = \mathbf{1}^{T}\mathbf{W}^{(i,j)} = \mathbf{1}^{T}\hat{\Sigma}_{t}^{-1 / 2}\mathbf{A}^{(i,j)} \tag{5}$$
  • 在理想的协方差估计下,其中 \(\text{Cov}(\mathbf{W}) = \mathbf{I}_n\) ,这个投影会捕捉到更少的跨维度冗余信息
    • 由于协方差是通过 EMA 在线估计并在特定的观测任务子空间内应用的,因此这个白化过程是减少相关性冗余的实用机制,而不是完美 Decorrelated 严格数学保证
    • 图 3 中的经验曲线显示,与 GDPO 相比,该机制在作者的训练混合中降低了平均绝对奖励相关性
      • 结合 MAQ,这种方法将聚合优势推向具有更高有效信息效率的、较少冗余的奖励机制
      • 与 GDPO 一样,本文随后应用 batch 级别的归一化以获得最终的优势估计

Training

Training Setup

  • 本文在 LongCat-Flash 的后训练阶段应用 RDPO
  • 策略在包含数学推理、代码生成、指令遵循和通用写作 prompt 的四个任务混合体上进行优化
  • 对于每个 prompt,模型采样一组 rollouts,接收为该任务定义的特定奖励信号子集,并从活跃奖励维度构建一个标量优势
  • 主模型采用完整的 RDPO 流程
    • 首先独立地对每个奖励维度应用 MAQ 归一化,以稳定 prompt 级别的优势分配
    • 然后在观察到的奖励子空间上执行马氏白化以减少相关冗余
    • 最后将得到的白化优势求和,并在策略梯度更新前进行批归一化
  • 这四个任务类别激活了不同的奖励子空间:
    • 数学推理样本使用 math+length
    • 代码生成样本使用 code+length
    • 指令遵循样本使用 ifeval+rubrics
    • 通用写作样本使用 length+rm+rubrics
    • 注:每个奖励的详细描述在下一节中提供
  • 这种异构设置代表了 RDPO 的预期用例
    • 由于不同的任务会暴露不同的奖励子集,活跃奖励在尺度、分布形状和相关性结构上可能存在显著差异

Reward Design

Rubrics Reward
  • 对于每个采样的 response,使用一个生成式奖励模型对其相关联的 rubric 集进行细粒度验证
  • 每个 rubric 的评估结果记录为一个二值变量,使用预定义的 rubric 权重计算加权平均值以获得最终的 rubric 奖励
    • 如果一个 response 未能满足任何标记为必要的标准,则总 rubric 奖励严格设置为 0
    • 否则,计算所有有效 rubric 上的归一化加权和,并将结果裁剪到 \([0,1]\) 区间
    • 这种设计确保了奖励既能覆盖明确的写作要求的广度,也能满足严格的关键约束
IFEval Reward
  • IFEval 奖励衡量 response 是否遵守明确的指令约束
  • 对于每个 response,作者调用与参考注释关联的基于规则的验证器,以评估格式、内容或行为要求
    • 标准的 IFEval 注释产生严格的通过/失败信号
    • 某些扩展数据集提供连续的分数
  • 在这两种情况下,此奖励为指令遵循能力提供直接监督,并主要反映对硬性任务约束的遵守情况
Math Reward
  • 数学奖励评估数学推理的正确性
  • 对于具有可验证最终答案的问题,评分器提取生成的答案,并使用精确匹配或特定任务的等价性检查将其与参考解决方案进行比较
  • 该指标为数学样本提供了主要的正确性信号,而 length 奖励则施加了补充性的压力以鼓励简洁推理
Code Reward
  • 代码奖励评估生成程序的功能正确性
  • 对于编码任务,评分器使用参考评估协议(例如,基于执行的检查或可用的特定任务验证器)评估生成的解决方案
  • 此奖励与 length 奖励配对,以确保面向代码的强化学习同时优化正确性和响应效率
RM Reward
  • RM 奖励由一个独立的奖励模型生成,以捕捉整体的 response 质量
  • 将 prompt 和 response 连接成一个完整的对话,并将其输入奖励模型以获得原始标量分数
  • 由于这些原始输出可能范围很广,将分数线性缩放到 \([0,1]\),以保持与其他奖励组件的数值一致性
  • 与基于规则的指标(如 rubrics 和 IFEval)不同,RM 奖励为流畅性、完整性、连贯性和主观质量提供了一个软偏好信号
    • RM Reward 作为补充信号而非硬性任务约束的替代
Length Reward
  • 长度奖励鼓励在不牺牲任务满意度的情况下生成简洁的 response
  • 对于每个 response,将生成的长度与参考统计数据进行比对:
    • 对于给定 Query,从基础模型的多次采样中,成功完成任务的平均长度
    • 该指标反映了基础模型的内在能力,并为后续训练建立了稳健的基线
  • 奖励设计:
    • 长度低于此阈值的 response 获得奖励 1
    • 长度超过阈值时,奖励会根据二次惩罚衰减,并被裁剪到 \([0,1]\) 区间
  • 这种表述避免了过度惩罚轻微的超长,同时对明显冗长的生成施加更严格的惩罚
Conditional Reward Handling
  • 在组合多个奖励之前,应用一个条件处理机制,以防止辅助信号补偿核心要求的失败
    • RM 奖励受 rubric 奖励约束:
      • 如果 rubric 奖励低于 0.5,RM 奖励被截断为 \(\min(r_{\text{rubric} },r_{\text{rm} })\)
      • 这确保了高的整体偏好分数不能掩盖对必要 rubrics 的违反
    • 对 length 奖励应用类似的门控规则
      • 对于指令遵循样本
        • 仅当满足 IFEval 约束时,length 奖励才被视为有效
        • 如果 IFEval 分数降至 0.5 以下,length 奖励会相应减少
      • 对于数学、代码和基于 rubric 的写作样本,当主要任务奖励低于 0.5 时,length 奖励也会被类似地截断
    • 理解:只有当 response 已经满足基本任务要求时,长度控制和整体偏好才能作为辅助优化信号

Evaluation

Evaluation Setup

  • 为了评估在训练任务类别上的表现,本文选择了一组多样化的挑战性基准,并将它们组织成四个评估集群:
    • 1)Instruction Following :此集群包括 IFEval (2023)、GuideBench (2025) 和 SOP-Maze (2025)
    • 2)Math and Knowledge Reasoning :此集群包括 AIME24、AIME25、GPQA (2024) 和 MATH500 (2023)
    • 3)Writing and Arena Evaluation :此集群包括 WritingBench (2025) 和 ArenaHard v2 (2024)
      • 对于 ArenaHard v2,报告两个互补的子集:AH-Hard 和 AH-Creative
    • 4)Coding :此集群包括 FullStackBench (2024)、HumanEval+ (2021)、MBPP+ (2021) 和 LiveCodeBench v6 (2024)

Small-Scale Validation on a Same-Family Smaller Model,在同系列小型模型上的小规模验证

  • 在将 RDPO 扩展到更大的 LongCat-Flash 后训练运行之前,本文首先在来自同一系列的一个较小的内部模型上验证该方法
    • 这个初步阶段有两个主要目的:评估完整的奖励解耦流程是否在相关基线上有所改进,并分离其两个核心组件(MAQ 归一化和马氏白化)的贡献
  • 表 2 和表 3 显示了初步性能,支持了更大规模的 LongCat-Flash 试验
    • 完整的流程在 IFEval、AIME24、AH-Hard、FullStackBench、HumanEval+ 和 MBPP+ 上相比 GDPO 基线有所改进
    • 此外,组件级别的分析表明,MAQ 和白化提供了互补的优势:
      • MAQ 在几个对分布敏感的指标(包括 AH-Creative)上表现强劲,而白化在相关性敏感的设定中有所帮助
    • 这些实证结果激发了为 LongCat-Flash 后训练运行采用完整 RDPO 方案
  • 表 2:在同系列小型模型上的小规模验证,在代表性指标上将 RDPO 与 GDPO、GRPO 以及 RL 初始化模型进行比较
  • 表 3:在相同小型模型设定下的组件验证,使用相同的代表性基准集来比较基础的 GDPO 设定、仅 MAQ (Q)、仅白化 (M) 以及组合的 RDPO 变体 \((Q + M)\)

Scaled LongCat-Flash Post-Training Results,扩展训练结果

  • 在小规模验证阶段之后,本文将完整的 RDPO 流程扩展到 LongCat-Flash
    • 本文的 LongCat-Flash 评估侧重于端到端的可扩展性
    • 本文研究了完整的奖励解耦优势构建在更大的后训练机制中是如何表现的
  • 如表 4 所示,LongCat-Flash RDPO 模型主要在与混合奖励训练目标一致的能力上取得了提升
    • 在评估的三个模型中,RDPO 在 IFEval 和 SOP-Maze 上获得了最高分,同时在 WritingBench 以及报告的两个 ArenaHard v2 子集(AH-Creative 和 AH-Hard)上也取得了显著的提升
    • 这些结果与前文的小规模验证一致:稳定 prompt 级别的优势分配和减少奖励冗余似乎对指令遵循以及开放式、偏好敏感的评估很有用
  • 在其余的推理和代码评估上,比较结果好坏参半但表现稳定
    • RDPO 在 MATH500 上达到了最高分,并在 AIME2025 和 GPQA 上保持竞争力
    • Init. 或 GRPO 在个别指标上可能仍然更强
  • 代码结果遵循类似的模式:
    • RDPO 在 MBPP\(^+\) 和 LiveCodeBench v6 上领先
    • GRPO 或 Init. 在 FullStackBench 和 HumanEval\(^+\) 上仍然更强
  • Scaled LongCat-Flash 实验表明,完整的 RDPO 方案可以从较小的模型验证中迁移过来,并在推理和代码结果上广泛保持稳定
  • 表 4:本文在涵盖指令遵循、数学与知识推理、写作与竞技场式评估以及代码的代表性基准上比较了 RL 初始化模型 (Init.)、GRPO 和 RDPO

附录:常见分布的 CDF 介绍

标准正态分布的 CDF

  • \(\Phi(z)\) 专门表示标准正态分布的 CDF :
    $$
    \Phi(z) = \int_{-\infty}^{z} \frac{1}{\sqrt{2\pi} } e^{-t^2/2} dt
    $$
    • 均值为 0
    • 方差为 1
    • 记作 \(N(0,1)\)
  • 这是统计学和机器学习论文中的通用约定

非标准正态分布的 CDF 表示方法

  • 对于一般正态分布 \(N(\mu, \sigma^2)\),CDF 通常用以下几种方式表示:
方法一:用 \(\Phi\) 标准化后表示
  • 比如:
    $$
    F_{X}(x) = \Phi\left(\frac{x - \mu}{\sigma}\right)
    $$
    • 这是最常见、最简洁的写法
    • 例如:
      • \(X \sim N(\mu, \sigma^2)\)
      • \(F_X(x) = P(X \le x) = \Phi\left(\frac{x - \mu}{\sigma}\right)\)
方法二:用 \(F\) 加下标
  • 比如:
    $$
    F_{N(\mu, \sigma^2)}(x) \quad \text{或} \quad F_X(x)
    $$
    • 然后用文字说明 “where \(X \sim N(\mu, \sigma^2)\)”
方法三:用不同字母区分
  • 具体方式对比:
    分布 CDF 符号 示例
    标准正态 \(N(0,1)\) \(\Phi(z)\) \(\Phi(1.96) \approx 0.975\)
    一般正态 \(N(\mu, \sigma^2)\) \(\Phi_{\mu,\sigma}(x)\) 或 \(F(x;\mu,\sigma)\) 不常用
    任意分布 \(F_X(x)\) 通用符号

补充:其他常见分布的 CDF 符号

  • 常见分布的 CDF 表示
    分布 CDF 符号 PPF 符号
    标准正态 \(N(0,1)\) \(\Phi(z)\) \(\Phi^{-1}(u)\)
    均匀分布 \(U(0,1)\) \(F(x) = x\) 或 \(U(x)\) \(U^{-1}(u) = u\)
    指数分布 \(\text{Exp}(\lambda)\) \(F(x) = 1 - e^{-\lambda x}\) \(F^{-1}(u) = -\frac{\ln(1-u)}{\lambda}\)
    任意分布 \(F_X(x)\) \(F_X^{-1}(u)\)

附录:马氏白化与 Z-Score 归一化的区别

  • 从纯粹的数学视角来看:
    • Z-Score 标准化只消除了各维度的量纲差异
    • 马氏白化(Mahalanobis Whitening)进一步消除了维度之间的线性依赖关系
  • 总结对照表
    性质 Z-Score 标准化 马氏白化
    变换后均值 零向量 零向量
    变换后各维度方差 1 1
    变换后各维度相关性 保留原相关矩阵 \(\mathbf{P}\) 完全消除,变为 0
    变换后的协方差矩阵 \(\mathbf{P}\)(相关矩阵) \(\mathbf{I}\)(单位阵)
    几何效果 各轴独立缩放,不旋转 旋转 + 缩放,得到球体
    旋转不变性 否 是
    对异常值敏感性 中等 高
    计算复杂度 \(O(d)\) \(O(d^3)\)
    需要估计的参数 \(d\) 个均值,\(d\) 个方差 \(d\) 个均值,\(d(d+1)/2\) 个协方差

数学定义

  • 设原始随机向量为
    $$\mathbf{x} = (x_1, x_2, \ldots, x_d)^T \in \mathbb{R}^d$$
    • 均值为 \(\boldsymbol{\mu}\)
    • 协方差矩阵为 \(\boldsymbol{\Sigma}\)
  • Z-Score 标准归一化 :
    • 对每个分量独立操作:
      $$
      x_i’ = \frac{x_i - \mu_i}{\sigma_i}
      $$
      • 其中 \(\sigma_i = \sqrt{\boldsymbol{\Sigma}_{ii} }\)
    • 写成向量形式:
      $$
      \mathbf{x}’ = \mathbf{D}^{-1/2} (\mathbf{x} - \boldsymbol{\mu})
      $$
      • 这里 \(\mathbf{D}\) 是对角矩阵
        $$ \mathbf{D} = \text{diag}(\boldsymbol{\Sigma}_{11}, \boldsymbol{\Sigma}_{22}, \ldots, \boldsymbol{\Sigma}_{dd})$$
  • 马氏白化 :
    • 利用完整的协方差矩阵:
      $$
      \mathbf{z} = \boldsymbol{\Sigma}^{-1/2} (\mathbf{x} - \boldsymbol{\mu})
      $$
      • 其中 \(\boldsymbol{\Sigma}^{-1/2}\) 是协方差矩阵的逆平方根
      • 计算方式:
        • 通常先对 \(\boldsymbol{\Sigma}\) 进行特征分解
          $$ \boldsymbol{\Sigma} = \mathbf{U} \boldsymbol{\Lambda} \mathbf{U}^T$$
        • 然后再计算:
          $$
          \boldsymbol{\Sigma}^{-1/2} = \mathbf{U} \boldsymbol{\Lambda}^{-1/2} \mathbf{U}^T
          $$

变换后的协方差结构

  • Z-Score 标准化后 :
    $$
    \text{Cov}(\mathbf{x}’) = \mathbf{D}^{-1/2} \boldsymbol{\Sigma} \mathbf{D}^{-1/2} = \mathbf{P}
    $$
    • 其中 \(\mathbf{P}\) 是相关矩阵 ,其对角线元素均为 1,但非对角线元素 \(\rho_{ij} = \frac{\boldsymbol{\Sigma}_{ij} }{\sqrt{\boldsymbol{\Sigma}_{ii}\boldsymbol{\Sigma}_{jj} } }\) 一般不为零
    • 即:各分量方差变为 1,但相关性依然保留
  • 马氏白化后 :
    $$
    \text{Cov}(\mathbf{z}) = \boldsymbol{\Sigma}^{-1/2} \boldsymbol{\Sigma} \boldsymbol{\Sigma}^{-1/2} = \mathbf{I}
    $$
    • 即变换后的向量各分量方差为 1,且协方差(相关性)为零 ,达到完全去相关

几何解释

  • 将 \(\mathbf{x}\) 视为高维空间中的一个数据点云,其分布呈椭球状
  • Z-Score 标准化 :将椭球的每个轴独立缩放至单位长度,但不旋转坐标轴
    • 结果是一个各轴长度相等但轴方向仍与原坐标轴平行的椭球
    • 如果原数据有倾斜的相关结构(即椭球主轴不与坐标轴对齐),标准化后的椭球仍然是倾斜的
  • 马氏白化 :
    • 先旋转坐标轴使其与椭球的主轴对齐(通过 \(\mathbf{U}^T\))
    • 再对各主轴缩放至单位长度(通过 \(\boldsymbol{\Lambda}^{-1/2}\))
    • 最后再旋转回原坐标系(通过 \(\mathbf{U}\))。结果是数据点云变成一个各向同性的球体 ,即所有方向上的方差相等且无相关性

对线性变换的敏感性

  • Z-Score 标准化 :对每个维度独立进行,因此在数据的正交变换(旋转)下不能保持形式不变
    • 如果对 \(\mathbf{x}\) 施加一个旋转矩阵 \(\mathbf{R}\),先旋转再标准化,与先标准化再旋转,结果不同
  • 马氏白化 :具有旋转不变性
    • 对 \(\mathbf{x}\) 施加任意可逆线性变换 \(\mathbf{A}\) 后再进行马氏白化,等价于先马氏白化再施加同一变换的某种规范化形式
    • 本质上,马氏距离 \(\sqrt{(\mathbf{x} - \boldsymbol{\mu})^T \boldsymbol{\Sigma}^{-1} (\mathbf{x} - \boldsymbol{\mu})}\) 本身是旋转不变的,而白化是该距离的线性实现

对异常值的鲁棒性

  • Z-Score 标准化 :均值和标准差对异常值敏感
    • 一个极端 outlier 会拉大 \(\sigma_i\),导致正常数据被过度压缩到接近零的区域
  • 马氏白化 :更加敏感
    • 因为协方差矩阵 \(\boldsymbol{\Sigma}\) 对异常值极其敏感(异常值会产生大的协方差项),同时 \(\boldsymbol{\Sigma}^{-1/2}\) 的计算依赖特征分解,异常值可能严重扭曲特征空间
    • 因此,马氏白化通常要求数据已经经过预处理以去除明显异常值(本文中就是经过预处理的)

计算复杂度

  • Z-Score 标准化 :\(O(d)\) 时间和空间复杂度,仅需计算每个维度的均值和方差
  • 马氏白化 :\(O(d^3)\) 时间复杂度(特征分解)和 \(O(d^2)\) 空间复杂度(协方差矩阵存储)
    • 对于高维数据(如 \(d \gg 10^4\)),计算代价极高,甚至不可行

NLP——LLM对齐微调-TCOD

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始论文:TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents, 20260429, Tongyi Lab

Paper Summary

  • 个人整体总结:
    • 作者发现:vanilla OPD 在多轮 Agent 中的一个基本失效模式: Trajectory-Level KL Instability
      • 观察:KL 散度随着成功率的下降而增加,并且即使在收敛后,KL 散度仍然很高,导致训练不稳定
      • Trajectory-Level KL Instability 定义:跨轮的复合错误导致 KL 散度不断升级和不可靠的教师监督信号
        • 随着错误的累积,学生模型被推到了教师有效支持范围之外的状态 ,使得监督信号变得不可靠
    • 解决方法:TCOD (Temporal Curriculum On-Policy Distillation) 框架
      • TCOD 核心思路:控制暴露给学生的轨迹深度,并通过由可配置的课程增长率控制的步调策略 ,逐步将其从短轨迹扩展到长轨迹
      • TCOD 有两种变体:
        • Forward-to-Backward (TCOD-F2B):将学生限制在轨迹的早期步骤,并逐步将其扩展到最大探索 Horizon
        • Backward-to-Forward (TCOD-B2F):利用教师将 Agent 导航到接近终止状态,减轻早期步骤的错误累积,同时逐步将学生的 Rollout Horizon 向后扩展到初始阶段
    • 特殊发现:TCOD 性能可以超越教师
      • 在教师 pass@10 采样失败的 ALFWorld 困难划分上,TCOD-B2F 的成功率比教师高出 14 个百分点,展示了超越教师自身能力边界的泛化能力
      • 理解:这个可能和学生本身在特定场景针对自身策略采样和修正有关
        • 注意:本文的结论不太 Solid,这个能力不一定是 TCOD 带来的,因为 Vanilla OPD 也在 Hard 熵表现出了超越教师的能力(如 表 2 所示),说明 OPD 本身就已经拥有了超过教师的潜力了
        • 而且 表 3 中并没有看到学生模型超过教师模型
    • 注意:论文目标公式中使用的是 Forward KL,应该是写错了,收集样本使用 Student,所以计算得到的 KL 散度应该是 Backward KL
    • 创新思考:
      • 针对单轮的场景,也可以使用类似 TCOD 的方式解决长文本下的 OPD 问题,固定一批数据集,先训练前 4K 一个 epoch,再训练前 8 K 一个 epoch,再训练 12 K 一个 epoch,以此类推
        • 核心思路:让学生的前缀先贴近教师,再训练学生后面的分布贴近教师(此时教师能给出不错的信号指导了)

Introduction and Discussion

  • 当前主要 OPD 方法本质上是为静态的单轮推理设计的
  • 多轮机制中直接应用 vanilla OPD 会导致一种基本的失败模式:Trajectory-Level KL Instability
    • 通过在 ALFWorld (2020) 上的实验,发现
      • (i) 学生模型同时遭受 KL 散度升级和成功率崩溃的问题
      • (ii) 尽管它们最终收敛,但开始时 KL 散度非常高,这两者都会导致训练不稳定
    • 关键:图 1 (左) 揭示了其潜在机制:
      • 跨轮次的累积错误逐步将学生推向教师有效支持范围之外的状态
      • 结果导致教师对学生生成 Response 中的 Token 分配了更低的概率,表明每一轮的 KL 散度都在增加,使其监督信号变得不可靠
  • 图 1:
    • (左) 在多轮 Agent 的 OPD 中,随着轮次增加,教师对学生生成 Response 中的 Token 分配的概率逐渐降低,表明每一轮的 KL 散度都在增加,使得监督信号不可靠
    • (右) OPD 使用所有轮次,因此包含了累积错误,而 TCOD-F2B/B2F 逐步从短轨迹扩展到长轨迹,减轻了计算错误轮次的问题
  • TCOD 核心思想:控制暴露给学生的轨迹深度,并通过由可配置的课程增长率控制的步调策略 ,逐步将其从短轨迹扩展到长轨迹
    • 如图 1 (右) 引入了两个仅需最少代码修改的实用变体:
      • Forward-to-Backward (TCOD-F2B):将学生限制在轨迹的早期步骤,并逐步将其扩展到最大探索 Horizon
      • Backward-to-Forward (TCOD-B2F):利用教师将 Agent 导航到接近终止状态,减轻早期步骤的错误累积,同时逐步将学生的 Rollout Horizon 向后扩展到初始阶段
  • 基于 TCOD-F2B/B2F,在三个多轮 Agent 基准测试上评估了四个师生模型对:
    • 基准:ALFWorld (2020),WebShop (2022a) 和 ScienceWorld (2022)
    • 结论:TCOD 减轻了 KL 不稳定性,并通过将 Qwen3-1.7B 从接近零的成功率中恢复出来,并将较大的模型 (例如 Qwen2.5-7B) 的性能提升了高达 15.71 个成功率点,同时平均减少了 2.97 个行动轮次
  • 特别提到:
    • TCOD 不仅仅是模仿教师
      • 在教师 pass@10 采样失败的 ALFWorld 困难划分上,TCOD-B2F 的成功率比教师高出 14 个百分点,展示了超越教师自身能力边界的泛化能力
      • TCOD-F2B/B2F 对课程增长率具有鲁棒性,性能变化小于 2%,并且与 vanilla OPD 相比,总训练时间减少了高达 32%

Related Work 解读

LLM-based Multi-turn Agents

  • 多轮 Agent 的挑战:
    • 长期 Horizon 的信用分配 (2025)
    • 内存管理 (2026)
    • 稀疏奖励设定下强化学习的样本效率低下 (2025; 2026)

On-Policy Distillation and its Limitations

  • OPD 的改进包括目标设计 (2026; 2026)、优化启发式方法 (2026) 以及替代监督源 (2026; 2026)
  • 提高 OPD 训练稳定性和收敛性的方法:
    • 平衡前向和后向 KL 项 (2026; 2026)
    • 整合 RL 风格的启发式方法如奖励裁剪 (2026)
  • 注:这些方法主要针对单轮设定设计,并未直接解决多轮 Agent 环境的问题

Curriculum Learning

  • 课程学习 (Curriculum learning) (2009) 是一种训练策略,模型随着其能力的增长而逐渐接触更难的样本
  • 本文通过定义随轨迹深度增加而增加的难度来避免这两种情况,仅使用学生生成的数据,保持训练简单、on-policy 且更稳定

Preliminary

  • 本文考虑在有限 Horizon 内与环境交互的多轮自主 Agent
    • 令 \(t\in \{0,\ldots ,T - 1\}\) 表示轨迹内的轮次索引,其中 \(T\) 是最大交互步数
    • 在每个轮次 \(t\) ,Agent 接收一个观察 \(o_{t}\) ,生成一个 Response \(a_{t}\) ,然后环境返回下一个观察 \(o_{t + 1}\)
    • 每个 Response \(a_{t}\) 由一个思维链推理轨迹后跟一个可执行动作组成(遵循最近的 Agent 框架 (2025a))

History State for Multi-turn Agent

  • 由于环境通常是部分可观测的,将 Agent 状态定义为直到当前观察的完整交互历史:
    $$h_{t} = (o_{0},a_{0},o_{1},a_{1},\ldots ,o_{t - 1},a_{t - 1},o_{t}). \tag {1}$$
  • 一个完整的轨迹则为
    $$\tau = (h_{0},a_{0},h_{1},a_{1},\ldots ,h_{T - 1},a_{T - 1})$$
    • 当采取终止动作或达到 Horizon \(T\) 时终止

On-Policy Distillation for Multi-turn Agent

  • 给定一个教师策略 \(\pi_{\phi}\) 和一个学生策略 \(\pi_{\theta}\) ,on-policy 蒸馏的目标是在学生自身的状态分布下,使学生与教师对齐,目标是:
    $$\mathcal{L}_{\text{OPD} }(\theta) = \mathbb{E}_{\tau \sim \pi_{\theta} }\left[\sum_{t = 0}^{T - 1}\mathcal{D}_{\text{KL} }(\pi_{\phi}(a_t\mid h_t)\parallel \pi_{\theta}(a_t\mid h_t))\right], \tag {2}$$
    • 问题:传统 OPD 中不应该是使用 下面的 Reverse KL 表达式吗?
      $$ \mathcal{L}_{\text{OPD} }(\theta) = \mathbb{E}_{\tau \sim \pi_{\theta} }\left[\sum_{t = 0}^{T - 1}\mathcal{D}_{\text{KL} }(\color{red}{\pi_{\theta}(a_t\mid h_t)\parallel \pi_{\phi}(a_t\mid h_t)})\right] $$
      • 推测1:作者确实刻意使用了 Forward KL
      • 推测2:作者笔误了,不然无法解释后续方法的采样轨迹是 Student 采样的(On-Policy)收集数据
  • 其中 \(\mathcal{D}_{\text{KL} }(\pi_{\phi}\parallel \pi_{\theta})\) 是衡量教师策略 \(\pi_{\phi}\) 和学生策略 \(\pi_{\theta}\) 之间差异的 KL 散度:
    $$ \mathcal{D}_{\text{KL} }(\pi_{\phi}\parallel \pi_{\theta}) = \sum_{a_{t} }\pi_{\phi}(a_{t}\mid h_{t})\log \frac{\pi_{\phi}(a_{t}\mid h_{t})}{\pi_{\theta}(a_{t}\mid h_{t})}$$

TCOD: Temporal Curriculum On-Policy Distillation

  • 观察:OPD 在多轮 Agent 设定中的一个关键限制,称为 Trajectory-Level KL Instability
    • OPD 在长期交互中存在不稳定性,其中累积错误导致 KL 散度升级和性能下降
  • TCOD:时间课程策略,在训练过程中逐步控制轨迹深度,以提高多轮蒸馏的稳定性和有效性

Trajectory-Level KL Instability in Multi-Turn On-Policy Distillation

  • 在 ALFWorld 检查 OPD 在多轮设定下的行为
  • 系统地评估了跨越 Qwen3 和 Qwen2.5 模型家族的师生模型对,包括更大规模和领域适应的教师
    • 对于 Qwen3,使用 Qwen3-30B-A3B-Instruct 作为教师,Qwen3-{0.6, 1.7, 4}B 作为学生
    • 对于 Qwen2.5,采用一个 GRPO 训练的 Qwen2.5-7B 模型作为教师,Qwen2.5-{0.5, 1.5, 3, 7}B 作为学生
  • 图 2: ALFWorld 上不同师生对的轨迹级 KL 分析
    • (a)(b) 显示 KL 散度在整个训练过程中升级,任务完成率崩溃
      • 理解:(b) 中可以看到蓝色线一开始还能成功一些,训练到后期完全失败了
      • 问题:图 2(b)中的纵轴是成功率,而不是竖轴写着的 Rollout Env Done Mean?
    • (c) 显示 OPD 训练期间初始和收敛的 KL 散度之间存在巨大差距
    • (d) 揭示了根本原因:KL 散度随轮次索引增长,表明错误在轨迹上被复合放大
Observation 1: KL escalation and success rate collapse co-occur during training,KL 升级和成功率崩溃在训练过程中同时发生(理解:这个现象是在较小 Student 模型中观察到的)
  • 多轮与单轮场景的 KL 表现不同
    • 单轮设定 (如数学或问答) 中:KL 散度在整个训练过程中持续收敛和下降
    • 多轮 Agent 场景中:KL 散度随着训练步数的增加而升级
  • 如图 2a 和 2b 所示,当学生模型 (Qwen3-{0.6,1.7}B) 在强大的教师 (Qwen3-30B-A3B-Instruct) 下使用 vanilla OPD 进行训练时,轨迹级 KL 散度迅速升级,任务成功率崩溃到接近零
    • 理解:这个现象是在较小 Student 模型中观察到的
Observation 2: Although KL divergence converges, it suffers from a prohibitively high initial value
  • 在不同的学生模型上进行实验,观察到尽管它们的 KL 散度最终收敛,但开始时的值高得令人望而却步
    • 问题:Observation 1 中不是说 KL 会变大吗?怎么 Observation 2 又收敛了
    • 理解:Observation 1 中的这个现象是在较小 Student 模型中观察到的;Observation 的 Student 模型都偏大一些
  • 如图 2c 所示,在不同的师生对中 (从 Qwen3-30B-A3B-Instruct 蒸馏的 Qwen3-3B,以及从 GRPO 训练的 Qwen2.5-7B 模型蒸馏的 Qwen2.5-{3,7}B)
    • 初始 KL 散度 ( \(\sim 1000\) ) 通常比其收敛值 ( \(\sim 60\) ) 大几个数量级,表明在多轮 OPD 训练期间存在严重的不稳定性
    • 更多细节参见附录 B
补充 附录 B Additional Observation
  • 对于 Qwen3,使用 Qwen3-30B-A3B-Instruct 作为 Teacher,Qwen3-{0.6, 1.7, 4}B 作为学生

  • 对于 Qwen2.5,采用 GRPO 训练的 Qwen2.5-7B 模型作为 Teacher,Qwen2.5-{0.5, 1.5, 3, 7}B 作为学生

  • Observation 1: KL escalation and success rate collapse co-occur in small models (<3B)

    • 观察 1:小模型(<3B)中 KL 升级(KL escalation)和成功率崩溃(success rate collapse)同时发生
    • 在单轮设置中 KL 散度通常在训练过程中减少并稳定,在多轮 Agent 环境中观察到了根本不同的行为
    • 如图 7 所示,当使用 vanilla OPD 训练小型学生模型(Qwen3-0.6B, 1.7B 和 Qwen2.5-0.5B, 1.5B)时,轨迹级别的 KL 散度随着训练进程急剧增加
      • 这种升级伴随着成功率几乎降至零的同时崩溃
    • Response 长度在各轮次中稳步增长,表明误差复合和越来越偏离分布的轨迹
      • 这些结果表明,在多轮设置中,小模型无法在其自身的 Rollout 分布下保持与 Teacher 的对齐,导致训练动态不稳定和无效的监督信号
  • 图 7:跨教师-学生对的 KL 升级(KL Escalation)和成功率(注:学生模型小于 3B)

    • 在 ALFWorld 上使用 vanilla OPD 评估 Qwen3-{0.6B, 1.7B}(教师:Qwen3-30B-AB3-Instruc)和 Qwen2.5-{0.5B, 1.5B}(教师:Qwen2.5-7B-RL)
  • Observation 2: Teacher–student matching matters; stronger teachers are not always better

    • 观察 2:教师-学生匹配很重要;更强的 Teacher 并不总是更好
    • 图 8 中进一步研究了教师-学生配对的影响
      • 对于 3B 学生,在强 30B Teacher 和 7B RL Teacher 下训练会导致类似的结果:
        • KL 散度稳定下降,成功率以相当的速率提高,表明将 Teacher 强度增加到某点以上并不会带来额外的好处
      • 当学生容量与 Teacher 更匹配时(7B 学生与 7B RL Teacher),KL 散度收敛显著更快,成功率上升更迅速,优于两种 3B 学生设置
        • 这表明适当的师生容量匹配比绝对的 Teacher 强度更关键;过强的 Teacher 不一定能提高,甚至可能限制多轮设置中的蒸馏效率
  • 图 8:跨教师-学生对的 Horizon 诱导的 KL 升级(Horizon-Induced KL Escalation),注:学生模型大于等于 3B

    • 在 ALFWorld 上使用 vanilla OPD 评估 Qwen2.5-{3B, 7B}(教师:Qwen3-30B-AB3-Instruct, Qwen2.5-7B-RL)
The underlying mechanism: Compounding error amplification over the trajectory
  • 直接将 OPD 应用于 Agent 为何会导致这种 KL 升级和训练不稳定性?
    • 图 2d 可视化了从 GRPO 训练的 Qwen2.5-7B 和 Qwen3-30B-A3B-Instruct 蒸馏 Qwen2.5-3B 时每一轮的 KL 散度,并观察到随着轮次索引持续增加
    • 无论增加的 KL 散度是反映了学生模仿教师能力的不足,还是学生进入教师变得不确定的分布外状态的结果,根本问题都是一样的:跨轮次的错误累积
  • 这是长期 Horizon 多轮 Agent 的一个固有属性:
    • 学生生成的动作和观察被附加到历史 \(h_t\) 中,导致跨轮次的因果耦合,并导致 KL 散度上升的趋势
      • 理解:当学生分布和教师分布差异较大时,学生生成的轨迹长度越长,教师模型能作为参考的能力越弱(因为教师自身不可能生成这种轨迹)
        • 注:毕竟教师模型训练目标是生成优质的轨迹,并不是修正学生模型的任意长度错误轨迹
  • 基本观察:
    • 对于小型学生来说,这是灾难性的
    • 对于较大的学生,它被部分容忍但仍然非常低效
    • 注:这也和上面的理解差不多一致
Remark 1
  • Long-CoT 增加了在相同环境状态下的 Response 长度
    • 多轮 Agent 通过在每个交互中整合新的观察和动作来更新环境状态,从而在轨迹上放大复合错误
    • 理解:多轮 Agent 难度可能是更高的,因为多轮 Agent 中不同模型输出得到的环境反馈可能是完全不同的,这可能更容易导致教师模型从未见过类似的状态
  • 上述观察和分析提出了一个挑战:作者如何才能保留 OPD 密集信号的益处,同时避免长期交互中累积错误导致的不稳定?
    • 为了解决这个问题,转向课程学习,其中模型首先在简单问题上训练,然后逐步接触难题

Our Proposal: Temporal Curriculum On-Policy Distillation

  • 基于前一部分的观察和见解,TCOD,这是一种原则性的方法,在训练过程中控制 Agent 交互的轨迹深度
  • 具体来说,引入了两个变体:TCOD-F2B 和 TCOD-B2F,它们分别在前向和后向课程中明确施加步数约束
  • 图 3:
    • TCOD-F2B/B2F 概览
      • vanilla on-policy 蒸馏与 TCOD 的比较
    • 左图是 OPD,中图是 TCOD-F2B 的图示,右图是 TCOD-B2F
      • \(k\) 是控制轨迹长度的线性步调
    • 蓝色步骤由学生执行,红色步骤由教师执行且梯度停止
Forward-to-Backward Induced Temporal Curriculum On-Policy Distillation (TCOD-F2B)
  • 通过在训练过程中限制轨迹的最大交互步数来实现一种“浅到深”的课程
  • 如图 3 (中) 所示,在 TCOD-F2B 中,学生策略 \(\pi_{\theta}\) 最多 Rollout \(k\) 步来完成任务,其中 \(k\) 从一个较小的数字开始,逐步增加到一个较大的数字,目标如下:
    $$\mathcal{L}_{T C O D - F2B}(\theta) = \mathbb{E}_{\tau \sim \pi_{\theta} }\left[\sum_{t = 0}^{k - 1}\mathcal{D}_{K L}\left(\pi_{\phi}(a_{t}|h_{t})\parallel \pi_{\theta}(a_{t}|h_{t})\right)\right], \tag {3}$$
  • 其中学生首先专注于早期轮次的学习信号,然后逐步端到端地完成任务,从而减轻复合错误并防止 Horizon 引起的 KL 崩溃
    • 但确定最佳的步长大小和起点是具有挑战性的,因为不同的环境和模型表现出不同的推理能力,为了解决这个问题,采用跨训练步骤的线性步调:
      $$k = k_{\text{start} } + \lfloor n / \eta \rfloor ,n\in 1,\ldots ,N, \tag {4}$$
      • \(n\) 表示当前训练步数 Global Step
      • \(N\) 是总训练步数(总计 Step)
      • \(k_{\text{start} }\) 定义初始交互步数
      • \(\eta\) 控制课程增长率
  • 这种方法只需要很少的代码更改,整个算法如下:
  • 此外,为了更好地利用教师模型,提出了 TCOD-B2F,它利用教师来避免早期轮次的错误累积
Backward-to-Forward Induced Temporal Curriculum On-Policy Distillation(TCOD-B2F)
  • 在这个变体中,教师策略 \(\pi_{\phi}\) 充当一个“导航器(Navigator)”
  • 通过执行使用教师策略 \(\pi_{\phi}\) 预先收集的成功轨迹 \(\tau^{*}\) 的初始前缀 ,将环境初始化到一个中间状态,并让 Agent 从这个状态开始交互
  • 如图 3 所示,教师在其成功轨迹 \(\tau^{*}\) 中执行前 \(L - k\) 步,之后学生策略 \(\pi_{\theta}\) 从这个即时状态接手继续规划和执行,目标如下:
    $$\mathcal{L}_{\text{TCOD_B2F} }(\theta) = \mathbb{E}_{\tau \sim (\pi_{\phi},\pi_{\theta})}\left[\sum_{t = L - k + 1}^{T - 1}\mathcal{D}_{KL}\left(\pi_{\phi}(a_t|h_t)\parallel \pi_{\theta}(a_t|h_t)\right)\right], \tag {5}$$
    • \(L\) 表示给定任务的成功轨迹 \(\tau^{*}\) 的长度
    • \(k\) 如公式 4 定义,在整个训练过程中单调扩展,直到学生端到端地完成任务
    • 这种实现同样轻量级,只需要一个简单的预热循环,如下所示
  • 注意:在 TCOD-B2F 中使用的是 Teacher 能够成功的轨迹作为候选轨迹
    • 问题:如果是确定性环境的话,在 Algorithm2 的第 7 行是不是不需要从头执行一遍了,直接截断教师轨迹中的前半部分就可以作为初始轨迹状态,直接进入学生轨迹收集吧
  • 这种机制通过确保学生仅在由教师验证的成功前缀发起的轨迹上进行优化,有效地绕过了复合动作错误
    • 至关重要的是,轨迹中的教师步骤不贡献梯度,仅用于将学生置于“成功的门槛上”
    • 详细算法见附录 C
Discussion of the train-test mismatch in TCOD-B2F
  • 在训练期间,学生从一个由教师导航的检查点开始,而在测试时,它必须从头开始端到端地行动
  • 本文逐步将教师前缀从 \(L - 1\) 步减少到零,确保在训练结束时,学生从初始状态执行完整的轨迹,无需教师干预,从而使训练和测试分布完全对齐
  • 如附录 D.5 所示,测试集上的端到端成功率随训练步数稳步增加,确认了平滑的课程转换在实践中有效地防止了灾难性的分布偏移
  • 注:增加讨论:
    • TCOD-B2F 会引发不是 On-policy 的数据吗?答案是不会,因为前面由教师得到的轨迹不参与更新策略 \(\pi_\theta\),相当于是固定的某个 Prompt
补充 附录 C:Algorithm for TCOD-F2B/B2F
  • 算法 3 和算法 4 分别展示了 TCOD-F2B 和 TCOD-B2F 的完整训练过程,集成了第 4.2 节中描述的课程进度策略和实现细节
    • 吐槽:算法 3 和 算法 1 一模一样;算法 4 和算法 2 一模一样
  • 在 TCOD-F2B(算法 3)中,学生策略 \(\pi_{\theta}\) 在每次训练迭代中 Rollout 轨迹 \(k\) 步,其中 \(k\) 根据方程 4 中的线性进度计划逐步扩展
    • 通过将蒸馏信号集中在训练初期的早期轮次状态,并逐步扩展 Horizon,学生在暴露于完整轨迹之前建立了坚实的基础,有效地减轻了复合误差并防止了 KL 崩溃
  • 在 TCOD-B2F(算法 4)中,教师策略 \(\pi_{\phi}\) 首先从预先收集的成功轨迹 \(\tau^{*}\) 中重放初始的 \(L - k\) 步而不贡献梯度,将学生置于一个经过核验的检查点状态
    • 然后学生接管剩余的 \(k\) 步,学习从随着 \(k\) 增加而越来越早的起点完成任务
    • 到训练结束时,教师前缀被完全消除(\(k = L\)),确保学生端到端地执行完整轨迹,并完全弥合训练-测试分布差距

Asynchronous Training Details for Stability,异步训练细节 For 稳定性

  • TCOD 核心框架在概念上很简单,但几个实际的设计选择会显著影响现实部署中的训练稳定性和效率
    • 所有实验均在 \(8 \times\) NVIDIA H20 (96GB) GPU 上进行
  • 关键实现策略:
    • Asynchronous Rollout and Training,异步 Rollout 和训练
      • 为了最大化 GPU 利用率,作将轨迹收集和模型优化解耦到独立的异步进程中
      • 使用一个 Actor 进程池进行 Rollout 以持续采样轨迹,而一个中心 Learner 进程进行训练,使用共享缓冲区中的这些轨迹并执行梯度更新
      • 使用无锁环形缓冲区来最小化同步开销
      • 在的实验中
        • 分配 4 个 H20 GPU 给 Actor,2 个 H20 GPU 给 Learner,剩余的 2 个 H20 GPU 用于教师
      • 问题:此时不需要使用使用重要性采样修正吗?
        • 本文似乎使用强制 Staleness 为 2 左右来实现近似 On-policy,但是如果要严格坚持 On-Policy 的定义,本文实际上是一个 近似 On-Policy 或 Near On-Policy 的方法,不算是纯粹的 On-policy,可能会留下其他坑?(总之数学目标已经发生了改变)
    • Staleness-Aware Sub-trajectory Experience Replay,具有陈旧性感知的子轨迹经验回放
      • 为了在多轮环境中最大化样本效率,将每个完整轨迹分解为一组递归子轨迹
        • 具体做法:对于一个长度为 \(n\) 的轨迹,将每个前缀序列 \(\tau_{1:t} = (s_0, a_0, \ldots , s_t)\) 作为独立的经验条目存储在回放缓冲区中
          • 其中 \(t \in \{1, \ldots , n\}\)
      • 为了防止输入上下文超过模型的有效内存限制从而导致训练不稳定,将交互历史封装在 Prompt 中作为结构化上下文
        • 所以:每批生成的 Rollout 数量是动态的,取决于收集到的轨迹的不同长度
      • 在的异步设置中,每个轨迹都标记有用于收集的策略 \(\pi_{\theta_n}\) 的版本号 \(n\)
        • 本文实现了一个陈旧性过滤器,丢弃任何满足 \(n_{\text{current} } - n_{\text{old} } > \Delta_{\text{max} }\) 的经验
        • 经验发现: \(\Delta_{\text{max} } = 2\) 在样本效率和 on-policy 约束的严格性之间提供了最佳平衡

Experiments

  • Q1: 与 vanilla OPD 相比,TCOD 如何缓解 KL escalation 并恢复小型学生模型的性能,以及如何增强较大学生模型的训练稳定性和性能?
  • Q2: TCOD 能否使学生模型有效地泛化到超出教师自身能力边界的任务?
  • Q3: TCOD 对课程的增长率的敏感性如何,并且在训练效率方面与 vanilla OPD 相比如何?

Experimental Setup

Benchmarks
  • 在三个基准上进行实验
    • 具身导航环境 ALFWorld (2020)
    • 电子商务平台 WebShop (2022a)
    • 科学推理 ScienceWorld (2022)
  • 如表 1 所示,涵盖了从简单到复杂的推理能力谱系
  • Max turns 表示每个任务的最大探索步数
    • 对于 ALFWorld,在 seen 和 unseen 划分上都进行了评估,其中 unseen 划分包含训练期间未遇到的新颖房间布局和物体组合,作为本文的 OOD 评估
    • 额外构建了一个 Hard 集合,包含教师模型在训练集上 pass@10 采样下失败的任务,以测试 TCOD 是否能泛化到超出教师自身能力边界的情况
    • 更多基准细节请参考附录 D.1
Training Details
  • 对于 ALFWorld 上的主要实验,使用 Qwen2.5-3B 和 Qwen2.5-7B 作为学生模型,并使用通过在 ALFWorld 领域上通过 GRPO 微调的 Qwen2.5-7B 作为教师模型
  • 对于跨基准评估,采用 Qwen3-1.7B 和 Qwen3-4B 作为学生模型,使用 Qwen3-30B-A3B-Instruct 作为教师模型
  • 所有实验均在 \(8 \times\) NVIDIA H20 GPU 上进行
  • 基于 Reinforcement Fine-Tuning 框架 Trinity-RFT (2025) 实现了 TCOD
  • 对于 TCOD-B2F 初始化所需的专家轨迹收集,采用教师模型的 pass@10 采样策略,仅保留成功的轨迹
  • 为简单起见,固定 \(k_{\text{start} } = 1\) 和 \(\eta = 2\),并在第 5.4 节中检查了来自 \(\{2, 4, 6\}\) 的不同 \(\eta\) 的影响
  • 对于基线,报告零样本学生作为经验下限,教师策略作为理论上限 (Oracle)
  • 其他:将 TCOD 与标准的知识迁移范式进行比较,包括 SFT 和 vanilla on-policy distillation (OPD)
    • 对于评估,使用成功率 (SR) 测试所有基准,该指标衡量成功完成任务的比例,其中任务完成被视为二元结果
    • 更多细节见附录 D

Q1:Alleviating KL Escalation and Improving Performance,缓解 KL 升级并提升性能

  • 表 2 展示了 TCOD 在 ALFWorld 上使用学生模型 (Qwen2.5-3B, Qwen2.5-7B) 和 GRPO 训练的 Qwen2.5-7B 教师模型的结果,报告了成功率 (SR) 和平均动作步数
    • TCOD-F2B 和 B2F 在模型规模上显著优于 vanilla OPD 和 SFT
    • TCOD 将平均动作步数减少了 2.97 步,同时与 OPD 相比将 SR 提高了多达 15.71
      • 这表明基于轨迹的教师课程学习带来了更好的性能
    • 图 4a、4b 和 5b 进一步显示,与 vanilla OPD 相比,TCOD 在成功率和优势上实现了更快的收敛,同时保持了更稳定的 KL 散度
  • 理解:图 5(b) 中 advantages 是负的
    • 一般来说在 OPD 场景下,采样是通过学生采的,所以教师的概率均值是低于学生的,这一点详情见 NLP——LLM对齐微调-Revisiting-OPD,所以 Advantage 作为 \(\pi_\text{teacher} - pi_\text{student}\) 应该是小于 0 的
      • 注:这里的 Advantage 一般来说都是负的,与本文的 Forward KL 错误书写没关系
        • 如果真是 Forward KL,那么收集数据一定是 Teacher,此时 Advantage 是负的 KL 散度估计,也就是 \(\pi_\text{student} - pi_\text{teacher}\) ,此时这也应该小于 0 才对(采样策略肯定更倾向于自己概率高的 Token)
        • 因为收集数据是 Student,就决定了不可能是 Forward KL 了
      • 思考:正因为 OPD 的 Advantages 均值倾向于小于 0,所以 Student 的熵一般不会降低,甚至会上涨(许多高概率 Token 降低自身概率带来的是熵增),少数 Token 会被提升概率,带来熵减
        • 熵增现象详情见 NLP——LLM对齐微调-Revisiting-OPD 图 8 图 9 和 NLP——LLM对齐微调-Rethinking-OPD 的 图 12
Different Benchmarks and Model Sizes
  • 表 3 使用学生模型 Qwen3-1.7B 和 Qwen3-4B 以及教师模型 Qwen3-30B-A3B-Instruct,在三个基准上评估了 TCOD
    • TCOD-F2B 和 TCOD-B2F 取得了与 vanilla OPD 相当的性能
  • 如图 4c 和 4d 所示
    • 在 \(\eta = \{3,6\}\) 两种设置下,TCOD-F2B 在整个训练过程中都保持了稳定的 KL,并实现了持续增长的成功率,有效地缓解了 KL 升级并将平均成功率提高了 18.67
  • 图 5c 和 5d 展示了额外的训练指标,其中 TCOD 能够从 Response 长度的爆炸中恢复,同时策略梯度损失平滑下降

Q2:Generalizing Beyond the Teacher‘s Capability Boundary,泛化超出教师能力边界

  • 除了 TCOD 带来的性能提升和 KL 稳定性之外,本文进一步研究 TCOD 是否能够使学生模型超越教师本身
  • 表 2 报告了在 unseen 环境划分和 hard 划分上的性能
    • hard 划分包含来自 ALFWorld 的 121 个具有挑战性的任务,教师在这些任务上表现不佳
    • 在 unseen 划分上,TCOD 已经以高达 2.5 个百分点的 SR 超过了教师
    • 在 Train Hard 划分上,TCOD-B2F 和 TCOD-F2B 都显著超过了教师 6.61 的 SR,其中 TCOD-B2F 取得了高达 14 个百分点的增益
    • 这表明 TCOD 不仅仅是模仿教师,而是发展了一个更鲁棒的策略,能够泛化到超出教师能力边界之外
  • 注意:本文的结论不太 Solid,这个能力不一定是 TCOD 带来的,因为 Vanilla OPD 也在 Hard 熵表现出了超越教师的能力(如表 2 所示),说明 OPD 本身就已经拥有了超过教师的潜力了
    • 理解:这个可能和学生本身在特定场景针对自身策略采样和修正有关
    • 而且 表 3 中并没有看到学生模型超过教师模型

Q3:Robustness, Sensitivity, and Efficiency Analysis of TCOD,鲁棒性、敏感性和效率分析

Curriculum’s Growth Rate \(\eta\) Ablation
  • 表 3 报告了在不同基准上改变课程增长率 \(\eta \in \{2,4,6\}\) 的效果
    • 在所有设置中,性能始终强于 vanilla OPD,成功率变化小于 \(2%\),这表明 TCOD-F2B/B2F 对 \(\eta\) 的具体选择不敏感
      • 这种鲁棒性使得 TCOD 在实践中易于部署,无需 extensive 的超参数调整
    • 如图 4d 所示,较大的 \(\eta\) 会在训练期间带来更稳定的 KL 散度 ,因为学生在课程推进到更长 Horizon 之前会花费更多的迭代来掌握当前的轨迹深度
      • 在实践中,建议从一个较小的 \(\eta\) 开始,让课程在早期阶段快速推进,如果在训练期间观察到 KL 散度不稳定,则增加 \(\eta\)
Domain-Specific vs. Larger Teacher
  • 比较表 2 和表 3 可发现:教师质量强烈影响 TCOD 的上限
    • 在表 2 中,教师是在 ALFWorld 上经过 GRPO 调优的 Qwen2.5-7B,达到了 \(85.71%\) 的成功率
      • 在这种设置下,使用相同 7B 骨干网络的 TCOD-B2F 甚至以 0.7 个百分点略微超过了教师
    • 在表 3 中,教师是 Qwen3-30B-A3B-Instruct,一个在目标领域上性能较弱的通用模型
      • 在这种情况下,vanilla OPD 和 TCOD 都无法超过教师,大约有 2 个百分点的差距
    • 这表明教师模型在目标任务上的性能比单纯的模型规模更重要,能够使学生模型得到提升
TCOD is computationally efficient,TCOD 计算效率高
  • 图 6 比较了 TCOD 和 vanilla OPD 在 ALFWorld 和 ScienceWorld 上的总训练成本
  • 在两个基准上,与 vanilla OPD 相比,TCOD-F2B 和 TCOD-B2F 将总训练时间减少了近 \(32%\)
  • 这一增益来自于 TCOD 中基于步数的课程:
    • 在训练早期,学生模型采取更少的步数,生成更短的轨迹并加快数据收集速度
    • TCOD-F2B 比 TCOD-B2F 更高效
    • 因为 TCOD-F2B 将最大交互步数限制为 \(k\),而 TCOD-B2F 尽管从中间状态开始,但仍然会导致学生模型采取额外的探索性动作,从而产生更长的轨迹
    • 图 5a 进一步验证了 TCOD-F2B 使用的 Rollout 动作步数比 TCOD-B2F 少,并且两者所需的步数都比 vanilla OPD 少

附录 A:Limitations and Future Work

  • TCOD-B2F 依赖于预先收集的成功 Teacher 轨迹,这可能需要额外的轨迹收集开销
    • 在这种情况下,前向到后向的变体(TCOD-F2B)提供了一个无需演示的即插即用替代方案
  • 本文在经验上观察到 TCOD 的固定课程计划在本文三个基准和模型规模上都是稳健的,但最佳进度可能随不同环境或学生-教师对而变化
    • 一种基于学生学习进度(例如通过 KL 散度的指数移动平均)自动调整 Horizon 的自适应机制可以进一步提高通用性
      • 作者认为这是未来研究的一个有前景的方向
  • 本文的评估侧重于三个基于文本的多轮基准
    • 将 TCOD 扩展到多模态或物理具身环境是评估其通用性的重要下一步

附录 B:额外观察 (Additional Observation)

  • 前文第 4.1 节已经补充

附录 C:Algorithm for TCOD-F2B/B2F

  • 前文第 4.2 节 已经补充

附录 D:Experiment Details

D.1 Benchmark Environments

  • ALFWorld (2020) 是一个基于文本的具身环境,需要跨六类家庭任务进行导航和物体操作
    • ALFWorld 提供了可见(seen)和未见(unseen)分区:
      • 可见分区测试在训练期间存在的环境中的性能
      • 未见分区要求 Agent 在新的房间布局和物体组合中操作,作为本文的 OOD 评估
    • 对于 ALFWorld,本文进一步构建了一个包含 121 个挑战性任务的困难集(Hard set),在这些任务中,Teacher 在训练集上的 pass@10 采样下失败
      • 这个集合作为一个更具挑战性的 OOD 评估,用于测试 TCOD 是否能够泛化超越 Teacher 自身的能力边界
  • WebShop (2022a) 是一个基于网络的环境,要求 Agent 在模拟的电子商务平台上,通过多轮交互搜索并选择与给定用户指令匹配的产品
  • ScienceWorld (2022) 是一个基于文本的环境,测试跨 30 种与基础科学课程一致的任务类型的科学推理能力
    • Agent 根据任务完成情况,在每项任务结束时获得 0 到 100 之间的分数

D.2 Baselines

  • 为严格评估 TCOD 的有效性,本文针对以下范式进行基准测试,为学生模型建立清晰的性能边界:
  • Teacher (Upper Bound):
    • 专家策略(\(\pi_{\theta}\))的性能直接在环境中进行评估
    • 在标准蒸馏中,这代表了理论上的上限,因为主要目标是在更小的学生模型中恢复这种能力
    • 本文在训练困难集(Train Hard split)(第 5.3 节)上的评估调查了 TCOD 是否甚至能泛化超越这个上限
  • Zero-Shot Student (Lower Bound):
    • 基础学生模型(\(\pi_{\theta}\))直接在交互式任务上进行评估,没有任何特定任务的微调或蒸馏
    • 这是学生模型在 Agentic 环境中推理能力的绝对起点
  • SFT
    • 基本的模仿学习基线
    • 学生模型通过标准的负对数似然(NLL)损失在预先从 Teacher 收集的成功轨迹(\(\tau^{*}\))上进行 2 个 Epoch 的微调,存在多轮设置中众所周知的暴露偏差(exposure bias)问题
  • Vanilla On-Policy Distillation(OPD)
    • 近期 OPD 方法的标准多轮适应
    • 学生在自己生成的完整轨迹(完整 Rollout)上,被训练以最小化其分布与 Teacher 分布在 Token 级别的 KL 散度,没有任何 Horizon 约束或时间课程
    • 这作为直接基线,以展示轨迹级别的 KL 不稳定性(Trajectory-Level KL Instability)

D.3 Training Hyperparameters

  • 三个基于文本的交互式环境:ALFWorld、ScienceWorld 和 WebShop 上进行训练,训练配置总结在表 4 中

D.4 Evaluation Hyperparameters

  • 在三个测试集上评估模型性能:test_unseen、test 和 train_hard(仅 ALFWorld)
  • 所有环境的评估超参数一致,如表 5 所示

D.5 More experiments results

  • TCOD-B2F 的详细成功率
    • 如图 9 和图 10 所示,TCOD-B2F 表现出特有的非单调训练动态
    • Rollout 成功率最初很高,因为训练从短 Horizon 开始,然后随着课程扩展到更长的轨迹而下降,最后随着学生适应增加的难度而恢复(图 9 右侧图)
      • 在 valid seen 分区中也观察到类似的模式,成功率在训练中期也会下降然后再改善(图 10 右侧图)
      • 在 valid unseen 和训练困难(train hard)分区在整个训练过程中保持相对稳定,没有明显的下降(图 10 左、中图)
    • 这表明中间的性能下降不是由于过拟合或不稳定,而是反映了受控的课程过渡
      • 这些结果表明 TCOD-B2F 在 Horizon 扩展时引入了暂时的难度,但保持了稳定的泛化能力,同时最终提高了性能,验证了渐进式 Horizon 扩展的有效性
  • 图 9:TCOD-B2F(\(\eta = 2\))的训练动态,包括 KL 散度、学生动作 Horizon 和成功率
    • 在 ALFWorld 上,从 GRPO 训练的 Qwen2.5-7B Teacher 蒸馏 Qwen2.5-7B 学生
  • 图 10:TCOD-B2F(\(\eta = 2\))的成功率,包括训练困难(左)、valid unseen(中)和valid seen(右)
    • 在 ALFWorld 上,从 GRPO 训练的 Qwen2.5-7B Teacher 蒸馏 Qwen2.5-7B 学生

附录 E:Environment Prompts

  • 详情见原论文
1…789…352
San Ye

San Ye

Stay Hungry. Stay Foolish.

704 posts
53 tags
© 2026 San Ye
Powered by Hexo
|
Theme — NexT.Gemini v5.1.4