Hexo

凡事预则立,不预则废


  • Home

  • Tags

  • Archives

  • Navigation

  • Search

NLP——Reinforcement-Pre-Training

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始论文:(RPT)Reinforcement Pre-Training, arXiv 20250609, Microsoft Research & PKU & THU

Paper Summary

  • 整体内容总结
    • 论文提出了一种新颖的,用于预训练大语言模型的新范式,强化预训练(Reinforcement Pre-Training, RPT)
    • 通过将下一词预测任务重构为可验证的推理任务,并应用基于正确性的强化学习奖励,RPT 使大语言模型能够在预训练期间利用扩展计算构建更强的基础推理能力
    • 实验表明:RPT 提升了下一词预测的准确性 ,在数学 和通用推理基准的 Zero-Shot 设置 中表现出色 ,并为后续强化学习微调 提供了更好的起点
    • RPT 通过从根本上重新思考预训练目标本身,为开发更强大、更通用的智能大语言模型提供了新的方向
  • 论文将 Next-Token Prediction(NTP)任务重新定义为一种通过强化学习训练的推理任务,模型在正确预测给定上下文的 Next Token 时会获得可验证的奖励
  • RPT 提供了一种可扩展的方法,能够利用海量文本数据实现 通用强化学习(general-purpose RL) ,而 无需依赖特定领域的标注答案
    • 通过激励 Next Token 推理能力,RPT 显著提升了语言模型在预测 Next Token 时的准确性
  • RPT 为后续的强化微调提供了强大的预训练基础
  • 实验结果表明,随着训练计算量的增加, Next-Token Prediction 的准确性持续提升
    • 作者认为,这些结果证明了 RPT 是一种有效且有前景的规模化范式,能够推动语言模型预训练的进步

Introduction and Discussion

  • LLM 在各种任务中展现出了卓越的能力,这主要得益于基于海量文本语料的 Next-Token Prediction 目标的可扩展性
    • 这种自监督范式已被证明是一种高效的通用预训练方法
  • RL 已成为一种强大的技术,可用于微调大语言模型,使其与人类偏好对齐或增强特定技能,例如复杂推理 (2022, 2023, 2024)
  • 但当前强化学习在大语言模型训练中的应用面临可扩展性和通用性挑战
    • RLHF 在对齐任务中表现有效,但其依赖昂贵的人类偏好数据,且学习到的奖励模型容易受到奖励破解(reward hacking)的影响,从而限制了可扩展性
    • RLVR 是一种 RLVR 方法
      • RLVR 利用客观的、基于规则的奖励(通常来自问答对),这种方法能够缓解奖励破解问题
      • 但 RLVR 通常受限于带有可验证答案的标注数据的稀缺性,因此其 应用范围仅限于特定领域的微调 ,而 非通用预训练
  • 在这项工作中,作者提出了 强化预训练(RPT) ,这是一种新颖的范式,旨在弥合可扩展的自监督预训练与强化学习能力之间的差距
    • RPT 将 Next-Token Prediction 任务重新定义为一种 Next Token 推理过程
    • 对于预训练语料中的任何给定上下文,模型会被激励在预测 Next Token 之前对其进行推理
    • 模型会根据其预测结果与语料中真实 Next Token 的匹配程度,获得一种可验证的内在奖励
    • 这种方法将通常用于 Next-Token Prediction 的海量未标注文本数据,转化为一个适用于通用强化学习的庞大数据集,而无需依赖外部标注或特定领域的奖励函数
  • 这种方法具有以下几个关键优势:
    • 1)可扩展性与通用性 :RPT 利用了与标准 Next-Token Prediction 相同的海量未标注文本数据,将其转化为通用强化学习的大规模数据集,无需外部标注
    • 2)减少奖励破解风险 :通过使用直接的、基于规则的奖励信号(即预测 Next Token 的正确性),RPT 从根本上降低了复杂学习奖励模型中常见的奖励破解风险
    • 3)促进深度理解与泛化 :通过显式激励 Next Token 推理模式,RPT 鼓励模型深入理解上下文,而非简单地记忆 Next Token
      • 模型学会探索和验证关于“为何某个 Token 应该出现”的假设,从而构建更鲁棒的表示
    • 4)推理过程的计算分配 :预训练中的内部推理过程使模型能够为每个预测步骤分配更多的“思考”或计算资源,类似于在训练时为每个 Token 应用推理时扩展,从而直接提升 Next-Token Prediction 的准确性
  • 论文的实验表明:
    • RPT 显著提升了 Next-Token Prediction 的准确性
    • RPT 为后续的强化微调提供了更鲁棒的预训练基础,从而在最终任务中表现更优
    • 扩展曲线显示,在 RPT 框架下,增加训练计算量能够持续提升 Next-Token Prediction 的准确性 ,这表明 RPT 是一种可持续的规模化策略
    • 这些结果证明了强化预训练是一种有效且有前景的新范式,能够推动大语言模型预训练的进步
  • 论文的主要贡献如下:
    • 提出了一种新的规模化范式: 强化预训练(RPT) ,将 Next-Token Prediction 重新定义为通过强化学习训练的推理任务,并利用预训练语料直接生成的内在可验证奖励
    • RPT 提供了一种可扩展且通用的强化学习预训练方法,通过基于规则的奖励减少奖励破解风险,并通过激励 Next Token 推理模式(而非机械记忆(rote memorization))促进泛化能力
    • RPT 显著提升了 Next-Token Prediction 的准确性,并展现出良好的扩展特性,即性能随着训练计算量的增加而持续提升
    • RPT 为后续的强化微调提供了更强的预训练基础,并提升了在多种下游任务中的 Zero-Shot 性能

Preliminary

Next-Token Prediction, NTP

  • Next-Token Prediction 是现代大语言模型的基本训练目标 (2022)
  • 给定训练语料中的输入序列 \(x_{0}\cdots x_{T}\),模型的训练目标是最大化以下目标函数:
    $$
    \mathcal{J}_{\text{NTP} }(\theta)=\sum_{t=1}^{T}\log P(x_{t}\mid x_{0},x_{1},\ldots,x_{t-1};\theta),
    $$
    • 其中 \(\theta\) 表示语言模型的参数

Reinforcement Learning with Verifiable Rewards, RLVR

  • RLVR 利用强化学习目标来增强具有可验证答案的特定技能 (2023)
  • RLVR 需要一个标注的问答对数据集 \(\mathcal{D}=\{(q,a)\}\)
  • 对于特定的问答对 \((q,a)\in \mathcal{D}\),大语言模型 \(\pi_{\theta}\) 会生成一个响应 \(o\sim \pi_{\theta}(\cdot \mid q)\)
    • 然后使用一个确定性的验证器 \(\mathcal{V}\) 计算可验证奖励 \(r=\mathcal{V}(o,a)\),模型的训练目标是最大化期望奖励:
      $$
      \mathcal{J}_{\text{RLVR} }(\theta)=\mathbb{E}_{(q,a)\sim \mathcal{D},o\sim \pi_{\theta}(\cdot|q)}\left[r(o,a)\right].
      $$

Reinforcement Pre-Training

Pre-Training Task: Next-Token Reasoning

  • 论文提出了 Next Token 推理任务用于语言建模
  • 给定训练语料库中的输入序列 \(x_0 \cdots x_T\),对于每个位置 \(t \in \{1, \ldots, T\}\),前缀 \(x_{ < t}\) 被视为上下文,而真实的 Next Token 是 \(x_t\)
  • 在 Next Token 推理任务中,模型 \(\pi_\theta\) 需要在生成对 Next Token 的预测 \(y_t\) 之前生成一个思维链(chain-of-thought)推理序列,记为 \(c_t\)
  • 模型的整体响应为 \(o_t = (c_t, y_t)\),其中 \(o_t \sim \pi_\theta(\cdot \mid x_{ < t})\)
  • 如图 2 所示, Next Token 推理的长思维链过程可能涉及多种推理模式,例如头脑风暴、自我批判和自我修正
  • Next Token 推理任务将预训练语料库重构为大量的推理问题集合,使预训练从学习表面的 Token-level 关联转向理解其背后的隐藏知识,并使强化学习的扩展成为可能

Pre-Training with Reinforcement Learning

  • RPT 通过在线策略强化学习训练 LLM 执行 Next Token 推理,如图 3 所示
  • 对于上下文 \(x_{ < t}\),RPT 提示语言模型 \(\pi_\theta\) 生成 \(G\) 个响应(思维轨迹),记为 \(\{o^i_t\}_{i=1}^G\)
  • 每个响应 \(o^i_t = (c^i_t, y^i_t)\) 包含一个思维链推理序列 \(c^i_t\) 和一个最终的预测序列 \(y^i_t\)
  • 为了验证 \(y^i_t\) 的正确性,论文引入了前缀匹配奖励(prefix matching reward),该奖励支持验证跨越多 Token 或涉及词汇表外 Token 的预测
  • 符号定义如下:
    • \(x_{\geq t}\) 表示真实补全序列,其字节(byte)序列表示为 \(\overline{x}_{\geq t}\)
      • 问题:为什么不是单个 token? 论文每次仅预估下一个 token 吧?到底是每次生成单个 token 还是多个 token?
      • 猜测:这里是表示每次推理时,可以只看一个 token,也可以看多个 token
    • \(y^i_t\) 表示预测的序列,其字节(byte)序列表示为 \(\overline{y}^i_t\)
    • \(\overline{y}^i_t\) 的字节长度记为 \(l\)
    • 真实补全序列中 Token 的累积字节长度定义为有效边界,记为 \(\mathcal{L}_{gt}\)
      • 理解:这里的有效边界是一个整数集合,表示有效的长度值的集合
  • 形式上,对于上下文 \(x_{ < t}\) 的第 \(i\) 个输出,奖励 \(r^i_t\) 定义为:
    $$
    r^i_t = \begin{cases}
    1 & \text{if } \overline{y}^i_t = \overline{x}_{\geq t}[1:l] \text{ and } l \in \mathcal{L}_{gt} \\
    0 & \text{otherwise}
    \end{cases},
    $$
    • 如果预测的字节序列是真实补全字节序列的精确前缀且其长度 \(l\) 匹配任何有效 Token 边界 ,则奖励为 1
    • \(\overline{y}^i_t\) 表示预测的字节序列
    • \(\overline{x}_{\geq t}\) 表示真实补全的字节序列
  • 令 \(\mathcal{D}\) 为所有 \(\{x_{ < t}\}_{t=1}^T\) 的集合,模型训练的目标是最大化期望奖励:
    $$
    \mathcal{J}_{\text{RPT} }(\theta) = \mathbb{E}_{(x_{ < t}, x_{\geq t}) \sim \mathcal{D}, \{o^i_t\}_{i=1}^G \sim \pi_\theta(\cdot|x_{ < t})} \left[r^i_t \right].
    $$

Pre-Training Setup

  • 论文使用 OmniMATH 数据集(2024)进行强化预训练。OmniMATH 包含 4,428 个竞赛级数学问题及其解答,数据来自 AoPS Wiki 和 AoPS 论坛等官方网站
  • 由于许多 Token 即使无需推理也容易预测,论文在强化预训练前进行了 Token-level 数据过滤
    • 论文使用 Deepseek-R1-Distill-Queen-1.5B 作为小型代理模型,计算每个 Token 在前 16 个候选 Token 上的代理模型熵
    • 通过应用熵阈值,论文过滤掉低熵位置,优先训练那些需要更多计算努力预测的挑战性 Token(注:高熵的 token 是较难预测的)
  • 在所有实验中,论文以 Deepseek-R1-Distill-Queen-14B(2025)作为基础模型
    • R1-Distill-Queen-14B 因其基本的推理能力而成为强化学习的良好起点
  • 论文使用 verl 库(2025)实现训练框架,并使用 vllm 进行推理
  • 论文采用 GRPO 算法(2025),具体超参数详见附录 B
  • 训练时,论文采用 8k 的训练长度,学习率为 \(1 \times 10^{-6}\),KL 惩罚为零,批次大小为 256 个问题,每个问题采样 \(G=8\) 个响应,在 rollout 过程中使用温度为 0.8
  • 从每个响应中,论文直接提取最后一个 \(\backslash\)boxed{ } 内的完整序列作为模型对 Next Token 的预测
  • 从第 500 步开始 ,论文使用动态采样以提高训练效率(2025),主实验的总训练步数为 1,000
    • 补充:这里的动态采样是 DAPO 中的动态采样技术,把奖励全为 0 或者全为 1 的 Prompt/样本 丢弃掉
  • 提示模板及其变体在附录 D 中讨论

Evaluation of Pretrained Models

  • 模型预训练完成后,我们可以直接在下游任务上进行 Next-Token Prediction 和强化微调
  • 论文通过以下设置展示强化预训练如何提升大语言模型的语言建模能力和推理能力
  • 语言建模(Language Modeling)
    • 基于 Next Token 推理目标,论文的模型可以自然地用于语言建模
    • 论文报告 Next-Token Prediction 准确率,以评估 RPT 的语言建模性能和扩展性
  • 下游任务的强化微调(Reinforcement Fine-Tuning on Downstream Tasks)
    • 论文以预训练后微调的方式对 RPT 模型进行持续的强化微调
    • 由于 RPT 将预训练过程与强化学习对齐,预训练与后续强化微调之间的目标差距被最小化
    • 论文评估强化预训练过程是否进一步提升了最终任务的性能

Experiments

Language Modeling

  • 论文在 OmniMATH 的 200 个验证集样本上评估语言建模性能
  • 根据第 3.3 节描述的基于熵的数据过滤策略,论文根据难度对验证集中的 Token 位置进行分类
    • 论文使用 R1-Distill-Queen-14B 计算每个 Token 位置的熵,并根据熵是否超过阈值 0.5、1.0 和 1.5 将位置划分为简单、中等和困难三类
    • 为了比较,论文报告了 R1-Distill-Queen-14B 在两种评估方式下的性能:
      • (1) 标准 Next-Token Prediction ,选择概率最高的 Token ;
      • (2) Next Token 推理,生成思维链后再进行最终预测
    • 论文还包含了 Qwen2.5-14B 的结果,因为它是 R1-Distill-Queen-14B 的基础模型
  • 如表 1 所示,RPT-14B 在所有难度级别上的 Next-Token Prediction 准确率均高于 R1-Distill-Queen-14B
    • 值得注意的是,它的性能与显著更大的模型 R1-Distill-Queen-32B 相当(图 4)
  • 这些结果表明,强化预训练能有效捕捉 Token 生成背后的复杂推理信号,并具有提升大语言模型语言建模能力的强大潜力

Scaling Properties of Reinforcement Pre-Training

  • 本节论文研究强化预训练的扩展性
  • 自然语言语料库上的 Next Token 预训练损失在模型大小、训练 Token 数量和训练计算量方面通常遵循幂律衰减(2020, 2022)
  • 论文使用以下幂律形式建模训练计算量 \(C\) 与性能的关系:
    $$
    P(C) = \frac{A}{C^\alpha} + P^*, \tag{5}
    $$
    • 其中 \(P(C)\) 表示验证集上的 Next-Token Prediction 准确率,\(P^*\)、\(\alpha\) 和 \(A\) 是待估计的参数
  • 论文在不同训练步数(100、200、400、800、1000 和 1200)下评估 RPT 的 Next-Token Prediction 准确率,并将其转换为相应的训练计算量
  • 为了评估数据难度的影响,论文考虑了基于熵阈值 0.5(简单)、1.0(中等)和 1.5(困难)过滤的验证集分割
    • 更高的阈值对应更具挑战性的输入
    • 对于每个难度级别,论文根据公式 (5) 拟合结果,并使用决定系数 \(R^2\) 衡量拟合优度(Goodness of fit)
    • 理解:按照 15W 词表算:
      • 熵为 0.5 对应这最大的概率差不多是 0.970;
      • 熵为 1.0 对应这最大的概率差不多是 0.936;
      • 熵为 1.5 对应这最大的概率差不多是 0.901;
      • 更多可视化详情见附录
  • 如图 5 所示,随着训练计算量的增加,RPT 的 Next-Token Prediction 准确率持续提升
  • 所有难度级别的高 \(R^2\) 值表明拟合曲线能准确捕捉性能趋势(理解:说明在不同难度上,均能很好的拟合到公式 (5) 上)

Reinforcement Fine-Tuning with RPT

  • 为了研究 RPT 模型是否能通过 RLVR 更有效地微调,论文从 Skywork-OR1(2025)随机采样带有可验证答案的问题进行进一步训练
    • 论文使用 256 个样本进行训练,200 个样本进行测试
    • 遵循 Skywork-OR1 的数据过滤流程(2025),论文使用 R1-Distill-Queen-32B 识别训练中的挑战性实例
    • 论文将训练批次大小和 PPO 小批次大小均设为 64,并训练模型 15 个周期
    • 评估时,验证的最大 Token 数设为 32,000,温度为 0.6
  • 如表 2 所示:
    • 强化预训练模型在使用 RLVR 进一步训练时达到了更高的上限
    • 当使用相同的 Next-Token Prediction 目标持续训练相同数据时,模型的推理能力显著下降,而后续的 RLVR 仅带来缓慢的性能提升
      • 理解:可以观察到,直接进行普通 NPT 的持续预训练(目标和 RPT 相同)会导致推理能力大幅下降;猜测这里是训练太多次,发生了过拟合了!
        • 引申问题:这里的 普通 NPT 和 RPT 训练轮次是相同的吗?
  • 这些结果表明,在数据有限的情况下,强化预训练可以快速将从 Next Token 推理中学到的强化推理模式迁移到最终任务中

Zero-Shot Performance on End Tasks

  • 论文评估了 RPT-14B 在下游任务上的 Zero-Shot 性能
  • 作为比较,论文评估了 R1-Distill-Queen-14B 和 R1-Distill-Queen-32B 的 Next-Token Prediction 性能,以及 RPT-14B 与 R1-Distill-Queen-14B 的推理性能
  • 论文的评估涉及两个广泛认可的基准:
    • MMLU-Pro(2020),一个综合性多任务理解基准,评估大语言模型在不同领域的表现;
    • SuperGPQA(2025),一个涵盖 285 个学科的研究生级推理问题的大规模基准
  • 在推理设置下,论文将最大 Token 数设为 12,288,温度为 0.8
  • 遵循先前工作(2024, 2025),论文使用多项选择题格式进行评估并报告准确率
  • 如表 3 所示
    • RPT-14B 在所有基准上均优于 R1-Distill-Queen-14B(无论是标准 Next-Token Prediction 还是作为推理模型评估)
    • RPT-14B 还超越了显著更大的 R1-Distill-Queen-32B(在 Next-Token Prediction 模式下),在 SuperGPQA 上提升了 7 分,在 MMLU-Pro 上提升了约 22 分
  • 每个基准的详细分科结果见附录 C

Next-Token Reasoning Pattern Analysis

  • 论文分析了 Next Token 推理与显式问题解决(explicit problem solving)在推理模式上的差异
    • 根据先前研究(2024, 2025),论文统计了模型响应中包含推理关键词(如“break down”、“alternatively”)的比例
  • 论文的分析比较了两种模型在 OmniMATH 数据集上的思维过程:
    • R1-Distill-Queen-14B 用于问题解决
    • RPT-14B 用于 Next Token 推理
    • 对每个模型,采样 200 个响应
  • 论文将推理模式分为六类:
    • 转换(切换策略)、反思(自我检查)、分解(分解问题)、假设(提出并验证假设)、发散思维(探索可能性)和演绎(逻辑推理)

      transition (switching strategies), reflection (self-checking), breakdown (decomposing the problem), hypothesis (proposing and verifying assumptions), divergent thinking (exploring possibilities), and deduction (logical inference).

  • 如图 6 所示,RPT-14B 的 Next Token 推理过程与 R1-Distill-Queen-14B 的问题解决过程显著不同
    • RPT-14B 相对 R1-Distill-Queen-14B: 假设模式的使用量增加了 161.8%
    • RPT-14B 相对 R1-Distill-Queen-14B:演绎模式的使用量增加了 26.2%
    • 问题解决过程(R1-Distill-Queen-14B)更依赖分解模式(breakdown) ,这表明 Next Token 推理引发的推理过程在性质上与结构化问题解决不同
  • 表 4 展示了一个推理模式的例子
    • 该例子揭示了模型参与的是一个深思熟虑的过程,而非简单的模式匹配
    • 它分析了更广泛的语义上下文(“calculating vector magnitude”),识别关键短语(“go over some…”),然后进行头脑风暴并权衡多个可能的延续
    • 这涉及假设生成(“the next part is likely going to be…”)、替代方案考虑(“Alternatively, it could be…”)以及对结构线索(“markdown with headers”)甚至细粒度 Token-level 细节(“could have a space”)的反思
    • 这种多方面的推理,既包含高级语义理解,又包含低级文本特征,展示了模型通过推理探索推断 Next Token 的努力,与 RPT 培养超越表面关联的更深层次理解的目标一致
  • 更多例子见附录 F

Related Work

Scaling Paradigms of Large Language Models

  • LLM 的进步主要由两个扩展维度驱动:
    • 训练时计算(training-time compute)(2022a):通过大幅增加模型参数和训练数据,以下一词预测(next-token prediction)作为预训练任务
    • 测试时计算(test-time compute)(2025a):测试时扩展(2024)通过延长推理计算时间提升大语言模型的推理能力
  • RPT 独特地整合了上述原则,超越现有扩展范式,将每一词预测任务重构为推理任务

Reinforcement Learning for Large Language Models

  • 强化学习在大语言模型的后训练阶段发挥了关键作用
    • RLHF(2022)通过人类偏好数据微调预训练语言模型以提升对齐性
    • 除对齐外,大规模强化学习还被用于增强语言模型的推理能力(2025)
  • 最相关的工作(2025)鼓励语言模型为下一词预测生成有帮助的推理过程
    • 基于帮助性的奖励容易被生成的推理中重复目标词所“破解” ,这种捷径可能损害模型性能
      • 问题:如何理解这里所谓的奖励破解问题?
        • 参考:Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking
    • 相比之下,论文使用下一词预测的正确性作为基于规则的奖励信号,以最小化奖励破解风险

Future Work

  • RPT 的初步探索仍存在一些局限性
    • 论文的实验主要基于 14B 参数的模型,没有在更大的模型进行测试
    • 虽然 RPT 方法设计为通用,但当前预训练语料库 主要由数学文档组成;
      • 未来工作将探索其在更广泛的通用领域文本上的有效性
    • RPT 训练是从一个具备基础推理能力的模型初始化(R1-Distill-Qwen-14B)的;
      • 后续可以研究从标准基础语言模型开始的 RPT 训练
      • 这将为 RPT 基础性影响提供进一步分析和结论
  • 未来工作可从以下方向推进:
    • 扩展训练语料库的规模和领域覆盖范围,利用大规模通用互联网数据进行强化预训练
    • 增加训练计算资源以突破性能边界
    • 建立强化预训练的扩展定律(scaling laws),指导大语言模型的扩展
    • 探索将混合思维(hybrid thinking)(2025)与 RPT 结合,通过自适应触发下一词推理实现细粒度的适应性思考

附录 A Design Choices of Reward

  • 除了第 3 节描述的基于前缀匹配的奖励机制外,论文还研究了其他几种奖励函数变体以评估其对强化预训练的影响
    • 变体一:首词匹配(first-token matching)
      • 在此设置中,奖励仅反映模型预测 \( y_t^i \) 的首词是否与真实下一词 \( x_t \) 匹配,忽略预测中首词之后的所有词
    • 变体二:探索了“密集奖励”(dense reward)方案:
      • 正确预测的下一词(即 \( y_t^i[0] = x_t \))获得满分奖励(如 1);
      • 对于错误预测(\( y_t^i[0] \neq x_t \)),奖励为一个较小的正值 ,具体为语言模型生成该错误词的概率 \( P(y_t^i[0] \mid x_{ < t}; \theta) \)
        • 问题:为什么是错误词的概率?岂不是错误词的概率越大,奖励越大,应该是正确词的概率吧
      • 这提供了比二元奖励更密集的反馈信号
    • 变体三:条件性应用密集奖励结构:
      • 仅当给定前缀 \( x_{ < t} \) 的 \( G \) 次采样中至少有一次正确预测下一词时 ,才使用密集奖励;
      • 若所有 \( G \) 次采样均错误,则应用其他奖励方案(如零奖励或统一的小惩罚)
  • 实验表明,这些替代奖励与前缀匹配奖励相比,性能相当
    • 表明强化预训练框架对这些奖励信号的修改具有较强的鲁棒性 ,其核心优势可能对这些特定选择不敏感,至少在测试的变体范围内如此

附录 B Hyperparameters Used for Reinforcement Pre-Training

  • 表 5 展示了第 4 节中强化预训练的详细超参数
  • 论文遵循精确策略强化学习(2025)的设置,将熵损失系数设为 0

附录 C Detailed Results on End Tasks

  • 表 6 和表 7 展示了通用终端任务基准的详细分类性能
  • RPT-14B 模型在大多数类别中表现优于 R1-Distill-Qwen-14B 和 R1-Distill-Qwen-32B

附录 D Impact of Prompt Templates

  • 论文探索了不同提示模板对初始下一词推理性能的影响
  • 表 10 展示了七种模板变体,这些模板使用不同指令片段,并以不同形式包装上下文
  • 如表 8 所示,清晰的 Prompt 能很大程度提升初始表现的准确性
    • 第 4 节的强化预训练实验使用了“v0”模板,其他模板变体的优化留待未来工作

附录 E Keywords for Reasoning Pattern Analysis

  • 表 9 列出了第 4.5 节中用于推理模式分析的模式组和关键词

附录 F Case Studies

  • 表 11 展示了 RPT-14B 在下一词推理任务中的三个案例,包括模型对数学问题和文本上下文的推理过程
  • 这些案例揭示了模型如何通过多角度思考生成最终预测

附录:概率和熵的关系图

  • 关键词:entropy curve;熵和概率;概率和熵;曲线图;

  • 假定只有一个 token 的值较大,其他 token 概率相同,此时的熵和最大概率的关系是如何的?

  • 可视化最大概率和熵的关系的代码

    1
    2
    3
    4
    5
    6
    7
    8
    9
    10
    11
    12
    13
    14
    15
    16
    17
    18
    19
    20
    21
    22
    23
    24
    25
    26
    27
    28
    29
    30
    31
    32
    33
    34
    35
    36
    37
    38
    39
    40
    41
    42
    43
    44
    45
    46
    47
    48
    49
    50
    51
    52
    53
    import numpy as np
    import matplotlib.pyplot as plt

    # 设置中文显示
    plt.rcParams["font.family"] = ["SimHei", "WenQuanYi Micro Hei", "Heiti TC"]
    plt.rcParams["axes.unicode_minus"] = False # 解决负号显示问题

    def calculate_entropy(p, n=150000):
    remaining_p = (1 - p) / (n - 1)

    probabilities = np.full(n, remaining_p)
    probabilities[0] = p

    entropy = -np.sum(probabilities * np.log(probabilities))

    return entropy

    p_values = np.linspace(0.0001, 0.9999, 9999)

    entropy_values = [calculate_entropy(p) for p in p_values]

    plt.figure(figsize=(10, 6))
    plt.plot(p_values, entropy_values, 'b-', linewidth=2)

    max_entropy_idx = np.argmax(entropy_values)
    plt.scatter(p_values[max_entropy_idx], entropy_values[max_entropy_idx], color='red', s=50, zorder=5)
    plt.annotate(f'最大熵: p={p_values[max_entropy_idx]:.2f}, H={entropy_values[max_entropy_idx]:.4f}',
    xy=(p_values[max_entropy_idx], entropy_values[max_entropy_idx]),
    xytext=(p_values[max_entropy_idx]+0.1, entropy_values[max_entropy_idx]+0.2),
    arrowprops=dict(facecolor='black', shrink=0.05, width=1.5, headwidth=8))

    # print(entropy_values)
    points = [0.5, 1.0, 1.5]
    for point in points:
    for index, entropy in enumerate(entropy_values):
    if entropy <= point:
    print((p_values[index], entropy_values[index]))
    plt.scatter(p_values[index], entropy_values[index], color='red', s=50, zorder=5)
    break

    plt.title('概率值p与熵的关系图 (15W个候选值)')
    plt.xlabel('概率值p (第一个候选值的概率)')
    plt.ylabel('熵 (nats)')
    plt.grid(True, linestyle='--', alpha=0.7)
    plt.xlim(-0.05, 1.05)
    plt.ylim(0, max(entropy_values) * 1.1)

    plt.tight_layout()
    plt.show()

    # (0.9695, 0.4999866540719247)
    # (0.9361, 0.9991510505356568)
    # (0.9012, 1.4999746052311926)
  • 示意图:

NLP——SEAL

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始论文:(SEAL)Self-Adapting Language Models, arXiv 20250612, MIT
    • 主页:jyopari.github.io/posts/seal

Paper Summary

  • 背景 & 问题:LLM 虽然强大,但缺乏动态调整其权重以应对新任务、知识或示例的机制
  • 论文提出了 自适应大语言模型(SEAL, Self-Adapting LLMs) 框架,通过生成自身的微调数据和更新指令,使 LLM 能够自我调整
    • 给定新输入时,模型会 produces a self-edit
      • a generation,可能以不同方式重组信息、指定优化超参数,或调用工具进行数据增强和基于梯度的更新

        Given a new input, the model produces a self-edit —— a generation that may restructure the information in different ways, specify optimization hyperparameters, or invoke tools for data augmentation and gradient-based updates

    • 通过 SFT ,这些 self-edit 会带来持久的权重更新,从而实现长期适应(lasting adaptation)
    • 为了训练模型生成有效的 self-edit,论文使用强化学习循环(loop) ,将更新后模型在下游任务中的表现作为奖励信号
    • 与依赖独立适应模块或辅助网络的现有方法不同,SEAL 直接利用模型的生成能力参数化并控制其自身的适应过程
  • 在知识整合和 Few-shot 泛化的实验中,SEAL 展现了语言模型在新数据下实现自我导向适应的潜力

Introduction and Discussion

  • 在大规模文本语料库上预训练的 LLM 在语言理解和生成方面表现出卓越能力(2020; 2023; 2024; 2025)
    • 但将这些强大模型适配到特定任务(2020)、整合新信息(2020)或掌握新推理技能(2025)仍然具有挑战性,主要由于任务特定数据的稀缺性
  • 论文探讨了一个有趣的假设:LLM 能否通过转换或生成自身的训练数据和学习过程来实现自我适应?(can an LLM self-adapt by transforming or generating its own training data and learning procedure?)
  • 以人类学生学习为例,学生通常通过整理笔记来备考,这些笔记是对原始内容的重新解读和增强 :这种将外部知识转化为更易理解形式的能力是人类学习的普遍特征
  • 但当前 LLM 的训练和部署方式与人类学习形成鲜明对比:面对新任务时,LLM 只能通过微调或上下文学习(ICL, In-Context Learning)(2022; 2024; 2023)直接利用原始数据
    • 这些数据可能并非最优格式(或数量),且现有方法无法让模型开发定制化的数据转换和学习策略
  • 为实现语言模型的高效适应,论文提出赋予 LLM 生成自身训练数据和微调指令的能力
    • 具体而言,论文引入了一种强化学习算法,训练 LLM 生成 self-edit(即指定数据和优化超参数的自然语言指令(如图1 所示)
    • 论文将此类模型称为 自适应大语言模型(Self-Adapting LLMs,SEAL)
  • 论文在两个应用中评估 SEAL
    • 首先,测试其在整合新事实知识任务中的表现:模型通过生成合成数据而非直接微调原文
      • 在无上下文版本的 SQuAD(2016)问答任务中,准确率从 33.5% 提升至 47.0%
      • 值得注意的是,SEAL 自生成的数据表现优于 GPT-4.1 生成的合成数据
    • 其次,论文在简化版 ARC-AGI 基准(2025)上评估 Few-shot 学习能力,模型通过调用工具自主选择数据增强和优化超参数(如学习率、训练轮次等)
      • 实验表明,SEAL 自动配置工具的能力显著优于标准上下文学习和未经强化学习训练的 self-edit 方法
    • 这些结果共同证明,SEAL 是实现语言模型自我适应的通用框架

Methods

  • 论文提出了 自适应性大语言模型(Self-Adapting LLMs, SEAL) ,这是一种框架,使语言模型能够通过生成自己的合成数据和优化参数(即“自我编辑”)来改进自身
    • 模型通过 Token 生成直接产生这些自我编辑,生成过程以模型上下文中的数据为基础
    • 自我编辑的生成通过 RL 进行训练,模型的奖励信号来源于应用自我编辑后模型在目标任务上的性能提升
    • 因此,SEAL 可以视为一种包含两个嵌套循环的算法:
      • 外部强化学习循环优化自我编辑的生成
      • 内部更新循环利用生成的自我编辑通过梯度下降更新模型
  • 论文的方法可以看作是一种元学习(meta-learning)实例,其目标是学习如何生成有效的自我编辑

General Framework

  • 设 \(\theta\) 表示语言模型 \(\text{LM}_{\theta}\) 的参数,SEAL 在单个任务实例 \((C, \tau)\) 上运行,其中 \(C\) 是包含任务相关信息的上下文,\(\tau\) 是用于评估模型适应能力的下游任务
    • 在知识整合任务中,\(C\) 是需要整合到模型内部知识中的段落,\(\tau\) 是关于该段落的一组问题和答案;
    • 在 Few-shot 学习中,\(C\) 包含新任务的少量示例,\(\tau\) 是查询输入和真实输出
  • 给定 \(C\),模型生成一个自我编辑(SE),其形式因领域而异(见原论文 3.2 节),并通过 SFT 更新参数:
    $$\theta’ \leftarrow \text{SFT}(\theta, \text{SE})$$
    • 问题:SE 是什么,如何理解 SE?
    • 回答:SE 是一些指令,给定一个新输入(如一段文本或少量示例),模型会生成一组数据或优化参数(即 self-edit),这些输出 SE 会被用于更新模型自身参数,从而提升模型
  • 论文使用强化学习优化自我编辑的生成过程:模型采取动作(生成 SE),根据 \(\text{LM}_{\theta’}\) 在 \(\tau\) 上的表现获得奖励 \(r\),并更新其策略以最大化期望奖励:
    $$
    \mathcal{L}_{\text{RL} }(\theta_t) := -\mathbb{E}_{(C,\tau)\sim\mathcal{D} } \left[ \mathbb{E}_{\text{SE}\sim\text{LM}_{\theta_t}(:C)} \left[ r(\text{SE}, \tau, \theta_t) \right] \right]. \tag{1}
    $$
    • 与标准强化学习设置不同,论文的奖励取决于模型参数 \(\theta\)(因为 \(\theta\) 会更新为 \(\theta’\) 并随后被评估)
    • 因此,强化学习的状态必须包含策略的参数,即 \((C, \theta)\),尽管策略的观察仅限于 \(C\)(将 \(\theta\) 直接放入上下文不可行)
    • 这意味着从旧模型 \(\theta_{\text{old} }\) 收集的(状态、动作、奖励)三元组可能与当前模型 \(\theta_{\text{current} }\) 不匹配
    • 为此,论文采用同策略(on-policy)方法,即自我编辑从当前模型中采样,并且奖励也基于当前模型计算
  • 论文尝试了多种同策略方法,如 GRPO 和近端策略优化(PPO),但发现训练不稳定
    • 最终,论文采用了 ReST\(^{EM}\)(2023),这是一种基于过滤行为克隆的简化方法,也称为“拒绝采样 + SFT”
    • ReST\(^{EM}\) 可以视为一种期望最大化(EM)过程:
      • E 步 :从当前策略中采样候选输出;
      • M 步 :仅对获得正奖励的样本进行监督微调
  • 这种方法在二元奖励下优化了目标函数(1)的近似:
    $$
    r(\text{SE}, \tau, \theta_t) = \begin{cases}
    1 & \text{If on } \tau \text{ adaptation using SE improves } \text{LM}_{\theta_t} \text{‘s performance}, \\
    0 & \text{Otherwise}.
    \end{cases} \tag{2}
    $$
    • 具体来说,在优化(1)时,论文需要计算梯度 \(\nabla_{\theta_t} \mathcal{L}_{\text{RL} }\)
    • 但由于奖励项 \(r(\text{SE}, \tau, \theta_t)\) 依赖于 \(\theta_t\) 且不可微,论文将其视为固定值
    • 在这种近似下,对于包含 \(N\) 个上下文和每个上下文 \(M\) 个采样自我编辑的小批量,蒙特卡洛估计为:
      $$
      \nabla_{\theta_t} \mathcal{L}_{\text{RL} } \approx -\frac{1}{NM} \sum_{i=1}^{N} \sum_{j=1}^{M} r_{ij} \nabla_{\theta_t} \log p_{\theta_t}(\text{SE}_{ij} \mid C_i), \tag{3}
      $$
      • 其中 \(p_{\theta_t}\) 表示模型的自回归分布
      • \(y_s^{(i,j)}\) 是自我编辑 \(\text{SE}_{ij}\) 的第 \(s\) 个 Token
      • 由于 \(r=0\) 的序列可以忽略,因此 ReST\(^{EM}\) 通过简单的“对优质自我编辑进行 SFT”优化了目标(1)
  • SEAL 的训练流程总结在算法1 中
  • 此外,尽管论文使用单一模型同时生成自我编辑和学习这些编辑,但也可以将这两个角色解耦
    • 在这种“教师-学生”框架中,学生模型通过教师模型提出的编辑进行更新,而教师模型则通过强化学习训练,以生成能最大化学生改进的编辑

Domain Instantiations

  • 论文在两个领域实现了 SEAL 框架:知识整合(Knowledge Incorporation)和 Few-shot 学习。这两个领域展示了模型适应的两种互补形式:
    • 1)将新信息整合到模型权重中,使其无需依赖上下文即可回忆(通过无上下文 SQuAD 评估);
    • 2)在少量示例后泛化到新任务(通过 ARC 评估)
Knowledge Incorporation
  • 论文的目标是高效地将段落中的信息整合到模型权重中
  • 一种有前景的方法是让语言模型生成基于段落的内容,然后对原始段落和生成内容进行微调(2022; 2023; 2024)
  • 论文采用典型格式:段落的逻辑推论
    • 这种方法将上下文 \(C\) 转换为一组推论 \(\text{SE} = \{s_1, s_2, \ldots, s_n\}\),并通过 Prompt 模型“列出从内容中衍生的几条推论”实现
    • 输出可能包括原始段落的推论、逻辑结果或重述
    • 在 附录C 中,论文还探索了其他 Prompt ,如“以不同方式重写段落”或“以问答格式重写”,并发现无论基础 Prompt 如何,论文的方法都能带来相似的性能提升
  • 这些自我生成的语句构成 SFT 的训练数据:论文对每个序列 \(s_i\) 计算标准因果语言建模损失,并更新模型参数,得到 \(\theta’\)
    • 由于每次更新的数据量较小且总更新次数较多,论文使用低秩适配器(LoRA)进行高效轻量级微调
    • 最后,适应后的模型 \(\text{LM}_{\theta’}\) 在任务 \(\tau\) 上评估。这一过程如图2 所示
  • 在强化学习训练中,适应模型在 \(\tau\) 上的准确率定义了奖励 \(r\),驱动外部强化学习优化。这训练模型以最适合微调的方式重组段落
Few-Shot Learning
  • 抽象与推理语料库(Abstraction and Reasoning Corpus,ARC)是一个测试抽象推理和从极少示例中泛化的基准
    • 每个任务包括少量输入-输出示例和一个需要预测正确输出的保留测试输入
  • 论文采用测试时训练(TTT)协议,其中少量示例的增强用于执行基于梯度的适应。论文训练 SEAL 学习这些决策,而不是依赖手动调整的启发式方法。为此,论文定义了一组工具 ,每个工具是预定义的函数,用于转换数据或指定训练参数,包括:
    • 数据增强(Data augmentations) :旋转、翻转、反射、转置、调整大小操作(如更改网格分辨率)以及链式或重复变换
    • 优化参数(Optimization parameters) :学习率、训练周期数以及损失是否计算所有 Token 或仅输出 Token
  • 模型通过任务的少量示例 Prompt 生成自我编辑(即指定调用哪些工具及如何配置的指令),如图3 所示
    • 然后通过基于 LoRA 的微调应用这些自我编辑来适应模型
    • 适应后的模型在保留测试输入上评估,结果决定训练自我编辑生成策略的奖励

Results

  • 本节论文通过两个适应领域实证评估 SEAL: Few-shot 学习和知识整合。完整的训练、超参数和评估细节见 附录A 和 附录B

Few-Shot Learning

  • 论文使用 Llama-3.2-1B-Instruct(2023)进行实验,这是一个未针对 ARC 进行预训练的小型开源模型
    • 由于大多数 ARC 任务对未经预训练的模型具有挑战性,论文从 ARC 训练集和评估集中分别筛选了 11 个和 8 个任务,确保它们在最优 TTT 配置下可解
  • 模型通过 ReST\(^{EM}\) 训练,每个训练任务采样 15 个自我编辑
    • 每个自我编辑独立生成 15 个更新模型,随后在对应的保留测试示例上评估
    • 论文仅强化那些导致模型正确适应的自我编辑(即适应后能正确输出测试输入的模型)
  • 训练后,论文通过为每个保留评估任务生成 5 个自我编辑并独立应用它们来评估模型
    • 然后报告导致正确输出的自我编辑百分比,反映学习到的自我编辑生成策略的质量
  • 论文对比了以下基线:
    • 1)ICL(上下文学习) :Llama-3.2-1B-Instruct 直接通过少量示例 Prompt 并查询测试输入
    • 2)TTT + 自我编辑(无 RL 预训练) :模型使用少量示例和合成增强进行测试时训练,但未通过 RL 优化增强或训练配置
    • 3)Oracle TTT :模型使用人工设计的最优配置进行测试时训练,作为方法的上限
  • 结果如表1 所示
    • SEAL 显著提高了适应成功率:72.5% vs. 20%(无 RL 训练的自我编辑)和 0%(无适应),但性能仍低于 Oracle TTT,表明还有改进空间

Knowledge Incorporation

  • 论文在 Quen2.5-7B 上实验,整合来自 SQuAD 段落的新事实内容
  • 论文进行了两轮 ReST\(^{EM}\) 训练,每轮包含 50 个上下文(详见 附录B)。论文对比了以下基线方法:
    • 1)基础模型 :未经适应的预训练模型,无法访问段落
    • 2)仅训练段落 :模型直接对段落进行标准语言建模损失微调,无合成数据
    • 3)训练段落 + 合成数据 :模型训练段落及自我生成的推论,与 SEAL 相同但无 RL 训练
    • 4)训练段落 + GPT-4.1 合成数据 :模型训练段落及通过 OpenAI API 从 GPT-4.1 生成的推论
  • 表2 报告了两种设置下的平均无上下文 SQuAD 准确率:单段落(\(n=1\))和持续预训练(CPT, \(n=200\))
    • 在单段落设置中,直接微调段落仅比冻结基础模型略优(33.5% vs. 32.7%),表明原始数据不足
    • 使用 GPT-4.1 生成的合成数据将准确率提升至 46.3%,比仅段落基线高 12.8 个百分点
    • 使用 Quen-2.5-7B 生成的合成数据达到 39.7%,提高 6.2 个百分点
    • 经过强化学习后,SEAL 进一步将准确率提升至 47.0% ,显著优于 GPT-4.1 的合成数据,尽管模型规模小得多
  • 在 CPT 设置中,模型在一次持续预训练中整合了 \(n=200\) 个段落的信息,随后在所有 974 个对应问题上评估
  • SEAL 再次超越所有基线,达到 43.8% 准确率。尽管绝对性能低于单段落设置(可能由于梯度干扰增加),但相对改进一致,表明 SEAL 的编辑策略能够泛化到原始 RL 设置之外
  • 图4 跟踪了每轮 RL 迭代后的准确率。两轮迭代后 SEAL 即超越 GPT-4.1 数据;后续迭代收益递减,表明策略快速收敛为将段落提炼为易学习的原子事实(定性示例见图5)。所有结果均使用调优超参数(见附录B)

Limitations

Catastrophic Forgetting

  • 论文提出 self-edit 语言模型(SEAL)的一个关键动机是实现持续学习(Continual Learning)的终极目标——让模型能够随着时间的推移不断整合新信息,无论是通过与环境的主动交互还是通过标准训练
  • 虽然之前的实验评估了 SEAL 在独立编辑场景下的适应能力,但更雄心勃勃的目标是支持连续的编辑序列 :模型能否在保留已有知识的同时,反复适应新信息?
  • 这一问题直接关联到灾难性遗忘(2014, 2015)的挑战,即新更新会破坏过去的学习成果
    • 当前的训练设置并未显式优化知识保留,但论文旨在建立一个基线,评估SEAL在没有专门机制的情况下处理连续 self-edit 的能力
    • 为了测试这一点,论文在知识整合领域模拟了一个持续学习场景:模型接收一系列测试段落,每个段落触发一次新的 self-edit
    • 每次更新后,论文重新评估模型在所有已见任务上的表现,以衡量其知识保留能力
  • 如图6所示,随着编辑次数的增加,模型在早期任务上的表现逐渐下降,这表明SEAL仍然容易受到灾难性遗忘的影响
    • 尽管如此,它能够在多次更新后避免完全崩溃,这表明未来仍有改进空间
    • 未来的工作可以通过奖励塑形(2020, 2024)来增强这一能力,例如惩罚对早期任务的回归,或整合持续学习策略,如零空间约束编辑(2025)或表示叠加(2019)

Computational overhead

  • TTT(Test-Time Training)奖励循环的计算成本显著高于其他用于 LLM 的 RL 方法
  • 例如,基于人类偏好的奖励信号通常只需要一次模型前向传播,而基于验证解的奖励可能仅依赖简单的模式匹配(如正则表达式)
  • 相比之下,论文的方法需要对整个模型进行微调和评估以计算奖励——每次 self-edit 评估大约需要30-45秒,带来了显著的开销(详见附录B.5)

Context-dependent evaluation

  • 当前的实例化假设每个上下文都配有一个明确的下游任务:Few-shot 示例附带一个保留的查询对,每个段落捆绑了参考问答
  • 这种耦合简化了奖励计算,但阻碍了 SEAL 的 RL 训练扩展到未标注语料库
  • 一个潜在的解决方案是让模型不仅生成 self-edit,还为每个段落生成自己的评估问题(例如草拟问答项或合成测试用例),同时保留原始内容在上下文中
  • 这些模型编写的查询可以提供强化学习所需的即时监督,从而将适用性扩展到缺乏外部问答集的通用训练领域

Related Work

  • 合成数据生成(Synthetic Data Generation) :
    • 合成数据在训练中的应用日益广泛,从大规模预训练数据集(2023; 2024; 2024)到任务特定的数据增强(2023; 2024)和指令微调集(2023; 2023)
    • Yang 等人(2025)通过基于图的 Prompt 生成合成数据
    • SEAL 在此基础上,利用强化学习训练生成策略,直接最大化合成数据在梯度更新中的下游效用,而非依赖手动调整的静态启发式方法
  • 知识更新(Knowledge Updating) :
    • 近期研究尝试通过权重更新修改或注入事实知识
    • 部分方法直接定位与特定事实相关的参数(2022; 2022; 2023)
    • 另一些则利用上下文信息生成额外的微调数据(2024; 2024; 2025; 2025)
    • 论文采用后者,参考 Akyurek 等人(2024)提出的逻辑蕴涵生成和 Lampinen 等人(2025)展示的蕴涵微调优于上下文学习的结果
    • SEAL 通过强化学习训练模型生成更优的微调数据,进一步扩展了这些方法
    • Park 等人(2025)表明,直接生成问答对(QA)的 Prompt 优于蕴涵式 Prompt
    • 由于 SEAL 框架对 self-edit 数据的格式无关,它同样可以训练生成 QA 对或其他输出格式
  • 测试时训练(TTT, Test-Time Training) :
    • 测试时训练基于输入临时调整模型权重(2020; 2022; 2024)。Akyurek 等人(2025)表明,TTT 与上下文学习结合可在 Few-shot 设置中超越标准 ICL
    • SEAL 在内部优化中整合了 TTT,利用其高效性执行多次更新,并奖励带来最大性能提升的数据生成策略
  • LLM 的强化学习(Reinforcement Learning for LLMs) :
    • 强化学习在改进 LLM 行为中发挥核心作用,最初通过 RLHF(2022)实现
    • 近期研究利用可验证奖励直接优化任务成功率(2022; 2024; 2025)
    • SEAL 将强化学习应用于优化 self-edit 数据的生成,而非最终答案或推理轨迹的修订
  • 元学习与自修改系统(Meta-Learning and Self-Modifying Systems) :
    • SEAL 通过外部优化循环学习适应策略(即如何生成有效的 self-edit),体现了元学习原则(2001; 2017; 2025),其目标是学习如何高效地从任务上下文中学习
    • 元学习同样已应用于强化学习领域在该领域中,模型通过元目标进行训练,以快速适应新任务
    • 这类工作的一个自然延伸是自指网络(self-referential networks),即模型自行修改自身参数(1992; 2022)
    • 在大型语言模型领域,近期的研究已将元学习原则应用于改进 LLM 的适应性[2024;2023]
    • 值得注意的是,Hu等人(2023)训练了一个较小的模型,使其在对语料库进行微调时输出特定于标记的权重,以解决与我们类似的知识整合任务
    • 然而,SEAL 通过利用模型现有的生成能力来参数化更新,从而在跨领域场景中展现出更强的通用性
  • 自我改进(Self-Improvement) :
    • 近期研究涵盖自我改进或自训练的多种方法
    • RLAIF(2022; 2024)和自我奖励语言模型(2024; 2025)利用模型自身提供奖励信号,基于判断输出比生成更容易的观察(2025)
    • 其他工作通过多数投票或模型置信度作为强化学习奖励,在无真实标签的情况下提升数学任务性能(2023; 2024; 2025; 2025)
    • 然而,这些方法受限于模型的当前评估能力和自一致性,相比之下,SEAL 通过与外部数据的交互实现自我改进,为更具扩展性的路径提供了可能

Discussion and Conclusion

  • Villalobos等人(2024)预测,到2028年,前沿 LLM 将完成对所有公开人类生成文本的训练
  • 作者认为,这一迫近的“数据墙”将迫使人们采用合成数据增强 ,一旦网络规模的语料库耗尽,进展将取决于模型自主生成高效用训练信号的能力
  • 自然的下一步是元训练一个专用的 SEAL 合成数据生成模型,生成新的预训练语料库,使未来模型能够在无需额外人类文本的情况下扩展并实现更高的数据效率
  • 我们可以设想一个未来场景:大语言模型能够消化新数据(如学术论文),并利用上下文中的数据和已有知识生成大量解释和推论
    • 这种自我表达和自我优化的迭代循环可能使模型即使在缺乏外部监督的情况下,也能在罕见或代表性不足的主题上持续改进
  • 此外,尽管现代推理模型通常通过强化学习生成思维链(CoT)轨迹,但 SEAL 可以提供一种互补机制,让模型学习何时以及如何更新自身权重
    • 这两种方法可以协同作用:模型可能在推理过程中选择更新权重以引导当前轨迹,或在完成推理后将关键见解提炼到参数中——通过内部化学习提升未来推理能力
  • 这种持续优化的循环对于构建代理系统(Agentic Systems)也很有前景——这些模型在长期交互中运行,并动态适应不断变化的目标
    • 代理模型必须逐步获取和保留知识
    • 论文的方法通过支持结构化的自我修改来实现这种行为:在交互后,代理可以合成一个 self-edit,触发权重更新
    • 这可能使代理能够随时间发展,使其行为与先验经验对齐,并减少对重复监督的依赖
  • SEAL 证明了大语言模型在预训练后不必保持静态:通过学习生成自己的合成 self-edit 数据并通过轻量级权重更新应用这些数据,它们可以自主整合新知识并适应新任务
  • 展望未来,作者计划将 SEAL 框架扩展到预训练、持续学习和代理模型中,最终使语言模型能够在数据受限的世界中自我学习和扩展

附录A 实验细节:Few-shot 学习(Experimental Details: Few-shot Learning)

  • 模型与设置 :论文使用Llama-3.2-1B-Instruct(2024)作为基础语言模型。由于该模型未针对ARC进行专门训练,其解决ARC任务的能力有限。为了进行受控评估,论文从训练集和评估集中筛选了一小部分可通过最优TTT超参数解决的 ARC 问题
    • 训练集 :从训练集中选择了11个ARC任务作为RL优化的环境
    • 评估集 :从评估集中选择了8个不同的ARC问题用于衡量泛化性能。这8个问题明确筛选为适合TTT的场景
  • 这些集合的选择是为了隔离 self-edit 学习的效果,而非通用ARC能力
  • 训练流程 :论文在11个训练问题上使用单轮强化学习训练SEAL。对于每个问题,模型生成15个 self-edit 配置,包括:
    • 数据增强策略 :控制是否包含基本示例、基于尺寸的增强、链式推理和重复输入
    • 优化配置 :指定学习率、训练轮数和损失函数类型(例如是否对所有 Token 或仅最终输出 Token 计算损失)
  • 每个配置通过测试时训练(TTT)评估,并分配二元奖励:如果适应后的模型生成正确解则为1,否则为0
  • 评估细节 :对于8个保留的评估任务,模型生成5个 self-edit 配置,共40个配置。成功率衡量为适应后生成正确输出的配置百分比

附录B 实验细节:知识整合(Experimental Details: Knowledge Incorporation)

  • 模型与设置 :论文在知识整合实验中使用Quen-2.5-7B基础模型(2025)。论文将SQuAD数据集v1.1(2016)重新用于无上下文段落的问答任务
  • RL训练流程 :论文运行2轮 ReST\(^{EM}\) 训练(2025)
    • 每轮从 SQuAD 训练集中抽取 50 个 上下文-问题-答案 三元组。对于每个上下文,采样 5 个 self-edit 生成(温度=1),并通过 3 个随机种子评估每个生成
  • 合成数据生成与微调细节 :在所有模型中,论文通过 Prompt 生成段落的推论来生成合成数据
  • 评估细节 :论文在 SQuAD 评估集的 200 个段落子集上评估,共974个问题
    • 使用 GPT-4.1(2025)通过 OpenAI API 进行自动评分
  • 计算资源 :所有实验在 2×H100 或 2×H200 上运行
    • 使用 DeepSpeed ZeRO-3(2020)进行 ReST\(^{EM}\) 训练的 SFT,使用 vLLM(2023)进行高效推理

附录C Prompting

  • 近期研究表明,强化学习基线和结果对 Prompt 高度敏感。论文在知识整合设置中测试了 4 种额外的 self-edit Prompt;五种 Prompt 如下:
    • 1)推论(Implications)
    • 2)长推论(Implications-long)
    • 3)超长推论(Implications-very-long)
    • 4)重写(Rewrite)
    • 5)自问答(Self-QA)
  • 结果显示,尽管通过 Prompt 生成长响应可以提高性能,但以这些 Prompt 为基础的 RL 训练能带来更大的改进
    • 在所有情况下,ReST\(^{EM}\)将性能提升了约 6 到 11 个百分点
1…676869…352
San Ye

San Ye

Stay Hungry. Stay Foolish.

704 posts
53 tags
© 2026 San Ye
Powered by Hexo
|
Theme — NexT.Gemini v5.1.4