Hexo

凡事预则立,不预则废


  • Home

  • Tags

  • Archives

  • Navigation

  • Search

NLP——LLM对齐微调-RubricRL

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始论文:RubricRL: Simple Generalizable Rewards for Text-to-Image Generation, 20251125, Microsoft CoreAI

Paper Summary

  • 整体说明:
    • 论文介绍了一个基于 Rubric 的奖励 RL 框架 为 RubricRL(为文本到图像)
    • RubricRL 通过显式地创建可配置的视觉标准(例如计数、属性、OCR 保真度、真实感)并独立地对它们进行评分,产生可解释和模块化的信号(这些信号可以与 RL 中的标准策略优化无缝集成)
  • 背景 & 问题:
    • RL 已成为一种有前景的方法,用于使文本到图像生成模型与人类偏好对齐,但一个关键的挑战在于设计有效且可解释的奖励
    • 现有方法通常依赖于具有固定权重的复合指标(例如,CLIP、OCR 和真实感分数)或从人类偏好模型提取的单一标量奖励,这可能会限制可解释性(interpretability)和灵活性(flexibility)
  • 论文方法:
    • Rubric-based 奖励设计的框架 RubricRL
    • RubricRL 提供了更高的可解释性、可组合性(composability)和用户控制力(user control)
    • RubricRL 不使用黑盒标量信号,而是为每个 Prompt 动态构建一个结构化 Rubric (一个可分解的细粒度视觉标准清单),并根据输入文本定制
      • 结构化 Rubric:例如 对象正确性、属性准确性、OCR 保真度(OCR fidelity)和真实感(realism)
    • 每个标准由多模态 Judge(如 o4-mini)独立评估,一个 Prompt 自适应加权机制会强调最相关的维度
  • 这种设计不仅为策略优化(例如,GRPO 或 PPO)产生了可解释和模块化的监督信号,还使用户能够直接调整奖励或惩罚哪些方面
    • 在一个自回归文本到图像模型上的实验表明,RubricRL 提高了 Prompt 忠实度、视觉细节和泛化能力,同时为跨文本到图像架构的可解释 RL 对齐提供了一个灵活且可扩展的基础

Introduction and Discussion

  • RL 最近已成为一种有前景的方法,用于对齐生成模型与人类偏好
  • 在 LLM 中,RLHF (2022) 和 RLVF (2024, 2025) 等框架已经证明,基于偏好反馈引导的策略优化可以显著增强忠实度、风格和可用性
  • 将这一范式扩展到文本到图像生成,包括扩散和自回归架构,提供了一种原则性的方式
    • 直接针对人类对齐的视觉质量而非基于似然的目标来优化模型
  • However,RL 在视觉领域的有效性关键取决于奖励设计:构建跨 Prompt、领域和架构都准确、可解释且可泛化的评估信号仍然是一个核心挑战
  • 现有的文本到图像 RL 框架可以大致分为多奖励混合和统一标量奖励模型两类
    • 多奖励系统(例如,X-Omni (2025),AR-GRPO (2025)):
      • 结合了异构目标,如基于 CLIP 的图文相似度 (2021)、OCR 准确度 (2025)、真实感 (2023) 和属性一致性,以共同鼓励对齐和视觉质量
      • 虽然这种方法提高了覆盖范围,但它们依赖于手动调整的加权方案,这些方案跨 Prompt 和领域可能很脆弱,并且提供的可解释性有限
    • 统一奖励模型(例如,OneReward (2025),Pref-GRPO (2025),LLaVA-Reward (2025)):
      • 从成对的人类偏好数据中学习单一标量奖励
      • 这简化了优化,但可能掩盖奖励背后的推理过程,限制可扩展性,并使得用户难以控制优先考虑哪些视觉方面
  • 在论文提出了 RubricRL ,一个用于文本到图像模型中 Rubric-based 奖励设计的简单通用框架
    • RubricRL 不依赖不透明的标量信号,而是 动态地为每个 Prompt 选择一个结构化 Rubric
      • 这里的 Rubric 即一个可分解的细粒度视觉标准清单,例如对象正确性、属性准确性、OCR 保真度、组合连贯性和真实感
      • 每个标准由多模态 Judge (例如,GPT-4o-mini)独立评估,同时一个 Prompt 自适应加权机制会突出最相关的维度
      • 这产生了可解释、模块化的监督信号,可以自然地集成到 GRPO (2025) 或 PPO (2017) 等策略优化框架中
  • 通过以人类可读和可分解的形式表达奖励,RubricRL 将奖励评估从黑盒启发式方法转变为可审计的过程,用户可以在此过程中直接检查、扩展或调整生成的哪些方面受到奖励或惩罚
    • Rubric 结构还有助于进行每个标准的诊断,为模型行为提供透明度,并简化评估和调试
  • RubricRL 与架构无关,兼容扩散和自回归文本到图像模型
    • 其 Rubric 输出进一步支持方差感知的群体优势,即使在长序列 Rollout 下也能实现稳健的更新
    • 其 Prompt 自适应设计确保每个奖励向量都反映了输入文本的显著方面,例如数字、命名实体、风格或嵌入文本,而无需手动调整
  • 论文使用一个自回归文本到图像模型验证了这个简单而有效的想法
    • 实验表明,RubricRL 提高了 Prompt 忠实度、组合准确性和视觉真实感,同时在数据集和架构上保持了高泛化能力
    • 与先前的多奖励或统一奖励方法相比,RubricRL 实现了更一致的优化行为,并实现了可控、可解释的奖励塑形
  • 图 1 提供了论文方法的可视化样本,展示了高视觉质量
  • In summary,RubricRL 的贡献如下:
    • 一个适用于扩散和自回归文本到图像模型的通用 Rubric 奖励设计;
    • 一个 Prompt 自适应、可分解的监督框架,增强了可解释性和可组合性;
    • 一个用户可控且可审计的接口,使 RL 奖励塑形变得透明且易于扩展
  • 通过基于显式视觉标准动态生成 Rubric 来操作对齐过程,RubricRL 使得用于文本到图像生成的强化学习更具可解释性、可扩展性和用户引导性,为将视觉生成与人类意图对齐提供了统一的基础

Method

  • 论文使用一个基于自回归的文本到图像模型来验证 RubricRL 框架的有效性,但它同样可以泛化到基于扩散的模型
  • 本节首先介绍论文 RubricRL 框架的总体架构,然后详细介绍 Rubric-based 奖励设计、RL 训练方法和动态 Rollout 采样

Overall architecture

  • 如图 3 所示,给定输入文本 Prompt \(p\),论文首先将其标记化为一个文本 Token 序列,然后将其输入到一个自回归文本到图像生成模型 \(\pi_{\theta}\) 中,以预测一个图像 Token 序列
    • 这些图像 Token 随后使用一个预训练的、固定的 VQ 解码器进行解码,以产生最终图像 \(I\)
  • 在论文中,论文主要关注对 \(\pi_{\theta}\) 进行 RL 后微调以进一步提高其输出质量,其中设计一个有效、可靠且可解释的奖励函数是关键挑战
  • 现有方法通常使用一个或多个专用模型来评估图像质量的不同方面,例如基于 CLIP 的图文语义对齐奖励 (2021) \(R_{\text{clip} }(I,p)\)、OCR 准确度 (2025) \(R_{\text{ocr} }(I,p)\) 和真实感 (2023)
  • 但这种方法有明显的缺点:
    • (1)部署多个专用模型计算成本高昂,难以扩展到更多方面;
    • (2)需要仔细的奖励校准和重新加权
  • 最近的工作试图从成对的人类偏好数据中学习一个单一的奖励模型,简化了优化,但由于高标注成本和较差的可解释性,可扩展性有限
  • 受到现代多模态大语言模型强大理解能力的启发,论文提出了一种简单且统一的 Rubric-based 奖励模型 ,记作
    $$ R_{\text{rubric} }(I,p,\mathcal{C}(p)) $$
    • 该模型用一个具有推理能力的视觉语言模型替换了特定任务评估器的集合
    • 论文的方法不依赖固定的子模型,而是自动构建一组可解释、Prompt 自适应的标准,称为“Rubrics”,以捕捉每个特定 Prompt \(p\) 的质量要求的基本方面
  • 具体来说,给定一个文本 Prompt \(p\),一个 Rubric 生成模型 \(\mathcal{G}\)(通过一个大语言模型实现)生成一组 Rubric :
    $$
    \mathcal{C}(p)=\mathcal{G}(p),
    $$
    • 其中 \(\mathcal{C}(p)=\{c_{1},c_{2},\ldots,c_{M}\}\) 定义了 \(M\) 个特定于 Prompt 的标准,涵盖诸如对象计数、属性准确性、文本/OCR 保真度、空间关系、美学和风格一致性等维度
    • 这确保了评估标准根据每个输入 Prompt 的语义和粒度动态适应
  • 在强化学习中,目标是调整模型参数 \(\theta\),以最大化在 Prompt 分布上的预期 Rubric-based 奖励:
    $$
    \max_{\theta}~ \mathbb{E}_{p\sim\mathcal{D},~ I\sim\pi_{\theta}(\cdot|p)}\big[R_{\text{rubric} }(I,p,\mathcal{C}(p))\big],
    $$
    • 其中 \(\mathcal{D}\) 表示 Prompt 集合
    • 一个 Rollout 对应于给定 \(p\) 从 \(\pi_{\theta}\) 中采样的单个图像,提供一个指导策略更新的奖励信号
  • 与多模型奖励系统相比,论文 Rubric-based 公式具有三个关键优势:
    • (1)简单性(Simplicity):无需多个特定任务的 Grader ;
    • (2)自适应性(Adaptivity): Rubric 为每个 Prompt 动态生成,确保与多样化用户意图的相关性;
    • (3)可解释性(Interpretability):每个奖励组件对应一个人类可读的评估标准,实现了透明的模型诊断和可控的优化

Rubric based reward

  • Rubric-based 奖励函数分两个阶段进行
    • 首先,一个Rubric 生成模型 \(\mathcal{G}\) 解释用户 Prompt \(p\) 并产生一组候选 Rubric \(\mathcal{C}(p)\)
    • 其次,一个多模态大语言模型 Grader 实现 Rubric-based 奖励 \(R_{\text{rubric} }(I,p,\mathcal{C}(p))\),该函数根据 \(\mathcal{C}(p)\) 中的每个 Rubric 对生成的图像 \(I\) 进行评分
      • 论文使用 GPT-4o-mini 来扮演这两个角色,生成特定于 Prompt 的 Rubric 并提供每个标准的判断,这些判断被聚合成一个标量奖励
Rubric construction
  • 给定一个用户 Prompt \(p\),论文要求 GPT-4o-mini 生成一个 Rubric 列表
  • 每个 Rubric 条目包含一个针对特定方面(例如,OCR 对齐、对象计数、空间关系、美学)的简短评估键,以及一个关于在图像中检查什么的简明描述
  • 为了在 Rubric 生成过程中促进多样性和减少位置偏差,论文在 Rubric 生成 Prompt 中随机排列评估方面,并多次查询 GPT-4o-mini
  • 在每一轮中,模型产生一组 Rubric (论文每次查询请求10个;因为一个 Prompt 可能描述多个对象或属性,模型可能会为一个评估键输出多个 Rubric 以确保足够的覆盖)
  • 论文将所有运行中的有效键-标准对聚合到一个统一的 Rubric 池中,丢弃模糊或格式错误的条目
  • 最后,为了消除冗余并关注最重要的信号,论文要求 GPT-4o-mini 选择前10个最相关和最关键的标准来评估从用户 Prompt \(p\) 生成的图像
Rubric-guided reward
  • 给定一个生成的图像 \(I\)、其对应的文本 Prompt \(p\) 和 Rubric 池 \(\mathcal{C}\),论文再次简单地要求 GPT-4o-mini 为每个标准输出一个单一分数 \(y_{i}\in\{0,1\}\),以反映生成的图像是否完全满足此 Rubric (\(y_{i}=1\))或不满足(\(y_{i}=0\))。总体 Rubric 奖励计算为归一化均值:
    $$
    R(I,p,\mathcal{C})=\frac{1}{M}\sum_{i=1}^{M}y_{i},\quad M=10 \tag{3}
    $$

Reinforcement learning with GRPO

  • 为了使自回归图像生成器与 Rubric-based 奖励对齐,论文采用 GRPO (2024),设计用于在分组 Rollout 上进行稳定优化
  • 对于每个 Prompt,生成的 Rollout 集合形成一个组,每个 Rollout 的奖励相对于该组进行归一化,以减少方差并改进信用分配
  • 具体来说,令 \(\pi_{\theta}\) 表示当前策略,\(R_{i}\) 表示组 \(g\) 中第 \(i\) 个 Rollout 的 Rubric 奖励, GRPO 计算相对优势:
    $$
    A_{i}=\frac{R_{i}-\bar{R}_{g} }{\sqrt{\frac{1}{|g|-1}\sum_{j\in g}\left(R_{j}-\bar{R}_{g}\right)^{2} } },\bar{R}_{g}=\frac{1}{|g|}\sum_{k\in g}R_{k} \tag{4}
    $$
  • 并通过最大化类似于 PPO 的裁剪目标来更新策略:
    $$
    \mathcal{L}(\theta)=\mathbb{E}_{i}\Big[\min\left(r_{i}(\theta)A_{i},\text{clip}(r_{i}(\theta),1-\epsilon,1+\epsilon)A_{i}\right)\Big] \tag{5}
    $$
    • 其中 \(r_{i}(\theta)=\frac{\pi_{\theta}(a_{i}|s_{i})}{\pi_{\theta,\text{old} }(a_{i}|s_{i})}\)
    • \(a_{i}\) 和 \(s_{i}\) 是对应于 Rollout \(i\) 的采样动作和状态
    • \(\epsilon\) 是 PPO 裁剪参数
  • 通过利用这种群体相对优势,GRPO 稳定了跨 Prompt 的训练,使模型对异构奖励尺度和噪声评估具有鲁棒性
  • 结合论文 Rubric-based 奖励和下文描述的动态 Rollout 选择策略,论文发现 GRPO 可以有效地引导生成模型生成既符合人类对齐又高质量的图像
Dynamic rollout sampling
  • 如上所述,GRPO 中的目标策略模型 \(\pi_{\theta}\) 通过采样多个 Rollout 来探索生成空间,每个 Rollout 产生一个用于优势计算的奖励 \(R_{i}\)
    • 在原始的 GRPO 设计中,来自单个 Prompt 的所有 \(N\) 个 Rollout 被分组在一起进行策略更新,即 \(|g|=N\)
    • 后续工作引入了过采样和过滤策略来提高训练效率
  • 例如,DAPO (2025) 采用了 Prompt 级别 的过采样方法:
    • 它为每个 Prompt 生成 \(N\) 个 Rollout,并丢弃那些所有 Rollout 准确度都为 \(1\) 或 \(0\) 的 Prompt,从而仅保留中等难度的 Prompt 用于策略优化
    • 形式上,DAPO 有选择地采样用于训练的 Prompt,同时仍使用每个保留 Prompt 的所有 Rollout 进行 RL 更新
  • 论文提出了一种新的 Rollout 级别 动态采样机制,其中选择发生在单个 Prompt 的 Rollout 内部,而不是过滤整个 Prompt
    • 具体来说,给定一个文本 Prompt,论文不是只采样 \(N\) 个 Rollout,而是过采样 \(N^{\prime}\) 个 Rollout(\(N^{\prime}>N\)),并选择性地使用一个具有代表性的 \(N\) 个 Rollout 子集进行策略更新
    • 为了平衡质量和多样性,论文采用了一种混合选择策略:论文选取前 \(K\) 个高奖励的 Rollout,并从其余的 Rollout 中随机采样剩余的 \(N-K\) 个以鼓励多样性
    • 形式上,Rollout 组 \(g\) 构造为:
      $$
      g = \{\tau_{(1)},\ldots,\tau_{(K)}\}\cup\text{RS}\big(\{\tau_{(K+1)},\ldots,\tau_{(N^{\prime})}\},N{-}K\big),
      $$
      • 其中 RS 表示随机采样
  • Empirically,论文观察到这种混合设计在稳定性和多样性之间取得了更好的平衡,实现了更好的模型质量
    • As a result,公式 5 中的损失是在更具代表性和信息量的 Rollout 子集上计算的,与原始的 GRPO 和 DAPO 中的 Prompt 级别过滤方案相比,带来了更一致和高效的学习

Experiments

Implementation details

  • 遵循 SimpleAR (2025) ,论文从 JourneyDB (2023) 和 Synthetic dataset-1M (2024) 中选择了 11,000 张图像,并使用 GPT-04-mini 为每张图像重新生成不同长度的 Prompt,并在训练过程中随机选取
  • 在网络架构方面,论文使用两个经过 SFT 的 LLM 作为骨干网络,即 Phi3-3.8B (2024) 和 Qwen2.5-0.5B (2024),并分别使用 LlamaGen 的 VQ 解码器 (2024) 和 Cosmos-Tokenizer (2025) 作为视觉解码器
  • RL 训练使用 TRL 框架 (2020) 进行,学习率为 1e-5,预热比例为 0.1
  • 默认情况下,数据集以批次大小为 28 训练 3 个 epoch。两个骨干网络输出图像的分辨率分别为 512 和 1024
  • 对于动态 Rollout 采样,论文为每个 Prompt 从 16 个 Rollout 中选择 4 个候选
  • 在推理过程中,论文利用无分类器引导 (CFG) (2022) 基于条件和非条件对数来指导图像合成
  • 所有实验均在 8 块 NVIDIA A100 GPU 上进行

Comparing with state-of-the-arts

  • 论文在 DPG-Bench (2024) 和 GenEval (2024) 上,将 RubricRL 与上述两种文本到图像 SFT 模型上的多种奖励模型进行比较
  • 对比的奖励方法可根据其奖励设计分为:
    • 1)单一的专用奖励模型,包括 CLIPScore (2021)、HPSv2 (2023)、Unified Reward (2025) 和 LLaVA-Reward-Phi (2025);
    • 2)具有固定权重的复合奖励指标,例如 AR-GRPO (2025) 和 X-Omni (2025)
  • 为了公平比较,论文通过实现他们的方法来获取基线数据,并使用相同的 RL 框架(GRPO)和设置,唯一的区别在于奖励函数的设计
  • 为了更好地理解 RL 带来的增益,论文还报告了初始 SFT 模型的性能,每个 RL 奖励都是在该模型基础上独立应用的
  • 使用 Phi3 和 Qwen2.5 骨干网络的量化结果分别在表 1 和表 2 中报告
  • 对于 GenEval,遵循 (2025) 应用了 Prompt 重写以确保评估一致性
  • 从结果来看
    • 所有经过 RL 后训练的方法都一致地优于 SFT 基线,证实了强化学习在提升图像生成质量方面的好处
    • 并且 RubricRL 取得了最佳性能,在两种 LLM 骨干网络上,其 GenEval 分数均超越 X-Omni 约 4%,凸显了论文基于 Rubric 的奖励的有效性和泛化性

Ablation study

  • 论文进行了多项消融分析
  • 默认情况下,所有实验均基于 Phi3 并在 GenEval 基准上进行评估
Strategies for dynamic rollout sampling
  • 为了研究动态 Rollout 采样使用的不同选择策略的影响,论文比较了四种方法,即不使用动态 Rollout 采样的 RubricRL(Vanilla)、FFKC-1D (1985)、DAPO (2025) 和论文提出的混合策略,并将结果报告在表 3 中
  • 具体来说
    • FFKC-1D 同样会过采样更多的 Rollout,然后通过首先选择一个中位数 Rollout(奖励最接近中位数的 Rollout),然后贪心地添加那些与已选样本奖励差异最大的样本来保留一个多样化的子集
    • 与论文的混合策略相比,FFKC-1D 过于关注多样性而忽略了高质量 Rollout 的重要性
  • 如表 3 所示,论文的混合采样策略始终达到最佳性能,超越了 FFKC-1D、DAPO 以及直接使用四个 Rollout 而不进行任何动态处理的 Vanilla 基线
  • 有趣的是,FFKC-1D 和 DAPO 并没有超越 Vanilla 基线,这表明它们的动态 Prompt 采样和纯粹基于 Rollout 多样性的采样策略未能为 RL 提供额外的有效信号
  • In Contrast,论文的混合策略有效地平衡了对高奖励 Rollout 的利用和对多样化候选的探索,使策略模型能够同时利用更高质量和多样化的样本,从而产生更有效的 RL 信号
Normalization scope for advantages
  • 在公式 4 中,GRPO 中使用的优势值是通过对一个 Rollout 组内的奖励进行归一化(使用均值和标准差)来计算的
  • 在论文的动态采样策略下,只从 \(N’\) 个候选 Rollout 中保留了 N 个
    • 这就引出了一个重要的设计选择:归一化统计量(均值和标准差)是应该使用所有 \(N’\) 个 Rollout 来计算,还是仅使用保留的 N 个?
    • 论文将这两种变体分别标记为“全局归一化 (Global Norm)”和“局部归一化 (Local Norm)”
  • 表 4 显示,“局部归一化”产生了更好的性能
    • 这是因为在保留的子集内进行归一化能更好地反映指导学习的实际奖励分布,防止高方差或低质量的 Rollout 扭曲梯度方向
RubricRL v.s. SFT with Best-of-N sampling
  • 论文进一步将提出的 RubricRL 与在推理时配备了 Best-of-N 采样策略(N=8)的 SFT 模型进行了比较,先前工作 (2025) 观察到这在语言任务中构成了 RL 方法的“上限”
  • 具体来说,对于 GenEval 中的每个 Prompt,论文首先生成一个 Rubric,然后从 SFT 模型中采样 8 个 Rollout
  • 每个 Rollout 都使用基于 Rubric 的奖励进行评分,并选择前 4 个在 GenEval 上进行评估
  • 如表 5 所示,
    • 尽管 Best-of-N 采样可以显著获得更高的分数,但 RubricRL 仍然实现了显著改进,超过了 Best-of-N 超过 5%
    • 这一结果与 X-Omni (2025) 中的观察一致,再次证实强化学习提供了一种更有效的优化范式
Failure case analysis
  • 作为 Grader,尽管 GPT-04-mini 在评估生成图像质量方面非常通用和强大,但论文观察到它有时会分配错误的分数
    • 例如,低估或高估物体数量,尤其是在基础模型的生成质量较差时
  • 图 4 展示了 GenEval 计数子类别中的几个典型失败案例,例如交通灯附近多余的杆子、交织的自行车和重叠的斑马
  • 这些具有挑战性的场景常常误导 GPT-04-mini,导致计数不准确
  • However,当基础模型生成更高质量的图像时,这个问题就不那么明显了
    • 这解释了为什么当使用 Qwen2.5-0.5B 作为基础模型时,RubricRL 在 GenEval 的“计数 (Counting)”子类别和 DPG-Bench 的“其他 (Other)”子类别(两者都包含许多计数案例)上的性能比基线 SFT 模型更差
  • In Contrast,使用 Phi3-3.8B 时,这个问题几乎消失了,使得 RubricRL 在计数相关类别上的性能大幅提升

Visual results

  • 论文在图 5 中进一步展示了 RubricRL 与其他基线方法之间的综合视觉比较
  • 如图所示,使用 RubricRL 训练的模型生成的图像不仅更具美学吸引力,而且在与给定输入 Prompt 的语义对齐方面表现出优越性
  • 为了帮助解释,生成图像中任何未对齐或缺失的元素都在图中使用粗体文本进行了强调
    • 例如,在图 5 的第三行,SFT 模型未能完全渲染出黑色的高顶礼帽,而几种基于 RL 的方法则出现了部分错位
    • 具体来说,LLaVA-Reward-Phi (2025) 和 Unified Reward (2025) 生成的图像中,黑色的包没有正确地拿在手中,在某些情况下,描绘了两个包分别在两只爪子里,同时完全忽略了木制手杖
    • 这些定性观察强调了 RubricRL 在增强模型遵循复杂、细粒度指令并生成高质量、符合 Prompt 图像方面的有效性

Related work

Text-to-Image Generation Methods

  • 文本到图像生成通过基于扩散的和自回归架构都取得了显著进展
  • 扩散模型以文本 Prompt 为条件迭代细化潜在表示,实现了高质量和逼真的图像
    • Stable Diffusion (2022) 和基于流的扩展 (2024, 2025) 等变体提供了多样化的风格、可控的生成以及在全局和局部层面的强保真度
  • 自回归方法将图像表示为离散 Token 序列,并使用单一的 Transformer 骨干网络对文本和图像 Token 的联合分布进行建模
    • 早期的混合设计,如 DreamLLM (2023),将自回归文本编码器与独立的扩散解码器配对
    • 最近的统一自回归模型,包括 Chameleon (1999), Emu3 (2024), TransFusion (2024) 和 Janus (2025),在一个架构中集成了视觉 Token 化和自回归建模
    • 这些模型允许文本 Token 和视觉输出之间的直接映射,从而实现灵活的控制和细粒度的生成
  • 论文为文本到图像模型中的强化学习提出了一种新颖的奖励设计,并使用一个统一的自回归文本到图像模型证明了其有效性
    • 注意:论文 Rubric-based 奖励同时适用于自回归和扩散架构

Reinforcement Learning for Text-to-Image Generation

  • 最大似然训练通常对用户关注的特性优化不足,例如语义忠实度、组合准确性和美学
  • RL 提供了任务对齐的反馈,直接优化超出似然的人类相关属性
  • 在基于扩散的文本到图像模型中,RL 方法,如 FlowGRPO (2025), DanceGRPO (2025) 和推理增强的 T2I-R1 (2025),通过使用偏好或基于度量的奖励微调生成策略,改进了对齐
  • Recently,RL 也被应用于统一的自回归文本到图像模型 (2025),其中策略梯度直接作用于下一个 Token 的概率,从而实现对生成图像的端到端信用分配和细粒度控制
  • 奖励函数的设计对于文本到图像模型中有效的强化学习至关重要
    • 一系列工作聚合了异构信号
      • 例如基于 CLIP 的图文对齐 (2021)、OCR/文本正确性 (2025)、多模态 VLM Judge (例如,Qwen2.5-VL-32B (2025))、美学和真实感度量 (2022) 以及人类偏好替代指标 (2023)
      • 虽然全面,但这些多奖励混合方法需要仔细的权重分配和调整,这可能会破坏优化的稳定性并掩盖每个方面的失败
    • 另一个方向训练统一的偏好模型 (2025) 从成对的图像输出中预测单一标量的人类对齐分数,简化了优化,但依赖于昂贵的人工标注且可扩展性有限
  • 在这项工作中,论文提出了一种简单、可泛化且可解释的 Rubric-based 奖励
    • 对于每个 Prompt,一个简洁的 Rubric 定义了方面的标准
      • 例如文本对齐/OCR 准确度、对象计数、空间关系和整体连贯性/质量
      • 每个标准由专用的评估器独立评分,并通过透明的聚合产生最终奖励
    • 这种设计更具 Prompt 自适应性、可分解性和可解释性,同时提供用户可控且可审计的反馈
  • 虽然有几项并行工作 (2025) 在自然语言处理中研究了 Rubric-based 奖励,但据论文所知,论文是第一个在文本到图像 RL 中提出基于 Rubric 奖励的

More ablations

Analysis of using different models as the grader

  • 论文的方法,即 RubricRL,在强化学习 RL 中受益于高质量的 Grader (GPT-04-mini):
    • 只有当每个标准(例如计数、空间关系、颜色)的判断准确时,奖励信号才能足够丰富,以驱动有效的策略更新
    • 一个弱或有噪声的 Grader 会产生错位的信号,策略可能会过拟合或利用这些信号,从而损害训练的稳定性和样本效率
    • By Contrast,可靠的 Grader 会产生低噪声、目标对齐的奖励,将功劳分配给正确的行为并惩罚特定的错误,从而使 RubricRL 有效
  • 为了量化这种效应,论文在 RubricRL 中使用不同的视觉语言模型作为 Grader ,并在表 6 中报告结果
    • 论文选择 Qwen2.5-VL (2025) 系列中不同模型大小(3B、7B 和 32B)的版本来评估训练期间的每个 rollout
    • 论文观察到 32B Grader 明显优于 3B 和 7B 变体,这证实了更强大的视觉语言模型总体上提供了更具信息性和可靠性的奖励
    • 7B 模型相比 3B 模型有轻微改进,这与它更高的能力一致,而 3B Grader 在某些标准(例如颜色和位置)上仍能提供有用的信号
    • 然而,所有 Qwen2.5-VL Grader 仍然明显弱于 32B Grader ,同时所有 Qwen2.5-VL Grader 与 o4-mini Grader 相比仍有明显差距
      • 论文将此归因于 o4-mini 更强的指令跟随能力、更好的多步推理能力以及与论文的 Rubric 设计更紧密的对齐,从而产生了更清晰、噪声更低的每标准奖励,并最终带来了更好的下游生成质量

Analysis of the number of rollouts before and after dynamic sampling

  • 论文研究了过采样预算和选择后预算(即论文在动态采样中生成了多少 rollout 与论文保留多少用于奖励计算)如何影响模型性能
  • 对于每个 Prompt,论文首先生成 \(N’\) 个候选 rollout(\(N’>N\)),然后使用论文的混合动态采样策略从中选择 \(N\) 个;选定的 \(N\) 个样本用于计算 GRPO 损失
    • 所有其他超参数在不同设置中保持不变
  • 如表 7 所示,增加过采样预算(例如,固定 \(N=4\),\(N’ \in \{8, 16, 32, 64\}\))最初通过提供更大的候选池改进了性能,混合选择器可以从中识别出高奖励和多样化的 rollout
  • 然而,收益很快饱和,因为更大的 \(N’\) 也引入了更高的奖励方差,使得优势估计噪声更大,并阻碍了稳定优化
  • 当将选择预算从 \(N=4\) 增加到 \(N=8\) 时,出现了类似的现象:
    • 虽然更多的选定 rollout 增加了利用,但包含太多 rollout 会增加包含低质量生成的可能性,放大了组归一化优势的方差,并稀释了学习信号
  • 值得注意的是,具有 4 倍过采样率的配置实现了可比较的总体性能,这表明维持这个级别的过采样足以获得高质量的候选
    • 总体而言,过采样和选择都仅在达到一定程度前是有益的,超过那个点,增加的多样性会被增加的噪声所抵消,揭示了在 GRPO 式训练中探索和优化稳定性之间固有的权衡

Visualization

  • 论文展示来自论文 RubricRL 的更多生成结果
  • 如图 6 所示,论文的 RubricRL 生成高保真图像,并显著提高了模型遵循复杂 Prompt 的能力
  • 此外,论文可视化了每个 Prompt 的详细关键标准 Rubrics,以及每个 rollout 在每个标准下的正确与否,如图 7 所示
  • 图 6: 更多定性结果展示论文的 RubricRL 模型产生的多样化生成。这些样本表现出强大的 Prompt 跟随能力、风格多样性以及细致的视觉质量
  • 图 7: 论文的 Rubric-based 奖励的可视化。对于每个 Prompt,论文生成评估关键标准 Rubrics,并按标准给生成的 rollout(图像)评分

NLP——LLM对齐微调-Skywork-Reward

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始论文:(SkyworkReward)Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs

Skywork-Reard Paper Summary

  • 本文对 Reward Model 相关的数据集做了非常详细的分析,对数据的处理流程具有很强的实际参考价值,值得深刻学习
  • Skywork-Reard 特点:数据优先、轻量化、高效率
  • Skywork-Reard 贡献:
    • 包含 80k 条偏好对的高质量数据集 Skywork-Reward Preference 80K
    • 奖励模型 Skywork-Reward-Gemma-2-27B(在 RewardBench 排行榜上排名第一),注意:仅用上述 80K 数据

RM 当前面临的挑战

  • 数据质量低 :开源偏好数据集中,“Chosen”与“Rejected”响应差异过小、标注噪声高、存在 bias(如长度 bias)
  • 数据规模冗余 :现有数据集动辄数十万甚至上百万条,但并未带来相应性能提升
  • 模型复杂度高 :许多研究引入复杂架构或损失函数,但收益有限

核心贡献总结

  • 轻量化数据构建 :仅使用 80k 条偏好对,远小于现有数据集(比如光 Preference 就多达 700K),这个数据集非常火,很多工作都已经引入
  • 精细化的数据筛选策略 :基于模型能力、任务类别、奖励分数等进行多级过滤
  • 详细的损失函数对比实验 :验证 Bradley-Terry loss 在所有变体中表现最优(对后续 RM 的使用提供了很实际的参考)
  • 解决数据污染问题 :识别并移除 RewardBench 中的污染样本,进一步提升模型性能

整体方法详细描述

初始数据:Dataset Mixture

  • Skywork-Reward Preference 80K 由以下四个高质量开源数据集组成(原始总样本约 378K,经过筛选压缩至 80K):
    数据集 来源 规模 特点
    HelpSteer2 ShareGPT + LLM/人工 10K 多维度评分(helpfulness, correctness, coherence, complexity, verbosity)
    OffsetBias 人工构建 8K 抗 bias,尤其对抗长度 bias
    WildGuardMix 合成 + 人工 87K(仅用部分) 安全偏好,拒绝 vs 遵从
    Magpie 系列 Llama 系列自生成 约 350K(筛选后) 完全合成,按任务类别划分,含 ArmoRM 评分
补充: Magpie 方法 & 数据集
  • Mapie 数据集合成策略参见:Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing, 20240617 & 20241007, University of Washington & AI2
  • Magpie 是一种 无需人工标注、无需种子指令、无需复杂提示工程* *的 **大规模对齐数据合成方法
  • Magpie 作者的 核心发现:对齐后的 LLM(如 Llama-3-Instruct)在仅输入模板中用户消息位置之前的“预查询模板” 时,会自动生成一条用户指令
    • 这是由于其自回归生成特性,模型会自然地“补全”对话。
  • Magpie 方法流程:Step 1:指令生成
    • 输入:仅包含模型对话模板中用户消息之前的固定模板部分(例如 Llama-3 的 <|start_header_id|>user<|end_header_id|>)
    • 输出:模型自回归生成一条用户指令
    • 特点:无需人工编写提示词或种子问题
  • Magpie 方法流程: Step 2:响应生成
    • 输入:将生成的指令放入完整对话模板中
    • 输出:模型生成对应的助手回复
    • 完成:形成一条完整的“指令-响应”对齐数据
  • 特别设计:
    • 使用不同模型来生成:指令 和 响应,扩展多样性

数据筛选与过滤策略(核心创新 从 378K 到 80K 的过滤逻辑)

  • 理解:本文中,数据筛选与过滤策略 是整个研究的核心贡献 ,也是其能够用 80K小数据集击败700K大数据集的根本原因
  • 原始数据集混合物(Preference 378K)的核心问题:
    • Magpie占比过高(93%) :其他高质量小数据集的信号被稀释
    • Magpie 数据集的合成方式:使用 Llama 3 家族中不同规模的模型来生成数据集
      • 传统合成数据生成通常是:人类写prompt + LLM生成response + 人类/模型打分 + 构建偏好对
      • Magpie 的合成策略:只给一个固定前缀,让 LLM 同时扮演“用户”和“助手”两个角色,全自动生成完整的对话对
    • Magpie 内部质量不均 :不同模型生成、不同任务类别、不同评分分布
    • WildGuardMix 存在副作用 :过度强化安全会损害通用偏好能力
  • 过滤目标
    • 降量 :从 378K 压缩至 80K(压缩比 78%)
    • 提质 :优先保留高质量、高信息密度的偏好对
    • 平衡 :维持任务多样性、安全与通用能力的平衡

Magpie 子集的精细化筛选(核心)

  • 整体流程如下:
    • Step 1: 分数提取
      • 输入为 原始偏好对,输出为 带 PairScore 的样本
      • 核心逻辑: (chosen_score + rejected_score)/2
    • Step 2: 分数校正
      • 输入为 PairScore,输出为 校正后 PairScore
      • 核心逻辑: Air -0.1, Pro3 -0.05, 其他不变
    • Step 3: 类别识别
      • 输入为 全量样本,输出为 按任务类别分组
      • 核心逻辑: 区分 Math/Code 与其他
    • Step 4: 类别内排序
      • 输入为 各组样本,输出为 各组头部样本
      • 核心逻辑: Math/Code: top30%, 其他: top10%
    • Step 5: 跨子集合并
      • 输入为 四子集头部样本,输出为 ~59.5K筛选后样本
      • 核心逻辑: 保留原始子集标签
    • Step 6: 最终集成
      • 输入为 Magpie筛选结果,输出为 Skywork-Reward 80K
      • 核心逻辑: + HelpSteer2 + OffsetBias + WildGuardMix
  • 核心思路:不是“全局择优”,而是“类别保底、核心强化、偏差校正”的三位一体筛选策略
Magpie 子集-打分修正原理:按生成模型能力优先
  • 问题诊断:ArmoRM 评分存在模型规模反向偏差 :
    • Llama 3 8B Instruct(Air 子集):得分虚高
    • Llama 3 70B Instruct(Pro 子集): 得分偏低
    • Llama 3.1 70B Instruct(Pro 子集): 得分偏低
    • 理解:在 Magpie 数据集中, Air 子集是 Llama 4 8B Instruct 生成的,却分数虚高于其他子集(如 70B)
  • 解决方案:启发式分数校正 ,引入基于先验知识的分数平移 :
    $$
    \text{Score}_{\text{adjusted} } =
    \begin{cases}
    \text{Score}_{\text{original} } - 0.10, & \text{if subset = Air (8B)} \\
    \text{Score}_{\text{original} } - 0.05, & \text{if subset = Pro (Llama 3 70B)} \\
    \text{Score}_{\text{original} }, & \text{if subset = Pro (Llama 3.1 70B)}
    \end{cases}
    $$
  • 校正逻辑理解:
    • 减0.10 :Air子集虚高最严重,强力下调
    • 减0.05 :Llama 3 70B 也存在一定虚高,适度下调
    • 不减 :Llama 3.1 70B 作为最强模型,作为基准
  • 校正后,三个子集的分数分布峰值与模型能力排序对齐(Figure 2)
Magpie 子集-分任务采样:按任务类别差异化采样
  • 核心洞察:
    • Math 和 Code 是 RLHF 最难优化的能力,也是奖励模型最需要强化的领域
      • 注:后来有了 RLVR 了
    • 其他任务(如创意写作、角色扮演)的边际收益较低
  • 采样策略
    • 数学 & 代码类别 :保留比例:前30%
      • 依据:校正后的 ArmoRM 分数
      • 目的:只保留最高质量的数学/代码偏好对
    • 其他类别(Reasoning、Planning、Brainstorming、Creative writing等): 保留比例:前10%
      • 依据:校正后的 ArmoRM 分数
      • 目的:维持任务多样性,但严格控制冗余样本
  • 问题:为什么不直接取全局top%?
    • 这是关键设计智慧 :
      • 如果全局取 top 30%,结果会严重偏向数学和代码(因为它们本身就占 Magpie 的大头)
      • 按类别独立采样,可以在压缩总量的同时,维持任务分布的多样性
  • 最终结果(Figure 3):
    • 数学 + 代码:占总筛选后样本的 63.57%
    • 其他7个类别合计:36.43%
    • 既强化了核心能力,又保留了多任务泛化性
Magpie 子集-(Chosen+Rejected)/2打分依据:基于评分差异的隐式筛选
  • (Chosen+Rejected)/2 的本质,是在测量“这个prompt下,模型能稳定产出高质量response的程度
  • 未显式说明,但实际存在的机制 :
    • 在 Magpie 的原始构建中,每个 prompt 生成 5 个 response,ArmoRM 打分后:
      • Chosen = 最高分response
      • Rejected = 最低分response
  • 将chosen score和rejected score的平均值作为该偏好对的整体质量分
  • 这意味着得到的是两种样本:
    • 1)如果 5 个 response 质量都很接近,那么 chosen 和 rejected 分差小,即平均分可能不低,学习难度大
      • 理解:这属于困难样本
    • 2)如果 5 个 response 质量差异大,即分差大,那么平均分更能代表高质量 chosen 的存在
      • 理解:这属于高质量样本(强调 Chosen 的正确性?)
  • 虽然没有直接按分差过滤,但高分差样本天然更容易进入 top 30% ,因为 chosen 的高分拉高了平均值

WildGuardMix 对抗性筛选(安全)

WildGuardMix 数据构建逻辑
  • WildGuardMix 原始结构:
    • 每个 prompt 带多个 response
    • 每个 response 标注:
      • 是否拒绝(refusal)
      • prompt 是否有害
    • 偏好构造规则为 :
      Prompt 类型 Chosen response Rejected response
      有害(harmful) 拒绝回答 遵从回答
      无害(benign) 遵从回答 拒绝回答
WildGuardMix 第一阶段:移除非对抗样本
  • 背景:
    • 早期版本的 Skywork-Reward 模型已经在非对抗的 WildGuardMix 样本上表现极好(准确率 > 95%)
    • 继续训练这些样本 边际收益接近 0
  • 操作 :
    • 移除非对抗子集
    • 仅保留对抗子集(Adversarial subset)
  • 对抗子集的来源 :
    • 基于 WildTeaming框架 生成
    • 从良性/有害 prompt 出发,自动化生成越狱攻击变体
    • 模拟真实世界中用户绕过安全护栏的尝试
WildGuardMix 第二阶段:控制对抗样本比例
  • 新问题出现 :
    • 仅用对抗子集 + 其他数据集训练 得到 模型安全能力提升 ,但通用偏好能力下降
    • 内部验证集上观察到明显 trade-off
  • 根本原因 :
    • 对抗样本的分布与正常用户请求差异较大
    • 过度拟合对抗模式会扭曲奖励模型的 核心偏好表征
  • 解决方案 :
    • 仅保留部分高质量、代表性强的对抗偏好对
    • 具体比例未公开,但策略方向明确:在不牺牲通用能力的前提下,注入安全偏好

HelpSteer2 与 OffsetBasis 的处理

HelpSteer2
  • HelpSteer2 论文自己的原始筛选逻辑:
    • HelpSteer2 为每个 response 标注 5 个维度的分数:
      • helpfulness, correctness, coherence, complexity, verbosity
    • 偏好构造 :只保留那些 chosen response 的 helpfulness分数 > rejected response 的 helpfulness 分数 的样本
  • 对于 HelpSteer2 数据集的处理:
    • 不做额外过滤,完整纳入 10K 样本
    • 原因:HelpSteer2 已经是人工+LLM混合标注的高质量小数据集 ,本身噪声低、信息密度高
OffsetBias
  • 原始设计目的 :
    • 专门针对奖励模型的长度 bias 、格式 bias 等伪相关信号
    • 构造对抗性偏好对 :rejected response 看起来写得很完整,但包含特定错误
  • 对于 OffsetBias 数据集的处理 :
    • 完整纳入 8K 样本
    • 原因:OffsetBias本身就是抗bias的“解毒剂” ,规模小但价值高

训练目标与损失函数实验

基础损失函数

  • 使用 Bradley-Terry 模型 :
    $$
    \mathcal{L}_{\mathrm{ranking} } = -\log \sigma (r_\theta (x,y_c) - r_\theta (x,y_r))
    $$
    • \( r_\theta(x, y) \) 是奖励模型对响应 \( y \) 的标量输出
    • \( \sigma \) 是 sigmoid 函数

实验的损失函数变体(作者系统对比了以下 6 种变体)

  • 变体1 Focal Loss :关注难分样本
    $$
    \mathcal{L}_{\mathrm{Focal} } = -\log \sigma(\Delta) \cdot (1 - \sigma(\Delta))^\gamma
    $$
  • 变体2 Focal Loss with Penalty :
    • 进一步惩罚模糊判断
  • 变体3 Hinge Loss :
    • 强制 margin (非下面的 margin)
      $$
      \mathcal{L}_{\mathrm{Hinge} } = \max(0, m - \Delta)
      $$
  • 变体4 Margin MSE :回归到 margin
    $$
    \mathcal{L}_{\mathrm{Margin-MSE} } = (r_\theta(x,y_c) - (r_\theta(x,y_r) + m))^2
    $$
  • 变体5 Cross-Entropy :
    • 作为二分类任务
  • 变体6 BT with Tempered Log / Temperature :
    • 修改对数曲率或分布平滑度
  • 最总实验 结论 :
    • Bradley-Terry loss 在所有任务类别上表现最均衡
    • 其他变体在某些类别有提升,但牺牲了整体性能(见表 3)

实验设计与结果分析

训练设置

  • 基座模型:Llama-3.1-8B-Instruct、Gemma-2-27B-it
  • 替换最后一层为 reward head,随机初始化
  • 优化器:AdamW,weight decay 1e-3
  • 学习率:2e-6(8B)、1e-6(27B)
  • 训练轮数:2 epochs
  • 全局 batch size:128

主要实验结果(表 2)

  • Skywork-Reward-Gemma-2-27B :RewardBench 总分第一
  • Skywork-Reward-Llama-3.1-8B :超越除 70B 外的所有模型
  • Chat Hard 类别 :27B 模型首次突破 90 分,远超 Nemotron-4-340B-Reward
  • 关键结论 : 小数据、高质量 > 大数据、低质量
    • 378K 未筛选数据已优于 700K 数据集
    • 80K 筛选数据进一步显著提升

数据污染问题与去污染实验

问题发现:
  • Magpie Ultra 子集中约 5K prompt 与 RewardBench 测试集重叠
  • 推测原因:Llama-3.1-405B 训练数据中可能包含这些 prompt
解决方案:
  • 使用 RewardBench 官方去污染脚本,移除 n-gram 匹配样本
  • 发布 Skywork-Reward Preference 80K v0.2
意外发现:
  • 去污染后模型性能不降反升(表 5)
  • 推测:污染的样本可能与 RewardBench 的偏好不一致 ,移除后反而提升泛化能力

核心观点总结

  • 观点 1:数据质量远重要于数量
    • 80K 精心筛选样本 > 378K 原始样本 > 700K 混合样本
  • 观点 2:Bradley-Terry loss 是最稳健的训练目标
  • 观点 3:模型能力与评分工具可能存在分布偏移 ,需手动校正
  • 观点 4:数据污染普遍存在,需系统性检测与移除
  • 观点 5:实践建议
    • 优先使用 HelpSteer2、OffsetBias 等高质量小数据集
    • 对合成数据按生成模型能力和任务类别进行分级采样
    • 避免盲目使用复杂损失函数
    • 奖励模型训练前必须进行 contamination check

补充:ArmoRM

  • 原始论文:(ArmoRM)Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts, 20240618, University of Illinois Urbana-Champaign
  • 开源模型 & 代码 :github.com/RLHFlow/RLHF-Reward-Modeling
  • for 传统 RM 在 RLHF 中存在的黑箱性、不可解释性、易受奖励黑客攻击等问题,论文提出了一种可解释、可调控的多目标奖励建模方法

背景:RLHF RM 现有问题

  • 黑箱性 :传统 RM 输出单一标量分数,无法解释为何某回复更优
  • 奖励黑客 :模型学会利用RM的漏洞(如生成长回复以获得高分)
  • 不可调控 :无法根据用户需求或上下文动态调整评分标准

解决方案概述

  • 提出多目标奖励模型(ArmoRM) ,使用绝对评分数据进行回归训练,输出多个可解释维度的评分
  • 提出基于Mixture-of-Experts(MoE)的门控机制 ,根据上下文动态加权各目标,生成最终标量分数
  • 在 RewardBench 上取得 SOTA ,超越 GPT-4 作为 Judge 的方法,逼近 Nemotron-4 340B 的性能

ArmoRM 方法详解(重点)

多目标奖励建模(Multi-Objective Reward Modeling)
  • 目标:训练一个模型,为每个回复输出多个可解释维度的评分(如帮助性、诚实性、安全性、冗长度等)
  • 输入输出:
    • 输入:\( x \oplus y \)(提示+回复的拼接)
    • 输出:\( k \)-维评分向量 \( r \in \mathbb{R}^k \)
  • 模型架构:
    • 使用 Llama-3 8B 作为特征提取器 \( f_\theta \)
    • 在最后一层接一个线性层 \( w \in \mathbb{R}^{d \times k} \),输出多目标评分
    • 训练目标为回归损失(均方误差):
      $$
      \min_{\theta, w} \mathbb{E}_{x,y,r \in D} | w^\top f_\theta(x \oplus y) - r |_2^2
      $$
  • 数据特点:
    • 使用 8 个数据集,共 19 个目标维度
    • 不同数据集评分尺度不同,统一线性归一化到 \([0,1]\)
    • 缺失目标维度在损失计算中被忽略
基于 MoE 的目标加权机制(MoE Scalarization)
  • 动机:不同上下文(如数学问题 vs. 安全敏感问题)对不同目标维度的重视程度不同,固定权重不灵活
MoE Scalarization 方法流程:
  • 1. 提取提示特征 :使用冻结的 \( f_\theta \) 提取提示 \( x \) 的特征 \( f_\theta(x) \)
  • 2. 门控网络 :一个浅层MLP \( g_\phi \) 将提示特征映射为 \( k \)-维权重向量,经Softmax归一化(非负且和为1)
    $$
    g_\phi(f_\theta(x)) \in \Delta^{k-1}
    $$
  • 3. 去偏处理(Verbosity Bias Removal) :
    • 每个目标评分减去冗长度评分的加权项:
      $$
      r_i’ \gets r_i - \lambda_i r_{\text{verbose} }
      $$
    • 选择 \( \lambda_i \) 使得调整后的评分与冗长度评分在参考数据集上的Spearman相关系数为0;
  • 4. 最终标量分数 :
    $$
    R = g_\phi(f_\theta(x))^\top r’
    $$
  • 5. 训练门控网络 :
    • 冻结 \( f_\theta \) 与 \( w \);
    • 仅训练 \( g_\phi \) 与一个缩放因子 \( \beta \);
    • 使用 Bradley-Terry 损失:
      $$
      \min_{\phi, \beta} \mathbb{E} \left[ -\log \frac{\exp(\beta R_{\text{chosen} })}{\exp(\beta R_{\text{chosen} }) + \exp(\beta R_{\text{rejected} })} \right]
      $$

ArmoRM 实验设置与结果

实验环境
  • 硬件 :CPU 训练线性层,单张 A6000 训练门控网络;
  • 超参数 :门控网络为 3 层 ReLU MLP(1024 hidden units),lr=0.001,batch=1024,steps=10000;
  • 评估基准 :RewardBench(4主类+1先验类,权重1.0/0.5)
主要结果(原论文表1)
  • 训练结果:
    方法 参数量 总体得分
    Nemotron-4 340B RM 340B 89.3
    ArmoRM + MoE (Ours) 8B 89.0
    GPT-4 Turbo(as judge) - 84.2
    Llama-3 8B BT RM 8B 83.6
  • 超越 Llama-3 8B BT RM ,验证了多目标+MoE的有效性
  • 超越 GPT-4 Judge ,表明可作为低成本替代
  • 逼近 340B 模型 ,展现方法的高效性
1…868788…352
San Ye

San Ye

Stay Hungry. Stay Foolish.

704 posts
53 tags
© 2026 San Ye
Powered by Hexo
|
Theme — NexT.Gemini v5.1.4