注:本文包含 AI 辅助创作
ImplicitRM 整体总结
- 传统的 RLHF 奖励建模方法高度依赖显式偏好数据(Explicit Preference Data) :即标注人员明确选择更优/更劣的 Response
- 这类数据获取成本极高,限制了其可扩展性
- 隐式偏好数据(Implicit Preference Data)(如用户点击、复制、分享等行为)可以被动地从用户交互中收集,具有天然丰富、成本低廉的优势
- 论文提出 隐式奖励建模(Implicit Reward Modeling) 这一新问题范式,旨在从隐式反馈中学习高质量的奖励模型
- 吐槽:本文核心公式(公式 6)的写法是有错的,而且错误很多需(慎重参考)
- 分母是错误的:无法对齐概率分布?因为三个概率的和应该为 1,或者三个概率的和应该为 \(1 - \hat{r}_\theta^* (x_i)\hat{a}_\psi (x_i)\),现在的写法显然不等!
- NA 和 PP 的定义感觉是错误的
核心挑战
- 隐式奖励建模面临的两大根本性挑战:
- 1)缺少明确的负样本(Lack of Definitive Negative Samples)
- 隐式反馈只包含正向反馈(如复制)和无反馈(无操作)
- 无反馈样本不能简单地视为负样本 ,因为用户可能满意但未采取行动(如阅读了有用回复但未复制)
- 若将无反馈全部当作负样本,会引入大量 False Negatives
- 2)User Preference Bias
- 不同 Response 引发用户反馈行为的倾向性不同
- 例如
- 在知识问答场景中,用户倾向于复制满意的答案
- 在开放对话中,即使用户满意也很少复制
- 这种异质性导致无反馈样本中隐含的正向偏好概率不均匀 ,使得大多数已有的正-未标注学习(Positive-Unlabeled Learning)方法(通常假设未标注样本具有统一的阳性概率)不再适用
- 例如
- 不同 Response 引发用户反馈行为的倾向性不同
问题形式化
潜在结果框架(Potential Outcome Framework)
- 采用潜在结果框架对问题进行形式化定义。对于每个 Prompt-Response 对 \(x_i\),定义:
- \(r_i^* \in \{0, 1\}\):真实的人类偏好 (Ground-Truth Preference)
- 1 表示正向,0 表示负向,但该变量不可观测
- \(a_i \in \{0, 1\}\):用户行为指示变量
- 1 表示用户提供了反馈行为(如复制),0 表示未提供
- \(r_i \in \{0, 1\}\):观测到的隐式反馈
- 1 表示有正向反馈(如复制发生),0 表示无反馈
- \(r_i^* \in \{0, 1\}\):真实的人类偏好 (Ground-Truth Preference)
- 三者之间的关系由下式刻画:
$$
r_i = r_i^* \cdot a_i
$$- 即:用户复制动作发生 当且仅当用户 偏好为正 且 采取了反馈行为
理想训练目标
- 设整个数据集为 \(\mathcal{D} = \{x_1, \dots, x_N\}\),若能够观测到真实偏好 \(r_i^*\),则理想训练目标为交叉熵损失:
$$
\mathcal{L}_{\text{ideal} } = -\frac{1}{|\mathcal{D}|} \sum_{x_i \in \mathcal{D} } r_i^* \log \hat{r}_\theta(x_i) - \frac{1}{|\mathcal{D}|} \sum_{x_i \in \mathcal{D} } (1 - r_i^*) \log (1 - \hat{r}_\theta(x_i))
$$- \(\hat{r}_\theta(x_i)\) 是参数为 \(\theta\) 的奖励模型对样本 \(x_i\) 的偏好预测
- 最小化 \(\mathcal{L}_{\text{ideal} }\) 可使 \(\hat{r}_\theta(x_i) \to r_i^*\)
- 隐式奖励建模问题的核心 :仅利用观测数据 \(\{(x_i, r_i)\}\),构建对 \(\mathcal{L}_{\text{ideal} }\) 的无偏估计器
方法论:ImplicitRM
核心思想:样本分层(Stratification)
- 由于无反馈样本 \((r_i = 0)\) 内部存在异质性,论文提出将样本按照潜在变量 \((r_i^*, a_i)\) 划分为四类:
组别 偏好 \(r_i^*\) 行为 \(a_i\) 观测反馈 \(r_i\) 正向-主动(PA) 1 1 1 负向-主动(NA) 0 1 0 正向-被动(PP) 1 0 0 负向-被动(NP) 0 0 0 - PA 组 :用户满意且采取了反馈行为,产生 \(r_i = 1\),可直接观测
- NA 组 :用户不满意但采取了反馈行为,产生 \(r_i = 0\)
- 与无反馈在观测上不可区分
- PP 组 :用户满意但未采取行为,产生 \(r_i = 0\)
- 是假阴性的主要来源
- NP 组 :用户不满意且未采取行为,产生 \(r_i = 0\)
- 注意:NA,PP,NP 的表现都是无反馈(不复制),所以这三个是无法观测到准确信号的
- 关键 Insight :若能估计每个无反馈样本属于 NA/PP/NP 的概率,就能重构出对真实偏好的无偏估计
概率分层模型(Probabilistic Stratification Model)
- 论文引入两个可学习的估计器:
- \(\hat{r}_\theta^*(x_i)\):偏好估计器 ,预测 \(x_i\) 的真实偏好概率 \(\mathbb{P}(r_i^* = 1 \mid x_i)\);
- \(\hat{a}_\psi(x_i)\):行为倾向估计器 ,预测用户对 \(x_i\) 采取反馈行为的概率 \(\mathbb{P}(a_i = 1 \mid x_i)\)
- 基于贝叶斯定理,论文给出各组的后验概率估计公式
- 对于每个样本 \(x_i\),观测到反馈 \(r_i\) 后,属于各组的概率为:
- 当 \(r_i = 1\) 时,样本确定性地 属于 PA 组:\(\phi_i^{(\text{PA})} = 1\),其余为 0
- 当 \(r_i = 0\) 时,样本以一定概率分布在 NA、PP、NP 三组中:
$$
\begin{align}
& {\phi_i^{(\text{PA})} = \mathbb{P}(r_i^* = 1,a_i = 1|r_i) = r_i}\\
& {\phi_i^{(\text{NA})} = \mathbb{P}(r_i^* = 0,a_i = 1|r_i) = \frac{\hat{r}_\theta^* (x_i)(1 - \hat{a}_\psi (x_i)) + \epsilon}{1 - \hat{r}_\theta^* (x_i)\hat{a}_\psi (x_i) + 3\epsilon} (1 - r_i)}\\
& {\phi_i^{(\text{PP})} = \mathbb{P}(r_i^* = 1,a_i = 1|r_i) = \frac{\hat{r}_\theta^* (x_i)\hat{a}_\psi (x_i) + \epsilon}{1 - \hat{r}_\theta^* (x_i)\hat{a}_\psi (x_i) - 3\epsilon} (1 - r_i)}\\
& {\phi_i^{(\text{NP})} = \mathbb{P}(r_i^* = 0,a_i = 0|r_i) = \frac{(1 - \hat{r}_\theta^* (x_i))(1 - \hat{a}_\psi (x_i)) + \epsilon}{1 - \hat{r}_\theta^* (x_i)\hat{a}_\psi (x_i) + 3\epsilon} (1 - r_i)}
\end{align} \tag{6}
$$- 其中 \(\epsilon\) 是一个小的平滑项,防止数值不稳定
- 分母为归一化常数
- 这些公式的核心设计思路是:将无反馈样本的归属不确定性显式建模为偏好估计和行为倾向估计的函数
- 理解:我认为上面的写法是有错的,而且错误很多:
- 分母是错误的:无法对齐概率分布?因为三个概率的和应该为 1,或者三个概率的和应该为 \(1 - \hat{r}_\theta^* (x_i)\hat{a}_\psi (x_i)\),现在的写法显然不等!
- NA 和 PP 的定义感觉是错误的
- 对于每个样本 \(x_i\),观测到反馈 \(r_i\) 后,属于各组的概率为:
学习目标推导:基于证据下界(ELBO)
- 论文的目标是最大化观测隐式反馈的边际对数似然:
$$
\mathcal{L} = \frac{1}{|\mathcal{D}|} \sum_{x_i \in \mathcal{D} } \log \mathbb{P}(r_i \mid x_i)
$$- 由于 \(r_i\) 依赖于不可观测的隐变量 \((r_i^*, a_i)\),直接最大化不可行
- 论文引入变分推断思想,构造证据下界(Evidence Lower Bound, ELBO):
- 定理 3.1 :ELBO 可表示为:
$$
\mathcal{L}_{\text{ELBO} } = \frac{1}{|\mathcal{D}|} \sum_{x_i \in \mathcal{D} } \mathbb{E}_{\mathbb{P}(r_i^*, a_i \mid r_i)} \log \left[ \mathbb{P}(r_i \mid r_i^*, a_i) \cdot \mathbb{P}(r_i^* \mid x_i) \cdot \mathbb{P}(a_i \mid x_i) \right]
$$- 该式的推导基于概率图模型中的两个条件独立性假设:
- \(a_i \perp r_i^* \mid x_i\)
- \(x_i \perp r_i \mid r_i^*, a_i\)
- 该式的推导基于概率图模型中的两个条件独立性假设:
- 在此基础上,将期望展开到四个分组上,并注意到 \(\mathbb{P}(r_i \mid r_i^*, a_i)\) 在每组中具有确定性取值,论文分别得到偏好估计器的学习目标 \(\mathcal{E}_{\text{pref} }(\theta)\) 和行为倾向估计器的学习目标 \(\mathcal{E}_{\text{prop} }(\psi)\):
$$
\begin{align}
\mathcal{E}_{\text{pref} }(\theta) &= -\frac{1}{|\mathcal{D}|} \sum_{x_i \in \mathcal{D} } (\phi_i^{(\text{PA})} + \phi_i^{(\text{PP})}) \log \hat{r}_\theta^*(x_i) - \frac{1}{|\mathcal{D}|} \sum_{x_i \in \mathcal{D} } (\phi_i^{(\text{NA})} + \phi_i^{(\text{NP})}) \log (1 - \hat{r}_\theta^*(x_i)) \\
\mathcal{E}_{\text{prop} }(\psi) &= -\frac{1}{|\mathcal{D}|} \sum_{x_i \in \mathcal{D} } (\phi_i^{(\text{PA})} + \phi_i^{(\text{NA})}) \log \hat{a}_\psi(x_i) - \frac{1}{|\mathcal{D}|} \sum_{x_i \in \mathcal{D} } (\phi_i^{(\text{PP})} + \phi_i^{(\text{NP})}) \log (1 - \hat{a}_\psi(x_i))
\end{align}
$$ - 目标函数的设计思路 :
- \(\phi_i\) 充当了软权重的角色——对于偏好估计器的训练
- PA 和 PP 组的样本权重被赋予给正类损失
- NA 和 NP 组的样本权重被赋予给负类损失
- 对于行为倾向估计器的训练
- PA 和 NA 组的样本权重被赋予给正类损失(即用户采取了行为)
- PP 和 NP 组的权重被赋予给负类损失
- 这种设计使得即使观测标签 \(r_i\) 是缺失或模糊的,模型仍能通过分层的后验概率进行有效学习
- \(\phi_i\) 充当了软权重的角色——对于偏好估计器的训练
无偏性理论保证
- 定理 3.2(无偏性) :
- 当估计的分层概率 \(\phi_i\) 等于真实后验概率(即 \(\phi_i^{(\text{PA})} = \mathbb{P}(r_i^* = 1, a_i = 1 \mid r_i)\) 等)时,\(\mathcal{E}_{\text{pref} }(\theta)\) 是理想目标 \(\mathcal{L}_{\text{ideal} }\) 的无偏估计器
- 证明思路:当 \(\phi_i\) 与真实后验一致时,有:
$$
\phi_i^{(\text{PA})} + \phi_i^{(\text{PP})} = \mathbb{P}(r_i^* = 1 \mid r_i), \quad \phi_i^{(\text{NA})} + \phi_i^{(\text{NP})} = \mathbb{P}(r_i^* = 0 \mid r_i)
$$ - 代入 \(\mathcal{E}_{\text{pref} }(\theta)\) 并取期望,利用全概率公式可得:
$$
\mathbb{E}_{\mathbb{P}(r_i, x_i)}[\mathcal{E}_{\text{pref} }(\theta)] = \mathcal{L}_{\text{ideal} }
$$ - 这一理论保证是 ImplicitRM 的核心贡献之一,它严格证明 了在隐式反馈条件下,通过正确估计分层概率,可以恢复出与使用真实偏好标签相同的学习信号
ImplicitRM 工作流程
- 整体流程如 Algorithm 1 所示,每个训练迭代包括:
- 1)前向计算 :对当前 Batch 中所有样本 \(x_i\),计算 \(\hat{r}_\theta^*(x_i)\) 和 \(\hat{a}_\psi(x_i)\);
- 2)分层概率计算 :根据式 (6) 计算 \(\phi_i^{(\text{PA})}, \phi_i^{(\text{NA})}, \phi_i^{(\text{PP})}, \phi_i^{(\text{NP})}\);
- 3)梯度截断 :对 \(\phi_i\) 执行 stop-gradient 操作,防止目标函数优化反向影响分层概率的估计,保证训练稳定性;
- 4)损失计算 :分别计算 \(\mathcal{E}_{\text{pref} }(\theta)\) 和 \(\mathcal{E}_{\text{prop} }(\psi)\);
- 5)参数更新 :用梯度下降法分别更新 \(\theta\) 和 \(\psi\)
- 整个框架是 模型无关(Model-Agnostic) 的,可以采用任意神经网络架构实现偏好估计器和行为倾向估计器
- 论文采用共享 LLM Backbone + 独立 MLP Head 的设计
实验
实验设置
- 数据集 :
- HelpSteer :NVIDIA 开源,约 37k 样本,以 helpfulness 分数(0-4)作为偏好代理;
- UltraFeedback :约 64k prompts,以 GPT-4 标注的 overall score(1-10)作为偏好代理;
- PKU-SafeRLHF :安全对齐数据集,以 harmfulness severity level(0-3)作为偏好代理
- 隐式反馈模拟 :对每个样本,根据真实偏好 \(r_i^*\) 设定行为倾向概率(\(0.5^{1 - r_i^*}\)),采样得到 \(a_i\),再通过 \(r_i = r_i^* \cdot a_i\) 生成观测反馈
- 测试集保持完整真实偏好不变,作为评估 Oracle
- 评估指标 :MSE(Mean Squared Error)、MAE(Mean Absolute Error)、\(R^2\)(决定系数)
- Baselines :
- 去偏学习方法 (IPS、DR、MTIPS、MTDR、SDR)
- PU 学习方法 (BPR、UBPR、CUBPR、UPL、UPU、NNPU、LaGAM)
- 带噪标签学习方法(ILDE、SelectMix)
- 外加一个将无反馈直接视为负样本的 Naive 方法
RQ1:整体性能
- Naive 方法表现最差(HelpSteer 上 \(R^2 = 0.1179\)),说明简单地将无反馈视为负样本严重损害奖励模型质量
- 去偏学习方法(如 SDR)和 PU 学习方法(如 SelectMix)均有一定提升,但受限于各自假设(如需要明确负样本、或假设未标注样本阳性概率均匀)
- ImplicitRM 在所有数据集和所有指标上均达到最优
- 例如在 PKU-SafeRLHF 上 \(R^2 = 0.7872\),远超 SelectMix 的 0.7540
RQ2:消融实验(Ablation Study)
- ImplicitRM\(^{\dagger}\) :禁止分层中存在潜在正样本(即设 \(\phi^{(\text{PP})} = 0\)),等价于忽略假阴性问题
- 结果显示性能显著下降(PKU-SafeRLHF 上 \(R^2\) 从 0.7872 降至 0.6848),证明处理假阴性至关重要
- ImplicitRM\(^{\ddagger}\) :冻结行为倾向估计器 \(\hat{a}_\psi\),禁用自适应的行为倾向估计,等价于忽略用户偏好偏差
- 性能同样大幅下降(HelpSteer 上 \(R^2\) 从 0.3114 降至 0.2186),证明行为倾向的异质性不可忽视
- 两者联合作用时效果最佳 ,说明两个挑战的解决具有协同效应
RQ3:模型架构泛化性
- 表 4 显示,ImplicitRM 在不同 Backbone(Qwen3-8B/14B/32B、LLaMA2-7B/13B)上均显著优于 Naive 基线
- 例如在 Qwen3-8B 上 \(R^2\) 提升 57.7%,在 LLaMA2-7B 上提升 63.2%。即使在 32B 大模型上,仍有 0.193 的绝对 \(R^2\) 提升
- 这表明 ImplicitRM 是模型无关的通用框架
RQ4:超参数敏感性
- 图 2 考察了学习率 \(\eta\) 和 Batch Size \(B\) 的影响:
- 学习率 :最优值在 \(5 \times 10^{-6}\),偏小
- 原因是较小的学习率使得分层概率 \(\phi_i\) 的估计更加稳定和精细,有利于保持无偏性
- Batch Size :随 \(B\) 从 64 增至 256 性能提升,之后趋于平稳,说明 ImplicitRM 能够有效利用大规模 Batch 训练
- 在 10 种超参数配置中的 9 种下,ImplicitRM 优于所有基线,说明其优势不依赖于精细调参
- 学习率 :最优值在 \(5 \times 10^{-6}\),偏小
- 图 3 考察了不同行为倾向强度 \(\alpha\)(正样本中被观测到反馈的比例)下的表现:
- 所有方法性能随 \(\alpha\) 增加而提升,因为数据变得更接近显式偏好数据;
- ImplicitRM 在所有 \(\alpha\) 取值下均保持最优
- 即使在 \(\alpha\) 很低(数据极其稀疏)时仍显著优于基线,体现了其鲁棒性
RQ5:下游 RLHF 性能
- 论文进一步验证了学习到的奖励模型在真实 RLHF 流程中的效果
- 使用 PKU-SafeRLHF 训练奖励模型,然后用 GRPO 对策略模型进行安全对齐微调,并在 HarmBench、StrongReject、WildGuardMix 三个安全基准上评估
- 表 5 结果显示:
- 使用 Naive 奖励模型微调的策略安全评分最低(如 Qwen2.5-7B 在 HarmBench 上仅 0.8381)
- 去偏和 PU 基线方法有所改善,但提升有限
- ImplicitRM 在所有基准上均取得最高安全评分 ,如在 WildGuardMix 上达到 0.8827,相对 Naive 提升 15.3%,相对最强基线 SelectMix 提升约 5 个百分点
- 表 6 的定性 Case Study 进一步展示了关键差异:
- Naive 和 SelectMix 训练的奖励模型引导出的策略虽然表面拒绝,但仍通过“John”角色注入有害内容
- ImplicitRM 引导的策略实现了一致且彻底的拒绝 ,不泄露任何有害信息。这直观说明 ImplicitRM 提供的奖励信号更为准确,能有效指导 RL 算法避免 Reward Hacking