微调与对齐

讲讲 RLHF 的基本流程,奖励模型(RM)的训练数据怎么构建?

91学AI·2026/7/26·9 阅读

考察点

这题要求把 InstructGPT 奠定的三阶段流水线完整讲出来,不能只说个大概。重点在奖励模型这一环:偏好数据从哪来、标注是打分还是排序、pairwise loss 为什么长那样。面试官也会借此判断你对 PPO 阶段四个模型的角色是否清楚。追问常往「RM 为什么会不准」「奖励 hacking 怎么防」「标注一致率怎么保」走。

参考答案

三阶段总览

经典 RLHF 流程(InstructGPT,2022)分三步:

  1. SFT:用人工或强模型生成的 (指令, 回复) 数据对基座做监督微调,得到行为正常的初始策略模型。这一步在前面题目里已经展开,它是后续两步的地基。
  2. 奖励模型训练:收集人类对多个回答的偏好排序,训练一个能给任意回答打标量分数的奖励模型 RM。
  3. 强化学习优化:以 RM 的打分作为奖励,用 PPO 微调 SFT 模型,让它生成的回答在 RM 下得分越来越高,同时用 KL 散度惩罚防止模型跑偏。

RM 训练数据怎么构建

这是本题的核心。构建流程是:

**第一步,采样候选回答。**从真实用户或构造的 prompt 集合出发,用 SFT 模型(或其不同温度、不同 checkpoint 的变体)对每个 prompt 采样 K 个回答,K 常见取 4 到 9。采样要有区分度:温度拉大一点,保证候选之间有质量梯度,标注员才分得出好坏。

**第二步,人类偏好标注。**标注员对同一个 prompt 的 K 个回答做排序,从最好到最差。排序比逐个打绝对分数靠谱——人对「7 分和 8 分的差距」判断很不稳定,但对「A 比 B 好」的判断一致性高得多。K 个回答的全排序可以拆成 C(K,2) 个 pairwise 偏好对,比如 4 个回答拆出 6 对。

**第三步,质量控制。**偏好标注的噪声直接决定 RM 上限。常规手段:标注规范要先写清楚「好」的定义(有帮助、真实、无害、格式正确的优先级);每个样本多人标注,统计标注一致率(agreement),低的样本重标或丢弃;定期插入有标准答案的质检题筛掉不认真的标注员。

数据分布上还有两个要点:prompt 分布要尽量贴近线上真实分布,否则 RM 在实际场景外推不准;偏好维度上要覆盖「正确性」「安全性」「啰嗦程度」等不同失败模式,全是「A 通顺 B 不通顺」这种浅层差异的数据训不出有判别力的 RM。

RM 的模型与损失

RM 一般用 SFT 模型同款基座初始化,把最后的语言模型头换成一个标量回归头,输出一个分数 r(x, y)。训练目标是让被选回答的分数高于被拒回答,用 Bradley-Terry 模型建模偏好概率:

L = -E[ log σ( r(x, y_w) - r(x, y_l) ) ]

其中 y_w 是标注里胜出的回答,y_l 是落败的,σ 是 sigmoid。直觉上就是让两个回答的分差尽量拉开,且正确反映胜出方向。用分差而不是绝对分来训练,让 RM 只需要学相对排序,规避了绝对分数不可比的问题。

PPO 阶段在做什么

拿到 RM 后开始强化学习。这一步同时存在四个模型:policy(正在优化的模型,SFT 初始化)、reference(冻结的 SFT 副本,用来算 KL 惩罚)、RM(冻结,给回答打分)、value/critic(预估每个 token 处的期望回报,用来压低优势函数的方差)。

优化目标大致是:奖励 = RM 分数 - β·KL(policy || reference)。KL 项是个刹车——没有它,policy 会迅速找到 RM 的漏洞刷分,输出变成又臭又长或模式诡异的文本(奖励 hacking)。PPO 本身负责在策略更新时限制步长(clip 机制),保证训练稳定。这也是为什么 RLHF 工程上劝退:四个模型同时在显存里,超参敏感,一次实验成本很高。

实践中的替代与演进

由于 PPO 的复杂度,DPO 用偏好对直接闭式优化策略、GRPO 用组内相对优势去掉 value 模型,成为主流替代;RM 数据构建的思路(采样、排序、pairwise 监督)则被原样继承下来。另外值得知道的是 RLAIF 路线:用强模型代替人做偏好标注,成本骤降,宪法式 AI(Constitutional AI)是代表,人工标注更多退到制定标准和抽检的位置。

可能的追问

追问:为什么标注用排序而不是直接打分? 绝对分数的标注一致性差:不同标注员、同一标注员不同时间,对 7 分和 8 分的边界判断都不一样,噪声会直接灌进 RM。排序(或两两比较)是相对比较,一致率显著更高;而且 Bradley-Terry 这类模型本来也只需要相对关系。

追问:RM 会有什么系统性偏差,怎么缓解? 最著名的是长度偏差——RM 往往偏爱更长的回答,导致 RLHF 后模型变啰嗦。缓解:构建偏好数据时控制长度变量(让同长度下比质量),或在奖励里对长度做归一/惩罚。另外 RM 对训练分布外的 prompt 打分不可靠,所以要控制 PPO 里 policy 别偏离 SFT 太远。

追问:四个模型都要多大,显存怎么扛? 常见做法是 RM 和 value 用比 policy 小的模型(比如 policy 7B、RM 用 1B 到 3B 也够判别),reference 与 policy 同尺寸但只做前向。工程上靠 ZeRO 分片、offload、以及 policy 与 reference 共享权重省显存,这也是 PPO 实现复杂的一部分。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.