考察点
这题考对齐训练的整体框架感。合格答案要能一句话说清分工——SFT 解决「会不会这么说话」,RLHF 解决「说哪个更好」;优秀答案能进一步指出 SFT 目标的结构性缺陷:它只能模仿正样本,对「坏回答」没有任何惩罚机制,且 token 级模仿无法表达人类偏好的相对排序。追问常往「能不能跳过 SFT 直接 RLHF」「DPO 出来后 RLHF 是不是过时了」走。
参考答案
两个阶段各自在做什么
SFT(监督微调)是在预训练基座上,用 (指令, 标准回复) 对做下一个 token 预测训练。它解决的问题是行为模式的切换:基座模型只会「续写」,你问它问题它可能续写更多问题;SFT 让它学会「听到指令要给出像样的回答」,包括对话格式、输出结构、基本的任务能力。可以把它理解成把预训练压箱底的能力「激发并约束到可用形态」。
RLHF(基于人类反馈的强化学习)做的事不同:它不再给「标准答案」,而是给偏好信号——同一个问题,回答 A 比回答 B 好。通过奖励模型把这个偏好变成可优化的标量奖励,再用 PPO 等算法调整策略,让模型整体上更倾向生成人类偏好的回答。它塑造的是「品味」:更有帮助、更诚实、更安全、详略得当。
为什么 SFT 之后还要 RLHF
根本原因在于 SFT 的目标函数有结构性缺陷,体现在三个地方:
第一,SFT 只见过正例。它教模型「好回答长什么样」,但对「坏回答有多坏」毫无概念。模型没有负反馈机制,碰到安全敏感问题或幻觉高发场景,SFT 数据覆盖不到的地方它没有拒答和纠错的动机。RLHF 的偏好对里天然包含负例,被压低概率的坏回答就是惩罚信号。
第二,token 级模仿 ≠ 回答级偏好。SFT 逐 token 最大化标准答案的似然,但人对回答的判断是整体的:两个回答逐字看都「像人话」,一个可能废话连篇、一个切中要害。这种「哪个整体更好」的排序信息,没法编码进 token 级交叉熵里,需要回答级的标量奖励来表达。
第三,现实里很多任务没有唯一标准答案。开放创作、客服应答、摘要详略,好回答的空间很大,人工写齐所有「标准答案」不现实,但让人在几个候选里挑一个更好的,标注成本低得多、噪声也更可控。偏好数据的可获取性本身就是 RLHF 存在的现实理由。
工程顺序上还有个原因:RLHF 需要一个行为已经基本正常的起点,否则探索空间里全是语法混乱的输出,奖励信号噪声极大,训练根本稳不住。SFT 正好提供了这个起点。
一个直觉的类比
SFT 像实习生入职时看前辈的工单记录学「活该怎么干」,RLHF 像导师在实习生的产出上打批改语「这版比那版好,以后往这个方向走」。前者建立能力下限,后者拉升质量上限并对齐团队口味。只做 SFT 的模型通常「能用但平庸」,堆 SFT 数据堆不出的那部分差距——回答的取舍感、边界感、安全性——正是 RLHF 补的。
补充:RLHF 的代价和替代路线
RLHF 的坑也要知道:奖励模型会被「hack」——模型学会用华而不实的套路刷高奖励(比如过度礼貌、盲目变长),需要 KL 惩罚约束它别偏离 SFT 模型太远;PPO 训练要同时维护 policy、reference、reward、value 四个模型,工程复杂、调参敏感。这也是 DPO 等直接偏好优化方法兴起的原因:跳过奖励模型和 RL,直接在偏好对上做监督式优化,用更低的成本拿到大部分对齐收益。但注意 DPO 替代的是 RLHF 的「实现方式」,不是「偏好对齐」这个阶段本身——SFT 之后仍然需要一个偏好学习阶段,只是算法选型变了。
可能的追问
追问:能不能跳过 SFT,直接在基座上做 RLHF? 理论上可以,实践上没人这么干。基座模型没有指令遵循能力,采样出来的回答大部分连格式都不对,偏好标注无从谈起,奖励信号几乎无差别;而且 RL 探索效率低,让 RL 去学 SFT 用监督信号一步就能教会的格式,是巨大的浪费。
追问:RLHF 阶段模型能力会下降吗? 会,这就是所谓 alignment tax——对齐后模型在某些纯能力基准(如部分推理、知识题)上可能小幅掉分。缓解手段是数据混合:偏好训练时掺入 SFT 数据或通用能力数据做正则,以及控制 KL 惩罚别放得太松。
追问:怎么判断 RLHF 起效果了? 一看人工盲测胜率:对齐后模型对 SFT 模型的 pairwise 胜率是否显著过半;二看安全性指标:红线测试集的拒答合理率;三看副作用:平均回答长度是否异常膨胀(长度偏爱是奖励模型的常见毛病)、通用基准是否掉分。