精选·模型与微调基础

SFT 和 RLHF 各解决什么问题:后训练流水线怎么分工

91学AI·2026/7/13·8 阅读

考察点

这题考察你对大模型生产流水线的整体认识。面试官想听清三个阶段各自的目标、数据形态、解决什么问题,以及一个经典追问:偏好对齐为什么不直接用偏好数据做 SFT。落地视角的回答(我的业务需要做到哪一步)是加分项。

参考答案

三阶段各管一件事

预训练(Pretrain)解决「能力」。在海量无标注文本上预测下一个 token,模型由此获得语言能力和世界知识。这一阶段的产出是基座模型(base model):它知识渊博但不知道自己在当助手——你问它问题,它可能续写出更多问题,因为它学到的只是「文本长什么样」。

SFT(监督微调)解决「行为」。用人工构造的「指令-回答」样本对做有监督训练,教模型三件事:理解这是一个对话任务、按指令要求组织回答、遵守格式约定。训练时有个关键细节叫 loss mask:计算损失时只算回答部分的 token,指令部分被屏蔽——因为我们要教的是「怎么答」,不是「怎么问」。SFT 之后模型才从「文本续写器」变成「助手」。

RLHF(人类反馈强化学习)解决「偏好」。SFT 教模型「会回答」,但没教「什么样的回答更好」。同样能答对的两个回答,一个详尽有条理、一个敷衍有废话,SFT 的逐 token 损失区分不出这种差异。RLHF 的思路是:让人对多个回答打偏好分,训一个奖励模型来模拟人类偏好,再用强化学习(经典方案是 PPO)调模型,让模型输出在奖励模型下得分更高,同时用 KL 惩罚拴住它别偏离 SFT 模型太远。

为什么偏好对齐不能直接做 SFT

这是本题的题眼,三个原因。

第一,SFT 只能学「正例」,学不了「负例」。偏好数据的本质是相对比较——A 比 B 好。直接把 A 当标准答案做 SFT,模型只学到「要这样答」,没学到「不要那样答」,而 B 类坏回答在概率分布里依然高。偏好学习要的是把好坏之间的概率差拉开,这需要对比式的训练信号。

第二,好回答不止一个。SFT 要求一个标准答案,但开放问题的优质回答有千万种写法,逼模型逐 token 模仿某一个具体答案,会把多样的合理表达都压成训练集的腔调,模型变僵硬。

第三,偏好涉及权衡。有用、无害、诚实这些目标互相打架,奖励模型学的是人类在这些维度上的综合打分,强化学习可以在多目标间找平衡,SFT 的单一模仿目标做不到。

工程上 PPO 流程重(要同时维护策略模型、奖励模型、价值模型、参考模型四个模型),所以后来 DPO 流行开来:不用强化学习,直接用偏好对构造一个对比损失做监督训练,效果接近、实现简单得多,中小团队对齐首选它。

中小团队的落地坐标

实话实说,大多数业务团队不需要碰 RLHF。决策顺序应该是:

  1. prompt 能解决的不微调——格式问题、语气问题、少量领域规则,先写进系统提示。
  2. prompt 装不下或不稳定的上 SFT——领域话术、固定输出结构、私有任务模式,几百到几千条高质量样本起步。
  3. SFT 之后出现「答得对但答得差」再考虑 DPO——比如回答啰嗦、推卸责任、风格不一致,收集线上真实 case 构造偏好对。
  4. 真正的 PPO 级别的 RLHF,除非你在做通用助手产品,否则投入产出不划算。

数据质量是这条流水线的命门。SFT 阶段一万条平庸样本不如一千条精心打磨的样本,这是被反复验证的经验(LIMA 等工作专门论证过);DPO 的偏好对如果标注不一致,模型学到的是噪声。

可能的追问

  • RLHF 里的参考模型(Reference Model)干嘛用?用 KL 散度惩罚约束策略模型别跑偏太远,防止模型为了刷奖励分钻奖励模型的空子(reward hacking),输出变成高分但奇怪的文本。
  • DPO 相比 PPO 的缺点?DPO 是离线方法,偏好对之外的行为无法纠正,对数据分布偏移更敏感;PPO 在线探索理论上上限更高,但工程复杂度劝退。
  • SFT 数据怎么构建?从真实业务日志改写成指令格式是黄金来源;其次是人工撰写加模型扩写再人工审核;纯模型生成的数据要过质量筛选,否则越训越平庸。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.