
微调与对齐2026-07-26
PPO、DPO、GRPO 分别是什么?DPO 相比 PPO 做了哪些改进?
考察三种主流偏好优化算法的机制与取舍:PPO 的在线 RL 范式、DPO 的闭式偏好直接优化、GRPO 的组内相对优势,以及 DPO 省掉 RM 和采样的本质。
91学AI·7 阅读
共 2 篇文章

考察三种主流偏好优化算法的机制与取舍:PPO 的在线 RL 范式、DPO 的闭式偏好直接优化、GRPO 的组内相对优势,以及 DPO 省掉 RM 和采样的本质。

考察 RLHF 三阶段流程(SFT、RM 训练、PPO 优化)的完整理解,重点是 RM 偏好数据的采样、排序标注方式与 pairwise 损失的设计。