微调与对齐2026-07-26PPO、DPO、GRPO 分别是什么?DPO 相比 PPO 做了哪些改进?考察三种主流偏好优化算法的机制与取舍:PPO 的在线 RL 范式、DPO 的闭式偏好直接优化、GRPO 的组内相对优势,以及 DPO 省掉 RM 和采样的本质。91学AI·7 阅读