精选·模型与微调基础2026-07-13SFT 和 RLHF 各解决什么问题:后训练流水线怎么分工讲清预训练、SFT、RLHF/DPO 三阶段的目标分工,解释偏好对齐为什么不能简单用 SFT 替代,以及中小团队该做到哪一步。91学AI·7 阅读