
精选·模型与微调基础2026-07-13
SFT 和 RLHF 各解决什么问题:后训练流水线怎么分工
讲清预训练、SFT、RLHF/DPO 三阶段的目标分工,解释偏好对齐为什么不能简单用 SFT 替代,以及中小团队该做到哪一步。
91学AI·7 阅读
共 2 篇文章

讲清预训练、SFT、RLHF/DPO 三阶段的目标分工,解释偏好对齐为什么不能简单用 SFT 替代,以及中小团队该做到哪一步。

考察 Prompt 与微调的选型判断。核心答案:先 Prompt 后微调——知识缺失用 RAG、格式风格调不动用 SFT,微调改的是行为模式不是知识。