微调与对齐

微调效果怎么评估?怎么防止过拟合?

91学AI·2026/7/26·9 阅读

考察点

微调效果评估的坑在于「loss 降了不等于效果好了」,面试官想看你是否有一套多层评估体系,而不是只盯训练曲线。过拟合部分则考你是否能从「检测」和「防控」两个角度系统回答,并且知道大模型 SFT 的特殊性:epoch 少、过拟合信号常常先从输出行为(复读、变短、风格僵化)暴露,而不是从 loss 暴露。追问常往「验证集怎么建」「GPT 评估靠谱吗」走。

参考答案

评估的第一层:训练过程信号

训练 loss 和验证 loss 是最基础的信号,但要知道它们能说什么、不能说什么。训练 loss 平滑下降说明优化在正常走;验证 loss 出现拐点(不降反升)是过拟合的经典信号。但 SFT 的损失是 token 级平均,它衡量「像不像训练数据的措辞」,和「回答好不好」只有弱相关——loss 平了的阶段,任务指标往往还在涨;loss 还在降的阶段,回答可能已经开始僵化。所以 loss 只用来做过程监控和早停参考,不做效果结论。

评估的第二层:自动指标

按任务类型选:分类、抽取类用准确率/F1;代码用 HumanEval/MBPP 通过率;数学用 GSM8K/MATH 准确率;知识能力用 MMLU、CMMLU 这类基准。要点有两个:一是测试集必须和训练数据严格隔离,微调前的去污染(n-gram 或 embedding 相似度比对)不能省,否则数字全是水分;二是通用基准还要承担「遗忘监测」的职责——训前训后各跑一次,掉分幅度说明领域微调有没有伤及通用能力。

评估的第三层:生成质量

开放生成类任务没有标准答案,靠两招:

  • 人工评审:从测试集抽样,按预定义的 rubric(正确性、完整性、格式、安全)打分,或做微调前后模型的 pairwise 盲测看胜率。人工评审是最终裁判,但贵且慢,一般每版抽几十到几百条。
  • 模型评审(GPT-as-judge):用强模型按 rubric 打分或做 pairwise 比较,成本低、可批量,适合日常迭代。要知道它的系统性偏差:偏爱长回答、偏爱和自己同源的模型、位置偏差(先出现的回答占优,缓解办法是交换顺序评两次取平均)。用它看趋势可以,定版结论还是要人工抽验校准。

实战里还会加一个「行为探针」集:几十个固定 case(边界输入、需要拒答的、多轮追问),每版模型跑一遍人工快速过,专抓指标体现不出来的行为退化。

过拟合长什么样

SFT 过拟合的典型症状:验证 loss 回升;输出趋同——不同问题给出结构雷同的回答,细节创造性消失;复述训练数据里的原句;对训练分布外的问法鲁棒性下降,轻微换种问法就答偏。大模型 SFT 因为 epoch 少(通常 1 到 3 个),过拟合往往还没到 loss 明显回升,行为僵化先出现了,所以行为探针比 loss 曲线更灵敏。

防控手段的组合

数据侧是根本:量足、多样、去重。重复样本等于给个别样本加权,是过拟合的头号帮凶;指令多样性铺开,模型才学「完成任务」而不是「背住答案」。

训练侧:控制 epoch(SFT 多数场景 2 个以内,质量高的数据 1 个就够);学习率别贪大;早停——按验证 loss 或周期性评测选最优 checkpoint,而不是无脑用最后一个;LoRA 场景下 rank 别超过数据支撑能力,小数据配大 rank 必过拟合。

正则侧:NEFTune 这类噪声技巧(往 embedding 加噪)在指令微调上被反复验证有效;LoRA dropout 在小数据时有用;权重衰减常规保留。

验证侧兜底:再完善的防控也要靠多层评估确认——任务指标涨、哨兵基准不掉、行为探针无退化,三条都过才算这版微调真的有效。只拿训练 loss 说事的实验报告,结论一律存疑。

可能的追问

追问:SFT 的验证集怎么建才有代表性? 从真实业务流量里采样(脱敏后),覆盖线上 query 的类型分布和难度分布,量级几百到上千条;和训练集做严格去重;固定不动,所有实验共用同一套,保证版本间可比。定期从新的线上 badcase 补充,但补充后标注版本,避免历史对比失真。

追问:epoch 设多少合适,怎么判断训过头了? SFT 一般 1 到 3 个 epoch。判断过头看三个信号:验证 loss 拐点、周期性任务评测开始回落、输出行为僵化(模板化、细节变少)。实操上每半个到一个 epoch 存一个 checkpoint,事后在这串 checkpoint 上跑评测挑最优,比事前猜 epoch 数可靠。

追问:测试集被训练数据污染了会怎样,怎么查? 污染会让评测数字虚高且失去版本区分度,决策全被误导。查法:训练集与评测集做 8 到 13-gram 的重叠检测,语义层面再用 embedding 相似度兜底;对公开基准,还要检查基座模型本身的预训练是否已包含该基准(看模型报告或做污染检测),必要时换用较新的基准。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.