考察点
这题考的是工程判断力:微调是手段不是目的,面试官反感「遇事不决就微调」的回答。想看到的是一条清晰的升级路径和每级的判断标准——先试便宜的,便宜的不够再往上走,以及「不够」怎么量化。没实操经验的候选人能讲出验证方案(怎么低成本试错)同样加分。追问常往「prompt 和微调的边界在哪」「RAG 和微调怎么分工」走。
参考答案
一条成本递增的升级路径
面对「模型在某个场景不够好」,手段按成本从低到高排:调 prompt(含 few-shot)→ 加 RAG → LoRA 微调 → 全参微调 → 继续预训练。工程上的正确姿势是沿阶梯逐级验证,而不是直接跳到最贵的方案。每一级都有它擅长的失效模式:
- prompt 解决「模型本来会、只是没被激发」的问题:格式要求、角色设定、输出约束、少量示例能覆盖的场景。零成本,先试。
- RAG 解决「知识不在模型脑子里」的问题:私域文档、时效性信息、长尾事实。这类问题微调是错配——把几万页文档蒸进参数既不经济也没法更新。
- LoRA 解决「行为模式要学」的问题:稳定的输出风格、领域术语的正确使用方式、特定任务范式。几千条数据、单卡可跑、随时回滚。
- 全参微调解决「低秩增量表达不下」的问题:深度领域迁移(通用模型改造成医疗/法律/代码专用模型)、需要注入大量事实知识、行为改变涉及底层表征。
值得上全参的四个信号
判断值不值,看四个维度:
任务性质:要的是新知识、新能力的深度内化,而不只是行为调整。典型标志:LoRA 把 rank 调到 64、target modules 开满 all-linear,验证集指标仍显著低于预期,且错误模式是「知识性错误」(事实不知道)而不是「格式错误」。
数据量和质量:全参微调的容量需要数据喂。手上有几万到几十万条高质量领域数据,全参才开得动;只有几千条时全参大概率过拟合,不如 LoRA。
效果差距的实测值:先用 LoRA 训一版拿到基线,再小成本试一版全参(可以先用小模型或短训练验证趋势),看差距是否值得十倍的成本。差距在噪声范围内就没必要。
资源与维护成本:全参微调意味着多卡环境、每个任务/版本一份完整权重、遗忘风险带来的额外评测和回放成本。这些不是一次性投入,是持续负担。团队没有 GPU 资源和训练基建时,「值得」的门槛要抬得很高。
没做过全参,怎么低成本判断
没有全参经验时,别直接上大实验,按三步走:
第一步,把 LoRA 用到极限。rank 上调、target modules 开满、lr 和 epoch 扫描,拿到 LoRA 的天花板数字。这个天花板就是全参要超越的基准线。
第二步,做小规模探针实验。在 1B 到 3B 的小基座上,用同一份数据分别跑 LoRA 和全参,看两者的差距模式。小模型上的结论不能精确外推,但「全参明显占优还是基本打平」的定性信号是可迁移的。
第三步,大模型上做短程对照。预算有限时不必训完——用 10% 到 20% 的数据跑短训练,比较同一步数下的验证集曲线斜率。全参曲线明显更陡且没有过拟合迹象,说明值得投入完整实验;曲线缠在一起,答案就是继续用 LoRA。
一句话的决策原则
全参微调是「确认便宜的方案到顶之后才付的溢价」。能讲清楚 LoRA 在哪卡住、数据撑不撑得起、成本换回来的效果增量值多少,这个决策就站得住;反过来,从没跑过 LoRA 基线就谈全参,基本是在烧钱买教训。
可能的追问
追问:微调能替代 RAG 注入知识吗? 不推荐。参数化知识的更新成本极高(文档一变就要重训)、无法溯源、长尾事实记不住还容易产生幻觉。RAG 的知识在数据库里,改了即生效、可以引用出处。两者分工:RAG 管「知道什么」,微调管「怎么表达和处理」。
追问:团队说效果必须再涨 5 个点,你直接上全参吗? 不直接上。先拆解当前错误的构成:多少是知识缺失(该补数据或 RAG)、多少是行为问题(该调 SFT 数据)、多少才是容量瓶颈。只有确认瓶颈在容量,且 LoRA 极限已验证,才轮得到全参。多数情况下,把数据质量提一档比换训练方式涨得快。
追问:继续预训练(CPT)和全参 SFT 怎么选? 目标不同:CPT 用海量无标注领域语料改造基座的知识分布,是「换地基」;全参 SFT 用指令数据教模型在领域里「怎么干活」。领域差异特别大(如基因序列、专业代码)时先 CPT 再 SFT;普通垂直场景直接 SFT 即可,别为 CPT 付出几倍成本。