微调与对齐

如果让你对比 LoRA 和全参微调,实验怎么设计?控制哪些变量、看哪些指标?

91学AI·2026/7/26·9 阅读

考察点

这题考的是实验方法论,不是概念。面试官想看你知道「公平对比」有多难:LoRA 和全参的最优学习率差一个数量级,用同一个 lr 比就是废实验。合格的回答要能列出变量清单、说明哪些必须对齐哪些要各自调优、指标分几类。能提到「等参数量对照」「多 seed 稳定性」的是加分项。追问常往「结论会随任务类型变吗」「怎么排除数据因素」走。

参考答案

先明确实验要回答的问题

「LoRA 和全参哪个好」不是单一问题,至少拆成三个:效果上限谁高(同数据、各自调优后的天花板)、同等资源下谁划算(固定显存/时间预算)、副作用谁小(遗忘、过拟合)。实验设计要围绕这三个问题分别给答案,指望一张表说清所有事是不可能的。

变量控制:哪些对齐,哪些各自调优

必须严格对齐的:同一份训练数据(同分布、同条数、同 shuffle 顺序)、同一个基座 checkpoint、相同序列长度和 packing 策略、相同 epoch 数(或等效的优化步数)、同一套评测脚本和评测 checkpoint 选择规则。任何一项不对齐,结论都可能被它主导——用不同数据训出来的对比毫无意义。

必须各自调优的:学习率。这是最常见的实验陷阱。全参微调 7B 模型的合理区间是 5e-6 到 2e-5,LoRA 是 1e-4 上下,差 10 倍。正确做法是给两边各做小范围 lr 扫描(比如各取 3 个候选值),各自选验证集最优再对比——比的是「各自最好状态」,不是「同一组超参」。同理,LoRA 的 rank 也应扫描(如 8/16/64),报告不同容量下的曲线,而不是单点结论。

记录但不一定对齐的:训练吞吐、峰值显存、收敛所需 step 数。这些进入成本分析。

进阶设计:堵住两个常见的坑

第一个坑是参数量不对等带来的质疑——「全参赢会不会只是因为容量大」。可以加一个对照组:全参微调但只解冻与 LoRA 覆盖模块等量的参数(例如只训注意力层),把「容量」和「优化方式」两个因素拆开。

第二个坑是随机性。SFT 实验单次运行的评测波动能有零点几个百分点,小到中等数据量下足以翻转结论。关键配置至少跑 2 到 3 个 seed 报均值和方差,差值在噪声范围内的结论不要下。

指标体系:三类一起看

任务效果:目标任务的 held-out 测试集指标。开放生成类任务用人工盲测或 GPT-as-judge 的 pairwise 胜率;可自动评的(分类、抽取、代码、数学)用准确率/F1/通过率。这是主指标。

通用能力与遗忘:固定一套哨兵基准(MMLU/CMMLU + 通用指令样本 + 格式遵循探针),训前训后各跑一次,掉分幅度是遗忘的直接度量。预期通常是:全参微调在哨兵集上掉得更多,尤其 lr 偏大或 epoch 偏多时。

成本:峰值显存(决定要什么卡、几张卡)、单步耗时与总训练时长、checkpoint 存储(全参每个任务一份完整权重 vs LoRA 几十 MB 增量)、多任务部署成本。工程团队做技术选型,这一栏往往和效果栏同等重要。

结果呈现与典型预期

最终结果用一张表呈现:行是三组实验(全参、LoRA 各 rank、可选的部分解冻对照),列是任务指标、哨兵指标 delta、显存、时长、存储。结论按任务类型分开下——常见规律是:行为/格式/风格类任务,LoRA 和全参差距在噪声内,选 LoRA;重知识注入或任务分布偏移大的任务,全参上限更高,差距随数据量放大;哨兵指标上 LoRA 几乎不掉,全参普遍有可见掉分。这样的结论形式比一句「全参效果好但贵」有用得多。

可能的追问

追问:为什么不能用相同学习率做对比? 两者的优化几何完全不同:全参在预训练权重附近微调,LoRA 是从零开始学习的新增低秩参数,且梯度经过两个小矩阵链式传导、有效步长被压缩。同一 lr 下必然有一方严重偏离其最优区,比出来的结论反映的是 lr 失配,不是方法差异。

追问:数据量大小会影响结论吗? 会,而且是系统性的。小数据(几千条)下 LoRA 往往打平甚至优于全参——全参的容量在小数据上反而成为过拟合来源;数据量上到几十万条、且任务需要注入大量新知识时,全参的上限优势才显现出来。所以严谨的实验报告应标注结论成立的数据规模。

追问:评测 checkpoint 怎么选才算公平? 两边用同一个规则,比如「验证集 loss 最低的 checkpoint」或「固定 epoch 数下的最后一个 checkpoint」。忌讳一边挑了验证集最优点、另一边用了最终点——checkpoint 选择本身就能制造零点几个点的差距。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.