提示工程

Prompt 工程和微调怎么选?什么场景必须微调?

91学AI·2026/7/26·11 阅读

考察点

这是技术选型题,面试官想看你有没有「先便宜后贵」的工程直觉,以及对三种手段本质差异的理解:prompt 是「每次推理临时教学」,微调是「把模式训进参数」,RAG 是「外接知识」。能把「教模型新知识」和「教模型新行为」分开,是这道题的核心区分点。追问常往微调成本、LoRA、数据量要求走。

参考答案

三者的边界

先把三个手段解决的问题画清:

  • Prompt 工程:零成本起步,改变的是单次推理的输入。适合任务定义、格式约束、风格引导。见效快,改完立刻能测。
  • RAG:解决「模型不知道」的问题——私有知识、时效性知识。知识放进参数里既贵又容易忘,检索外挂是标准答案。
  • 微调:解决「模型不会按你的方式做」的问题——稳定的行为模式、特定风格、领域术语的理解方式、输出格式的内化。改的是参数,一次训练永久生效(对这批行为而言)。

一句话:知识问题用 RAG,行为问题用微调,先确认问题不是 prompt 能解决的

决策顺序:先 prompt,再 RAG,最后微调

实际项目按这个顺序走:

  1. 先写 prompt 把任务定义清楚,建评测集测出基线。
  2. 效果差先判断缺的是知识还是行为。缺知识(答不上内部业务概念、最新政策)上 RAG,别碰微调。
  3. prompt 加到十几个示例、格式靠示例硬压还是不稳,或者行为模式复杂到示例教不会,才考虑微调。

为什么这么排?微调的真实成本不只是训练那点钱。数据标注(高质量样本通常要几百到几千条起)、训练调参、评估、上线后每次基座模型升级都要重训、维护一份额外的模型资产,这些是长期负担。prompt 能解决的问题绝不要动参数。

必须(或强烈建议)微调的场景

1. 格式和风格的深度内化。 输出格式复杂且稳定(比如特定领域的结构化报告、法律文书体例),靠 prompt 每次注入长示例,输入 token 成本在高频调用下会超过微调摊销成本。算一笔账:示例占 2000 token,日调用十万次,一年多烧的输入 token 费用可能就够训好几次 LoRA 了。

2. 领域术语和行话的理解。 医疗、法律、芯片这类领域,通用模型对术语的理解是飘的,prompt 里塞术语表治标不治本。领域语料做继续预训练或 SFT 能实质改善。

3. 降低延迟和成本。 大模型 + 长 prompt 能做的事,微调后小模型 + 短 prompt 往往也能做。7B 模型 fp16 推理大约 14GB 显存,部署成本远低于 70B,微调是把大模型的特定能力「蒸馏」到小模型的常规路径。

4. 分类、抽取等高频确定性任务。 意图分类、实体抽取这类模式固定的任务,微调小模型的稳定性和成本全面优于 prompt 大模型,这在工业界基本是共识。

5. 行为对齐。 拒答边界、品牌口吻、特定的交互风格(比如客服话术),需要成千上万条一致行为时,prompt 约束的稳定性不够。

反例:别用微调干这些事

注入事实性知识(会幻觉,而且知识过期就要重训)、解决一次性的临时需求、评测集都没有就盲目微调(没有度量就不知道有没有效)。还有一个常见误区:以为微调能解决推理能力不足——微调教的是模式,不是推理能力,复杂推理问题换强模型或改任务拆解更实际。

工程上微调首选 LoRA/QLoRA:只训少量低秩参数,7B 模型单卡可训,训练和存储成本都比全量微调低一到两个数量级,效果在多数 SFT 场景接近全量。

可能的追问

  • 微调需要多少数据? SFT 场景几百条高质量样本就能看到效果,几千条是常见量级;质量远比数量重要,一百条精标胜过一万条脏数据。继续预训练(领域知识注入)才是吃数据量的,通常要亿级 token 起。
  • 微调后模型通用能力退化怎么办? 这是灾难性遗忘。手段:LoRA 本身改动小、遗忘轻;训练数据里混入一定比例的通用指令数据;学习率别给太大。上线前除了目标任务评测,还要跑通用基准回归。
  • 微调和 prompt 能混用吗? 当然,而且是常态:微调固化行为和格式,prompt 注入每轮的动态上下文和知识,RAG 补知识。三者是组合拳不是单选题。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.