精选·模型与微调基础

业务落地怎么选模型:从任务分层到成本压测的选型方法论

91学AI·2026/7/13·9 阅读

考察点

这是业务面必考题,考察的是工程判断力而不是模型知识面。面试官想看你的决策框架:需求怎么拆、候选怎么筛、拿什么数据拍板。追问常考「为什么不用最强模型打全场」「私有化什么时候值得做」。

参考答案

第一步:按任务复杂度给模型分层

选型的起点不是逛模型榜单,而是把自己的业务任务拆开分级。经验上分三档:

轻任务:意图分类、情感判断、字段抽取、格式转换。输出空间小、不需要推理,小模型或各厂商的轻量档 API 足够,甚至传统 NLP 方案都还能打。这类任务用旗舰模型是拿牛刀杀鸡,成本高十倍、延迟还更差。

中任务:客服问答、摘要改写、基于文档的问答(RAG)。需要语言理解和组织能力,但推理链短,中档模型是性价比甜点。

重任务:多步推理、复杂代码生成、Agent 规划调度、需要综合多个工具的开放任务。这才轮到旗舰模型出场,而且要接受它的延迟和成本。

一个真实业务系统通常是三档混合的,所以架构上要把「模型调用」抽象成可配置的路由层,按任务类型或难度标签分流到不同档位——这条路由策略本身就是选型方案的一部分,也是后续降成本的主要抓手。

第二步:自建评测集,别信公开榜单

Benchmark 分数(MMLU 之类)只能用来筛候选池,不能用来拍板。原因很简单:榜单测的是通用能力,你的业务有自己的输入分布、格式要求和容错标准,榜单第一在你的场景里可能又贵又不好使。

正确姿势是从真实业务数据里抽 50~200 条有代表性的样本,标注期望输出或评分标准,做成评测集。候选模型挨个跑,至少盯三个指标:任务准确率、格式合规率(该出 JSON 的时候是不是稳定出 JSON)、平均延迟与 token 消耗。每次换模型、升版本、改 prompt 都重跑一遍,这个评测集是你团队的资产。

第三步:三个硬约束算总账

成本:不只看单价。input 和 output token 分开计价,output 通常贵 3~5 倍,你的业务如果输出长(写报告)和输入长(RAG 灌文档)的成本结构完全不同。还要看上下文缓存(重复的系统提示能不能命中缓存降价)、批量接口折扣。算总账用「单次业务请求的端到端成本」做单位,不是「每百万 token 单价」。

延迟:首 token 延迟(TTFT)决定用户体验,整段吞吐决定你的并发容量。流式输出能掩盖一部分延迟,但 Agent 场景里模型要串行调好几轮,每轮的延迟会叠加放大——多工具 Agent 选模型时延迟权重要调高。

合规与部署:数据能不能出内网、能不能出境,先把这条路卡死再谈效果。金融、医疗、政企场景往往直接指向私有化部署:选开源模型(Qwen、DeepSeek 等系列)自己起推理服务,用 vLLM 这类框架,再配量化版本压硬件成本。私有化要算的另一笔账是运维人力和 GPU 成本,调用量小的业务不如老老实实走 API。

第四步:留好退路

模型选型不是一次决策。API 厂商会调价、会改版、会停服旧版本,开源社区半年一换代。工程上两件事必须做:模型访问层做抽象,换模型只改配置不改代码;核心链路配 fallback,主模型超时或 5xx 时自动降级到备选模型。灰度发布也按互联网老规矩来:新模型先切 5% 流量,评测集和线上指标都过了再全量。

一句话收个尾:没有最好的模型,只有和当前任务、流量规模、合规要求最匹配的模型组合。选型能力本质上是把业务需求翻译成技术指标的能力。

可能的追问

  • 什么时候值得私有化部署?三个条件至少占两个再考虑:数据合规强制要求、日调用量大到 API 月费超过 GPU 成本、需要深度定制(私有化权重做微调)。否则 API 省心。
  • 开源模型和闭源 API 怎么选?闭源旗舰的推理和 Agent 能力上限目前仍领先,复杂任务优先闭源;简单任务和私有化场景开源够用,且开源模型可微调可控性强。
  • 小模型微调后能替代大模型吗?在窄任务上经常可以——一个 7B 模型用几百条业务数据 SFT 后,字段抽取准确率可能超过通用旗舰,成本和延迟还好一个量级,这就是任务分层能省钱的底层逻辑。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.