考察点
这是业务面必考题,考察的是工程判断力而不是模型知识面。面试官想看你的决策框架:需求怎么拆、候选怎么筛、拿什么数据拍板。追问常考「为什么不用最强模型打全场」「私有化什么时候值得做」。
参考答案
第一步:按任务复杂度给模型分层
选型的起点不是逛模型榜单,而是把自己的业务任务拆开分级。经验上分三档:
轻任务:意图分类、情感判断、字段抽取、格式转换。输出空间小、不需要推理,小模型或各厂商的轻量档 API 足够,甚至传统 NLP 方案都还能打。这类任务用旗舰模型是拿牛刀杀鸡,成本高十倍、延迟还更差。
中任务:客服问答、摘要改写、基于文档的问答(RAG)。需要语言理解和组织能力,但推理链短,中档模型是性价比甜点。
重任务:多步推理、复杂代码生成、Agent 规划调度、需要综合多个工具的开放任务。这才轮到旗舰模型出场,而且要接受它的延迟和成本。
一个真实业务系统通常是三档混合的,所以架构上要把「模型调用」抽象成可配置的路由层,按任务类型或难度标签分流到不同档位——这条路由策略本身就是选型方案的一部分,也是后续降成本的主要抓手。
第二步:自建评测集,别信公开榜单
Benchmark 分数(MMLU 之类)只能用来筛候选池,不能用来拍板。原因很简单:榜单测的是通用能力,你的业务有自己的输入分布、格式要求和容错标准,榜单第一在你的场景里可能又贵又不好使。
正确姿势是从真实业务数据里抽 50~200 条有代表性的样本,标注期望输出或评分标准,做成评测集。候选模型挨个跑,至少盯三个指标:任务准确率、格式合规率(该出 JSON 的时候是不是稳定出 JSON)、平均延迟与 token 消耗。每次换模型、升版本、改 prompt 都重跑一遍,这个评测集是你团队的资产。
第三步:三个硬约束算总账
成本:不只看单价。input 和 output token 分开计价,output 通常贵 3~5 倍,你的业务如果输出长(写报告)和输入长(RAG 灌文档)的成本结构完全不同。还要看上下文缓存(重复的系统提示能不能命中缓存降价)、批量接口折扣。算总账用「单次业务请求的端到端成本」做单位,不是「每百万 token 单价」。
延迟:首 token 延迟(TTFT)决定用户体验,整段吞吐决定你的并发容量。流式输出能掩盖一部分延迟,但 Agent 场景里模型要串行调好几轮,每轮的延迟会叠加放大——多工具 Agent 选模型时延迟权重要调高。
合规与部署:数据能不能出内网、能不能出境,先把这条路卡死再谈效果。金融、医疗、政企场景往往直接指向私有化部署:选开源模型(Qwen、DeepSeek 等系列)自己起推理服务,用 vLLM 这类框架,再配量化版本压硬件成本。私有化要算的另一笔账是运维人力和 GPU 成本,调用量小的业务不如老老实实走 API。
第四步:留好退路
模型选型不是一次决策。API 厂商会调价、会改版、会停服旧版本,开源社区半年一换代。工程上两件事必须做:模型访问层做抽象,换模型只改配置不改代码;核心链路配 fallback,主模型超时或 5xx 时自动降级到备选模型。灰度发布也按互联网老规矩来:新模型先切 5% 流量,评测集和线上指标都过了再全量。
一句话收个尾:没有最好的模型,只有和当前任务、流量规模、合规要求最匹配的模型组合。选型能力本质上是把业务需求翻译成技术指标的能力。
可能的追问
- 什么时候值得私有化部署?三个条件至少占两个再考虑:数据合规强制要求、日调用量大到 API 月费超过 GPU 成本、需要深度定制(私有化权重做微调)。否则 API 省心。
- 开源模型和闭源 API 怎么选?闭源旗舰的推理和 Agent 能力上限目前仍领先,复杂任务优先闭源;简单任务和私有化场景开源够用,且开源模型可微调可控性强。
- 小模型微调后能替代大模型吗?在窄任务上经常可以——一个 7B 模型用几百条业务数据 SFT 后,字段抽取准确率可能超过通用旗舰,成本和延迟还好一个量级,这就是任务分层能省钱的底层逻辑。