大模型基础

业务落地怎么做模型选型?Qwen、DeepSeek 各自什么特点?

91学AI·2026/7/26·11 阅读

考察点

这是一道没有标准答案但最能区分候选人成色的题。面试官不想听榜单排名,想听决策框架:你怎么从业务约束出发收敛候选,怎么设计评测集验证,怎么在效果和成本之间做权衡。对 Qwen、DeepSeek 的了解程度反映你是否真的在一线部署过。追问常往「自研部署还是调 API」「小模型微调 vs 大模型直出」「怎么评估模型升级要不要跟」上走。

参考答案

选型的决策顺序

我一般按四步收敛,顺序不能乱:

第一步,明确任务画像。任务类型(对话/抽取/分类/代码/多模态)、输入输出长度分布、质量要求(错一次的代价多大)、QPS 和延迟要求。这一步决定你需要多大的模型——很多抽取、分类任务 7B 微调后足够,不需要 72B。

第二步,定部署方式。数据能不能出内网是硬约束:金融、政企数据敏感,直接锁死自部署开源模型;不敏感再看调用量——日均 token 量小的时候 API 一定更划算,量大到某个拐点(经验上几百万到上千万 token/天,视模型价格而定)自部署才开始摊薄成本。

第三步,建评测集实测。从真实业务数据抽 100-300 条建评测集,包含典型 case 和已知坑(边界输入、易错格式)。候选模型跑一遍,看业务指标而不是 MMLU 分数——榜单高分在你的场景上可能完全不灵。格式合规率、幻觉率、中文表达质量这些都要实测。

第四步,算总拥有成本。API 按 token 计费好算;自部署要算 GPU 成本(推理卡时价)、并发需要的副本数、运维人力。别忘了评估供应商锁定风险:prompt 工程大量依赖某家特有 function calling 格式,迁移成本会越来越高。

Qwen 的特点

阿里通义系列,核心优势是全尺寸 + 全生态。从 0.5B 到 110B+ 每个档位都有开源权重(Apache 2.0 协议,商用友好),还有专门的 Qwen-Coder、Qwen-VL、Qwen-Audio、Embedding/Rerank 模型,一个技术栈解决多种需求。中文能力是开源模型里的第一梯队,词表对中文优化过,压缩率好。工具链成熟:vLLM、SGLang、Ollama 全部原生支持,微调有 LLaMA-Factory 现成适配,社区资料最多。小尺寸段(1.5B-14B)几乎没有对手,边缘部署、低成本微调场景基本是默认选择。Qwen2.5/Qwen3 代的指令遵循和 function calling 稳定性也打磨得比较好,适合 Agent 类业务。

DeepSeek 的特点

核心优势是旗舰性能 + 极致性价比。DeepSeek-V3/R1 是开源权重模型里综合能力的天花板之一,尤其 R1 的推理能力(数学、代码、复杂分析)对齐 o1 级别,API 定价却只有主流闭源模型的一个零头。V3 是 671B 总参数、37B 激活的 MoE,这个架构带来低成本的同时也带来部署门槛:自己部署要按 671B 备显存,一般团队玩不转,所以 DeepSeek 的典型用法是调 API 或用第三方托管,而不是自建。它的开源尺寸主要集中在旗舰档,缺少 Qwen 那样的中小尺寸梯度。另外 R1 的思维链输出很长,延迟和 token 消耗都高,简单任务用它属于浪费,适合复杂推理场景按需调用。

实际的组合策略

一线落地很少单押一个模型,常见组合:主链路用 Qwen 中等尺寸(14B/32B/72B)自部署,保证数据可控和成本可预期;复杂推理 case 路由到 DeepSeek-R1 API;抽取、分类等轻任务用 Qwen 小尺寸微调版本;embedding 和 rerank 用 Qwen 或 bge 系列。模型之间用统一的路由层隔离,方便随时替换——开源模型半年一换代,架构上要为「换模型」做准备,prompt 和评测集是迁移时的核心资产。

最后一点:选型不是一次性的。建好评测集之后,每次有重量级新模型发布就顺手跑一遍,成本半天,但能避免「上线时最优、一年后落后两代」的局面。

可能的追问

  • 什么情况下选小模型微调而不是大模型加 prompt? 任务固定、输出格式严格、QPS 高的场景(如审核、抽取):7B 微调后质量可追平大模型直出,成本降一个数量级,延迟也更稳。
  • 国产模型和 GPT-4o/Claude 怎么取舍? 闭源旗舰在复杂指令遵循、长上下文稳定性上仍有优势;但数据合规、成本敏感、需要定制微调的场景国产开源是更现实的选择。混合用也常见。
  • 模型升级换代怎么平滑过渡? 评测集回归 + 灰度:新模型先在 5% 流量上跑,对比线上指标无回退再全量;prompt 通常需要针对新模型微调一轮。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.