考察点
这道题出自字节跳动 AI 产品经理校招面试,客服 Agent 方向。面试官想淘汰的答案是「选效果最好的模型」——客服是典型的规模化场景,一天几十万会话,全部走旗舰模型,成本报表会非常难看;全走小模型,复杂问题答不了,投诉率教你做人。这题的核心考点是你有没有「路由思维」:把不同难度的请求分给不同成本的处理方式。延迟部分考你对首 token、语音链路这些实际约束的了解;微调部分考你知不知道微调解决什么问题、不解决什么问题。追问一般往「路由错了怎么办」「要不要微调」「高峰期怎么扛」走。
参考答案
先看分布:客服不是均质负载
选型之前先看请求的分布形态。客服场景是典型的「高频简单+低频复杂」:查物流、问营业时间、退换货政策这类问题占咨询量的大头,回答它们不需要多少智能,知识库里都有标准答案;真正需要强推理的是长尾——多问题混合、情绪激烈的投诉、规则边缘地带的争议。这个分布特征决定了正确答案不可能是单一模型:让所有请求都经过最贵的大脑,是设计上的懒惰。
核心架构:分层路由
我的方案是三层路由。第一层,意图分类:用小模型甚至传统分类器做意图识别和复杂度判断,毫秒级、成本几乎可以忽略,它是整个路由的交通警察。第二层分流:高频 FAQ 类意图走「检索+模板」,命中知识库标准答案后用小模型润色口吻即可,这一步很多请求甚至不需要旗舰模型出场;中等复杂度的走轻量大模型+RAG;只有复杂多轮、投诉安抚、规则争议才路由到旗舰模型。第三层兜底:任何一层置信度不足,升级处理或转人工。这套架构下来的经验数字是:旗舰模型的调用量能压掉五到七成,平均延迟降一半,而解决率几乎不掉——因为被分走的本来就是不需要强智能的请求。路由的难点不在技术在于运营:分流规则要跟着 badcase 数据持续调,把「被小模型接错」的 case 不断归到新类别里。
选型维度:四个轴,别只看跑分
具体选哪个模型,我在四个轴上评估。效果:不看公开榜单,用自己的评测集跑——从真实历史会话抽几百条,覆盖 Top 意图和边缘 case,看意图识别准确率、回答正确率、口吻一致性。延迟:文本客服首 token 要压到 1 秒上下,整句回复 3 秒内,超过这个用户就开始刷「人工」;如果未来接语音,预算更苛刻,ASR、LLM、TTS 三段级联,每段的延迟预算要单独分配,LLM 段可能只有不到一秒的余地,这直接就把超大模型排除在语音主链路外了。成本:算「每千会话成本」而不是每 token 单价,结合路由架构算外推到全量的月度账单。合规:客户数据敏感度高时,是否需要私有化部署,这个约束一票否决,先问清楚再选型。
要不要微调:想清楚微调解决什么
这是面试里最容易露怯的点,我的态度很明确:微调改的是「格式和口吻」,不改「知识」。业务知识、政策规则一律走 RAG,因为知识天天变,微调跟不上更新节奏,过时的知识比没有知识更危险。什么时候才微调:prompt 加 few-shot 已经调到天花板,风格一致性、字段输出格式还是不稳定,且手里有几千条高质量标注数据,这时 LoRA 微调是划算的。客服场景一个常见的微调理由是「让机器人的回复像人又像品牌」,这个成立,但优先级排在知识库质量之后——90% 的客服效果问题,根子在知识库不在模型。
高峰期的动态平衡
大促是客服的期末考。预案要提前写:流量超过容量阈值时,降级策略自动生效——旗舰模型路由阈值收紧,更多请求流向轻量模型;高频答案走缓存,相同问题不重复调模型;非核心功能(比如回复的个性化润色)直接关掉保主链路。这套降级预案要在大促前演练过,不能是文档里的摆设。核心原则一句话:高峰期保「能答、答得快」,牺牲「答得妙」,用户在排队等客服的时候,对回复文采的容忍度远高于对等待时长的容忍度。
可能的追问
- 路由分错了怎么办,简单问题被送去旗舰、复杂问题被小模型接住? 答:前者只是浪费钱,后者会出事,所以路由策略宁可是非对称的——置信度模糊的一律往上送;监控两层:每层模型的「升级率」(被判定处理不了向上转的比例)和人工抽检的错分率,每周用错分样本迭代分类器。
- 多模态要不要上,比如用户发图片举证? 答:退换货场景发图举证是真实高频需求,值得上,但用法是「多模态模型做初判+人工复核」,比如判断商品破损程度给出定级建议,不直接自动赔付;图片理解的错误代价高,全自动的风险扛不住。
- 怎么向业务方证明分层路由没有牺牲效果? 答:AB 实验说话:对照组全走旗舰模型,实验组走路由架构,比解决率、CSAT、平均响应时长和单会话成本四个数;经验上路由方案解决率损失在 1-2 个点以内,成本降一半以上,这笔账业务方自己会算。