考察点
这道题出自阿里 AI 产品经理校招一面,是典型的技术选型题,但面试官不想听你背三条路线的定义。淘天场景的隐含约束很重:商品信息分钟级在变、大促流量是日常的几十倍、一次错误推荐直接影响成交。面试官想看你能不能把「搜索」和「客服」这两个看似相近的场景拆开,按数据时效性、错误代价、成本结构分别给方案,并且知道三条路线不是互斥的。追问会往「为什么不用另外两条」「大促怎么办」「效果怎么验证」上压。
参考答案
先拆场景:搜索和客服是两种问题
商品搜索的核心矛盾是相关性排序,用户输入 query,系统要在毫秒级返回几百个商品的排序结果。这个环节的主体永远是召回排序系统(倒排索引 + 向量召回 + 排序模型),大模型插不进去全链路——一次搜索让 LLM 逐条理解百万商品,成本和延迟都是天文数字。大模型在搜索里的正确位置是两端:前端的 query 理解(意图识别、query 改写、长尾词扩展)和后端的重排与结果解释。
客服的核心矛盾是知识时效和多轮解决问题。活动规则今天改明天变、订单状态实时更新,答案是「查出来的」不是「学出来的」。这决定了它的技术路线和搜索完全不同。
三条路线各自的正确位置
精调解决的是「风格和稳定能力」,不是「知识」。 很多人对精调最大的误解是拿它灌知识——把商品库、活动规则喂给模型精调,两周后规则变了模型就开始一本正经地胡说。精调在淘天场景的正确用法是:让模型学会客服的话术风格(友好、简短、带表情分寸感)、学会输出固定格式(工单 JSON、导购卡片结构)、学会平台特有的业务判断逻辑(什么算「描述不符」)。这些是不随时间变的稳定能力,一次精调长期受益。训练数据靠历史优质客服会话和人工构造,几千到几万条高质量样本就够,用 LoRA 类方法,成本可控。
RAG + 提示词工程解决的是「活的知识」。 客服回答「这个商品支不支持 88VIP 折扣」「退货要扣运费吗」,答案在知识库里,不在模型参数里。用 RAG 把商品详情、活动规则、店铺政策做成可分钟级更新的检索库,模型只负责组织语言。好处是知识改了立刻生效,可溯源(每个回答能挂引用来源,客服场景客诉时这是刚需),幻觉能压住。这套方案上线快,两周就能出 MVP,是我会选的主路线。
多智能体解决的是「跨系统的复杂任务」,只在长尾启用。 用户说「我买的手机收到有划痕,帮我处理」,这一单里要查订单、判责任、走退换流程、可能还要算差价补偿,涉及四五个系统,这时候单 Agent 的上下文和规划能力都不够用,可以拆成意图 Agent、订单 Agent、售后 Agent 协作。但多智能体的代价是链路长、延迟翻倍、错误沿链放大、token 成本翻几倍,所以我的原则是:默认单 Agent,只有被数据证明高频且多步的任务才升级多智能体。
我的落地方案:一个底座,三种用法
如果让我从零规划,第一阶段(1-2 个月)上 RAG + Prompt 的智能客服 MVP:知识库接入商品和活动规则,意图白名单控制在前 20 个高频问题(查物流、退换政策、优惠券),覆盖率冲到 60% 以上,这个投入产出最快。第二阶段做客服话术和工单结构的精调,把回复风格统一、把结构化输出打稳,同时用大模型改造搜索的 query 改写。第三阶段看数据:哪些多步任务的转人工率居高不下,再针对性上多智能体。精调、RAG、多智能体从来不是三选一,是按「稳定能力、活知识、复杂任务」分层组合。
大促这个坎必须提前过
淘天场景绕不开大促。几十万 QPS 下,每次请求都过一遍大模型不现实,要靠三件事扛:高频问题做答案缓存(同义 query 归一化后命中率能到 30-40%),高峰期限流降级到模板化回复(保住可用性),以及提前用大促活动规则刷新知识库并做全量回归评测。成本侧,大促期间客服机器人每多解决一单就是省一块多的人力成本,这笔账拿出来,资源申请不难。
可能的追问
- 怎么验证 RAG 客服真的比原来的规则机器人好? 答:双轨跑:机器人独立解决率、转人工率、会话满意度(解决后追问率/差评率)三组指标 AB 对比,再看客服人力成本的绝对下降。离线先用历史会话回放评测回答准确率,达标再灰度。
- 精调后怎么防止模型能力退化? 答:建回归评测集(覆盖通用问答 + 业务场景各几百条),每次精调版本跑对比,业务指标涨但通用能力掉的版本不上;精调数据里混入 10-20% 通用数据防灾难性遗忘。
- 搜索场景为什么不让 LLM 直接生成推荐结果? 答:三个硬伤:商品库分钟级变化,模型参数里的商品信息必然过期;百万商品全进上下文成本不可行;生成式结果没法保证每个推荐都真实存在于库存中,出现幻觉商品就是事故。LLM 只能做理解和重排,成交的确定性必须靠检索系统保。