考察点
AI 功能的度量比传统功能难:输出质量主观、「有没有用」没有现成埋点。这道题看候选人能不能搭出分层的指标体系,以及对单一指标陷阱的警觉。面试官常拿「解决率 90% 但用户还在流失」这类矛盾场景追问,看你怎么拆。
参考答案
四层指标体系
拿 AI 客服这类典型场景说。最上层是北极星指标,回答「这个功能创造了什么价值」,比如「无需人工介入完成服务的会话占比」,它直接挂钩人力成本节约。第二层是效果指标,衡量 AI 干得好不好:意图识别准确率、答案正确率、解决率、首响解决率。第三层是体验指标:响应延迟 P95、平均会话轮次、用户满意度 CSAT、点赞点踩率——AI 答对了但绕了八轮才答对,体验依然是差的。第四层是护栏指标,约束「不能为了效果牺牲什么」:投诉率、幻觉率、敏感内容事故数、单次会话成本、人工介入率。护栏指标的意义是一票否决,任何优化把护栏指标打坏,都不能上线。
解决率的陷阱
解决率是最容易报也最容易骗的指标,坑主要有四个。
口径坑:什么叫「解决」?用户没转人工就算解决?那用户问了三次没得到答案、放弃离开,也算「未转人工」。沉默不等于满意,放弃和解决在日志里长得一模一样。口径里至少要排除「短会话后流失」这类疑似放弃的模式。
标注坑:如果解决率靠 LLM 或人工判,判定标准的主观漂移会直接改变指标。标注规范要写成可执行的判例集,定期校准。
刷分坑:指标一旦成为考核目标,就会被优化动作本身扭曲——把话术改得「看起来像解决了」、把模糊回答变多让用户不再追问,解决率涨了,真实效果没动。古德哈特定律在这里完全适用。
分布坑:总体解决率涨 3 个点,可能是简单场景涨 10 个点、高价值复杂场景跌 5 个点被平均掉了。不看切片,均值会撒谎。
对策:交叉验证与分层看数
单一指标不可信,用指标族交叉验证。解决率要和这些指标一起看:7 日重复来访率(真解决了用户不会为同一问题再来)、CSAT 和点踩率(用户直接表态)、人工介入率和介入后处理时长(人工是兜底,它的负载反映 AI 的真实水位)、留存和复购(终极业务结果)。解决率涨、重复来访率也涨,说明解决是虚的;解决率涨、CSAT 平、成本涨,说明可能是拿轮次和字数堆出来的虚高分。
看数必须分层切片:按意图、按客户等级、按新老用户、按渠道分别看指标,再决定优化方向。一个意图一个意图地啃,比盯总分有效得多。
A/B 实验的 AI 特殊性
AI 功能做 A/B 有几个传统实验不太碰的问题。一是新奇效应:用户对新 AI 功能初期好奇、容忍度高,实验跑太短会高估效果,观察窗口至少 2-4 周,覆盖完整业务周期。二是样本量要按 MDE(最小可检测效应)反推,想检测解决率 1 个点的差异,需要的会话量往往比直觉大得多,提前算好再开实验,避免跑了两周发现功效不足。三是随机化单元:按用户分流而不是按会话,避免同一用户上午看到旧版下午看到新版造成的体验割裂和污染。四是实验期间护栏指标设自动熔断,点踩率或投诉率超标自动停止放量。结论汇报时同时报效果指标和护栏指标的变化,只报喜不报忧的实验结论不可信。
可能的追问
- 北极星指标和团队考核指标应该怎么设? 北极星选业务价值指标(如人工节约量),考核指标用「效果指标 + 护栏指标」的组合而不是单点,并且考核口径用第三方抽样判定而不是系统自报,降低刷分动机。
- 用户不打分、不点踩,满意度怎么测? 主动触发轻量调研(会话结束弹出 1-5 分,采样率控制在不打扰的水平);用行为代理指标:重复来访、追问轮次、会话后是否完成目标动作(下单、预约);LLM 对会话做满意度推断,再用人工抽检校准。
- 实验期新版成本高 30%、解决率高 2 个点,怎么决策? 算单位经济账:每次成功解决的增量成本是多少,对比人工替代价值;同时看这 2 个点来自哪些切片,如果集中在低价值场景,大概率不划算。成本要进护栏指标体系,常态化监控。