先定位:不达标有三种,解法完全不同
模型效果不达标,外行看是一个问题,内行看是三个问题。第一种是需求错了:指标定义本身有问题,或者业务方要的 95% 准确率在这个场景根本没必要——客服机器人答错 5% 的问题,如果都能礼貌地转人工,业务上完全可接受。第二种是数据错了:训练数据和线上分布不一致、标注质量差、场景覆盖不全,这种情况换什么模型都没用。第三种才是方法错了:模型选型或方案路线不行。
定位的方法很笨但有效:抽 badcase 人工分类。我一般会拉 100-200 条错误 case,和算法、业务一起看,按"需求定义问题 / 数据问题 / 模型能力问题"三类打标。做完这个分类,方向基本就清楚了。有一次我们做完分类发现,40% 的"错误"是标注员和评测人员对同一个 case 的判断不一致——需求口径都没统一,模型做得再好也是错。
对照基线,别对照想象
很多项目"不达标"的真相是:大家在跟想象中的完美系统比,而不是跟现状比。正确的对照组有三个。第一,人工基线:人工做这件事的准确率和成本是多少?如果人工客服的首次解决率也就 75%,模型做到 80% 已经是提升,凭什么砍?第二,旧系统基线:原来的规则系统或关键词匹配是什么水平?第三,竞对基线:同行公开的产品实际体验如何?我习惯在项目初期就把这三个基线测出来存档,效果争议出现的时候,这是最有力的决策依据。
判断该不该继续,我的三个判据:一看差距性质——离目标差 5 个点,是优化问题;差 30 个点,大概率是路线问题,继续投入等于赌博。二看数据上限——能不能通过补数据、改标注继续涨,如果最近的实验曲线已经平了,加数据也不动,说明摸到了当前方法的天花板。三看替代成本——降级方案(人工兜底、规则+模型混合)能不能先接住业务。三个问题答完,"继续"还是"叫停"通常自己会浮出来。
中间路线:降级上线比硬撑和放弃都强
真实世界里"继续"和"叫停"之间还有一大块中间地带,这往往是最优解。效果差一点的系统,加一层人工审核就能用:模型高置信度的自动放行,低置信度的转人工,人机协同跑起来,业务先受益,真实数据还能源源不断回流,反哺模型继续迭代。很多今天的成熟 AI 产品都是这么起步的——先当"副驾驶",再当"自动驾驶"。
还有一种降级是收缩场景:全场景做不到 90%,但把范围砍到三个最高频场景可能就够了。业务价值的分布本来就是头部集中的,高频场景往往占 70% 以上的量,先把这块吃下来,长尾挂"暂不支持"。
叫停也是交付,关键是留证据
如果判断该停,PM 的职责是让它停得体面。一份清晰的结项报告:验证了什么、否定了什么、沉没成本是多少、继续投入的预估成本和成功概率是多少、数据和评测集怎么存档复用。这份报告的价值在于——半年后业务方再来提同样的需求,你不用从头再踩一遍。把"叫停"做成组织资产,是成熟 PM 和不成熟 PM 的分水岭。怕就怕项目无声无息地烂尾,没人敢写结论,一年后换个领导又立项重来。