AI 产品做 A/B 的三个先天困难
传统 A/B 的前提是同一用户在同一实验组里体验一致,AI 产品直接打破这个前提:同一个用户问同一个问题,模型两次回答都不一样,个体体验本身就是噪声。其次,AI 产品的交互单位是多轮会话不是单次点击,用户的问题可能在第三轮才暴露,按「次」分流会把同一场实验的因果切碎。第三个麻烦是价值延迟:Cursor 的一个补全模型改动,用户要用上一两周才能感知到效率提升,传统实验跑三天看留存根本看不出东西。这三点决定了 AI 产品的实验设计必须做调整。
分流单位:按用户分,不按请求分
最基本的纪律:实验分流按用户 ID,不按请求。否则用户上午看到 A 版下午看到 B 版,体感混乱,指标也脏。对多轮会话产品,分流粒度甚至可以放到「会话」以上——用户整个生命周期固定在一个组里。有个例外:模型侧的快速验证可以用「影子模式」,新模型只算不出,离线比对新旧模型的输出差异,不占用线上流量,适合早期粗筛。
指标选择:别只盯点击率
AI 产品的实验指标要分层设计。护栏指标先行,这是底线:延迟、错误率、拒答率,这些变差了不管主指标多好都砍掉。核心指标按产品类型选:工具型看任务完成率(Copilot 类看 accept 率、Cursor 看补全采纳后的代码保留率),对话型看会话深度和次日回访,内容型看消费时长。最忌讳盯单一虚荣指标——把回答写长能拉高会话时长,但用户其实是被迫多读废话。建议每个实验固定一个主指标加两三个护栏指标,指标太多必然总有一个涨,实验就失去裁决力了。
周期和样本量:比传统产品更苛刻
因为输出方差大,AI 实验需要更大的样本量才能达到同样的置信度,经验上比传统 UI 实验多 30%-50% 的量。周期上至少跑满一个完整的用户行为周期,To C 产品一般是 7-14 天,覆盖周末和工作日的差异;工具型产品甚至要到 4 周,等新鲜感消退——新功能上线用户会玩两天,数据虚高,这叫新奇效应,是 AI 功能实验最常见的假阳性来源。ChatGPT 插件刚上线时打开率很好看,一个月后绝大多数插件无人问津,就是新奇效应的教科书案例,谁按第一周的数据做决策谁后悔。
模型升级这种大实验,用评测集先行
换基座模型、大改 prompt 这种全局变更,直接 A/B 风险大且浪费流量,正确路径是三段式,一步都不能省:先用评测集离线对比,新版比老版好 5 个点以上才进线上;然后小流量 A/B,5%-10% 用户,盯护栏指标;最后全量。还有一个 AI 特有的坑:模型输出会自我影响分布——推荐场景里 A 版推的内容塑造用户后续行为,对照组被污染,长期实验要考虑这一点,必要时用交错实验设计。
几个高频坑,提前知道能少交学费。
一是把「统计显著」当「业务显著」,0.3% 的转化率提升 p 值过了 0.05,对决策毫无意义;二是实验期间偷偷改配置,A 组上线第三天顺手调了 prompt,数据直接作废,实验期间实验组环境要冻结;三是赢家诅咒,跑了 20 个实验只公布涨的 1 个,团队对实验的信任就是这么败光的,无效实验的结论也要存档;四是忽视成本,新模型效果好 2% 但推理成本贵 40%,这个实验结论得连同成本一起算才有意义,账算不平的效果提升不值得上线。五是低估实验设计外的杂音:实验期间赶上市场投放拉新,新用户涌入改变了流量结构,两组对比就不干净了,大推期间要么暂停实验,要么把新老用户拆开分析。