数据与评估

AI 产品的指标体系和传统产品有什么不同?

91学AI·2026/8/14·16 阅读

传统指标体系还在,但不够了

先说好的一面:DAU、留存、转化、时长这些传统指标照样要看,AI 产品也是产品,用户不买账什么都白搭。问题在于,传统产品的指标体系里,功能表现被默认是 100% 的——支付成功率掉到 99.5% 都是事故。而 AI 产品里,你吭哧吭哧做到 90% 正确率可能已经是行业顶尖了。所以指标体系必须从「一层」变成「两层」:上面是业务指标,下面是模型质量指标,两层都要盯。

多出来的那层:质量指标

质量指标一般分三类。第一类是效果指标:准确率、召回率、拒答率、幻觉率,按任务类型选,比如客服场景看问题解决率,搜索场景看 top-K 命中率。第二类是体验指标:首 token 延迟、整轮响应时长、多轮对话的轮次深度——ChatGPT 把首字延迟压到一秒以内,这个体验是它早期碾压对手的重要原因之一,用户不会等一个十秒才开口的助手。第三类是安全指标:有害输出率、敏感话题拒答误判率,这类指标出事就是舆情,一票否决。

质量指标怎么量化,是产品经理的活

很多新人以为质量指标是算法团队的事,这是误区。准确率怎么定义、测试集从哪来、人工打分的 rubric 长什么样,都得产品经理牵头定,因为只有你懂「用户觉得什么叫答对了」。举个具体例子:智能客服里「解决了问题」怎么算?用户没转人工就算解决?那他可能是放弃了呢。所以要设计成复合指标:未转人工 + 会话结束 24 小时内无重复进线 + 满意度评分,三个条件组合才记一次解决。这个定义过程本身就是产品经理的核心工作,定义错了,后面所有优化都在往错的方向使劲。

两层指标会打架,取舍是常态

最常见的一对矛盾是质量和成本:Kimi 早期长文本回答很惊艳,但长输出意味着推理成本高、延迟大,所以在产品上要砍——默认回答长度控制住,用户要求再展开。另一对是质量和规模:为了 DAU 增长放宽 prompt 限制、接更多娱乐化 query,质量分可能掉,但用户涨了,这个仗怎么算?我的经验是定一条质量红线,比如核心场景准确率不能低于某个值,红线之上业务指标优先,跌破红线质量优先,别让团队每次上线都临时吵架。

指标落地:埋点、看板和例会节奏。

体系画在纸上不算完,落到工程里才算数。埋点阶段就要想清楚:质量类指标大多不能靠客户端埋点拿到,要在服务端日志里埋——请求耗时、模型版本、token 数、拒答标记,这些是算质量分的原料。看板分两层做:业务看板给老板看,DAU、留存、付费转化,按天更新;质量看板给团队自己用,分场景的准确率、bad case 趋势、bad case 复发数,按版本更新。节奏上,业务指标日会扫一眼,质量指标发版必过会——每次发版把质量看板投出来,涨了讲为什么涨,跌了讲接不接受,这个仪式感能保证两层指标始终有人盯。

北极星指标的选择

AI 产品的北极星指标最好落在「用户实际拿到价值」上,而不是「用户跟模型聊了多少」。Cursor 看的不是对话轮数,而是用户接受了多少次代码补全、accept 率多少;Copilot 公开过约 30% 的建议被采纳,这个数字就是它的命根子。对比一下,如果北极星定成对话轮数,团队很容易把产品做得啰嗦——回复越长轮数越多,数据好看,用户烦死。选指标就是在选团队的行为方向,定错了比没有指标更糟糕。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.