数据与评估

AI 产品的用户满意度怎么量化?有什么传统产品没有的特殊指标?

91学AI·2026/8/14·6 阅读

传统指标还能用,但要改造

NPS 和 CSAT 在 AI 产品里没有失效,但颗粒度太粗。一个用户今天用 Kimi 读论文觉得惊艳,明天让它写周报觉得不行,整体 NPS 反映不出这种波动。所以传统满意度指标我只用来看大盘趋势,真正的功夫下在行为指标上——用户用脚投票的行为比问卷诚实得多。

AI 特有的核心指标:采纳率和重试率

第一个必须做的是采纳率,不同产品形态定义不同:Copilot、Cursor 这类代码产品是建议接受率,业界公开数据大概在 20%-30% 量级,低于 15% 说明补全质量有问题;对话产品是「回答被直接使用」的比例,可以用「用户没有追问、没有改写重问、且后续有复制/采纳行为」来近似定义。第二个是重试率,用户点了重新生成,就是一次明确的不满意投票,但要拆开来分析:是觉得内容错了,还是风格不对,还是单纯想再抽一次卡。第三个是追问深度,用户连续追问 3 轮以上,可能是真的在深挖,也可能是第一轮就没答好,要结合会话最终有没有解决来判断。

显式反馈:点赞点踩要用,但别全信

ChatGPT、豆包都有点赞点踩按钮,这是最直接的满意度信号,但数据极稀疏——愿意点的人通常不到会话量的 5%,而且有严重偏差:极端满意和极端不满意的人更可能点。所以点赞点踩率的绝对值意义不大,趋势和对比才有意义:同一个模型版本,点踩率从 3% 涨到 5%,一定是哪里出问题了。点踩一定要配分类标签(事实错误/答非所问/太啰嗦/格式差),否则回收上来一堆「不满意」也没法指导迭代。

最容易被忽略的:静默失败率

这是 AI 产品独有的坑。传统产品功能坏了用户会报错、会投诉;AI 产品的失败经常是静默的——模型一本正经地编了个错答案,用户没发现,直接采纳了。这种「满意的错误」比明显的不满意危害大十倍,它会透支用户信任。量化它的办法是抽样人工审计:每周随机抽几百条会话,按「事实准确性、指令遵循、无害性」打分,算出一个幻觉率/错误率,作为满意度的修正系数。这个指标不上台面,但是做 AI 产品的人和做传统产品的人最大的认知差。

指标要分层,别揉成一个数

我的做法是把满意度分成三层:单次任务层(采纳率、重试率、点踩率)、会话层(任务完成率、会话轮次、是否转人工)、长期层(次周留存、周活跃任务数)。单次层指导模型和 prompt 迭代,会话层指导产品流程优化,长期层才是管理层汇报用的北极星。三层指标各管各的决策,揉成一个加权总分反而谁也指导不了。

另外补一个容易漏的维度:任务类型分层。同一个产品里,写代码的满意度和闲聊的满意度是两回事,豆包的用户拿它查资料和拿它角色扮演,预期完全不同。所有指标按意图拆开看,才能定位到「是代码场景模型不行」还是「写作场景 prompt 太保守」,大盘均值只会把问题搅成一锅粥。

指标最终要挂钩迭代动作

度量不是目的,每个指标都要事先约定「变了之后干什么」:点踩率单周涨 20% 触发 badcase 专项排查,采纳率连续两周下滑触发模型版本对比实验,静默失败率超标卡住下一个版本发布。没有挂钩动作的指标就是墙上的装饰画,团队看三个月就免疫了。这套「指标—阈值—动作」的映射表,是 PM 在评审会上最能体现实战经验的东西。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.