数据与评估

对话式产品的埋点和行为分析怎么做?

91学AI·2026/8/14·5 阅读

先接受现实:漏斗模型要重写

传统产品的分析骨架是页面漏斗:首页→详情页→下单。对话产品的界面就是一个输入框,用户旅程全发生在消息流里。所以要换一个骨架:以「会话」为基本单位,分析「发起会话→需求被理解→拿到可用回答→采纳/继续追问→结束或流失」这条链。每个环节的流失都要能找到对应的行为事件来解释,埋点设计就是围绕这条链展开的。

事件埋点:三层结构

我的做法是分三层埋。消息层是最细的:每次发送(带上文本长度、是否带附件、是否语音)、每次响应(耗时、token 数、模型版本、是否触发检索/工具调用)、每次反馈(点赞、点踩及分类、复制、分享、重新生成)。会话层是聚合:会话 ID、轮次数、总时长、是否有采纳行为、是否中途放弃(发出消息后没等响应完就退出)、结束方式(自然停止/主动清空/超时流失)。用户层是长期:激活以来的会话数、任务类型分布、留存和召回情况。有一个原则:原始消息文本要存(合规前提下脱敏),但要和埋点数据分库存、限权限,行为分析用结构化事件,文本只在定性分析和 badcase 挖掘时按流程调阅。

意图识别是分析的地基

不标意图,所有指标都是一锅粥。「点踩率 8%」毫无意义,「代码类任务点踩率 15%、闲聊类 3%」才能指导行动。意图打标用三层递进:规则先行(带代码块的算编程、带链接的算总结),覆盖三四成;模型分类补位(用小模型对首条消息做意图分类,成本极低,能覆盖到八九成);人工抽检校准(每周抽几百条核对模型分类准不准,准确率低于 85% 就优化 prompt 或加类别)。意图标签挂在会话上之后,分层看板才有意义——哪个场景在涨、哪个场景质量在拖后腿,一眼看清。

多轮会话的分析套路

对话产品最有价值的分析都在会话级。常看的几个:一是「首轮解决率」,用户第一轮就拿到可用回答、没有追问重试的会话占比,这个指标和满意度的相关性最强;二是「追问模式分析」,把追问分成「深入追问」(同一话题挖更深,好事)和「纠偏追问」(用户换个说法重问,说明上一轮没答好),比例变化直接反映模型迭代效果;三是「放弃点分析」,用户在第几轮、什么意图上流失最多,那里就是产品改进的优先级清单。Kimi、豆包这类产品还值得看「长会话健康度」——轮次多了之后模型有没有遗忘、跑偏,这是长上下文产品的特有指标。

埋点数据要反哺模型迭代

分析不能停在看板上。点踩会话、纠偏追问、放弃会话,这三类是最好的 badcase 来源,建一条自动管道:每周把带负反馈的会话按意图聚合,TOP 问题类型产出成 badcase 清单交给算法;高质量的点赞会话反过来进精选案例库,可以做 few-shot 示例或者评测集的「好答案」基线。这样埋点就不只是「看数据」,而是模型迭代的输入系统,PM 的价值就在这里——把用户行为翻译成算法能用的资产。

两个实操的坑

一是埋点版本管理,模型版本、prompt 版本必须打进每条响应事件,否则灰度期间根本没法对比分析,这个字段漏了就是灾难。二是采样问题,会话量大了以后消息文本存储成本高,可以做采样存储,但负反馈会话一定要全量保留,最稀缺的信号不能省。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.