考察点
这是美团 AI 产品岗实习面的评测专题题,四连问层层递进:定义、标准、评估者、自动化。面试官想看的是你有没有在真实项目里被 Bad Case 折磨过——教科书答案会说「准确率低的就是 Bad Case」,干过活的答案会先问「这个场景里什么叫错」。最后一问关于 AI Native 评测(用模型评模型),是在探你的技术视野跟没跟上行业做法。追问方向:「人工和模型评分不一致听谁的」「评测集会不会过时」「线上 Bad Case 怎么回流」。
参考答案
Bad Case 的定义:先定义「错」,再统计「坏」
我定义 Bad Case 的原则是:从用户损失出发,不从模型输出出发。同样是事实错误,推荐了一家已关门的店(用户白跑一趟)和把人均 150 说成 130(无伤大雅)完全是两个等级的错。所以第一步是按损失分级:一级是错误且有害——虚构商户、报错价格、承诺不存在的优惠,这类必须有拦截机制;二级是答非所问或没帮上忙——意图理解偏了、推荐不符合约束,用户需要重问;三级是体验瑕疵——啰嗦、语气不对、格式乱。每个级别对应不同的处理:一级兜底拦截,二级进优化池排期,三级记录观察。没分级的「Bad Case 率 8%」是个没法指导行动的数字。
评估标准怎么制定
标准不是拍出来的,是从三方对齐出来的。一是从用户视角定底线:这条回答用户能不能直接照着做?能,就是及格线。二是从业务视角定红线:涉价格、资质、承诺类的内容必须 100% 准确,这没得谈。三是从技术视角定可达线:问算法同学当前模型在这个任务上的能力上限,标准定在上限的八成,定高了评测失去区分度,定低了掩盖问题。落到纸面上,标准要写成可打分的 rubric:比如商户推荐场景,拆成「商户真实存在、符合用户约束、信息时效正确、排序合理」四个维度,每个维度 0/1 或 0-2 分,标注同学照着打,不靠感觉。
谁来评估:三方各有不可替代的活
人工标注是 gold standard,新场景冷启动、标准本身有争议、以及校准自动评测时,必须人来。标注要用「双人标注+分歧仲裁」,一致率低于 85% 说明标准本身写得模糊,回去改标准而不是怪标注同学。业务侧(运营、客服)负责定义红线和抽查体感,他们知道什么样的错误会被用户投诉。模型评估(LLM-as-Judge)负责规模化:人工标 500 条定标准,模型按 rubric 跑几万条。我的分工原则是:定标准靠人,跑规模靠模型,有分歧看人。
AI Native 评测:用模型评模型的实操要点
LLM-as-Judge 现在已经是主流做法,但用好有几个坑要绕。一是裁判模型要比选手强,或者至少用不同家的模型,避免「自己人护短」式的同源偏差。二是必须先做一致性校准:拿人工标注的 500 条让裁判模型评,计算和人工的一致率(Cohen's Kappa 之类),一致性不够就先调裁判的 prompt,不能直接用。三是裁判也要给 rubric 和 few-shot,让它打分而不是写感想,结构化输出分数+理由,理由字段是排查问题的金矿。四是防刷分:评测集要保密和定期轮换,否则团队会无意识地对着评测集调 prompt,分数涨了线上没涨。最后,自动化评测解决的是「每次发版回归」的效率问题,线上真实用户的点踩、转人工、追问率才是终极裁判——评测集里的分数再高,线上点踩率涨了就是失败。
可能的追问
- 人工和模型评分打架听谁的? 答:抽查复核。固定抽 5-10% 模型评过的样本让人复评,一致率掉到阈值(比如 85%)以下,说明裁判 prompt 该修了或者标准漂移了。听人的,但要听「按标准评的人」,不是听感觉。
- 评测集多久更新一次? 答:看业务变化速度。本地生活这种商户、价格天天变的场景,评测集一个季度就明显过时,我们按月度从线上新 query 里补采,同时下线已经没有代表性的旧题;模型大版本升级前必须全量重跑。
- 线上 Bad Case 怎么回流到评测? 答:建一条固定管道:用户点踩、转人工、投诉的会话自动进待标注池,每周抽样人工确认是不是真 Bad Case,确认的案例补进评测集。评测集的「血统」来自线上,分数才有业务含义。
- 多轮对话的 Bad Case 怎么评?单轮标准够用吗? 答:不够用。多轮要加「上下文一致性」(前后回答矛盾)、「任务推进度」(几轮下来问题解决没有)两个维度;评估单位也从单条回复变成整段会话,裁判模型要看完整上下文再打分。