数据与评估

怎么评估模型效果?准确率、召回率、人工评测分别怎么用?

91学AI·2026/8/14·8 阅读

先分清任务类型,再谈评估方法

这是所有评估的起点。任务分两类:一类是封闭任务,有明确对错——意图识别、内容审核、信息抽取,模型输出落在一个有限集合里;一类是开放任务,没有唯一正确答案——写摘要、答问题、生成代码、闲聊陪聊。封闭任务用自动化指标,开放任务用人工或模型裁判,混着用就是灾难。我见过团队给文案生成算「准确率」,拿参考答案做字符串匹配,得出 12% 的结论说要换模型,其实生成质量挺好,只是字不一样。

准确率、召回率、F1:封闭任务的三件套

准确率是「判对的比例」,召回率是「该抓的抓住了多少」。什么时候看重哪个,取决于错误的代价。内容审核场景,漏掉一条违规内容的代价是监管处罚,误判一条正常内容的代价只是用户申诉,所以召回率优先,宁可误杀;反过来的场景是客服意图识别里的「转人工」判断,误判转人工浪费人力,这时看准确率。两个指标天然互相拉扯,调阈值就是在两者之间选位置,F1 是两者的调和平均,适合两者都重要的时候。还有个坑要提:样本不均衡时准确率会骗人——99% 的样本是正常内容,模型全判正常也有 99% 准确率,所以必须配合看混淆矩阵或者 AUC。

开放任务:人工评测是定盘星

生成质量、回答好不好、代码对不对,最终裁决是人。人工评测分两种做法:打分制,1-5 分给单个回答评分,要有明确的 rubric,比如「事实正确 2 分、覆盖要点 2 分、表达清晰 1 分」;对比制,给同一个问题的两个回答选哪个好,这就是 ChatGPT 训练里 RLHF 的核心做法,也是各家模型竞技场(Chatbot Arena)的做法——人对「哪个更好」的判断远比「值几分」稳定,新人评测首选对比制。一次靠谱的人工评测,题量不用多,100-300 条精选样本就够看出趋势,关键是题目要覆盖核心场景和已知坑点。

人工评测的两个坑:一致性和成本

两个标注员对同一条回答打分差两分,说明 rubric 是废纸。工程上的做法是:先写清楚评分细则和示例,标注前做培训对齐,正式标注时抽样 10%-20% 做双人标注,算一致率(Cohen's Kappa 之类),低于 0.6 就打回去重新定义标准。人力成本是实打实的,规划预算时别漏掉这块。成本方面,一条认真的人工评测市场价几块到几十块,1000 条样本评一轮就是小几万,所以人工评测不可能高频跑,一般放在大版本发布前做基准测试。

LLM-as-judge:便宜快,但别全信

现在主流做法是让强模型(GPT-4 级别)当裁判评自家模型的输出,成本只有人工的零头,能每次迭代都跑。经验上,设计好裁判 prompt 后,它和人工评测的结论一致率能到 80%-90%,用来「看趋势、筛版本」完全够用。但三个坑要知道:裁判模型有偏好,喜欢长的、结构化带小标题的回答;自己评自己会放水,所以裁判模型和参赛模型别用同一家;涉及事实正确性的题它判不准,因为它不知道正确答案。所以最终方案是组合:日常迭代用 LLM 裁判看趋势,发版前用人工评测抽审定生死,两条腿缺一不可。

评测频率和自动化的边界要划清。

评估方案定了,什么时候跑也要想清楚。自动化指标可以每天跑甚至每次提交跑,接进 CI 里,prompt 改一行就触发冒烟评测;LLM 裁判按迭代跑,一周一两次;人工精评留给关键节点——换基座模型、大版本发布、季度复盘。别把人工评测当日常手段,又贵又慢,团队会被拖垮;也别全靠自动化,自动化指标只能告诉你「变没变」,告诉你「好不好」的永远是人或者校准过的裁判。最后一句话总结这块:评估方法没有高下,只有匹配——匹配任务类型、匹配决策的重量、匹配你手里的预算。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.