评测与安全

用另一个大模型做评测(LLM-as-Judge),它的正确率和自我一致性怎么保证?

91学AI·2026/7/26·9 阅读

考察点

LLM-as-Judge 是大模型评测绕不开的手段,这道题看候选人是否清楚它不是「免费的评测员」。面试官想听到:怎么验证 judge 本身可信、它有哪些系统性偏差、工程上怎么矫正。追问常往「judge 和人 disagreement 了怎么办」「judge 模型换了要不要重测」「pairwise 和打分哪个好」走。

参考答案

三种用法

LLM-as-Judge 常见三种形态。Pointwise 打分:给输出按 rubric 打 1-5 分,适合监控质量水位。Pairwise 对比:给两个输出选更好的一个,适合做版本 A/B,因为判断「哪个好」比「绝对值几分」更容易,judge 的判别稳定性更好。Reference-based:给参考答案让 judge 评估匹配度,适合有标准答案的场景。实践中 pairwise 用来做版本间比较,pointwise 用来做线上质量监控,组合使用。

正确率怎么保证:先过金标准这一关

judge 上线前必须量化它和人类判断的一致程度。做法是标注一份人工金标准:抽 200-500 条样本,由业务标注员按同一份 rubric 打分,然后算 judge 输出和人工标注的一致率,用 accuracy 加 Cohen's kappa 两个口径看,kappa 能扣除随机一致的成分。经验上 kappa 到 0.7 以上才敢说这个 judge 可用,0.6-0.7 之间要谨慎,只适合做粗粒度筛选。

judge prompt 的设计直接决定一致率。几条经验:rubric 要写到可执行的程度,「回答准确」没用,「答案中的每个事实性陈述都能在提供的上下文中找到依据」才有用;让 judge 先输出分析过程再给分数,反过来先给分数容易锚定;temperature 设为 0 或接近 0,降低随机性;给 few-shot 示例,尤其是边界 case 的判例。

系统性偏差和矫正

LLM-as-Judge 有几类公认的偏差,工程上要针对性处理。

位置偏差:pairwise 对比时 judge 偏好先出现或后出现的答案。矫正方法是同一样本交换顺序跑两次,只在两次结论一致时采纳,不一致的进人工复核。

冗长偏差:judge 普遍偏爱更长、结构更工整的回答,哪怕内容质量一样。在 rubric 里明确「长度不构成加分项,以信息密度为准」,能缓解但根除不了,所以长版本对比短版本的优势要打折看。

自我偏好:模型给自己家输出打分偏高。用 GPT 系评 GPT 系的输出时尤其明显。做法是选和被评模型不同家族的强模型做 judge,或者用多个 judge 投票。

风格和格式偏好:judge 对 markdown 排版、列表结构的输出有偏爱。离线评测输出最好做格式归一化再送评。

自我一致性怎么校验

同一个 judge 对同一样本多次评分,结果应该稳定。校验方法:抽样跑 3-5 次,看分数方差或结论翻转率。翻转率高的样本类别说明 rubric 在这类 case 上定义不清,要么改 rubric,要么这类 case 固定走人工。日常运行中,对置信度低(比如 judge 自己表达犹豫、分析里出现大量「可能」「但是」)的样本自动路由到人工复核,这比全量人工省成本。

最后一点容易被忽略:judge 模型本身会升级换代,换了 judge 等于换了尺子,历史分数不可比。所以 judge 也要纳入版本管理,judge 变更时用金标准重新标定,并保留旧 judge 一段时间的并行跑分做对照。

可能的追问

  • judge 和人工标注冲突了,以谁为准? 以人工为准,但冲突案例要分类复盘:是 rubric 歧义就改 rubric,是 judge 能力盲区(比如专业领域事实判断)就给这类 case 加 reference 或走人工,冲突样本本身是金标准里最有价值的部分。
  • pairwise 判断能用 Elo 积分排多个版本吗? 可以,这是 Chatbot Arena 的做法。注意传递性不一定成立(A>B、B>C 但 C>A 会出现),样本量要够,且要控制位置偏差。
  • 小团队没有标注资源怎么办? 金标准可以小,100-200 条先起步;标注优先投给 judge 置信度低和结论翻转的样本,用主动学习的思路把标注预算花在刀刃上。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.