评测与安全

主流 benchmark 有哪些?为什么不能只看 benchmark 选模型?

91学AI·2026/7/26·11 阅读

考察点

这道题看候选人是不是真的做过模型选型,还是只会看榜单排名。面试官想听到对主流 benchmark 测什么的准确理解,以及更重要的——榜单分数和业务效果之间的鸿沟。追问常往「数据污染怎么判断」「你们选型时怎么做的」「榜单没覆盖的能力怎么评」走。

参考答案

主流 benchmark 盘点

按能力维度分几类。知识与推理:MMLU 覆盖 57 个学科的多选题,是通用知识的标配;MMLU-Pro 是它的难度升级版,选项从 4 个增到 10 个,抗猜测性更强;GPQA 是研究生级别的理科难题。中文场景有 C-Eval 和 CMMLU。数学推理用 GSM8K(小学应用题)和 MATH(竞赛数学)。代码能力看 HumanEval(函数级代码生成)和 MBPP,更接近真实工程的有 SWE-bench(修真实 GitHub issue)。对话与指令遵循看 MT-Bench 和 IFEval,人类偏好对齐的直接参考是 Chatbot Arena 的 Elo 榜——它靠真人盲测投票,和其他静态题库性质不同。Agent 和工具调用方向有 BFCL(Berkeley Function Calling Leaderboard)。

类别代表 benchmark测什么
通用知识MMLU / MMLU-Pro多学科知识问答
中文C-Eval / CMMLU中文知识与理解
数学GSM8K / MATH数学推理
代码HumanEval / SWE-bench代码生成与修复
对话偏好MT-Bench / Arena人类偏好对齐
工具调用BFCLFunction calling 准确性

为什么不能只看榜单

第一个原因是数据污染。这些公开题库流传太广,难免以网页、讨论、变体的形式进入各家训练语料。模型对题目「背过答案」,分数虚高。GSM8K 就多次被质疑污染。判断污染没有完美的办法,但可以用一些信号:用题目的改写版本重测看分数掉不掉、看模型对同一榜单新旧题目的表现差异。

第二个原因是饱和。头部模型在 MMLU 上都在 85 分以上挤作一团,差一两个点没有区分度,更可能是评测噪声而不是能力差距。这时候需要看更难的新榜单,但新榜单又面临新一轮的污染和刷榜。

第三个原因最关键:榜单分布和你的业务分布不匹配。客服场景不需要竞赛数学,法律场景需要的法条精确引用能力没有任何主流榜单直接测。一个在 MMLU 上高 5 分的模型,在你的具体意图上可能更差——尤其是多轮对话、长上下文里的信息抽取、按格式输出这些工程化能力,榜单覆盖得很弱。

第四个原因是刷榜动机。厂商针对知名榜单做定向优化是公开的秘密,分数上去了,泛化能力没动。

最后一个常被忽略:榜单完全不测工程属性。延迟、吞吐、成本、上下文窗口的实际可用长度、function calling 的稳定性、内容安全倾向,这些才是选型落地时天天打交道的东西。

正确的选型姿势

榜单的正确用途是初筛:用它把候选范围缩到 3-5 个模型。然后必须自建业务评测集复测——几百条真实 case,覆盖核心意图和边界情况,用统一 prompt 跑候选模型,业务指标加 LLM-as-Judge 加人工抽检三管齐下。再往后是小流量 A/B,看真实用户行为指标。同时测工程指标:P95 延迟、每千 token 成本、并发稳定性。模型选型是「榜单海选、业务集复赛、线上决赛」的三段论,跳过中间环节直接用榜单拍板,翻车的概率很高。

可能的追问

  • 两个模型在你的业务评测集上打平,怎么选? 看工程指标和成本:延迟、单价、上下文窗口、供应商稳定性、合规要求。打平说明能力冗余,决策权交给成本和工程约束。
  • 怎么快速判断一个模型在你的领域被污染过? 构造榜单题目的语义改写版(换数字、换实体、换表述)做对照测试,原题分数远高于改写版就有污染嫌疑;更彻底的做法是全部用自己的私有数据,根本不用公开题。
  • Arena Elo 榜比静态题库更可信吗? 在人类偏好维度更可信,但它测的是「聊起来舒服」,偏风格偏好,不保证事实正确性,也不覆盖代码、工具调用这些硬能力。两者互补,不能互相替代。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.