
评测与安全2026-07-26
主流 benchmark 有哪些?为什么不能只看 benchmark 选模型?
考察对公开榜单的批判性认识:MMLU、HumanEval 等榜单存在数据污染、饱和、分布不匹配问题,正确姿势是榜单初筛加业务自建评测集复测。
91学AI·11 阅读
共 2 篇文章

考察对公开榜单的批判性认识:MMLU、HumanEval 等榜单存在数据污染、饱和、分布不匹配问题,正确姿势是榜单初筛加业务自建评测集复测。

考察模型选型的决策框架:从任务、成本、部署方式、合规四个维度收敛候选,以及 Qwen(全尺寸开源生态)与 DeepSeek(MoE 性价比)的实际差异。