
公司真题库2026-07-26
【快手】做模型评测,初期怎么增加评测维度?评测数据集怎么建立?
快手大模型评测一面真题:考评测体系从 0 到 1 的搭建。核心是评测维度的扩展路径、数据集的构建来源与质量控制。
91学AI·7 阅读
共 4 篇文章

快手大模型评测一面真题:考评测体系从 0 到 1 的搭建。核心是评测维度的扩展路径、数据集的构建来源与质量控制。

考察对 LLM-as-Judge 可靠性的理解:先用人工标注金标准测一致率,再针对位置偏差、冗长偏差、自我偏好做工程矫正,多次采样校验稳定性。

考察评测体系的分层设计能力:组件级、链路级、系统级三层评测,上线前用 golden set 做 CI 门禁,上线后靠监控、抽样标注和 badcase 回流形成闭环。

考察 RAG 效果度量体系:检索层指标(Recall@K、MRR)与生成层指标(忠实度、答案相关性)分开评,评测集从真实日志构造,baseline 逐级消融。