
共 10 篇文章


考察 AI 产品度量能力:指标体系按北极星、效果、体验、护栏四层搭建,解决率口径容易被刷和误读,要用满意度、复访率、人工介入率交叉验证并分层切片。

考察迭代质量保障能力:prompt 当代码做版本管理、核心指标进 CI 门禁且阈值要大于自然波动、线上走灰度和 shadow 验证、护栏指标异常自动回滚。

考察安全攻防全景:风险分输入攻击(越狱、注入)、输出风险(有害内容、数据泄露)、系统风险(越权调用),防御靠输入输出过滤、护栏模型和权限最小化的分层体系。

考察幻觉治理的工程闭环:检测靠检索对照、NLI 一致性校验和多次采样,监控靠抽样加用户反馈信号,兜底靠引用溯源、低置信拒答和人工接管。

考察对公开榜单的批判性认识:MMLU、HumanEval 等榜单存在数据污染、饱和、分布不匹配问题,正确姿势是榜单初筛加业务自建评测集复测。

考察 RAG 评测指标的定义功底:检索侧召回率、命中率、MRR 的分子分母口径要能说清,生成侧忠实度衡量答案陈述被上下文支撑的比例,RAGAS 是常用落地框架。

考察对 LLM-as-Judge 可靠性的理解:先用人工标注金标准测一致率,再针对位置偏差、冗长偏差、自我偏好做工程矫正,多次采样校验稳定性。

考察评测集工程能力:样本要贴近真实线上分布、量级由统计功效决定而不是拍脑袋、用 holdout 拆分和滚动轮换防过拟合,评测集是需要持续维护的活资产。

考察评测体系的分层设计能力:组件级、链路级、系统级三层评测,上线前用 golden set 做 CI 门禁,上线后靠监控、抽样标注和 badcase 回流形成闭环。