
精选·评测安全与生产2026-07-13
设计一个大模型应用的安全架构,要考虑哪些层面
大模型应用安全架构按五层展开:接入层过滤、模型层对齐、编排层权限收敛、数据层隔离、运营层监控响应,核心假设是模型不可信。
91学AI·8 阅读
共 11 篇文章

大模型应用安全架构按五层展开:接入层过滤、模型层对齐、编排层权限收敛、数据层隔离、运营层监控响应,核心假设是模型不可信。

Agent 可观测性的核心是完整 trace:跨步关联的调用链、按步维度的质量与成本指标、以及支撑归因分析的检索与告警体系。

上线前靠三层评测集加发布门禁,上线后靠灰度、影子测试、线上抽检和持续回归,把大模型应用的不确定性管成工程流程。

内容安全要输入输出双侧把关:敏感词兜底、分类模型主力、大模型审核语义级风险,加上变体对抗、兜底话术和审计留痕。

按威胁面梳理 OWASP LLM Top 10 核心风险,重点讲注入、泄露、供应链、过度代理四项的工程含义与对应缓解措施。

Prompt 注入分直接与间接两类,本质是模型分不清指令和数据;防御靠输入过滤、上下文隔离、工具权限收敛、输出审计的纵深体系。

红队测试用攻击者视角主动构造越狱、注入、越权、泄露样本,覆盖 OWASP 风险面,按攻击成功率度量并接入发布门禁。

badcase 体系的关键是闭环:线上多渠道收集、按错误类型归因打标、修复后入评测集回归,让每一次线上事故都变成评测资产。

LLM-as-Judge 有位置偏差、冗长偏差、自我偏好等问题,通过成对比较、打乱顺序、rubric 细化、人工校准和一致性监控把可信度提上来。

结果评估看终局对错,轨迹评估看每一步决策质量;只评结果会漏掉运气分和隐患,只评轨迹则失去业务锚点,两者结合才能归因。

讲清 Agent 评估的四层指标体系:任务成功率、轨迹质量、效率与成本、安全合规,以及离线评测集与线上影子测试的组合打法。