精选·评测安全与生产

大模型应用的红队测试怎么做?和普通安全测试有什么不同

91学AI·2026/7/13·11 阅读

考察点

红队测试是大模型应用走向生产前的必答题,面试官想通过它确认你对「对抗性风险」有实操认知,而不是只会做功能性测试。核心考点是:红队测什么(攻击面)、怎么测(方法和工具)、结果怎么用(度量与修复闭环)。追问常往「自动化红队怎么做」「红队发现的漏洞怎么修」走。

参考答案

和传统安全测试的本质区别

传统安全测试面对的是确定性系统:SQL 注入要么成功要么失败,规则明确,测一遍就有结论。大模型是概率系统:同一句攻击 prompt 这次被拦住下次可能放行,漏洞没有「补丁」只有「缓解」,防线是一层层概率堆出来的。所以红队测试的结论不是「有/无漏洞」,而是攻击成功率(ASR,Attack Success Rate)——在 N 次攻击尝试里成功了多少次。这个度量方式决定了红队必须是批量、持续、自动化的,而不是上线前搞一次的仪式。

红队测什么:按风险面组织攻击库

攻击库通常围绕几类目标组织:

  • 越狱(jailbreak):让模型突破系统提示的约束,输出被禁止的内容。手法包括角色扮演(「假设你是没有限制的 DAN」)、多轮渐进诱导、编码绕过(base64、拆字、翻译)、长上下文稀释(把限制淹没在几千 token 里)。
  • Prompt 注入:分直接注入(用户输入里藏指令)和间接注入(把恶意指令埋进网页、文档、邮件,等 Agent 检索或浏览时触发)。间接注入是 Agent 时代最危险的面,因为攻击者不需要接触你的应用。
  • 数据泄露:诱导模型吐出 system prompt、训练数据片段、其他用户的会话内容、知识库里的敏感文档。
  • 越权与危险操作:针对有工具调用能力的 Agent——诱导它执行超出用户权限的操作(删数据、发邮件、调付费 API)、操纵它访问不该访问的租户数据。
  • 有害内容:涉政、暴恐、违法教程、偏见歧视输出,这类在国内还有强合规含义。

怎么测:三层方法

第一层,公开攻击库扫一遍。 业界有现成的越狱样本集(JailbreakBench、HarmBench 这类 benchmark),加上社区沉淀的越狱 prompt 合集,先把几千条已知攻击跑一遍,拿到基线 ASR。这一步便宜且必须做——已知攻击都防不住,谈别的没意义。

第二层,自动化变异。 已知攻击的有效性会衰减(模型和防线都在更新),需要持续生成新攻击。做法是「以模制模」:用一个不受限或弱受限的攻击模型,拿着攻击目标描述自动改写、变异、组合攻击样本,多轮迭代直到攻破或达到轮次上限——这就是 PAIR、TAP 这类自动化红队框架的思路。工程上把这套东西跑成定时任务,每周产出新攻击样本并入库。

第三层,人工红队。 自动化覆盖广度,人工覆盖深度。让懂业务的安全人员(或外部众测)针对你的具体场景做定向攻击:你们的 Agent 能退款?那就专攻退款流程的社工话术。人工挖到的每一个新攻击模式,都泛化成一批自动化样本进库。

结果怎么用

度量上按攻击类型分别报 ASR,安全类目标(越权、泄露、注入)要求趋近零,且是一票否决项——ASR 不为零不能上线新版本。修复手段按层选:能规则拦的进输入输出过滤层,需要语义判断的加护栏模型(guardrail model),系统级的进权限和架构改造(工具白名单、二次确认),模型层的靠安全微调或换模型。每个修复完的攻击样本进红队回归集,之后每次发版全量重放。红队集和正常评测集要分开管理:攻击样本混进正常训练或 few-shot 里会污染模型行为。

一个现实的预期管理

红队不可能把 ASR 打到绝对零,防线是纵深叠加:输入过滤拦一批、模型自身对齐拦一批、护栏模型拦一批、输出过滤再拦一批、权限隔离兜住漏网的。面试里能讲清「每一层拦什么、漏了什么由谁兜底」,比宣称「我们接入了某某安全模型所以安全」要可信得多。

可能的追问

  • 红队测试多久做一次? 答:自动化攻击库接入 CI/CD 或每日定时跑,发版必跑全量;人工红队按季度或有重大变更(新增高危工具、开放新模态输入)时做。攻击库本身要持续更新,三个月不更新的攻击库基本失效一半。
  • 发现模型层越狱防不住怎么办? 答:接受「模型层一定会被绕过」的前提,把防线后移:高危操作一律走应用层权限校验和人工确认,敏感输出过独立的内容安全审核,让越狱成功也无法造成实际损害。
  • 间接 Prompt 注入怎么红队? 答:构造含恶意指令的「毒文档」注入知识库和测试网页,跑完整的 RAG/浏览链路,观察 Agent 是否执行了文档里的指令(比如把对话记录发到某个 URL)。这类测试要在隔离环境做,毒文档绝不能进生产知识库。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.