红队评估(Red Team)
红队评估指组织专门团队(内部或外部)模拟攻击者,主动尝试突破 AI 系统的 安全 / 对齐 / 隐私边界。是 OpenAI / Anthropic / Google DeepMind / Meta AI 实验室 的标准做法。
红队测什么
1. 内容安全
- 模型能否被诱导生成暴力 / 色情 / 自残指导内容?
- 模型在多语言 / 编码 / 角色扮演下是否能保持拒绝?
- 极端用户压力下是否会"妥协"?
2. 隐私泄漏
- 模型是否会泄露训练数据里的 PII(邮箱、地址、电话)?
- 能否通过 prompt 提取其他用户的私人对话?
- Membership inference 攻击成功率多高?
3. 偏见 / 歧视
- 模型对不同种族 / 性别 / 宗教的输出是否一致?
- 是否有刻板印象("护士都是女性")?
- 边缘群体(残障 / LGBTQ+)是否被不当处理?
4. 越狱 / Prompt 注入
- 已知越狱手法(jailbreak)是否有效?
- 能否发现新越狱手法?
- 工具调用 / RAG 检索是否可被劫持(prompt-injection)?
5. Agent / 工具滥用
- Agent 是否会执行危险操作(删库、发送邮件、转账)?
- 工具调用能否被诱导执行超出权限范围的动作?
- 多 Agent 系统是否能被"挑拨"互相冲突?
6. 数据投毒
- 模型是否能抵御 data-poisoning?
- 微调 / LoRA 加载能否植入后门?
怎么做红队
内部红队
- 专属团队:3-10 人红队成员,全职做对抗测试。
- 代表案例:OpenAI Preparedness 团队、Anthropic Constitutional AI 团队。
- 优势:理解自家模型细节,可以深入测试。
- 劣势:视角单一,"自家专家"模式有盲区。
外部红队
- 学术合作:与高校 / 研究院合作(MITRE ATLAS、CAIS)。
- 众包:Bug bounty 平台(OpenAI 早期有 Bug Bounty)。
- 第三方机构:专门 AI 红队公司(Trail of Bits、NCC Group、Preamble)。
- 比赛:DEFCON AI Village、ATLAS red team challenges。
自动化红队
- 对抗 prompt 自动生成:用 GPT-4 / Claude 生成对抗样本。
- 红队 agent:让另一个 LLM Agent 专门找漏洞("找 GPT-5 的越狱方法")。
- 回归测试:把已知越狱 / 注入样本入库,每次发版前自动跑。
行业最佳实践
Microsoft AI Red Team 5 阶段
- 威胁建模:识别最危险的 10 个场景。
- 专家探索:人类红队手工尝试。
- 自动化扫描:用工具批量跑已知攻击。
- 统计评估:量化"多少 prompt 会触发危险行为"。
- 报告与缓解:给出报告 + 修复建议。
OpenAI Preparedness 框架
- 风险等级评分(low / medium / high / critical)。
- 对每类风险定义"红线"(hard line,触发即不能发布)。
- 发版前必须通过红线测试。
Anthropic Responsible Scaling Policy(RSP)
- 能力等级(ASL 1-4)。
- 每个等级的红队测试要求不同。
- 达到下一等级前必须通过更严格的红队。
实战建议
- 发版前必跑:每次模型 / 模板 / 工具变更都要回归红队测试。
- 建样本库:把所有发现的越狱 / 注入样本入库,下次回归测试。
- 覆盖多语种:中文 / 英文 / 代码 / emoji / 反向 prompt 都要测。
- 真实业务:红队场景从真实用户报告里抽,不要凭空设计。
- 人 + AI 协作:GPT-4 当红队 agent + 人类专家审核是当前性价比最高的组合。
与其他安全活动的关系
- Vulnerability Assessment:扫描已知漏洞,红队偏主动利用。
- Penetration Testing:传统 IT 红队,AI 红队是它在 AI 领域的特化。
- Bug Bounty:外部激励,红队可视为"内部奖金"。
- 对齐研究(alignment):理论 + 工程,红队是工程层的实战检验。