红队攻防
核心:越狱(Jailbreak)攻防是不对称战争——攻击者只需一个成功手法,防御者要堵住所有缺口。
攻击演进:手工 Prompt(DAN)→ 自动化批量变体(LLM 生成越狱,分钟级上千变体)→ 多轮渐进式(crescendo,逐轮累积有害意图)→ 语言切换绕过(低资源语言对齐弱)
新战场:Agent 越狱后果从"说错话"升级为"做错事"(调 API、执行代码、转资金),防御重心转向系统层——工具最小权限、沙箱、人工审批门
自动化红队框架:微软 PyRIT、NVIDIA garak、DeepTeam、OpenRT(多模态)、OpenART(Agent 专项)
防御纵深:模型拒绝训练 → 独立输入分类器 → 输出分类器(Anthropic Constitutional Classifiers,约 23.7% 开销)→ 攻击特征监控与回滚
残酷数据:12 种已发表的防御在自适应攻击下 90%+ 被绕过;被越狱的模型内部仍产生安全激活信号——"知道"该拒绝但续写惯性压过安全
根因:指令与内容是同一 token 流,无结构性边界;安全是学来的行为而非架构约束,开源权重几百条样本即可微调掉
务实结论:不假设模型不可越狱,而是限制越狱后能做什么;每次模型更新自动跑一轮红队测试(红队市场 2026 约 $2.3B,CAGR 28.8%)
