AIGC

行业资讯

AIGC模式解析(16)

  • 发布时间
  • 点击次数

红队攻防

核心:越狱(Jailbreak)攻防是不对称战争——攻击者只需一个成功手法,防御者要堵住所有缺口。

  • 攻击演进:手工 Prompt(DAN)→ 自动化批量变体(LLM 生成越狱,分钟级上千变体)→ 多轮渐进式(crescendo,逐轮累积有害意图)→ 语言切换绕过(低资源语言对齐弱)

  • 新战场:Agent 越狱后果从"说错话"升级为"做错事"(调 API、执行代码、转资金),防御重心转向系统层——工具最小权限、沙箱、人工审批门

  • 自动化红队框架:微软 PyRIT、NVIDIA garak、DeepTeam、OpenRT(多模态)、OpenART(Agent 专项)

  • 防御纵深:模型拒绝训练 → 独立输入分类器 → 输出分类器(Anthropic Constitutional Classifiers,约 23.7% 开销)→ 攻击特征监控与回滚

  • 残酷数据:12 种已发表的防御在自适应攻击下 90%+ 被绕过;被越狱的模型内部仍产生安全激活信号——"知道"该拒绝但续写惯性压过安全

  • 根因:指令与内容是同一 token 流,无结构性边界;安全是学来的行为而非架构约束,开源权重几百条样本即可微调掉

  • 务实结论:不假设模型不可越狱,而是限制越狱后能做什么;每次模型更新自动跑一轮红队测试(红队市场 2026 约 $2.3B,CAGR 28.8%)


JK小助手
转人工 ×