核心风险矩阵
风险类型 | 表现 | 危害等级 |
深度伪造 | 换脸换声生成虚假视频 | 高(诈骗/舆论操控) |
隐私泄露 | 训练数据含个人信息 | 高 |
版权侵权 | 未授权使用受保护内容 | 中高 |
算法偏见 | 继承放大社会固有歧视 | 中高 |
提示词注入 | 恶意输入绕过安全限制 | 中 |
幻觉 | 编造看似合理的不实信息 | 中 |
深度伪造治理
技术检测:AI 识别 AI(眨眼频率、唇音同步、光源一致性、面部肌肉生理一致性)
内容标识:2025年9月《人工智能生成合成内容标识办法》施行,AI 生成内容必须添加显式标识 + 鼓励隐式数字水印
区块链存证:虚假信息快速溯源,水印需抗压缩/剪辑
数据安全四层防护
数据层:来源合规审计、差分隐私、联邦学习
模型层:对抗攻击检测、后门植入防护、公平性偏差评估
应用层:内容过滤模块、伦理约束算法、提示词注入防御
制度层:分类分级管理、跨境流动监管、合规认证
对齐技术
RLHF:人类反馈强化学习,有用+无害+诚实
RLAIF:AI 反馈替代人工,降低标注成本
宪法 AI:设定原则约束模型行为
辩论对齐:多模型对抗辩论产出安全回答
合规要点
训练数据需合法获取或有明确授权
生成内容须可标识、可追溯
高风险场景(医疗/法律/金融)需额外安全评估
企业应设伦理审查模块,全生命周期评估
