幻觉治理
新共识(2025-2026):幻觉是概率模型的结构性属性(数学上已证明不可根除),目标从"零幻觉"转向校准的不确定性——错得少、错得可见。
两类幻觉
Factuality 错误:凭空捏造事实(编造统计数据、引文)
Faithfulness 错误:扭曲给定材料(摘要里塞原文没有的结论)
检测技术
Span 级验证:把回答拆成原子断言,逐条对照检索证据(RAG 必配)
语义熵:同一问题多次采样,答案语义发散 = 高幻觉信号,闭源模型可用
内部探针(CLAP/MIND):在模型激活层挂轻量分类器,实时打标,无需外部真值
Best-of-N 事实性重排:生成多个候选,选最忠实的一个
缓解手段(按 ROI 排序)
RAG 接地:降低幻觉 30-70%,但检索内容仍需验证
联网搜索:GPT-5 错误率 12%→6%
针对性偏好微调:构造易幻觉样本做 DPO,降 90%+
约束解码:强制 JSON schema,结构上杜绝自由捏造
GraphRAG:结构化查询替代"文本拼凑+模型自己算",无数据时诚实返回空
多 Agent 交叉验证:执行者/校验者/评审者角色分离
无效操作:调 temperature 几乎没用;超长 Prompt 反而 +10% 错误;无验证的 CoT 在复杂任务上幻觉 +12%。
生产底线:高风险输出必过验证层;每次幻觉按事故复盘(检索为何失败/哪条规则能拦);展示置信度与来源链接,允许"我不知道"。
数据参考:法律 AI 幻觉率 17-34%;AI 生成文献综述幻觉率约 60%;GPT-5 思考模式医疗幻觉 1.6%(仍是 60 次一错)。
