AIGC

行业资讯

AIGC 进阶实战指南(15)

  • 发布时间
  • 点击次数

GraphRAG

问题:传统 RAG 按语义相似度取文本块,只能"找到相似",无法跨文档"追踪关系"——多跳推理、实体消歧、溯源是硬伤。

核心思想:把文档转成实体+关系的知识图谱,检索时沿着关系边"走图",而非只搜相似文本。

构建三步骤

  1. 实体抽取:识别人物/组织/概念/事件

  1. 关系映射:typed edges("管制"、"供应"、"竞争")

  1. 社区检测:Leiden 算法分层聚类 → 各社区生成摘要

数据表现

  • Microsoft 评测:多跳基准 HotpotQA 上 GraphRAG 比纯向量 RAG 高 30-60%

  • 企业内部基准:GraphRAG 86% vs 向量 RAG 32%

  • ACL 2025:答案可溯源到节点/边,幻觉进一步降低,Token 消耗最多省 80%

成本账

  • 索引阶段贵 5-10×(LLM 抽取实体+社区摘要):1000 文档 ≈ 50-200 vs 向量 1-5

  • LazyGraphRAG:查询时才构建社区,索引成本降至全量 1/1000,质量持平

  • 混合路由是 2026 生产最佳实践:简单查询走向量 RAG,多跳问题走 GraphRAG,可保留 85-90% 推理收益、成本接近纯向量

选型工具:Microsoft GraphRAG(开源,研究/中规模)、Neo4j+LangChain(企业生产)、FalkorDB(高性能)、Nano-GraphRAG(轻量实验)

何时不建图:单跳查询为主、文档相互独立、语料日更、无工程能力维护抽取管道。

迁移四步:审计失败查询 → 图与向量库并行构建 → 查询路由分类 → 评估后逐步扩大图查询占比。

结论:图不替代向量库,而是填补"找相似"与"找关联"之间的空白。先向量 RAG,监控多跳失败信号再上图。


JK小助手
转人工 ×