GraphRAG
问题:传统 RAG 按语义相似度取文本块,只能"找到相似",无法跨文档"追踪关系"——多跳推理、实体消歧、溯源是硬伤。
核心思想:把文档转成实体+关系的知识图谱,检索时沿着关系边"走图",而非只搜相似文本。
构建三步骤
实体抽取:识别人物/组织/概念/事件
关系映射:typed edges("管制"、"供应"、"竞争")
社区检测:Leiden 算法分层聚类 → 各社区生成摘要
数据表现
Microsoft 评测:多跳基准 HotpotQA 上 GraphRAG 比纯向量 RAG 高 30-60%
企业内部基准:GraphRAG 86% vs 向量 RAG 32%
ACL 2025:答案可溯源到节点/边,幻觉进一步降低,Token 消耗最多省 80%
成本账
索引阶段贵 5-10×(LLM 抽取实体+社区摘要):1000 文档 ≈
50-200 vs 向量1-5
LazyGraphRAG:查询时才构建社区,索引成本降至全量 1/1000,质量持平
混合路由是 2026 生产最佳实践:简单查询走向量 RAG,多跳问题走 GraphRAG,可保留 85-90% 推理收益、成本接近纯向量
选型工具:Microsoft GraphRAG(开源,研究/中规模)、Neo4j+LangChain(企业生产)、FalkorDB(高性能)、Nano-GraphRAG(轻量实验)
何时不建图:单跳查询为主、文档相互独立、语料日更、无工程能力维护抽取管道。
迁移四步:审计失败查询 → 图与向量库并行构建 → 查询路由分类 → 评估后逐步扩大图查询占比。
结论:图不替代向量库,而是填补"找相似"与"找关联"之间的空白。先向量 RAG,监控多跳失败信号再上图。
