GraphRAG 的整体流程分为离线索引构建与在线查询检索两大阶段,形成"先建图、再检索"的完整闭环。
GraphRAG 的知识图谱由大语言模型在离线抽取阶段自动构建,无需人工标注,其核心是"文本块 → 图元素 → 图聚合"的三步转化。
GraphRAG 的图索引由三类核心元素构成,分别对应图的节点、边和协变量。
GraphRAG 采用 Leiden 算法进行社区检测,将知识图谱划分为语义内聚的社区群组。
GraphRAG 通过 Leiden 算法生成多层级的社区结构,形成从宏观到微观的层级索引。
GraphRAG 的索引构建是一个多阶段的离线流水线,可通过命令行工具或模块化 Python 工作流执行。
Global Search 是 GraphRAG 面向全局性问题的检索模式,采用 map-reduce 机制在整个语料库范围内进行归纳推理。
GraphRAG 借助知识图谱的路径结构,在多跳推理任务上明显优于纯向量检索方案。
GraphRAG 的索引以批处理方式构建,针对数据变更提供了增量更新能力,但整体更新成本相对较高。
提示词调优直接影响知识图谱的抽取质量,是 GraphRAG 落地中不可忽视的关键环节。
GraphRAG 的索引成本主要来自大语言模型调用,是部署前需要重点规划的部分。
GraphRAG 适用于文档密集、关系复杂的知识管理场景,其价值集中在全局理解与关系推理。
部署 GraphRAG 需要具备一定的工程与大语言模型使用基础,并提前做好成本与环境准备。
传统向量 RAG 擅长事实型局部检索,但在需要全局归纳与关系推理的场景中存在明显短板,GraphRAG 正是针对这些短板提出。
GraphRAG 与 HippoRAG 都属于图增强 RAG 方案,但二者的核心机制与侧重场景有所不同。
LightRAG 是针对 GraphRAG 高索引成本问题提出的轻量化替代方案,二者在成本与能力上各有取舍。