GraphRAG 的整体流程分为离线索引构建与在线查询检索两大阶段,形成"先建图、再检索"的完整闭环。
1. 离线索引构建阶段
- 原始文档首先被切分为若干文本块(TextUnit),作为后续处理的基本单元
- 大语言模型对每个文本块进行实体、关系和声明的抽取,形成结构化的图元素
- 抽取出的实体与关系被聚合为知识图谱,并通过社区检测算法划分为层级化的社区结构
- 系统为每个社区预生成自然语言摘要,构建出可被查询复用的"社区层级索引"
2. 在线查询检索阶段
- 用户提出问题后,系统根据问题类型选择合适的检索模式(Global、Local、DRIFT 或 Basic)
- 检索引擎从知识图谱与社区摘要中定位相关内容,组装为增强上下文
- 大语言模型基于组装后的上下文生成最终回答,并可追溯到具体的实体、关系与源文本
3. 图结构带来的关键变化
- 检索对象从"孤立的文本块"升级为"相互连接的实体与关系网络"
- 通过社区摘要,系统具备了对整个语料库进行全局归纳的能力
- 借助图谱路径,系统能够支撑跨多个文档片段的连续推理