RAGAS(Retrieval Augmented Generation Assessment)是业界广泛采用的 RAG 评测框架,定义了以下核心指标。下表阈值综合 2026 年多家行业基准(DatavLab、Metafied Lab、InfoQ 等)的共识区间,具体取值应结合业务风险容忍度设定:
指标 | 定义 | 生产环境常见建议阈值 |
|---|---|---|
Faithfulness(忠实度) | 生成答案中的声明是否被检索上下文支撑 | ≥ 0.85(金融、医疗、法律等高风险场景建议 ≥ 0.90) |
Answer Relevancy(答案相关性) | 生成的答案是否直接回应了用户问题 | ≥ 0.80 |
Context Precision(上下文精确率) | 检索到的文档中相关文档的占比 | ≥ 0.75 |
Context Recall(上下文召回率) | 回答问题所需的信息是否被成功检索 | ≥ 0.80 |
除通用 RAG 指标外,Agentic RAG 还需要评估以下特有维度: