首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >Agentic RAG >Agentic RAG 的评估指标有哪些?

Agentic RAG 的评估指标有哪些?

词条归属:Agentic RAG

1. RAGAS 核心指标体系

RAGAS(Retrieval Augmented Generation Assessment)是业界广泛采用的 RAG 评测框架,定义了以下核心指标。下表阈值综合 2026 年多家行业基准(DatavLab、Metafied Lab、InfoQ 等)的共识区间,具体取值应结合业务风险容忍度设定:

指标

定义

生产环境常见建议阈值

Faithfulness(忠实度)

生成答案中的声明是否被检索上下文支撑

≥ 0.85(金融、医疗、法律等高风险场景建议 ≥ 0.90)

Answer Relevancy(答案相关性)

生成的答案是否直接回应了用户问题

≥ 0.80

Context Precision(上下文精确率)

检索到的文档中相关文档的占比

≥ 0.75

Context Recall(上下文召回率)

回答问题所需的信息是否被成功检索

≥ 0.80

2. Agentic RAG 特有指标

除通用 RAG 指标外,Agentic RAG 还需要评估以下特有维度:

  • 检索必要性准确率智能体是否正确判断了是否需要检索
  • 工具调用准确率(Tool Call Accuracy):智能体是否选择了正确的工具并传入了合适的参数
  • 多跳成功率:需要多轮检索的问题是否最终获得了完整答案
  • 迭代效率:平均需要多少轮检索才能收敛(过度检索和检索不足都是问题)
  • 每次正确回答的成本:综合 Token 消耗、API 调用次数和延迟

3. 评估实践建议

  • 建立 50~200 条查询的"黄金数据集"作为评估基准,锚定后不随意更新
  • 在 CI/CD 流水线中集成自动化评估,每次修改提示词、检索策略或模型时自动运行
  • 对 5% 的线上流量进行人工抽检,校准自动评估器的偏差
  • 关注趋势而非单次分数,避免对个别异常值过度反应
相关文章
ClickHouse常用的监控指标有哪些?
在前一篇文章《ClickHouse的运行指标监控可以怎么玩?》中,我介绍了怎么利用 ClickHouse 内置的 /metrics 服务,轻松与 Prometheus 和 Grafana 集成。 所以
Nauu
2021-01-07
5.3K0
ChatGPT的评估指标有哪些?微调与上下文学习是否存在相似性?
NLP 分很多的任务,不同的任务有不同的指标来度量模型质量,比如AUC,Precision/Recall是分类模型的度量指标。
叶锦鲤
2023-03-21
1.6K0
【必备】目标检测中的评价指标有哪些?
上期我们一起学习了全卷积神经网络FCN,今天我们看下目标检测中的评价指标都有哪些?
智能算法
2020-05-08
19.5K0
LLM Agent和 Agentic RAG 的最佳综述
代理式检索增强生成(Agentic RAG)通过在RAG管道中嵌入自主代理,代表了人工智能领域的重大飞跃。本仓库补充了综述论文《代理式检索增强生成(Agentic RAG):综述》,提供了以下方面的见解:
致Great
2025-01-22
1.9K0
智胜|从 RAG 到 Agentic RAG:企业 AI 的任务闭环革命
本文揭示了企业 AI 的真正迁移方向:从“模型生成答案”,走向“智能体完成任务”;从“知识增强问答”,走向“知识驱动行动”;从“Prompt 技巧”,走向“可治理、可验证、可迭代的任务闭环”。
凯哥
2026-05-25
4600
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券