1. 迭代循环失控
Agentic RAG 的自主迭代特性带来了独特的风险:
- 无限循环:智能体可能陷入反复检索而无法收敛的循环,持续消耗资源
- 错误强化:如果初始检索方向错误,后续的迭代可能不断强化错误路径
- 缓解措施:设置最大迭代次数硬限制、超时控制和成本预算约束
2. 延迟与成本显著增加
Agentic RAG 的性能开销远高于传统 RAG:
- 延迟:标准 RAG 查询通常 1~2 秒完成,Agentic RAG 经过 3~4 轮迭代可能需要 8~15 秒
- 成本:每轮迭代涉及多次 LLM 调用(规划、评估)和检索调用,单次查询成本是标准 RAG 的 3~10 倍
- 缓解措施:通过查询分类器将简单查询路由到标准 RAG 管线,仅对复杂查询启用 Agentic 循环
3. 调试与可观测性困难
多步骤的迭代过程使问题定位变得复杂:
- 难以追溯是哪一轮检索引入了错误信息
- 智能体的决策逻辑可能不透明
- 需要专门的追踪工具(如 LangSmith、Arize Phoenix、Langfuse)记录每一步的状态
4. 提示注入攻击面扩大
多轮检索增加了提示注入的攻击面:
- 检索到的文档中可能包含恶意指令,影响智能体的后续决策
- 跨多轮迭代的攻击可能逐步引导智能体偏离预期行为
- 需要对所有检索内容进行输入清洗和安全过滤
5. 评估可靠性挑战
- 使用 LLM 作为评估器(LLM-as-Judge)存在循环依赖——可能产生幻觉的模型同时也在评估检索质量
- 评估器自身的偏差可能导致"虚假充分"判定,跳过本应进行的检索