Reflexion 的效果高度依赖于 Evaluator 的质量。当评估信号模糊或不可靠时,反思可能基于错误的归因而误导后续尝试。MBPP 基准上的性能下降(从 80.1% 降至 77.1%)就是一个典型案例——智能体生成的单元测试存在较高假阳性率,导致其过早判定尝试成功。
当底层模型缺乏足够的领域知识来区分正确与错误时,可能产生"幻觉式改进"——智能体自信地诊断出一个不存在的错误原因,并在下一轮中应用无效的修正方案。这种情况在模型能力低于 GPT-4 级别时尤为明显,starchat-beta 的实验结果显示其使用 Reflexion 后相对基线没有任何提升。
对于缺乏明确验证信号的任务(如创意写作、开放式研究探索),反思容易退化为空洞的套话,无法提供可执行的改进指导。WebShop 任务的失败也印证了这一点——当失败模式是"在庞大搜索空间中探索了错误区域"时,告诉智能体"下次尝试不同的搜索词"并不能有效收敛。
Reflexion 不会改变模型权重,所有学到的内容仅存在于当前会话的上下文窗口中。一旦会话结束,积累的反思记忆即告丢失。要实现跨会话的持续学习,必须借助外部持久化存储机制。
两项 2026 年的独立研究对 Reflexion 的实际表现提出了更审慎的评估: