在长周期多步任务中,最终失败往往源于早期某一步的错误决策,而中间步骤可能看起来都合理。这种非局部信用分配问题使得反思诊断变得困难——智能体需要准确定位"哪一步开始出错"以及"为什么那一步是错的"。
Reflexion 的自反思模型接收完整的执行轨迹作为输入,而非仅看最终结果。这使得它能够:
在 ALFWorld 这类需要 10 步以上操作的序列决策任务中,Reflexion 经过 12 次尝试后解决了 130/134 个任务,显著优于 ReAct 基线的 108/134。这表明反思机制确实能够帮助智能体在长周期任务中纠正早期错误。但在 WebShop 这类需要大量探索和多样性的任务中,Reflexion 未能带来明显提升,说明当失败模式难以用语言精确归因时,反思的效果会受限。