ReAct(Reason + Act)是当前最广泛采用的单 Agent 规划模式。它在每一步都要求模型先显式表达推理过程,再选择并执行一个动作,然后观察结果并进入下一轮循环。这种模式的优点是透明度高、调试方便,适用于大多数需要工具调用的开放型任务。
该模式将规划与执行分离为两个阶段:首先由规划器生成完整的步骤列表,然后由执行器按序实施。相比 ReAct 的逐步决策,Plan-and-Execute 在处理长周期任务时更具一致性,因为执行阶段不会偏离初始规划的大方向。
ReWOO(Reasoning WithOut Observation)预先计算包含占位符的执行计划,然后并行执行所有工具调用,最后将结果代入得到最终答案。对于可并行化的工作负载(如同时检索多个信息源),ReWOO 比串行的 ReAct 循环效率高出数倍。
Tree-of-Thoughts 将推理过程建模为树形搜索:Agent 生成多个候选方案,对每个方案评分,扩展有希望的分支并剪除表现不佳的路径。这种方法在复杂推理任务上显著优于 ReAct,但计算成本也高出 10 到 50 倍,通常只在高价值场景中采用。
Reflexion 在每次尝试失败后生成自然语言的反思总结并存入记忆,供下一次尝试参考。实验表明该方法可将 HumanEval 代码基准的通过率从 80% 提升至 91%。它特别适合具有明确成功/失败信号且允许多次尝试的任务场景。