零样本提示(Zero-shot Prompting)要求模型一次性生成正确答案,没有任何纠错机制。在多步推理任务中,任何一步的错误都会向下游传播并放大,最终导致完全错误的结果。Reflexion 通过迭代试错打破了这一脆弱性——即使第一次尝试在某一步出错,反思机制能够识别错误并将其作为经验传递给后续尝试,从而逐步收敛到正确路径。
零样本提示本质上是对策略空间的一次随机采样,成功率完全取决于模型的先验知识。Reflexion 则通过反思记忆实现了有指导的策略搜索:每次失败都会缩小有效策略空间,排除已知的错误路径。在 HotpotQA 多跳问答基准上,CoT + Reflexion 将精确匹配率从 61% 提升至 75%,这一 14 个百分点的增益直接来源于反思对错误推理路径的有效剪枝。
多步推理任务中,模型往往具备解决问题所需的知识,但无法在单次前向传播中正确组织和调用这些知识。Reflexion 的反思过程迫使模型将这些隐性的推理能力显式化为自然语言规则,例如"在回答多跳问题时,应先验证每个子问题的证据来源是否可靠"。这些显式化的规则随后作为额外的上下文引导后续尝试,相当于在推理过程中动态生成了定制化的思维模板。
零样本提示对所有难度的问题采用相同的处理方式,而 Reflexion 能够根据任务的难度自适应地调整尝试次数。简单问题可能在第一次尝试就成功,复杂问题则通过多轮反思逐步逼近。这种弹性使得整体资源分配更加高效——不在简单问题上浪费额外计算,同时在困难问题上投入足够的推理预算。