Chain-of-Thought 是一种单次通过的推理增强技术,通过在答案之前显式生成逐步推理过程来提升单次输出的质量。它相当于给模型一个"先想清楚再回答"的提示,但整个推理链条是线性的、不可回溯的——一旦某一步推理出错,错误会沿着链条向下游传播且无法修正。
Reflexion 则是一种跨多次尝试的学习机制,它不关注单次推理的内部结构,而是关注如何在失败后利用反馈改进下一次尝试的整体策略。它将"犯错"转化为"学习信号",通过迭代逼近正确答案。
CoT 追求的是"一次做对",适合有明确推理路径的问题;Reflexion 追求的是"越做越好",适合可通过迭代优化的复杂任务。
两者并非互斥关系,而是可以在不同层次上协同工作。在实际应用中,最常见的模式是在 Reflexion 的每次 Actor 尝试内部使用 CoT 进行逐步推理,同时在外层通过反思机制实现跨尝试的学习。这种组合既保证了单步推理的质量,又具备了从失败中积累经验的能力。