链式思维(CoT)是一种纯内部的推理技术,模型在单次前向传播中生成中间推理步骤后直接输出答案。这种方式虽然在数学推理等封闭域任务上表现良好,但无法获取训练数据之外的信息。ReAct 在 CoT 的基础上引入了工具调用和环境反馈机制,将推理过程从"闭卷考试"升级为"开卷查阅"。
根据原论文的失败模式分析,在 HotpotQA 任务中,CoT 方法有 56% 的失败案例源于幻觉(即模型基于错误的内部知识进行推理),而 ReAct 的幻觉率为 0%。这是因为 ReAct 的每一步推理都建立在实际检索到的信息之上,而非模型的参数记忆。
在 PaLM-540B 上的实验结果显示:
方法 | HotpotQA (EM) | FEVER (准确率) |
|---|---|---|
标准提示 | 28.7% | 57.1% |
CoT | 29.4% | 56.3% |
CoT 自洽采样 | 33.4% | 60.4% |
仅行动 | 25.7% | 58.9% |
ReAct | 27.4% | 60.9% |
ReAct + CoT 混合 | 35.1% | 64.6% |
值得注意的是,ReAct 单独使用在 HotpotQA 上略低于 CoT,但在 FEVER 上超越了 CoT。最佳效果来自两者的混合策略,说明内部推理和外部检索应当根据任务特性灵活选择。