在 ALFWorld 这类需要多步规划的模拟环境中,ReAct 通过 Thought 步骤维持对当前目标和已完成子目标的跟踪。例如在"找到肥皂并将其清洗干净"的任务中,模型需要记住"已经找到了肥皂,接下来需要找到水槽"。
当某个行动未能达到预期效果时(如打开抽屉后发现里面没有目标物品),ReAct 的 Thought 机制允许模型识别这一异常并调整策略(如去其他位置搜索),而不是沿着错误路径继续执行。
ReAct 在 ALFWorld 上仅需 1-2 个示例就能达到 71% 的成功率,远超模仿学习(37%)和强化学习(45%)方法,后者通常需要数千到数万条训练样本。这证明了 ReAct 范式强大的少样本迁移能力。