试错阶段由 Actor 主导,基于当前任务和已有的反思记忆执行任务,生成完整的行为轨迹。这一阶段允许智能体自由探索解决方案空间,即使可能犯错——犯错本身正是 Reflexion 学习的起点。Actor 通常采用 ReAct 风格的推理-行动交替模式,在每一步生成思考痕迹并调用相应的工具或环境动作。
当试错失败后,自反思模型接管处理。它接收两个关键输入:完整的执行轨迹和评估器提供的反馈信号。在此基础上,反思模型完成三项工作:
这一阶段的价值在于将稀疏的数值反馈(如"失败")转化为稠密的语义指导信号。
规划阶段并非独立于 Actor 的额外模块,而是体现在 Actor 下一轮尝试的策略调整中。具体而言:
这种"反思指导规划"的机制使得 Reflexion 能够在不修改模型权重的前提下实现策略优化。