1. 三元组件架构
Reflexion 框架由三个核心模块构成:
- Actor(执行者):基于当前任务和累积的反思记忆生成行为轨迹,通常采用 ReAct 风格的推理-行动循环,调用工具并与环境交互
- Evaluator(评估者):对 Actor 的输出进行评分,可以是二值信号(通过/失败)、启发式规则或另一个大语言模型的评判
- Self-Reflection Model(自反思模型):根据评估结果和失败轨迹,生成自然语言的错误分析和改进建议
2. 迭代学习循环
Reflexion 的工作流程遵循以下循环:
- Actor 执行任务并产生完整的行为轨迹
- Evaluator 对该轨迹进行评分,判断成功或失败
- 若失败,Self-Reflection Model 分析失败原因并生成反思文本
- 反思文本被存入情景记忆缓冲区
- Actor 在下一轮尝试中读取累积的反思记忆,调整策略后重新执行
这一循环持续进行,直到任务成功或达到最大尝试次数。整个过程中模型权重保持冻结,所有"学习"都发生在上下文窗口内。