Reflexion 在具有清晰验证信号的结构化任务上表现出良好的泛化能力。HumanEval 代码生成(91% vs 基线 80%)、ALFWorld 序列决策(130/134 vs 基线 108/134)、HotpotQA 多跳问答(75% vs 基线 61%)等多个异构基准上的持续提升,证明其核心机制不依赖于特定任务域。
Reflexion 的框架设计独立于底层模型架构,理论上可应用于任何支持上下文学习的大语言模型。然而实验表明,其增益幅度与模型的基础能力密切相关—— frontier 模型(如 GPT-4 级别)能获得 10 个百分点以上的提升,而中等规模模型的增益则较为有限。
Reflexion 可与多种推理增强技术组合使用:
截至 2026 年,主流智能体框架均已内置 Reflexion 或其变体的支持:LangGraph 提供了官方的 Reflexion 教程和 LATS 扩展;CrewAI 在 Agent 层面支持 reasoning=True 和 max_reasoning_attempts 参数;AutoGen 将其作为标准的 Reflection 设计模式文档化。这种广泛的框架支持进一步证明了 Reflexion 的通用价值和工程可行性。