首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >Reflexion >Reflexion 的三阶段循环(试错、反思、规划)分别做什么?

Reflexion 的三阶段循环(试错、反思、规划)分别做什么?

词条归属:Reflexion

1. 试错阶段(Trial)

试错阶段由 Actor 主导,基于当前任务和已有的反思记忆执行任务,生成完整的行为轨迹。这一阶段允许智能体自由探索解决方案空间,即使可能犯错——犯错本身正是 Reflexion 学习的起点。Actor 通常采用 ReAct 风格的推理-行动交替模式,在每一步生成思考痕迹并调用相应的工具或环境动作。

2. 反思阶段(Reflection)

当试错失败后,自反思模型接管处理。它接收两个关键输入:完整的执行轨迹和评估器提供的反馈信号。在此基础上,反思模型完成三项工作:

  • 错误归因:定位导致失败的关键决策点,区分是策略性错误还是执行层面的偶然失误
  • 经验抽象:将具体的失败案例提炼为可复用的通用原则,例如从"在容器 A 中没找到钥匙"上升为"应该系统性地搜索所有可能位置而非重复检查同一处"
  • 改进指令生成:产出面向下一轮尝试的可执行建议,以自然语言形式写入反思记忆

这一阶段的价值在于将稀疏的数值反馈(如"失败")转化为稠密的语义指导信号。

3. 规划阶段(Planning)

规划阶段并非独立于 Actor 的额外模块,而是体现在 Actor 下一轮尝试的策略调整中。具体而言:

  • Actor 将累积的反思记忆作为额外的上下文条件注入提示中,直接改变其策略分布
  • 反思中的改进指令引导 Actor 优先选择之前未尝试或已验证有效的行动路径
  • 随着多轮迭代,反思记忆的积累使 Actor 的策略逐步收敛到高效的问题解决路径

这种"反思指导规划"的机制使得 Reflexion 能够在不修改模型权重的前提下实现策略优化。

相关文章
从零构建能自我优化的AI Agent:Reflection和Reflexion机制对比详解与实现
AI能否像人类一样从错误中学习?反思型Agent系统不仅能生成回答,还会主动审视自己的输出,找出问题并持续改进。
deephub
2025-11-15
1.7K0
Reflexion:让AI智能体学会反思的神奇技术
每次小R犯错之后,你跟它说"你这样做不对,应该那样做",它点头如捣蒜:"好的好的,我记住了!"结果下次遇到同样问题,它还是犯一模一样的错误,就像得了健忘症一样。
martinzh7
2025-09-01
6180
AI Agent 系统设计避坑指南:从业界论文到工程实践
作者:云与数字化 来源:AI Agent 架构设计实战笔记 01 背景:为什么 Agent 比你想象的更容易踩坑 ChatGPT 之后,生成式 AI 的第二波浪潮指向了一个共同方向:AI Agent(AI 智能体)。 从 AutoGPT、BabyAGI 到如今各企业自研的 Copilot 助手,Agent 架构正在快速落地。但现实很骨感:大量团队在构建 Agent 系统时,经历了相似的痛苦循环—— 建好了,跑不通;跑通了,容易死循环;不死循环了,发现结果全是幻觉。 这不是个别团队的问题。IBM、Microsoft、Neudesic 的工程师联合发布的这篇论文 [「The Landscape of Emerging AI Agent Architectures」](arXiv:2404.11584)系统梳理了当前 Agent 架构的现状和陷阱。本文结合这篇论文的核心结论,加上工程实践,整理出一份完整的 Agent 设计避坑手册。 02 基础认知:Agent = Brain + Perception + Action 在开始设计之前,先把 Agent 的本质搞清楚。 一个最小可用的 AI Agent 由三个部分构成: 组件 作用 类比 Brain 大语言模型,负责推理和决策 人类大脑 Perception 感知环境反馈、用户输入 感官系统 Action 调用工具、操作外部系统 手脚 很多设计失败的 Agent,本质上是把"大模型套了个壳"就叫做 Agent。但没有规划(Planning)、没有工具调用(Tool Calling)、没有反思(Reflection)能力的,本质上还是"高级聊天机器人",不是 Agent。 03 架构选型:单 Agent 还是多 Agent? 这是第一个需要做对的选择。 单 Agent 适用场景 - 任务目标清晰,步骤可枚举 - 反馈来源是环境或用户,不需要其他 Agent 提供信息 - 工具集合有限,执行路径相对固定 典型案例:代码审查 Agent、产品文档写作 Agent 多 Agent 适用场景 - 任务需要多个专业能力(搜索 + 写作 + 代码执行) - 存在多个可并行的独立子任务 - 需要协作、讨论和多方校验 论文原文:While single agent architectures excel when problems are well-defined and feedback from other agent-personas or the user is not needed, multi-agent architectures tend to thrive more when collaboration and multiple distinct execution paths are required. 多 Agent 两种拓扑 垂直架构(Vertical):一个 Leader Agent 负责分配任务,其他 Agent 向 Leader 汇报。 Leader Agent / | \ Agent1 Agent2 Agent3 (专业化分工,清晰汇报线) 水平架构(Horizontal):所有 Agent 平等协作,共享同一个讨论线程,各自认领任务。 Agent A ←→ Agent B ←→ Agent C (平等协作,适合需要大量讨论的场景) 论文中一个关键发现值得单独提出:有明确 Leader 的团队,比无 Leader 团队快近 10%。 在没有 Leader 的情况下,Agent 们会把 50% 的时间花在互相"发指令"上,而不是真正执行任务。 04 任务拆分:如何把大任务变成可执行的子任务 这是 Agent 系统中最核心、也最容易做错的一步。 任务拆分的 5 种方法 论文引用了人类自动驾驶规划领域的研究,总结出 5 条路线: ① Task Decomposition(任务分解) 把大任务递归拆解为子任务树。这是最基础的方法,也是大多数团队第一时间想到的。 关键原则:每个子任务必须原子化——有明确输入输出,可独立执行验证。拆分深度一般控制在 2-3 层,过深的规划链会显著增加执行出错的概率。 ② Multi-plan Selection(多计划选择) 不急着拆解,而是让 LLM 一次性生成 N 个候选计划,通过 Evaluator 评估后选择最优路径。适合需求模糊、方向不确定的场景。 ③ External Module-aided(外部模块辅助) LLM 不自己负责规划,而是翻译成专用模块可理解的格式,交给外部规划器执行。 论文特别指出:在机器人规划任务上,"纯 LLM 目前缺乏直接将自然语言指令转换为可执行计划的能力"。结合 PDDL(Planning Domain Definiti
heidsoft
2026-07-02
2630
智能体|AI Agent 框架介绍
智能体 Agent 核心是通过与环境交互更好的完成用户的指令或任务。一个合格的智能体应该具有那些能力,这些能力面临何种困难,又有那些的解决方案。为建立起Agent的知识体系,本文围绕Agent的框架主要介绍:
AI老马
2026-01-13
1.8K0
当GPT-4反思自己错了:性能提升近30%,编程能力提升21%
机器之心报道 机器之心编辑部 GPT-4 的思考方式,越来越像人了。 人类在做错事时,会反思自己的行为,避免再次出错,如果让 GPT-4 这类大型语言模型也具备反思能力,性能不知道要提高多少了。 众所周知,大型语言模型 (LLM) 在各种任务上已经表现出前所未有的性能。然而,这些 SOTA 方法通常需要对已定义的状态空间进行模型微调、策略优化等操作。由于缺乏高质量的训练数据、定义良好的状态空间,优化模型实现起来还是比较难的。此外,模型还不具备人类决策过程所固有的某些品质,特别是从错误中学习的能力。 不过现在
机器之心
2023-03-29
4530
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券