传统强化学习依赖标量奖励信号(如 +1/-1)来指导策略更新,这种信号虽然精确但信息密度极低——它只告诉智能体"做对了"或"做错了",却不说明"为什么错"以及"如何改正"。Reflexion 的核心创新正是将这种稀疏的数值反馈转化为稠密的自然语言反馈,使智能体能够获得具有语义内容的指导信号。
Reflexion 框架设计的关键优势在于其能够灵活整合多种来源和类型的反馈信号:
自反思模型不仅仅是翻译器,它还承担着"信号放大器"的角色。一个二值的失败信号(如单元测试未通过)经过反思模型的加工后,可以扩展为一段包含错误定位、根因分析和改进方向的结构化文本。这种放大效应使得智能体能够从极简的反馈中提取出丰富的学习信号,显著提升了样本效率。