反思质量与底层大语言模型的推理能力呈强正相关。只有当模型本身具备足够的领域知识和因果推理能力时,才能生成准确的错误归因和有效的改进建议。这也是 Reflexion 在 GPT-4 上表现出色而在较小模型上效果有限的主要原因。
评估器提供的反馈越具体、越可操作,反思的质量越高。二值信号(通过/失败)配合详细的错误日志(如编译器报错信息、单元测试失败详情)能够为反思模型提供充分的诊断依据。相比之下,模糊的标量奖励难以支撑高质量的归因分析。
结构化反思模板能够显著提升反思的可执行性。推荐采用"失败现象 → 根因分析 → 改进行动"三段式模板,强制反思输出包含具体的约束条件、涉及的工具或 API、以及明确的下一步行动指令,避免生成"下次要更仔细"这类无效的空话。
记忆缓冲区的管理策略直接影响反思的利用率。过于激进的淘汰机制可能丢失关键经验,而过大的缓冲区则会稀释注意力并增加 Token 成本。实践中需要根据任务特点调整记忆容量、去重策略和优先级排序规则。