传统强化学习需要通过梯度下降更新模型参数,这需要大量训练样本和昂贵的计算资源。Reflexion 另辟蹊径,将策略更新从参数空间转移到语言空间——智能体不修改权重,而是通过在上下文中积累"经验教训"来调整后续行为。这种机制类似于人类通过复盘总结来提升能力,而非重新学习基础技能。
反思记忆作为额外的上下文条件注入到 Actor 的提示中,直接影响其策略分布。具体而言,第 t 次尝试的策略可以表示为 π_t(a|s) = π(a|s, M_t),其中 M_t 是前 t-1 次尝试累积的反思记忆。随着尝试次数增加,记忆中的有效经验不断增多,智能体的表现也随之提升。