Reflexion 的计算开销主要来自多次迭代执行,每轮迭代都需要完整的 Actor 推理加反思生成。相对于单次 Chain-of-Thought 调用的 Token 消耗:
每次迭代还会检索历史反思记忆,进一步增加输入 Token 数量,形成累积效应。
延迟与迭代次数呈线性关系。对于一个基础推理时间为 2 秒的任务,三轮 Reflexion 迭代的端到端延迟通常在 8 至 12 秒之间。在生产环境中,标准 HTTP 网关超时(通常为 10 至 30 秒)可能会中断正在进行的反思循环,需要将超时阈值配置为 60 至 120 秒,或采用流式响应与轮询模式。
尽管开销显著,但在错误代价高昂的场景中,Reflexion 的投入产出比仍然合理。例如在代码生成任务中,一轮成功的 Reflexion 可以避免人工调试的时间成本;在数据处理流水线中,自动纠错可以减少故障停机损失。关键在于任务的验证信号是否足够清晰可靠。