这是 Reflexion 最具优势的应用领域。单元测试提供了清晰、客观的二值验证信号,编译器报错信息为反思提供了丰富的诊断依据。在实际工程中,Reflexion 模式已被 Devin、Sweep 等 AI 编程助手用于失败恢复——当生成的代码未通过测试时,智能体分析错误日志、生成修复方案并重试,将 HumanEval 通过率从 80% 提升至 91%。
数学问题通常具有明确的正确答案,便于构建自动验证器。Reflexion 可以帮助智能体在证明失败后分析哪一步推导出了问题,并在下一轮尝试中调整证明策略。对于 LeetCode Hard 级别的算法题,Reflexion 将解决率从 7.5% 提升至 15%,虽然绝对值仍然有限,但相对提升达到 100%。