内在反思指 Agent 仅依靠自身模型权重和提示词来评估和改进输出质量。最简单的形式是在提示词中加入"在最终确定之前,请检查你的答案是否有错误"这样的指令。然而研究表明,当生成器和评估器是同一个模型时,它们共享系统性盲区,内在反思对深层推理错误的修正效果有限。
更可靠的反思机制依赖于外部环境提供的反馈信号。例如在代码生成场景中,单元测试的通过与否提供了客观的正确性判断;在数据查询场景中,可以通过二次查询来验证第一次的结果。这种基于执行的反思将评判权交给独立于模型的环境,有效突破了内在反思的相关性误差瓶颈。
过程奖励模型(PRM)代表了一种更精细的自我修正方法:不是只评估最终输出,而是对推理链中的每一步都进行打分。这样可以在错误发生的早期就检测到偏差并纠正方向,而不是等到最终结果出来才发现整体失败。PRM 通常需要额外的训练数据来学习如何评判中间步骤的质量。
通过引入多个具有不同视角的 Agent 相互审查对方的推理过程,可以模拟人类团队中的同行评审机制。一个 Agent 生成方案,另一个 Agent 扮演批评者角色寻找漏洞,必要时还可以引入第三个 Agent 作为仲裁者。这种多角色设置增加了发现错误的概率,尤其适用于高风险决策场景。