学术界和工业界常用的评估基准包括:
a. HotpotQA:多跳问答数据集,使用精确匹配率(EM)作为指标 b. FEVER:事实验证数据集,使用准确率(Accuracy)作为指标 c. ALFWorld:文本模拟家庭环境中的任务完成基准,使用成功率作为指标 d. WebShop:模拟电商购物流程的基准,使用任务完成率作为指标
除了任务成功率之外,全面的评估还应当考虑:
a. Token 效率:完成任务所需的平均 Token 消耗量 b. 延迟:从用户输入到最终输出的端到端响应时间 c. 可解释性:人类审计者能否理解模型的决策过程 d. 鲁棒性:在工具失败或返回噪声时的容错能力
对错误案例进行人工标注分类是理解 ReAct 表现的重要手段。原论文采用的分类体系包括:幻觉、推理错误、检索错误、标签歧义等类别,这种方法可以帮助开发者有针对性地优化系统。