最常用的评估指标包括精确匹配(Exact Match, EM)和 F1 分数。EM 要求预测答案与标准答案完全一致(经过标准化处理后),适合有唯一正确答案的事实性问题;F1 分数衡量预测答案与标准答案之间的词级别重叠度,对部分正确的答案给予一定宽容。
除了最终答案的正确性,还可以评估推理链本身的质量:子问题是否覆盖了回答主问题所需的全部关键信息?中间答案是否准确?是否存在冗余或偏离主题的子问题?这类评估通常需要人工标注或使用更强的大模型作为评判者(LLM-as-Judge)。
当 Self-Ask 与搜索引擎等外部工具结合时,可以额外追踪工具调用的成功率:模型提出的子问题是否能被搜索引擎有效理解?返回的结果是否包含正确答案?这些信息有助于定位系统瓶颈是在模型的问题生成环节还是在工具的检索环节。