在原始论文的实验中,Self-Ask 在多个权威多跳问答数据集上均取得了显著优于直接提问和思维链的成绩。以下是关键数据(精确匹配率 EM,百分比):
方法 | Bamboogle | 2WikiMultiHopQA | MuSiQue |
|---|---|---|---|
直接提问 | 17.6 | 25.4 | 5.6 |
思维链(CoT) | 46.4 | 29.8 | 12.6 |
Self-Ask | 57.6 | 30.0 | 13.8 |
Self-Ask + 搜索引擎 | 60.0 | 40.1 | 15.2 |
Self-Ask 相比直接提问在 Bamboogle 上提升了 42.4 个百分点,在 2WikiMultiHopQA 上提升了 14.7 个百分点,在 MuSiQue 上提升了 9.6 个百分点。接入搜索引擎后,2WikiMultiHopQA 的准确率进一步提升至 40.1%,较纯 Self-Ask 高出 10.1 个百分点。
Self-Ask 在最困难的 Bamboogle 数据集上比思维链高出 11.2 个百分点,这一差距说明在高度组合性的推理任务中,结构化的子问题分解比连续的自由推理更为有效。在较简单的数据集上两者差距较小,表明 Self-Ask 的难度优势主要体现在问题复杂度较高的场景。
除准确率外,Self-Ask 在推理效率上也优于同类方法。与 Least-to-Most prompting 相比,Self-Ask 在取得相当或更好准确率的同时,token 消耗减少约 30%,推理速度更快。这是因为 Self-Ask 在一次前向传播中完成问题分解和求解,而 Least-to-Most 需要对每个子问题分别发起独立的模型调用。