首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >Self-Ask >Self-Ask 相比直接提问的准确率提升幅度有多大?

Self-Ask 相比直接提问的准确率提升幅度有多大?

词条归属:Self-Ask

1. 多跳问答基准测试结果

在原始论文的实验中,Self-Ask 在多个权威多跳问答数据集上均取得了显著优于直接提问和思维链的成绩。以下是关键数据(精确匹配率 EM,百分比):

方法

Bamboogle

2WikiMultiHopQA

MuSiQue

直接提问

17.6

25.4

5.6

思维链(CoT)

46.4

29.8

12.6

Self-Ask

57.6

30.0

13.8

Self-Ask + 搜索引擎

60.0

40.1

15.2

Self-Ask 相比直接提问在 Bamboogle 上提升了 42.4 个百分点,在 2WikiMultiHopQA 上提升了 14.7 个百分点,在 MuSiQue 上提升了 9.6 个百分点。接入搜索引擎后,2WikiMultiHopQA 的准确率进一步提升至 40.1%,较纯 Self-Ask 高出 10.1 个百分点。

2. 与思维链的对比优势

Self-Ask 在最困难的 Bamboogle 数据集上比思维链高出 11.2 个百分点,这一差距说明在高度组合性的推理任务中,结构化的子问题分解比连续的自由推理更为有效。在较简单的数据集上两者差距较小,表明 Self-Ask 的难度优势主要体现在问题复杂度较高的场景。

3. 效率优势

除准确率外,Self-Ask 在推理效率上也优于同类方法。与 Least-to-Most prompting 相比,Self-Ask 在取得相当或更好准确率的同时,token 消耗减少约 30%,推理速度更快。这是因为 Self-Ask 在一次前向传播中完成问题分解和求解,而 Least-to-Most 需要对每个子问题分别发起独立的模型调用。

相关文章
自适应Prompt技术:让LLM精准理解用户意图的进阶策略
自适应Prompt技术通过动态意图解析与反馈驱动优化,将LLM从“机械执行者”进化为“认知协作者”。企业落地时需聚焦垂直场景,结合自动化工具链(如LangChain + HumanLoop)快速验证价值。随着多模态与强化学习的深度融合,未来的Prompt工程将走向“静默化”——用户无需刻意设计指令,AI自能理解未尽之言。
nine是个工程师
2025-05-18
1.7K0
解密Prompt系列14. LLM Agent之搜索应用设计:WebGPT & WebGLM & WebCPM
前两章,我们分别介绍了基于微调和prompt的工具调用方案,核心都是如何让大模型和工具进行交互,包括生成工具调用语句和处理工具调用请求。不过在实际应用中,想要设计一个可以落地的LLM Agent,需要更全面整体的系统设计。本章我们以搜索工具为例,介绍如何更好和搜索引擎进行交互的LLM Agent。
风雨中的小七
2023-08-31
4.1K0
解密Prompt系列32. LLM之表格理解任务-文本模态
这一章我们聊聊大模型表格理解任务,在大模型时代主要出现在包含表格的RAG任务,以及表格操作数据抽取文本对比等任务中。这一章先聊单一的文本模态,既你已经通过OCR或者多模态等方式从PDF或者图片中获取了表格的文本数据。和前文相同,我们分别介绍微调和基于Prompt的两种方案。
风雨中的小七
2024-06-20
1.9K0
【AIGC】ChatGPT提示词Prompt高效编写模式:Self-ask Prompt、ReACT与Reflexion
在本文中,我们详细探讨了几种提升AI模型性能的关键方法:自我提问(Self-ask Prompt)、协同思考和动作(ReACT)、以及失败后自我反思(Reflexion)。这些方法各具特色,通过鼓励模型主动生成并解答问题、在思考和行动间取得平衡,以及从失败中汲取经验,它们有效地拓展了AI在复杂任务中的适应能力和分析深度。不论是通过自问自答的方式深入理解主题,还是通过协同合作提高解决问题的效率,或是通过反思优化未来的策略,这些方法能够全面提升AI模型的输出质量和综合能力,帮助其在多样化的场景中为用户提供更有价值的支持。
CSDN-Z
2024-10-18
7800
HippoRAG:模拟大脑记忆思索机制的 RAG
人类大脑通过不断积累和更新知识来适应环境,而大型语言模型(LLMs)虽具智能,却缺乏这种动态更新能力。为解决这一问题,研究人员开发了一种名为“HippoRAG”的新框架,模仿了大脑新皮质和海马体的工作机制,显著提升了多跳问题解答的性能,比现有 RAG 方法高出 20%。HippoRAG 不仅成本低、速度快,在单一检索步骤中还优于迭代 IRCoT 方法。这展示了如何将生物学原理应用于提高 LLMs 的效率。RAG 通过将数据集分块并索引于矢量数据库中,实现高效检索。然而,传统 RAG 在涉及多块知识整合的现实任务(如法律、医学和科学领域的多跳问题解答)上表现不佳。以前的研究,如 Self-Ask[1] 和 IR-CoT[2],通过多重检索和 LLM 生成迭代连接知识块,但在处理信息分散且无直接联系的任务上仍有不足。
AgenticAI
2025-03-18
1.1K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券