对于单跳事实性问题(如"珠穆朗玛峰海拔多少米?"),模型通常不需要任何追问即可直接作答;对于两跳问题(如"奥巴马夫人出生在哪座城市?"),一般需要 1–2 个子问题;对于更复杂的多跳推理(如涉及三个以上事实的组合),追问深度可能达到 3–5 层。实际部署时可设置分级策略:简单问题走直通路径,复杂问题启用多层追问。
每一层追问都会增加模型的输出 token 数量和推理延迟。行业实践表明,Self-Ask 相比直接提问会显著增加 token 消耗,具体幅度取决于问题的复杂度和追问深度。在高并发生产场景中,建议对追问总 token 数设置预算上限,超出后降级为直接回答或返回"需要更多信息"的友好提示。
最优实践是根据意图识别结果动态选择是否启用 Self-Ask。对于数学计算、逻辑推理、多跳事实查询等场景开启自提问;对于情感分析、文本分类、创意写作等任务则跳过该步骤。这种路由机制可以在保证准确率的同时最大化系统吞吐效率。