← 最新论文
🤖 AI

Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers

本文介绍了主动交互式推理(PIR),这是一种新范式,通过将内部推理与用户澄清交替进行以解决前提和意图的不确定性,将推理大语言模型从被动求解者转变为主动探究者,从而在显著降低计算成本的同时大幅提高准确性和效率。

原作者: Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单、日常的语言对论文《提问时推理》(PIR)的解释,并借助类比使概念更加清晰。

问题:“过度思考”的学生

想象你是一位老师,让学生解决一道数学题。这位学生极其聪明,背熟了成千上万个公式。然而,他们有一个奇怪的毛病:他们从不请求澄清。

如果你说“修复数据脚本”,学生不会问“哪个脚本?什么格式?”,而是立即开始写一篇 2000 字的长文,猜测你的意思。他们可能会猜错脚本,陷入僵局,幻觉出一个看似正确实则错误的解决方案,并浪费大量的时间和精力。这就是论文中所称的“盲目自我思考”。当前的 AI 模型就像这个学生:它们太急于思考,以至于忘记检查自己是否掌握了所有事实。

解决方案:“主动侦探”(PIR)

作者提出了一种新的 AI 工作方式,称为主动交互式推理(PIR)。AI 不再是一个只会猜测的被动解题者,而是变成了一位主动的侦探

这就像侦探破案。如果证人说道:“我看见了一辆车”,侦探不会立即撰写一份关于“蓝色轿车”的报告。相反,侦探会问:“它是什么颜色的?它超速了吗?你看到车牌了吗?”

PIR 教导 AI 做同样的事情:

  1. 暂停并检查:在深入进行长篇推理之前,AI 会检查自己的信心。“我真的有足够的信息来解决这个问题吗?”
  2. 先提问:如果 AI 感到不确定(就像侦探缺少线索),它会停下来,向用户提出一个具体问题以获取缺失的信息。
  3. 高效解决:一旦用户回答,AI 就会利用这些新信息快速、准确地解决问题,而不会浪费时间在胡乱猜测上。

他们如何教会 AI 这样做

研究人员并没有只是告诉 AI“去提问”。他们建立了一个包含两个特定阶段的训练健身房:

阶段 1:“脚本”训练(监督微调)
想象通过给新员工提供脚本来进行教学。研究人员利用现有问题,人为地插入了 AI 本应提问的“怀疑时刻”。然后,他们编写了一份脚本,其中 AI 问“你是什么意思?”,用户回答。AI 反复阅读这些脚本,直到学会何时停止并提问的模式

阶段 2:“模拟”训练(用户模拟器优化)
这是巧妙之处。你无法通过让 AI 全天候与真人对话来训练它(这太慢且太昂贵)。因此,研究人员构建了一个用户模拟器——一个被编程为像人类用户一样行动的第二代 AI。

  • 他们设计了一个游戏:主 AI 尝试解决问题,而模拟器 AI 充当用户。
  • 如果主 AI 提出了一个问题,能快速获得正确答案,它就会得到高分(“奖励”)。
  • 如果主 AI 问了太多问题或盲目猜测,它就会得到低分。
  • 随着时间的推移,AI 学会了完美的平衡:提问足够多以确保准确,但又不会多到让用户感到厌烦。

结果:更快、更聪明、更少浪费

论文在三种类型的任务上测试了这种新的“侦探 AI":数学、编程和文档编辑。与旧的“过度思考”AI 相比,情况如下:

  • 更高的准确率:新 AI 获得正确答案的频率要高得多(在某些数学测试中高达 32%),因为它不会在缺失信息上进行猜测。
  • 更少的浪费:它使用的计算资源(token)约为一半。与其写一篇 2000 字的猜测,不如问一个问题并写出一篇 500 字的解决方案。
  • 更少的回合:尽管它问了问题,但来回消息的数量却更低。这是因为它第一次就正确解决了问题,而不必后来回头修正错误的猜测。
  • 现实世界测试:在与真实人类的盲测中,参与者更喜欢新的 AI。他们喜欢它在信息缺失时不会“幻觉”(编造内容)。他们觉得它更有帮助且更高效。

总结

这篇论文介绍了一种系统,旨在阻止 AI“盲目过度思考”。通过训练 AI 识别自己何时感到困惑,并在猜测之前寻求帮助,它变成了一个更高效、更准确且更用户友好的伙伴。它将 AI 从一个猜测答案的学生,转变为一个先收集事实的侦探。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →