← 最新论文
💻 computer science

Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning

本文介绍了 ACA-RL,这是一个强化学习框架以及缺失前提基准测试(Missing-Premise Benchmark, MPB),它们使推理模型能够通过学习询问缺失信息、基于未知情况给出回答或选择弃权,从而有效地处理欠定查询,而不是强行给出错误的响应。

原作者: Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin Zhang, Jianshe Li

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin Zhang, Jianshe Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在向一位知识渊博的助手提问,但你却不小心遗漏了一个解开谜题所需的关键信息。例如,你询问了一次旅行的总费用,却忘了提到目的地;或者你提出了一个数学问题的解法,却漏掉了一个特定的数字。在现实世界中,一个乐于助人的真人会停顿下来,察觉到缺口,并询问你缺失的细节。他们不会去猜测目的地,也不会凭空捏造一个数字来给你答案。长期以来,受训于解决问题的人工智能系统在处理这种特定情况时一直表现挣扎。面对一个不完整的问题时,这些系统往往会迫切地想要自己填补空白,从而自信满满地给出一个错误的答案或编造一个事实。这种行为被称为“幻觉”,之所以发生,是因为这些模型的训练目标主要是寻找最终答案,而不是识别何时无法找到答案。

研究人员一直致力于教导这些系统识别不确定性,但仅仅告诉它们说“我不知道”并不总是最有帮助的反应。有时,最好的反应是向用户索取缺失的信息。还有时候,系统可以提供一个取决于变量的有用答案,例如说:“如果目的地是巴黎,费用将是十美元;但如果目的地是伦敦,则是二十美元。”本文介绍了一种新的方法,旨在训练人工智能像人类一样谨慎地处理这些不完整的问题。研究人员开发了一种系统,教导模型要么询问缺失的信息,要么提供一个有条件的答案,或者在无法给出有用回复时礼貌地拒绝猜测。

由蚂蚁国际(Ant International)和浙江大学的研究人员领导的团队,创建了一种名为“询问-条件-弃权”(Ask-Condition-Abstain)强化学习的新型训练方法。为了教导模型这种行为,他们首先必须创建一个庞大的、故意设计成“残缺”的练习题库。他们提取了12万个定义明确、可解的问题,并仔细地从每个问题中移除或更改了一个关键信息。这个过程并非随机进行的;他们利用一个关于问题应如何解决的结构化图谱,精准地识别出得出答案所必需的特定事实。通过手术式地移除这些事实,他们创建了一个数据集,其中唯一的正确反应就是承认问题是不完整的。

一旦准备好这些训练数据,他们就通过一套鼓励特定行为的奖励机制来教导模型。该系统不仅会对正确的最终答案给予奖励,还会为提出澄清性问题或解释缺失内容的行为加分。对于仅仅拒绝回答的行为,它会给予较少的分数;而对于捏造事实或进行猜测的行为,则会给予负分。其目标是将模型的本能从“猜测答案”转向“识别缺口”。为了测试这种训练是否奏效,研究人员构建了一个新的基准测试——“缺失前提基准”(Missing-Premise Benchmark)。该测试集包含274个经过仔细验证的、信息缺失的问题,涵盖了数学、逻辑和现实世界的应用题。

结果显示,这种新的训练方法显著提高了模型处理不完整问题的能力。在新的基准测试中,使用该方法训练的模型得分远高于那些仅受训于寻找答案或仅受训于简单说“我不知道”的模型。经过训练的模型产生幻觉或捏造事实的可能性大大降低。相反,它们经常选择询问缺失的信息,或者解释答案会如何根据未知变量而改变。至关重要的是,这种能力的提升并没有以牺牲解决正常、完整问题的能力为代价。当测试标准的数学和逻辑谜题(即所有信息均已提供时),这些模型的表现与之前一样出色,这表明学习识别不确定性并不会降低它们解决可解任务的能力。

这项研究表明,智能系统的下一步发展不仅在于更快或更准确地解决问题,还在于更好地知道何时无法按所述方式解决问题。通过教导模型揭示缺失的信息而非进行猜测,这种方法有助于构建更安全、更可靠的助手。这些系统可以决定何时向用户寻求帮助,或者何时使用工具来寻找缺失的事实,而不是自信地提供一个错误的答案。研究人员指出,虽然他们的方法在处理结构化问题中的逻辑缺口时效果良好,但现实世界的问题可能更加混乱且具有歧义。然而,这项工作为教导人工智能识别自身知识的局限性,并在信息不完整时做出建设性回应提供了一条清晰的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →