← 最新论文
💻 computer science

From Atomic Evidence to Logical Composition: Structured Compositional Reasoning over Compound Answer Options

本文提出了一种结构化组合推理框架,该框架将复合选项分解为原子判断,并使用算子约束的整数线性规划将其重新组合,从而显著提升了大语言模型在 LOGICAL-COMMONSENSEQA 和 LOGICAL-SATA 等逻辑推理基准测试上的性能。

原作者: Obed Junias, Maria Leonor Pacheco

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Obed Junias, Maria Leonor Pacheco

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜团的侦探,但你不是在寻找线索,而是在要求一个超级聪明的机器人阅读一个故事并选择正确的结局。这个机器人是一个大语言模型(LLM),一种阅读了几乎整个互联网内容的类型的人工智能。它擅长写故事、回答常识问题以及像人类一样聊天。然而,科学家们注意到一个有趣的故障:当机器人必须根据复杂的规则做出决定时——比如“答案必须是 A B”或者“答案既不是 A 也不是 B”——它经常会感到困惑。它可能对 A 的事实判断正确,对 B 的事实也判断正确,但当它试图用逻辑词将它们粘合在一起时,它却会绊倒自己的双脚。这在现实世界中是一个大问题,因为我们不仅想要知道事实的机器人,我们还想要能够进行逻辑思考、将信息碎片组合起来得出正确结论,而不至于陷入混乱的机器人。

这篇题为《从原子证据到逻辑组合》的论文正是在解决这个故障。作者 Obed Junias 和 Maria Leonor Pacheco 意识到,问题不在于机器人不知道事实,而在于机器人试图一次性做太多事情。他们提出了一种新的工作方式,就像雇佣一个专家团队,而不是要求一个人完成所有工作。首先,他们将一个复杂的问题分解成被称为“原子答案”的微小、简单的碎片。然后,他们要求机器人分别对每一个微小的部分进行判断,观察支持或反对该部分的证据。最后,他们使用一套严格的数学规则手册(称为整数线性规划)来强制机器人正确地组合这些微小的判断,确保最终答案遵循“与(AND)”、“或(OR)”或“既非/非(NEITHER/NOR)”的逻辑。

结果非常显著。当他们在两组不同的逻辑谜题(一组关于日常常识,另一组关于阅读理解)上测试这种新方法时,机器人的表现大幅提升。在常识测试中,机器人的准确率从摇摇欲坠的 48.3% 跳升至稳健的 77.0%。在阅读测试中,它从 47.0% 提升到了 75.6%。最大的进步发生在最难的逻辑“既非/非(NEITHER/NOR)”上,机器人在该项上的表现从几乎无法理解该概念(得分仅在 12-14% 左右)跃升到了掌握该概念(得分超过 73%)。该论文表明,通过将“事实核查”部分与“逻辑粘合”部分分离,我们可以帮助这些人工智能模型思考得更加清晰,这证明了有时机器人最聪明的方法就是停止尝试一步登天的巨型跨越,而是采取小巧、谨慎的步伐。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →