LOGICAL-COMMONSENSEQA: A Benchmark for Logical Commonsense Reasoning
本文提出了 LOGICAL-COMMONSENSEQA 基准,通过将常识推理重构为基于“与”、“或”及“非”逻辑算子的原子陈述组合,揭示了当前大模型在处理否定逻辑推理时存在的显著局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 LOGICAL-COMMONSENSEQA 的新测试工具,它的目的是给现在的 AI(大语言模型)出一些更“刁钻”的常识题,看看它们是不是真的懂生活,还是只是在背答案。
我们可以把这篇论文的核心内容想象成一场**“从做选择题到玩逻辑拼图”的升级考试**。
1. 以前的考试:只要选出一个“标准答案”
想象一下,以前的常识考试(比如 COMMONSENSEQA)是这样的:
题目:狐狸从城市跑进了森林,它在找什么?
A. 食物
B. 水
C. 睡觉的地方
D. 朋友
AI 只需要从 A、B、C、D 里选一个最对的。如果它选了“食物”,就算对。
问题在于:现实世界很复杂,狐狸可能既在找食物,也在找睡觉的地方。以前的考试强迫 AI 只选一个,这就掩盖了 AI 是否真的理解“多个答案可能同时成立”这种复杂的逻辑。
2. 新考试:逻辑拼图(LOGICAL-COMMONSENSEQA)
现在的这个新测试,把题目变成了**“逻辑组合题”**。它不再问“选哪个”,而是问“这两个说法放在一起,合不合理?”
它引入了三个神奇的**“逻辑连接器”**(就像乐高积木的接口):
- AND(而且/两者都):两个说法都得是合理的。
- 例子:狐狸在找“食物”而且在找“睡觉的地方”。(如果两个都合理,这题就对了。)
- OR(或者/至少一个):只要有一个说法合理就行。
- 例子:狐狸在找“食物”或者在找“玩具”。(只要找食物是对的,这题就算对,哪怕找玩具很荒谬。)
- NEITHER/NOR(既不...也不.../两个都不行):两个说法都得是不合理的。
- 例子:狐狸在找“去月球”也不在找“去火星”。(这两个都很荒谬,所以“既不...也不..."这个判断是对的。)
这就像是在玩“真假话游戏”:
以前的考试是让你从一堆话里挑一句真话;现在的考试是让你判断两句话组合在一起,是“真 + 真”、“真 + 假”还是“假 + 假”。
3. 考试结果:AI 的“偏科”现象
研究人员让各种 AI 模型(包括最新的 LLaMA、Gemini 等)来做这套题,结果发现了一个有趣的现象:
- 做“加法”(AND)很厉害:AI 很擅长判断“两个都对”的情况。就像它知道“狐狸既找食物又找睡觉的地方”是合理的。
- 做“减法”(OR)还行:只要有一个对,它也能蒙对。
- 做“否定”(NEITHER/NOR)彻底崩盘:这是最惨的地方。当题目问“狐狸既不在找 A 也不在找 B"时,AI 经常搞反。
- 比喻:这就好比 AI 是个**“肯定句专家”**,它很擅长说“是的,这很合理”,但一旦让它说“不,这俩都不合理”,它就晕了。它总是忍不住把那些“看起来有点道理”的话选进去,哪怕题目要求的是“两个都不行”。
数据很扎心:
在普通的常识题里,LLaMA 模型能考 72 分;但在这种带“否定逻辑”的新题里,它的分数直接掉到了13 分!这说明 AI 并不是真的在“思考”,它只是在统计概率,一旦逻辑变复杂(特别是涉及“不”的时候),它的统计捷径就失效了。
4. 为什么这很重要?
这就好比我们教小孩认字。
- 旧方法:教小孩认“苹果”、“香蕉”,让他指认哪个是水果。
- 新方法:问小孩“苹果和香蕉都是水果吗?”或者“苹果和石头都不是水果吗?”
这篇论文告诉我们,现在的 AI 虽然能背很多“常识”,但在组合常识和处理否定逻辑上,还像个还没学会辩证法的小学生。它们能处理简单的“是”,但处理不了复杂的“不是”和“既不是也不是”。
总结
这篇论文就像给 AI 照了一面**“逻辑哈哈镜”。它没有发明新的知识,而是换了一种问法,暴露了 AI 在“组合推理”和“否定推理”**上的短板。
一句话总结:现在的 AI 很擅长做“填空题”,但一旦题目变成了需要同时处理“是”与“否”的“逻辑判断题”,它们就经常把自己绕晕,尤其是在需要说“不”的时候。这个新测试就是为了逼着 AI 学会真正的逻辑思考,而不仅仅是猜答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。