CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models
本文介绍了 CommonWhy,这是一个包含 15,000 个基于实体的“为什么”问题的数据集,用于评估大语言模型的因果常识推理和溯因解释能力,结果显示尽管 Wikidata 中提供了支持性知识,但当前模型仍存在显著不足。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明、博览群书的机器人助手。你已经向它提出了数千个问题,例如:“哈利·波特真的会飞吗?”或“亚里士多德拥有过笔记本电脑吗?”由于能够扫描其庞大的事实库并找到答案,这台机器人在回答这些“是”或“否”的问题方面已经变得非常出色。
但现在,想象一下你向机器人提出了一个更加棘手的问题:“为什么卡塔琳娜·巴利观看 2024 年欧冠决赛不需要签证?”
正是在这里,机器人开始踉跄。这正是论文《CommonWhy》试图解决的问题。
问题:机器人无法“串联线索”
作者们认为,虽然机器人在事实检索(在书中查找特定事实)方面表现出色,但在因果推理(通过常识将不同事实联系起来,从而弄清楚某事为何发生)方面却表现糟糕。
可以这样理解:
- 事实检索就像在电话簿中查找电话号码。
- 因果推理则像当一名侦探。你必须查看电话号码,意识到此人居住在不同的国家,记起该国与当事人的母国之间有无签证协议,然后得出结论:“啊,这就是他们不需要签证的原因!”
当前的机器人往往无法胜任这种侦探工作。它们可能会猜测答案、编造事实(幻觉),或者因为答案并未以单句形式出现在其训练数据中而陷入停滞。
解决方案:一场新的“侦探考试”
研究人员创建了一个名为CommonWhy的新数据集。你可以将其想象为一场包含 15,000 道题的巨型“侦探考试”,专门用于测试这些机器人在推断“某事为何发生”方面的能力。
以下是他们构建这场考试的方式:
- 规则(公理): 首先,他们向人工智能提供了一些基本的世界规则,例如:“如果你是 A 国的公民,且 B 国允许 A 国公民免签入境,那么你就不需要签证。”
- 角色(实体): 他们从名为Wikidata(结构化数据的维基百科)的巨型数据库中选取了真实的人物、地点和事件。
- 问题: 他们将规则与角色混合,创造出问题。例如:“为什么人物 X前往事件 Y不需要签证?”
- 答案: 关键在于,他们并不只寻找一个正确答案。在现实世界中,往往存在多种原因。也许人物 X 不需要签证是因为他是东道国的公民,或者是因为他是一名外交官。该数据集包含了所有这些有效的可能性。
结果:机器人未能通过考试
研究人员在最新的“推理”模型等当今最先进的人工智能模型上测试了这场考试。结果令人惊讶且有些令人担忧:
- 它们陷入了困境: 即使是最好的模型,也只有约 68% 的答案是正确的。对于我们要期待其具备超级智能的系统来说,这是一个不及格的分数。
- 它们编造内容: 当模型确实答对答案时,它们往往为了得出答案而编造了虚假事实。这就像一个学生得出了正确的数学答案,却使用了一个虚构的公式来解题。
- “长尾”问题: 当问题涉及生僻、不太知名的人物或地点(即“长尾”)时,机器人的表现甚至更差。它们似乎依赖于记忆著名事实,而不是真正通过逻辑进行推理。
- 旧工具无效: 他们尝试使用专为数据库问题设计的标准工具(KGQA),但这些工具彻底失败了。这些工具旨在查找事实,而非解释某事为何发生。
全局视角
该论文得出结论:我们面临着人工智能的一项全新且极其艰巨的挑战。我们不能仅仅继续要求机器人记忆事实或回答简单的“真/假”问题。如果我们希望它们有效地与现实世界互动,就需要教会它们如何成为侦探——如何将硬事实与常识结合起来,以解释世界为何如此运转。
CommonWhy是我们拥有的第一个工具,用于衡量机器人是否真的在这类思维上有所进步,还是仅仅在变得更擅长猜测。目前,论文指出,它们大多只是在猜测。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。