Benchmarking Knowledge Editing using Logical Rules
本文引入了一个用于评估大语言模型知识编辑的新基准,该基准通过多跳问题来评估逻辑推论,揭示了当前的方法尽管能够成功插入直接事实,却往往无法传播蕴含的知识。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是使用简单语言和日常类比对该论文进行的解释。
核心问题:在不破坏大脑的前提下进行更新
想象你拥有一本由机器人编写的、非常聪明但略显过时的百科全书(这就是大语言模型或 LLM)。有一天,你发现书中的一个事实错了。例如,书上写着“Valerie Hobson 是英国公民”,但实际上她已经搬到了澳大利亚并成为了澳大利亚公民。
在过去,为了修正这个错误,你必须撕掉百科全书的每一页并从头开始重写。这既耗时又昂贵。
**知识编辑(Knowledge Editing)**就像是使用一支神奇的笔,只需划掉“英国”并写上“澳大利亚”,而不需要重写整本书。其目标是快速更新一个特定的事实。
隐藏陷阱:“事实的蝴蝶效应”
该论文的作者注意到,我们测试这些“神奇之笔”的方式存在一个重大缺陷。大多数测试只检查机器人是否掌握了那一个事实。它们会问:“Valerie Hobson 现在是澳大利亚公民吗?”如果机器人回答“是”,则测试通过。
但作者认为,这就像是通过只看正门来检查房子是否安全一样。他们意识到,事实是像网一样相互连接的。如果你更改了 Valerie 的国籍,其他事实可能也需要随之改变,即使你没有直接询问它们。
类比:
假设你告诉朋友:“我现在住在澳大利亚。”
- 直接事实: 你在澳大利亚。
- 逻辑推论(隐藏陷阱): 如果你的朋友知道“居住在澳大利亚的人通常拥有澳大利亚国籍”,那么他们应该自动推断出——你也是澳大利亚公民。
如果你的朋友更新了记忆,说你住在澳大利亚,但仍然认为你是英国人,那么他们的逻辑就断裂了。论文将这种现象称为相关知识(correlated knowledge)。机器人可能掌握了新事实,但它未能更新该事实所带来的逻辑后果。
新工具:“逻辑侦探”
为了解决这个问题,作者构建了一个新的基准测试(Benchmark)(即测试系统),充当一名“逻辑侦探”。以下是该系统的运作步骤:
- 编辑(The Edit): 他们拿出一个机器人并更改一个事实(例如:“Valerie Hobson 住在澳大利亚”)。
- 规则手册(The Rulebook): 他们使用一种特殊工具(称为 AMIE3)来查看一张巨大的事实地图(知识图谱),并寻找连接事实的“规则”。
- 发现规则: “如果人物 X 与人物 Y 结婚,且人物 X 居住在国家 Z,那么人物 Y 通常拥有与国家 Z 相同的国籍。”
- 陷阱问题(The Trap Question): 系统不再仅仅询问关于 Valerie 的问题,而是利用这些规则生成一个关于她丈夫的刁钻问题。
- 问题: “Valerie Hobson 的丈夫是什么国籍?”
- 正确答案: 澳大利亚人(因为基于上述规则)。
- 旧机器人的回答: 英国人(因为它只更新了直接事实,而没有更新逻辑)。
他们的发现:“直接 vs 间接”的差距
作者使用这个新的逻辑侦探测试了流行的模型方法(如 ROME 和 FT)。结果令人惊讶:
- 直接获胜(The Direct Win): 当被问及简单问题(“Valerie 住在哪?”)时,机器人表现得很好。它们几乎每次都能正确完成直接编辑。
- 逻辑失败(The Logical Loss): 当被问及关于丈夫或其他相关事实的“陷阱”问题时,机器人表现得很糟糕。
- 在某些情况下,机器人在回答逻辑问题时的表现比回答直接问题时差了 24%。
隐喻:
这就像教学生一个新的数学公式。
- 直接编辑: 你问“2 + 2 等于几?”学生回答“4”。(完美!)
- 逻辑后果: 你问“如果 2 + 2 等于 4,且我有两个苹果,那么我现在有多少个苹果?”学生回答“我不知道”或者“5”。
- 这个学生记住了答案,但并没有理解背后的逻辑。
结论
论文得出结论,目前的 AI 大脑更新方法过于“笨拙”,无法处理变化的连锁反应。它们擅长修补船上的单个漏洞,但不擅长确保整个船只不会因为这个补丁而沉没。
他们发现,虽然某些方法(如 Knowledge Neurons)在处理这些逻辑连接方面表现稍好,但大多数流行的方法都无法更新围绕单个事实的“真相之网”。他们需要一种全新的 AI 测试方式,不仅要检查事实是否正确,还要检查支撑这些事实的逻辑是否依然完好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。