Revisiting the Systematicity in Negation in the Era of In-Context Learning
本文通过上下文学习研究了大语言模型在否定理解方面的系统性,揭示了虽然模型可以通过示例部分识别否定表达及其作用域,但它们在实现完美性能以及稳健地构建用于作用域识别的函数向量方面仍存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明但有点过于死板的机器人如何理解“不”(not)这个词。你给它展示了一些例子:“猫是不开心的”以及“狗是不在奔跑的”。你希望机器人能学会“不”字如何翻转句子含义的一般规则,从而使其能够处理从未见过的句子。
这篇论文针对你的机器人提出了两个大问题:
- 行为系统性(Behavioral Systematicity): 机器人真的能在新句子上完成这项工作吗?
- 表示系统性(Representational Systematicity): 机器人的大脑里是真的理解了“不”这个概念,还是仅仅在根据模式进行猜测?
以下是他们利用简单的类比对研究结果进行的拆解。
1. “行为”测试:机器人能完成这项工作吗?
研究人员使用**上下文学习(In-Context Learning, ICL)**来教机器人。你可以把它想象成在向机器人提问之前,先给它一份“小抄”(几个例子),而不是重新训练它的整个大脑。
他们给了机器人两类任务:
- 任务 A(寻找“不”): 在句子中指出“不”这个词的位置。
- 任务 B(寻找“作用范围”): 搞清楚“不”到底改变了什么。例如,在“我不吃苹果”中,“不”是仅作用于“吃”,还是作用于“吃苹果”?
结果:
- 寻找单词: 当给出示例时,机器人能很好地识别出“不”这个词。它的表现几乎与一个只需猜出单词反义词的任务(如“热” “冷”)一样出色。
- 寻找作用范围: 这是机器人栽跟头的地方。它很难搞清楚句子中究竟哪一部分被否定了。
- “格式”陷阱: 机器人的表现会根据你询问答案的方式而发生剧烈变化。
- 如果你要求它写出作用范围内的词(例如“吃苹果”),它表现尚可。
- 如果你要求它在词语周围加上括号(例如“[吃苹果]”),它就会感到困惑。
- 如果你要求它用 0 或 1 给每个单词做标记(就像打清单一样),它则完全失败了。
结论: 机器人可以学会识别“不”,但它并没有对“不”如何运作建立起稳固且通用的理解。它就像一个学生,如果考试题目看起来和练习题一模一样,他就能通过;但如果老师稍微改变一下出题格式,他就会陷入混乱。
2. “脑部扫描”测试:机器人的大脑里有一个“不”按钮吗?
为了观察机器人是否真正理解了这个概念,研究人员尝试了一种叫做**函数向量(Function Vectors)**的技术。
类比: 想象机器人的大脑是一个拥有数千名工人的巨大工厂。当你向机器人展示“不”的例子时,一组特定的工人会变得兴奋起来,并开始从事一项特定的工作。研究人员试图将这种“兴奋感”捕捉为一个单一的数字文件(即向量)。
然后,他们将这个文件注入到机器人的大脑中,让它在看一个新句子时,无需任何示例就能直接使用。这就像是给机器人吃了一颗“神奇药丸”,强行让它的脑部瞬间切换到“否定模式”。
结果:
- 寻找“不”这个词: 药丸奏效了!当他们注入“否定模式”文件后,即使没有任何示例,机器人也能正确找到新句子中的“不”字。这表明机器人确实拥有一个清晰、结构化的“寻找线索”的表示。
- 寻找作用范围: 药丸失效了。注入文件并不能帮助机器人理解否定的作用范围。机器人仍然无法完成这项工作。
结论: 机器人拥有一个清晰、有组织的“文件”来识别“不”这个线索;然而,它并没有建立起一个清晰、有组织的“文件”来理解“不”所否定的逻辑含义。它有一个写着“寻找‘不’字”的按钮,但缺乏一个写着“理解‘不’的含义”的按钮。
总结
- 机器人能学会吗? 可以,但仅限于一定程度。它可以识别出“不”这个词(如果你给它例子),但它难以理解完整的含义,尤其是当你改变提问方式时。
- 机器人理解了吗? 部分理解。它对于“寻找否定线索”拥有稳固的内部表示,但在构建“理解否定作用范围”的稳固内部表示方面失败了。
论文得出结论:虽然大语言模型正在变得越来越好,但它们仍然缺乏人类那种能瞬间理解“狗没追猫”与“猫没追狗”之间逻辑差异的深层“逻辑系统性”。它们擅长模式匹配,但在真正的结构化推理方面尚未达标。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。