Surprisal and Metaphor Novelty Judgments: Moderate Correlations and Divergent Scaling Effects Revealed by Corpus-Based and Synthetic Datasets
本研究表明,尽管语言模型的惊异度(surprisal)与隐喻新颖度标注呈现中度相关,但其表现出迥异的缩放行为——在基于语料库的数据上,其预测能力随模型规模增大而下降,但在合成数据上则随之上升——这凸显了其作为衡量语言创造力综合指标的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试猜测句子中的下一个词。如果句子是“猫坐在……”(The cat sat on the...),你的大脑(以及计算机程序)可以很容易地猜出“垫子”(mat)。这很容易预测,所以它并不令人感到意外。但如果句子是“猫坐在……水母”(The cat sat on the... jellyfish)上,你的大脑会愣一下。这个词很难预测,因此具有很高的“惊奇度”(surprisal)。
这篇论文提出了一个简单的问题:这种“惊讶感”能否帮助我们区分一个陈旧、乏味的隐喻和一个新鲜、有创意的隐喻?
核心理念:可预测性 vs. 创造力
隐喻就像是心理上的桥梁。有时,这座桥是每个人都熟知的、被踩烂了的路径,比如说“我攻击了他的论点”(I attacked his argument)。大家都知道你不会对一段演讲使用武器;这是一个标准的表达方式。这就是常规隐喻(conventional metaphor)。
而另一些时候,这座桥是全新的且摇摇欲坠的,比如说“逮捕了水”(The arrested water)。你必须停下来思考:水怎么会被逮捕?字典里没有这个词。这就是新颖隐喻(novel metaphor)。
研究人员想要观察计算机程序(称为语言模型)是否能利用它们的“惊讶度量计”来识别这些新的、有创意的桥梁。其理论是:如果一个词难以预测,也许它就是一个有创意的隐喻。
实验:两个不同的世界
团队使用两种截然不同的数据测试了这个想法,结果就像是两个不同的城市:
1. “真实世界”城(基于语料库的数据)
他们观察了从书籍、新闻和对话中提取的真实句子。
- 结果: 在这里,“惊讶度量计”表现尚可,但有一个转折。较小、较简单的计算机模型实际上比那些庞大、超级智能的模型更能发现有创意的隐喻。
- 类比: 想象一个熟悉社区的小型当地侦探。他们能注意到那些古怪的新事物,因为他们不会过度思考。而那个巨大的侦探(大型人工智能)见过太多数据,以至于它开始在任何地方都预见到了奇怪的事情,这使得它对特定句子中实际存在的“新颖性”变得不再敏感。模型越大,它在这个特定任务上的表现就越差。
2. “玩具工厂”城(合成数据)
他们还使用了在实验室(或由另一个 AI)中精心构建的句子,其中唯一的区别在于隐喻是旧的还是新的。
- 结果: 在这里,规则反转了。更大、更聪明的模型在识别创意隐喻方面表现得更好。
- 类比: 在一个受控的玩具工厂里,巨大的侦探大放异彩。因为玩具是完美的,规则是严格的,庞大的大脑可以利用其巨大的力量来捕捉那些小型侦探会错过的细微差别。
“完形填空”技巧:向两边看
研究人员还尝试了一种新技巧。标准的“惊讶度”只观察目标词之前的词(比如从左到右阅读句子)。但为了理解一个隐喻,你通常也需要看到它之后的内容。
他们创建了一个“完形填空”(Cloze)方法(就像玩填空游戏)。他们隐藏了那个隐喻词,展示了整个句子(包括结尾),然后问道:“哪个词填在这里?”
- 结果: 这种“向两边看”的方法通常让计算机在识别隐喻方面变得更聪明。这就像是给了侦探一张整条街道的地图,而不仅仅是他们站立的那个街角。然而,这个技巧在“真实世界”的句子中效果最好,有时却会让“玩具工厂”中的模型感到困惑。
关于教 AI 像人类一样说话
团队还尝试使用了“指令微调”(Instruction-Tuned)模型(即经过训练以遵循人类指令并进行友好交流的 AI)。
- 结果: 出人意料的是,让 AI 说话更像人类并没有让它在识别创意隐喻方面变得更好。事实上,对于某些模型来说,这反而让它们在处理这个特定的数学问题时表现得更差。变得“健谈”并没有帮助它们变得“有创意”。
总结
论文得出结论,虽然“惊讶度”(一个词的不可预测程度)是一个尚可的寻找创意隐喻的工具,但它并不是一根魔杖。
- 它运作得还可以(大约 40-50% 的相关性),这意味着它很有帮助,但远非完美。
- 语境很重要: AI 是在观察混乱的现实世界文本,还是在观察干净的实验室制造文本,这改变了一切。
- 规模很重要: 大并不总是意味着更好;有时取决于数据,较小的模型反而更敏锐。
简而言之,虽然计算机可以通过测量它们有多“惊讶”来获得人类创造力的一丝线索,但它们仍然难以完全领悟真正新颖隐喻中的魔力。要理解语言的艺术,它们需要的不仅仅是一个惊讶度量计。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。