Figurative and Cultural Knowledge in LLMs: Investigating Cross-Domain Transfer through Fine-Tuning
本文研究了在文化数据上进行微调是否能增强大语言模型对修辞性语言的理解,发现虽然诗歌训练能以一种可迁移的方式提升对成语的理解,但文化微调往往会降低对谚语的解释能力,并揭示了文化沉浸与修辞性语言习得之间一种复杂的、非线性的关系,而这种关系无法仅通过微调来简单地捕捉。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
语言不仅仅是一套排列词汇的规则;它是一个社区历史、价值观和共同经历的活态档案。对于修辞性语言——即那些依赖文化语境才能产生意义的成语、谚语和诗歌——这一点尤为真实。像“It's raining cats and dogs”(正如下着猫狗一样的大雨)这样的短语,对于从未听过这个表达的人来说毫无意义,但对于母语使用者,它能瞬间勾勒出大雨倾盆的具体意象。对于通过处理海量文本进行学习的人工智能而言,掌握这类语言是一个重大的障碍。虽然现代人工智能模型可以流利地阅读和写作,但它们往往难以理解编织在文化结构中的深层非字面含义。研究人员长期以来一直追问的问题是:向人工智能教授一个文化的日常生活和传统,是否会有助于它理解其隐喻;或者,学习解释隐喻是否有助于它掌握文化事实。
一支研究团队决定利用阿拉伯语来测试这种联系,这是一种拥有多样方言和深厚文学传统的语言。他们与四种不同的“大语言模型”一起工作,这些模型是驱动许多现代人工智能应用的强大计算机系统。为了观察文化知识与修辞理解是否相关,研究人员进行了一系列受控实验。他们对这些模型进行了额外的训练,即“微调”,使用了特定类型的数据。在一组实验中,他们向模型输入了数千个关于文化知识的示例,例如关于阿拉伯世界各地社会习俗、地域实践和日常生活的知识。在另一组实验中,他们利用充满谚语、成语和诗歌的数据集对模型进行了修辞语言训练。他们还包括了一个接受通用阿拉伯语语法训练的对照组,以确保任何变化都是由于特定内容的训练,而非仅仅因为学习了更多阿拉伯语。
结果揭示了一个复杂且有些令人惊讶的情况。研究人员发现,教授模型关于文化的内容并不会自动使其更擅长理解成语或谚语。事实上,对于那些已经专门针对阿拉伯语优化的模型,用文化数据进行训练有时反而会降低它们的表现。这些模型可能已经在初始训练阶段吸收了大量的文化知识,因此在接触到一套更窄、更精选的文化事实时,似乎变得困惑了。相反,用文化数据训练模型也并未帮助它们回答有关文化事实的一般性问题。这两类知识——文化事实与修辞含义——似乎并不像研究人员所希望的那样能够相互支持。
然而,有一个明显的例外脱颖而出。当研究人员专门针对诗歌对模型进行训练时,模型理解成语的能力显著提升了。这种进步是可衡量且在统计学上可靠的,其中一个特定的模型显示出了准确性的显著飞跃。至关重要的是,当模型接受通用阿拉伯语文本或语法训练时,并没有出现这种提升,这表明这种进步来自于诗歌内容本身,而非仅仅是因为看到了更多的阿拉伯语单词。诗歌凭借其对意象、节奏和非字面含义的依赖,似乎教会了模型一种更广泛的技能:识别并解释超越词汇字面定义之上的含义的能力。这种技能成功地迁移到了成语上,尽管诗歌和成语是不同的表达形式。
研究还强调,结果在很大程度上取决于所使用的模型。那些专为阿拉伯语设计的模型起步时具有更高的知识基准,并且在接受新数据微调后往往会出现退化,即表现变差。这表明它们已经从现有的训练材料中学习到了尽可能多的知识。相比之下,多语言模型(在多种语言上进行训练的模型)展现出了更多的学习空间,并在接触新数据时表现出更一致的进步。当研究人员仔细观察错误时,他们发现训练倾向于强化关于日常经验性事物(如食物、游戏和庆典)的知识,而有时会削弱模型对历史事实或特定政治细节的掌握。
最终,研究表明,文化与修辞性语言之间的关系并不是一个可以通过向人工智能喂养更多数据就能简单切换的开关。虽然两者在人类经验中是紧密相连的,但教给人工智能其中之一并不保证它能掌握另一者。本研究中发现的唯一可靠桥梁是从诗歌到成语,这表明接触语言的艺术性和非字面性部分,有助于模型驾驭其隐喻景观。目前,通往真正具备文化意识的人工智能之路依然是不平坦的,它需要的不仅仅是从一个领域向另一个领域的简单知识迁移。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。