Interpretable Cross-Lingual Alignment in Small Language Models: Probing Cultural and Pragmatic Reasoning in Japanese-English Bilingual LLMs
本文介绍了用于日语语用现象的最小对(minimal-pair)基准测试 J-PragEval-v0,并利用在 1.5B 双语模型上进行的线性探测(linear probing)和激活转向(activation steering)实验表明,虽然敬语在残差流(residual streams)中是线性可解码的,但诸如隐性主语和圈内指代等其他语用对比是在生成过程中解决的,而非存储在提示词(prompt)中。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
语言不仅仅是词汇和语法规则的集合;它是一个由社交暗示、默契协议和文化语境构成的生命系统。当一个人说日语时,他们一直在应对一张复杂的社交关系图谱,决定谁属于自己的信任圈,谁在圈外,并选择能够精准反映他们对谈话对象感受的措辞。这就是语用学(pragmatics)的领域,即研究语境如何塑造意义。几十年来,人工智能在翻译单词和回答问题方面表现出色,但在被要求理解这些微妙的社交层面时却经常失手。计算机可能知道一个礼貌短语的字典定义,但它往往不知道何时该使用它,或者更糟的是,以一种让听者觉得粗鲁或奇怪的方式来使用它。这种差距在日语中尤为显著,因为在日语中,说话者之间的关系决定了句子的基本结构。随着研究人员构建旨在运行在日常设备上的更小、更高效的计算机模型,一个关键问题出现了:这些紧凑型模型是真的理解它们所使用的语言的文化规则,还是仅仅在模仿表层模式?
独立研究员弗洛里安·布劳恩(Florian Braun)的一项近期研究通过观察一个同时具备英语和日语能力的双语小型计算机模型,试图解决这一问题。该研究关注的是一种被称为“小语言模型”的特定类型人工智能,这类模型旨在既能胜任有用任务,又足够轻量,无需依赖庞大且耗能的服务器。虽然这些模型在日本正变得越来越普遍,但它们的测试通常仅限于翻译文本或回答阅读理解问题的能力。然而,这些标准测试忽略了人类交流中最困难的部分:察言观色的能力。为了解决这个问题,研究人员创建了一个名为 J-PragEval 的新测试场。该测试不再要求模型翻译句子,而是向模型展示两个几乎完全相同、仅在单一社交细节上有所差异的情景,例如说话者是在对老板还是对朋友说话。随后,模型必须根据该社交细节选择正确的句子结尾方式。该测试涵盖了日语社交生活的四个特定领域:使用敬语以示尊重、在主语省略时推测正在谈论的对象、选择体现“圈内人”或“圈外人”身份的动词,以及在不直接说“不”的情况下委婉拒绝请求的艺术。
随后,研究人员窥视了拥有 28 层处理结构的计算机模型内部,以观察它在哪里存储了通过这些测试所需的知识。通过一种类似于模型思想显微镜的方法,研究观察了模型在不同处理阶段的活动情况。结果揭示了模型处理这些社交规则时存在令人惊讶的分歧。对于敬语的使用,模型的表现就像一个组织有序的图书馆。关于使用哪种礼貌程度的信息被清晰地存储在模型的特定层中,通过简单的检查即可实现近 96% 的准确率。模型知晓规则,并将规则准备就绪以供使用。然而,对于其他社交规则,情况发生了变化。当模型必须决定在主语缺失的句子中正在谈论谁,或者在选择合适的“圈内人”与“圈外人”动词时,研究人员无法在模型完成读取提示词的瞬间,在其内部发现关于这些规则的清晰、静态的记忆。内部信号过于微弱,无法被标准检查检测到。然而,当模型实际生成答案时,其正确率达到了 77% 到 79%。这表明模型并非简单地检索存储的规则,而是在构建句子的过程中,实时计算出社交语境。
研究还揭示了我们在测试这些模型时的一个陷阱。其中一项专注于间接拒绝的测试最初似乎显示模型已经掌握了这项技能,检测得分高达 95%。然而,当研究人员仔细观察模型的实际行为时,发现模型在很大程度上并未通过这项测试。高分是由测试设计本身的缺陷导致的假象:正确答案往往是较长的句子,而模型只是根据句子长度进行猜测,而非理解社交细微差别。一旦测试根据长度进行了调整,模型处理间接拒绝时的真实无能才显露出来。这一发现发出警告:如果测试设计不够严谨,无法将真正的理解与表层技巧区分开来,那么计算机测试的高分有时会掩盖深层的误解。
为了应对这些发现,研究人员提出了一种无需从头开始重新训练模型即可引导模型的新方法。这种被称为“语用表示引导”(Pragmatic Representation Steering)的想法,涉及在模型生成文本的瞬间,轻轻地将其内部活动向正确的方向引导。可以将其想象成对模型内部指南针的一次微妙调整,而非对其大脑的彻底改造。研究表明,至少对于那些存储清晰的规则而言,进行此类引导所需的数学方向确实存在于模型的结构之中。这表明,无需承担大规模重新训练的巨大成本,就可以使小语言模型更具文化意识和社会得体性。虽然未来计划对这些引导方法在更大规模模型上的应用进行全面测试,但目前的研究证明,即使文化理解的机制以不同的方式隐藏着,其内部机制本身是存在的。研究结论指出,要让小语言模型真正服务于日语用户,我们必须超越简单的翻译评分,去理解这些模型是如何处理人类连接中那些无形且未竟之言的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。