← 最新论文
💬 NLP

Differences in Typological Alignment in Language Models' Treatment of Differential Argument Marking

本文表明,尽管在合成语料上训练的 GPT-2 模型成功复现了人类在差异论元标记系统中对标记语义异常论元的偏好,但它们未能复现跨语言中优先标记宾语而非主语的趋势,这表明这些类型学模式源于不同的根本来源。

原作者: Iskar Deng, Nathalia Xu, Shane Steinert-Threlkeld

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Iskar Deng, Nathalia Xu, Shane Steinert-Threlkeld

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机器人说一门新语言。但你不是教它像西班牙语或日语这样的真实人类语言,而是发明了 18 种不同的“假”语言。在每种假语言中,你都有一条特定规则,规定何时在句子中的某个词上添加一个特殊的“印章”(即标记)。

本文讲述的是一组研究人员教 AI 模型(具体为 GPT-2 的某个版本)学习这 18 种假语言,以观察 AI 是否能像人类一样自然地掌握这些规则,还是会感到困惑。

以下是他们所做的工作及其发现,借助一些日常类比进行说明。

游戏:“印章规则”

在现实世界中,语言通常拥有一套称为“差异论元标记”(Differential Argument Marking, DAM)的系统。这是一种 fancy 的说法,意思是:“只有当某个词在做不寻常的事情时,我们才给它盖上特殊的印章。”

研究人员创建了 18 种英语变体,在其中根据四条不同的规则,向句子添加特殊符号(如🅿️或🅰️):

  1. 触发条件:什么使一个词变得特殊?(它是有生命的吗?是特指的吗?是代词吗?)
  2. 目标对象:我们给“施动者”(主语)还是“受动者”(宾语)盖章?
  3. 方向:我们给“异常”情况盖章,还是给“正常”情况盖章?
  4. 复杂度:我们只看一个词,还是将两个词相互比较?

示例

  • 正常英语:“狗追猫。”(无印章)。
  • 假规则:“如果被追逐的事物是有生命的,就给它盖上🅿️印章。”
  • 结果:“狗追猫🅿️。”(因为猫是有生命的)。
  • 结果:“狗追石头。”(无印章,因为石头没有生命)。

两个核心问题

研究人员希望观察 AI 是否能学会人类在真实语言中自然遵循的两种特定模式:

  1. “异常”规则(标记性):人类倾向于给“不寻常”的事物盖章。如果 90% 的情况下你追逐的是石头,而 10% 的情况下你追逐的是猫,你可能会给猫盖章,以表示:“嘿,这才是特别的那个!”
  2. “受动者”规则(宾语偏好):在人类语言中,我们几乎总是给动作的“受动者”(宾语)盖章,而很少给“施动者”(主语)盖章。

AI 的表现(结果)

1. AI 正确掌握了“异常”规则 🎯

AI 非常擅长学习标记性规则。

  • 类比:想象你穿着制服。通常大家都穿蓝色衬衫。但如果你是唯一穿红色衬衫的人,你就会获得一枚特殊徽章。
  • 结果:AI 学会了,如果规则说“给不寻常的事物盖章”,它就完美地执行了。它明白,如果某种“异常”配置出现的频率较低,就需要一个印章来使其脱颖而出。这与人类语言模式完全吻合。

2. AI 未能掌握“受动者”规则 ❌

AI 没有学会宾语偏好规则。

  • 类比:在人类语言中,这就像一条规则:“我们只给接收礼物的人盖章,绝不给赠送礼物的人盖章。”
  • 结果:AI 并不关心谁在赠送或接收。如果规则说“给赠送者盖章”,AI 也能很好地学会。如果规则说“给接收者盖章”,它也能学会。它并没有像人类那样表现出对接收者的强烈偏好。

为什么会这样?(现象背后的“原因”)

作者认为,这两条规则源于我们大脑(或在此情况下,AI 的训练)中两个不同的“引擎”。

  • “异常”引擎是局部的:AI 被训练来预测句子中的“下一个词”。它非常擅长注意到:“嘿,这个词在这里很罕见,所以我应该预期会有一个印章来帮助我预测接下来的内容。”这是一种局部的、机械的技能,AI 非常擅长。
  • “受动者”引擎是全局的:人类倾向于给受动者盖章的原因与讲故事和对话有关。通常,“施动者”是主角(即话题),因此我们不需要标记他们。而“受动者”往往是新信息,所以我们需要标记他们。然而,AI 只是在看下一个词;它并不真正理解故事的“大局”或谁是主角。由于缺乏这种“讲故事”的语境,它没有发展出人类那种给受动者盖章的偏好。

结论

这篇论文表明,AI 模型就像非常聪明的学生,擅长发现模式和统计规律(例如“不寻常的事物会被盖章”),但在社会性和叙事性压力方面(例如“我们通常关注执行动作的人”)却存在困难。

这表明,人类语言的规则并非由同一种材料构成。有些规则仅仅关乎数学和效率(AI 很容易学会),而另一些规则则关乎我们如何讲故事和管理注意力(至少在目前的设置下,AI 还未能完全掌握)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →