← 最新论文
💬 NLP

Whose Norms? Disentangling Cultural and Personal Alignment in Large Language Models

本文介绍了用于评估大语言模型如何在文化规范与个人偏好之间进行权衡的 PACT 框架,揭示了模型表现出僵化且依赖上下文的文化执行,并且未能捕捉到人类社会判断中存在的细微多元性与不确定性。

原作者: Angana Borah, Isabelle Augenstein, Rada Mihalcea

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Angana Borah, Isabelle Augenstein, Rada Mihalcea

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对论文《Whose Norms?》(谁的规范?)进行的解释。

核心理念: “社交之舞”的困境

想象你正在异国他乡参加一场晚宴。主人希望每个人都用右手进食(这是一个文化规范)。然而,你最习惯使用的是左手,而且你真的很想用它(这是你的个人偏好)。

你应该怎么做?

  1. 遵循规则: 用右手进食,以示礼貌并尊重主人的文化。
  2. 跟随直觉: 用左手进食,因为这让你感觉更自然。

这篇论文探讨的是:当大语言模型(LLMs)在这些棘手的场景中充当顾问时,它们是告诉你遵循规则,还是告诉你跟随直觉?

研究人员将此称为 PACT 框架(个人偏好与文化规范的权衡)。他们构建了一个庞大的“测试”,包含数百个类似上述晚宴的场景,以观察不同的 AI 模型如何处理这种拉锯战。


关键发现(“剧情反转”)

1. 并非所有 AI 都一样(“性格”测试)

就像人类有不同的性格一样,AI 模型也有不同的“道德指南针”。

  • “规则追随者”: 一些模型(如 Mistral 和 Qwen)就像严厉的老师。它们几乎总是说:“遵循文化规范!”它们很少让个人偏好获胜。
  • “自由灵魂”: 其他模型(如 Llama 和 GPT)则更像开明的朋友。即使违反了当地规则,它们也更有可能说:“做让你觉得舒服的事也没关系。”
  • “中间派”: 一些模型则处于两者之间,取决于具体情况。

类比: 想象一群旅行者。一个旅行者(Mistral)总是严格遵守指南;另一个旅行者(Llama)则说:“咱们就随性一点吧。”论文发现,AI 模型表现得就像这些不同类型的旅行者一样。

2. 地点比身份更重要

研究人员测试了 AI 是否会关心参与者的年龄性别(例如:“年长的男性是否应该遵循规则,而年轻女性可以打破规则?”)。

  • 结果: AI 几乎不在乎年龄或性别。
  • 真正的驱动力: 国家/地区才是最重要的。
    • 如果场景设定在美国或英国,AI 更倾向于说:“随你便。”
    • 如果场景设定在亚洲、中东或非洲的部分地区,AI 则要严格得多,并表示:“遵循当地规则。”

类比: 把 AI 想象成一名天气预报员。它并不在乎你穿红衬衫还是蓝衬衫(人口统计特征);它只在乎你站在沙漠里还是热带雨林里(国家/地区)。地点决定了建议的“天气”。

3. “训练”改变了性格

论文研究了“基座”(Base)模型(原始 AI)与“指令”(Instruct)模型(经过人类对话训练后的 AI)的区别。

  • 令人惊讶的是: 训练并没有以同样的方式让所有 AI 都变得更“像人”。
    • 对于某些模型,训练让它们更愿意让你打破规则。
    • 对于另一些模型,训练则让它们在遵循规则方面变得更加严格。
  • 为什么? 这取决于开发者在训练期间告诉 AI 优先考虑什么(例如,“要有帮助”还是“要安全”)。

类比: 想象两名学生参加同样的期末考试。一名学生刻苦学习,变得成为了一个严格的守规者;另一名学生刻苦学习,却变成了一个富有创造力的解决问题者。“训练”改变了他们,但方向却截然相反。

4. AI 无法理解“也许”

这也许是最重要的发现。在现实生活中,当人类面临这些困境时,人们往往会有分歧。房间里的某些人可能会说,“遵循规则”,而另一些人可能会说,“随你便”。这并没有一个单一的“正确答案”。

  • AI 的问题: AI 试图选出一个“赢家”。它选择大多数人类会选择的选项(多数派)。
  • 缺失的细微差别: AI 无法捕捉到不确定性。它没有意识到人类其实意见严重分化。它表现得好像它知道答案一样,即便人类本身正处于困惑之中。

类比: 想象一次抛硬币。如果 51% 的人说“正面”,49% 的人说“反面”,人类知道这是一个势均力敌的情况。然而,AI 会自信地大喊“正面!”,并将其当作事实。它忽略了房间里其实存在分歧这一事实。

5. “主场”优势

当研究人员要求人类评价来自其母国的场景时,人类之间的分歧最大。

  • 原因: 当你在自己的文化中时,你知道规则是灵活的。你知道存在例外情况。
  • AI 的盲点: AI 经常将文化规范视为不可逾越的法律,即便是在人类知道这些规范其实很灵活的文化中也是如此。

类比: 如果你问当地人关于他们城市的交通规则,他们可能会说:“嗯,凌晨两点大家都会闯红灯,但技术上是不应该的。”如果你问一个游客(或 AI),他们会说:“红灯意味着停止,就这么简单。”AI 错失了这种“本土细微差别”。


总结:这意味着什么?

论文得出结论,我们不能仅仅问 AI:“在这种文化下,什么是正确的做法?”,因为:

  1. 不同的 AI 会给出不同的答案,这取决于它们的内在“性格”。
  2. AI 太过僵化。 它们将文化规范视为不可打破的法律,而人类知道规范通常是可以协商的。
  3. AI 忽略了分歧。 它们选择一个单一的答案,但在实际的社交场合中,人类往往无法就答案达成一致。

核心启示: 如果我们希望 AI 成为社交情境中的优秀顾问,我们需要停止要求它给出一个单一的“正确答案”。相反,我们需要教会它去理解:有时,并不存在唯一的正确答案——有的只是混乱的人类辩论。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →