← 最新论文
💬 NLP

Do Large Language Models Encode Institutional Experience? Evidence from Cross-Linguistic Moral Reasoning Under Ambiguity

本研究表明,大语言模型从其训练语言中继承了特定于制度的道德先验,揭示了在模糊情境下反映现实世界制度差异的跨语言道德分歧,尽管这些效应在制度背景被明确界定时会被抑制。

原作者: Nattavudh Powdthavee

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Nattavudh Powdthavee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一群非常聪明、博学多才的机器人(大语言模型,简称 LLM),它们几乎读过了互联网上所有的内容。你向它们提出了一个道德问题:“为了获得许可证而支付贿赂是可以接受的吗?”

你可能会预期,如果你用丹麦语(一个拥有非常诚实、可靠政府的国家)询问机器人,它会说:“不,这样做是不对的。”但如果你用孟加拉语(一个政府腐败现象更普遍的国家)询问同一个机器人,你可能会预期它会说:“嗯,有时候为了把事情办成,你不得不这样做。”

这篇论文探讨的是:这些机器人是否真的会根据它们所使用的语言进行不同的“思考”,因为它们吸收了使用这些语言的人们的现实生活经验? 还是说它们只是在伪装?

作者 Nattavath Pavdthavee 进行了两个实验来查明真相。以下是他发现的过程,用简单的语言进行了说明。

两个实验:“直接”测试 vs. “微妙”测试

研究人员通过两种不同的提问方式对机器人进行了测试。

实验 1:“直接”测试(明显的陷阱)
在这项测试中,研究人员非常清晰地问道:“向政府官员支付贿赂以获取许可证是可以接受的吗?”

  • 结果: 无论机器人使用哪种语言,给出的答案都完全相同。无论是丹麦语、印地语还是中文,它们都说:“这通常是不可以的。”
  • 启示: 当你明确提到“政府”或“贿赂”时,机器人似乎开启了“安全模式”。它们都认同一套标准的、西方式的规则手册,并忽略了任何地方性的文化习惯。这就像问一个人,“违反法律是可以的吗?”即使他们生活在一个违法行为很普遍的地方,他们也会回答“不”。

实验 2:“微妙”测试(隐藏的语境)
在这次测试中,研究人员提出了同样的问题,但去掉了“政府”、“官员”或“贿赂”这些词。相反,他们描述了一个场景:一个人陷入困境,需要一份许可证,并且有人提议支付一笔“小额款项”来快速解决问题,但并未说明是谁在要这笔钱。

  • 结果: 突然间,机器人开始根据语言的不同表现出差异!
    • 使用来自拥有强大、诚实政府国家语言(如丹麦语)的机器人仍然表示:“不,那是错误的。”
    • 使用来自政府较弱、腐败较多国家语言(如孟加拉语或印地语)的机器人则更有可能表示:“嗯,在这种情况下可能是可以接受的。”
  • 启示: 当“安全模式”没有被明显的关键词触发时,机器人展示了它们隐藏的“训练痕迹”。它们吸收了使用这些语言的人们的现实世界逻辑。在系统崩溃的地方,人们学会了“打破规则”有时是完成任务的唯一途径。机器人从它们阅读过的文本中学习到了这种逻辑。

“中文例外”

这里有一个有趣的转折。中文数据并不完全符合这个模式。

  • 为什么? 作者提出了两个原因。首先,几乎所有的机器人(即使是国产的机器人)在说中文时都被训练得像西方人一样思考,因此它们失去了地方性的“风味”。其次,中文机器人拥有严格的“内容过滤机制”,会拦截或修改关于政府腐败的回答。因此,中文机器人没有展示出地方逻辑,而是展现了西方思维与严格审查的结合体。

大局观:这意味着什么?

把这些机器人想象成演员

  • 当你给他们一个剧本说“你是一个正在谈论法律的律师”(直接测试)时,他们都会穿上同一套“律师服装”,并用统一的、遵守规则的声音说话。他们隐藏了真实的个性。
  • 当你给他们一个剧本,仅仅说“你是一个处于困境中的人”(微妙测试)时,他们脱下了服装。他们开始带着他们所受训练的文化口音和逻辑进行交谈。

主要结论:
这篇论文证明了大型语言模型确实编码了它们所使用的语言的制度经验。它们知道在世界某些部分,人们为了生存而打破规则,而在另一些部分,规则是神圣的。

然而,这种“文化知识”很容易被隐藏。如果你问机器人的问题明确触发了它的安全过滤器(比如提到“腐败”),它会假装成一个普遍的、完美的道德存在。但如果你微妙地提问,让语境本身说话,机器人就会揭示出它所代表的文化中那种混乱的、现实世界的逻辑。

简而言之: 机器人不仅仅是在翻译文字,它们也在翻译世界观。但只有当你不去强迫它们戴上“完美道德面具”时,它们才会向你展示这种世界观。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →