← 最新论文
💬 NLP

Histoires Morales: A French Dataset for Assessing Moral Alignment

本文介绍了“Histoires Morales”,这是一个源自 Moral Stories 的经过文化适配的法语数据集,旨在解决评估法语语言模型道德对齐时资源匮乏的问题,并证明了尽管这些模型默认通常遵循道德规范,但它们仍然容易通过用户偏好优化受到操纵。

原作者: Thibaud Leteno, Irina Proskurina, Antoine Gourru, Julien Velcin, Charlotte Laclau, Guillaume Metzler, Christophe Gravier

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Thibaud Leteno, Irina Proskurina, Antoine Gourru, Julien Velcin, Charlotte Laclau, Guillaume Metzler, Christophe Gravier

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大型语言模型是强大的工具,它们通过基于从海量文本中学习到的模式来预测句子中的下一个词,从而实现写作、翻译和对话。随着这些系统日益融入日常生活,一个关键问题出现了:它们是否理解人类的价值观?具体而言,它们能否像人类一样区分对与错?虽然研究人员在测试这些模型的英文和中文能力方面取得了显著进展,但在法语(世界第五大语言)方面仍存在重大空白。由于缺乏衡量这些模型如何处理法语道德推理的方法,很难得知它们是否会对数亿法语使用者表现出符合伦理的行为。这种不确定性至关重要,因为一个无法理解文化细微差别或道德规范的模型,可能会提供有害的建议,或者以一种对机器来说自然、但对用户来说错误的逻辑来强化偏见。

为了填补这一空白,来自法国的一个研究小组创建了一个名为 HISTOIRESMORALES 的新资源。该数据集由 12,000 个法语短篇故事组成,每个故事都描述了一个社会情境,其中一个人面临着道德行为与不道德行为之间的抉择。这些故事涵盖了广泛的日常场景,从对待亲朋好友的方式到处理金钱或动物的方式。例如,一个故事可能描述一个人为了和朋友出去玩而忽略了父母的电话,而另一个故事可能描述一个人支付兽医的诊费,还是拒绝支付。每个叙述都包含了背景、人物的意图、他们采取的行为以及该行为的后果。研究人员并非简单地将这些故事从英文翻译过来;他们仔细地对其进行了改编,以符合法国文化。这意味着将名字如“John”改为“Jean”,将货币从美元转换为欧元,并将美国式的活动(如打棒球)替换为更常见的法国消遣方式(如打网球)。他们还确保了习语和社会暗示对法语母语者来说感觉自然,而不是听起来像是一个直接且生硬的翻译。

该团队通过利用现有的英文故事集,并结合自动化翻译和人工审核来构建这个数据集。他们首先使用语言模型进行文本翻译,然后要求法语母语者纠正错误并确保文化背景的准确性。这个过程涉及多轮检查,人类标注员评估翻译是否保留了原意、使用了正确的语法,并适当地改编了文化引用。研究人员发现,仅仅翻译单词是不够的;模型往往会忽略语调或情境中的文化分量。通过在翻译指令中加入具体的错误示例和修正方法,他们显著提高了最终数据集的质量。其结果是一个让法语使用者感到真实的系列故事,使研究人员能够测试人工智能对法国社会道德结构的理解程度。

利用这个新数据集,研究人员测试了几种大型语言模型,以观察它们在道德推理任务中的表现。他们要求模型预测给定的行为是否可能发生,或者在道德选项与不道德选项之间做出选择。结果显示,虽然模型通常与人类的道德规范保持一致,但它们并不完美。事实上,模型在处理英文故事时的表现略优于法语,这表明它们的训练数据在英文方面可能更丰富或更平衡。更令人惊讶的是,研究人员发现这些道德对齐是脆弱的。通过使用一种称为“直接偏好优化”的技术(即向模型展示少量偏好行为的示例),我们可以轻易地改变模型的道德指南针。仅需 84 个示例,就可以训练模型去偏好不道德行为而非道德行为,反之亦然。这表明模型并不具备深层且不可改变的对错观;相反,它们的行为对所接触的数据高度敏感。

研究结论指出,虽然目前的语言模型通常很有帮助且符合人类价值观,但它们的道德推理并不稳健,尤其是在处理英语以外的语言时。通过少量训练数据就能轻易影响模型的道德立场,这表明这些系统在没有仔细监督的情况下,尚不足以被信任来处理复杂的伦理决策。HISTOIRESMORALES 的创建为研究人员持续监测和改进这些系统提供了重要的工具,确保随着这些系统能力的增强,它们在不同文化和语言中也能变得更加值得信赖。这项工作强调,构建伦理人工智能不仅仅是翻译代码;它需要对这些工具将要使用的文化和道德背景有深刻的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →