← 最新论文
💬 NLP

LLMs Infer Cultural Context but Fail to Apply It When Responding

本文介绍了 CAPRI 数据集,旨在证明虽然大型语言模型能够推断文化语境并召回相关惯例,但除非受到明确引导,否则它们往往无法应用这些知识来生成经过文化适配的响应。

原作者: Yisong Miao, Jian Zhu, Vered Shwartz

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yisong Miao, Jian Zhu, Vered Shwartz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、博学多才的图书管理员,他读过世界上几乎所有的书。这位图书管理员对不同国家了解颇深:他知道法国人使用摄氏度,美国人使用华氏度,也知道日本的电话号码格式与巴西不同。

然而,这篇论文揭示了这位图书管理员在工作方式上的一个有趣且令人沮丧的缺陷。他虽然掌握着这些事实,但在与你交谈时却忘了运用它们。

以下是使用简单类比对研究进行的拆解:

1. 测试:“文化侦探”游戏

研究人员创建了一个名为 CAPRI(文化与语用响应推理)的游戏。想象一个聊天机器人正在与用户对话。用户会留下一些微妙的暗示,比如提到一个特定的法国网站(Fnac.com)或使用法国电话号码的格式。

聊天机器人有两个任务:

  1. 发现线索: 推断出:“哦,这个用户很可能来自法国。”
  2. 调整回答: 当用户询问“现在的温度是多少?”(并展示一张温度计的照片)时,机器人应该回答“40°C”(符合法国习惯),而不是“104°F”(符合美国习惯)。

2. 问题所在:“懂得多但不听劝”的人

研究人员测试了目前最智能的 AI 模型。结果如下:

  • 侦探部分(任务 1): AI 在这方面表现出色。只要你给它一两个线索,它几乎 100% 能正确猜出用户的国家。它掌握着这些事实。
  • 适配部分(任务 2): 这正是它失败的地方。即便 AI 知道 用户是法国人,它也经常忽略这一知识,仍然以美国单位(华氏度)给出答案。

类比: 这就像一个服务员,他明知道你是素食主义者(因为你告诉过他你不吃肉),但当你点汉堡时,他还是因为处于“自动驾驶”状态而给你端上了一块牛排,完全没把你的身份和你的订单联系起来。

3. 解决方法:“大声思考”

研究人员尝试了一个修复技巧。他们要求 AI 在回答之前先**“大声思考”**。他们要求:“首先,确定用户来自哪里。然后,根据该地点决定使用哪种单位。”

这样做之后,AI 的表现有了显著提升。这就像是在告诉服务员:“停下来想一想:等等,这个人是素食主义者。我需要把牛排换成沙拉。” 一旦 AI 被迫进行分步推理,它终于开始给出符合文化的答案了。

4. “默认设置”偏差

研究还观察了在 没有任何线索 的情况下(没有电话号码、没有提到的网站)会发生什么。

  • 国家猜测: 如果 AI 在没有任何提示的情况下进行猜测,它通常会猜是美国
  • 单位猜测: 但这里有一个转折:尽管它猜的是美国,但它仍然经常使用公制单位(摄氏度、公里),而这恰恰是美国并不使用的。

这看起来像是 AI 拥有一个“默认人格”,它是美国公民与欧洲人特征的混合体。它并不真正中立;它有着基于其开发地和训练数据所产生的隐藏偏见。

5. 主观事物(时间与“一些”)

研究人员还测试了一些没有严格规则的“模糊”概念,比如一天中的时间(下午 6 点是“傍晚”还是“下午”?)或篮子里有多少个鸡蛋(是“几个”还是“一些”?)。

  • 好消息: 随着线索的增加,AI 开始改变其回答以匹配不同的文化。
  • 坏消息: 在没有线索的情况下,AI 的“默认”回答往往倾向于开发该模型的公司的文化(例如,中国模型倾向于中国的解释,美国模型则倾向于美国的解释)。

总结

论文结论指出,目前的 AI 模型就像是尚未学会如何成为优秀对话者的百科全书。它们将文化事实存储在大脑的一个部分,而将运用这些事实的能力存储在另一个部分,但两者之间并没有自动建立联系。

要让它们真正变得有用,我们不能仅仅依赖它们“了解”文化;我们必须明确地教它们去停顿、思考正在与谁交谈,然后调整自己的回答。在此之前,它们可能知道你是法国人,但依然会用华氏度来告诉你温度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →