← 最新论文
💬 NLP

Progressing beyond Art Masterpieces or Touristic Clichés: how to assess your LLMs for cultural alignment?

本文通过提出新的设计指南、构建相应数据集,并通过对比实验证明该方法在区分文化专用模型方面能产生更具判别力的结果,从而解决了现有数据集在评估大语言模型文化对齐方面的局限性。

原作者: António Branco, João Silva, Nuno Marques, Luis Gomes, Ricardo Campos, Raquel Sequeira, Sara Nerea, Rodrigo Silva, Miguel Marques, Rodrigo Duarte, Artur Putyato, Diogo Folques, Tiago Valente

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: António Branco, João Silva, Nuno Marques, Luis Gomes, Ricardo Campos, Raquel Sequeira, Sara Nerea, Rodrigo Silva, Miguel Marques, Rodrigo Duarte, Artur Putyato, Diogo Folques, Tiago Valente

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图招聘一名新员工,让他去某个特定社区工作。你想知道他是否真正理解当地的风气、内部笑话和该社区不成文的规则,还是说他只是一个背下了几本指南事实的“游客”。

本文探讨的是我们如何测试大型语言模型(LLM)——即我们日常使用的 AI 聊天机器人——以判断它们是否真正与特定人群(在本例中为葡萄牙人)“文化对齐”,还是仅仅凭借表面知识在装模作样。

以下是本文的脉络梳理,借助一些简单的类比:

1. 问题所在:“旅游手册”式测试

作者认为,目前大多数针对 AI 文化的测试就像旅游手册。它们提出的问题诸如:

  • “葡萄牙最著名的画作是什么?”
  • “意大利人通常晚餐吃什么?”
  • “法国的首都是哪里?”

为何这种测试行不通:

  • “谷歌”效应: 任何在互联网上训练过的 AI 都已经知道这些事实。这就像通过询问埃菲尔铁塔的名字来测试当地居民;即使是游客也知道。这并不能证明他们生活在那里。
  • 刻板印象陷阱: 这些问题往往依赖陈词滥调(例如“意大利人爱吃意大利面”)。这就像通过一个卡通人物来评判整个社区。它忽略了文化真实、混乱且充满日常细节的现实。
  • “拐杖”问题: 许多测试明确告诉 AI:“假设你在葡萄牙,回答这个问题。”作者指出,这是作弊。这就像在学生甚至没读题之前,就给他们一张写着“你正在考场里”的作弊小抄。这虚增了分数,却并未证明他们真正掌握了内容。

2. 解决方案:“本地酒吧”式测试

作者提出了一种构建此类测试的新方法,称之为Tuguesice-PT。与其询问著名地标或历史书籍,他们设计该测试使其感觉像是在本地酒吧里的一次随意交谈

他们为出题人制定了一套严格的规则(指南):

  • 无“游客”线索: 不要在问题中说“在葡萄牙……"。要自然地提问。如果你问“谁是 20 世纪大部分时间的独裁者?”而不提及国家,真正的当地人应该知道答案,但通用的 AI 可能会猜错。
  • 日常知识: 询问当地孩子成长过程中学到的事情,而不是百科全书里的内容。例如,询问两个本地城市之间的具体公交线路,而不是询问该国的人口数量。
  • 唯一明确答案: 避免模糊的问题,如“人们通常喝什么?”(这取决于你问谁,可能是葡萄酒、啤酒或水)。要询问具体的、有且只有一个正确答案的事实性问题。
  • "AI 失败”规则: 理想情况下,问题应该足够棘手,以至于如果大型知名 AI 模型(如来自 Google 或 OpenAI 的模型)没有针对该文化进行专门训练,它们就会答错

3. 实验:对决

团队构建了新的“本地酒吧”测试(Tuguesice-PT),并将其与旧的“旅游手册”测试(名为 BLEnD 的数据集的翻译版本)进行了对比。

他们让一系列模型同时接受这两项测试:

  • “当地人”: 经过葡萄牙数据专门微调(训练)的 AI 模型。
  • “游客”: 未经过葡萄牙数据训练的通用 AI 模型。
  • “大牌”: 像 Gemini 和 Llama 这样庞大且强大的模型。

结果:

  • 在旧测试(旅游手册)上: 所有人的得分都很高。“当地人”和“游客”的得分几乎相同。该测试无法区分真正理解文化的模型和仅仅背诵维基百科的模型。这就像一场所有人都得了"A"的考试,因为题目太简单了。
  • 在新测试(本地酒吧)上: 差异巨大。
    • 专门为葡萄牙训练的模型(“当地人”)表现要好得多。
    • 通用模型(“游客”)表现明显吃力。
    • “神谕”测试: 当研究人员给通用模型一个“提示”(告诉它们“假设你是葡萄牙人”)时,它们在旧测试上的得分飙升,但在新测试上的得分依然很低。这证明旧测试仅仅衡量了 AI 是否能遵循指令,而非它是否真正了解文化。

4. 结论

本文得出结论:要真正了解 AI 是否理解一种文化,我们需要停止询问它关于艺术杰作和旅游陈词滥调的问题。

相反,我们需要询问那些未言明的、日常的细节,只有那些真正生活在那里的人才会自然地知道。通过移除“拐杖”(如告诉 AI 它在哪个国家)并专注于具体的、本地的、事实性的知识,我们最终可以看清哪些模型真正与文化对齐,而哪些只是在假装。

简而言之: 旧测试就像问一条鱼:“你知道水是什么吗?”(大家都说是)。新测试则问:“周二在里斯本海岸外,捕沙丁鱼的最佳地点是哪里?”(只有当地的鱼才知道)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →