← 最新论文
💬 NLP

LLMs as Cultural Archives: Cultural Commonsense Knowledge Graph Extraction

本文引入了一种从大语言模型中提取文化常识知识图谱的迭代框架,旨在结构化隐性的文化知识,并揭示了尽管这些图谱增强了文化推理与生成能力,但在表示非英语文化时目前仍表现出显著的英语偏见。

原作者: Junior Cedric Tonga, Chen Cecilia Liu, Iryna Gurevych, Fajri Koto

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Junior Cedric Tonga, Chen Cecilia Liu, Iryna Gurevych, Fajri Koto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,大型语言模型(LLM)就像是巨大的、无形的图书馆。这些图书馆里装满了世界各地人们编写的书籍,因此它们包含了大量关于不同文化如何思考、行动和庆祝的信息。然而,目前这些信息是混乱的。它们被埋藏在图书馆深处,散落在数百万个无序的句子中,很难找到或理解某种文化的特定“规则”。

本论文提出了一种清理这座图书馆并将其转化为文化常识知识图谱(CCKG)的方法。请将这个图谱想象成不是一份事实清单,而是一个火车轨道系统

核心理念:将事实转化为火车轨道

通常,如果你问人工智能关于文化的问题,它可能会给你一个单一的事实,比如“印度尼西亚人早餐吃 soto ayam(鸡肉汤)”。那是一个静态的事实。

作者想要绘制出这个事实的旅程。他们构建了一个系统来询问人工智能:“如果有人想吃早餐,接下来会做什么?然后呢?在那之后又会发生什么?”

  • 轨道: “如果你寻找早餐 \rightarrow 你会去 warung(小店) \rightarrow 你点一份 soto ayam \rightarrow 你感到温暖和慰藉。”

通过连接这些步骤,他们创建了一条文化逻辑的“火车轨道”。这使得人工智能不仅能理解发生了什么,还能理解文化生活的流动

他们是如何铺设轨道的(过程)

研究人员将人工智能(特别是 GPT-4o)视为一名“文化档案管理员”。他们使用了一个两步走的过程来构建这些轨道:

  1. 铺设第一道铁轨(初始生成): 他们要求人工智能针对日常生活的各种话题(如食物、婚礼或习惯)生成简单的“如果-那么”陈述,涵盖了五个不同的国家:中国、印度尼西亚、日本、英国和埃及。
  2. 延伸轨道(迭代扩展): 这是聪明之处。一旦人工智能说“如果你寻找早餐,你会点一份 soto ayam”,研究人员就会要求人工智能填补空白。
    • 中间扩展: “在寻找早餐和点餐之间会发生什么?也许你会先选择一份配菜。”
    • 向前扩展: “点餐之后会发生什么?也许你会加入 sambal(辣椒酱)。”

他们重复了这个过程,将一个单一的事实转变为一条长长的、逻辑性的文化行为链。

大惊喜:“英语桥梁”

研究人员有一个假设:“如果我们想了解印度尼西亚文化,我们应该用印尼语询问人工智能。如果我们想了解中国文化,我们应该用中文询问。”

他们错了。

当他们测试这些文化轨道的质量时,发现了一个奇怪但一致的模式:用英语构建的轨道比用母语构建的轨道效果要好得多。

  • 类比: 想象你在绘制一张城市地图。你可能会认为用当地语言绘图会最准确。但研究人员发现,人工智能的“内部地图”是用英语绘制得最清晰的。即使是在描述印度尼西亚式的早餐或埃及式的婚礼时,当人工智能被迫使用英语时,它产生的文化轨道也更加逻辑严密、连贯且符合文化事实。
  • 结果: 与中文、阿拉伯文或印尼文版本相比,英语版本的知识图谱在人类评估者看来更具一致性,也更有意义。

这对小型 AI 有帮助吗?

研究人员随后将这些“火车轨道”(CCKG)提供给规模较小、能力较弱的 AI 模型,以观察这是否能帮助它们更好地理解文化。

  • 测试: 他们要求这些较小的模型回答有关文化的问题或编写短篇故事。
  • 结果: 当这些较小的模型被允许“观察轨道”(使用 CCKG 作为引导)时,它们在回答问题和编写具有文化真实感的文章方面表现得好得多。
  • 注意点: 最大的提升出现在模型使用英语轨道时,即使是针对非英语文化。看来,“英语桥梁”是目前访问 AI 文化知识最可靠的方式。

他们并没有声称什么

重要的是要紧扣论文实际内容:

  • 他们没有说这个系统已经可以用于医院、学校或法律系统。
  • 他们没有声称解决了 AI 偏见或刻板印象的问题(事实上,他们指出偏见仍然是一个风险,并且他们没有进行深入的审计)。
  • 他们没有说英语是人类交流的“最佳”语言;他们只是发现,对于这些特定的 AI 模型而言,英语是提取文化逻辑最稳定的语言。

总结

论文表明,我们可以将 AI 模型视为巨大的文化知识档案馆。通过要求人工智能构建文化逻辑的“火车轨道”(如果发生这件事,那么会发生那件事),我们可以创建一个结构化的地图,展示不同文化是如何运作的。然而,这里有一个转折:目前,这些人工智能模型在用英语表达这些文化地图时,似乎理解得最为清晰,即便所描述的文化并非英语文化。“英语优势”有助于较小的 AI 模型表现得更好,但也凸显了我们目前的 AI 工具在呈现世界多样化文化方面仍然是不均衡的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →