← 最新论文
🤖 AI

CulTrace: Tracing Internal Cultural Reasoning in Large Language Models

该论文介绍了 CulTrace,这是一种机械解释性方法,它揭示了大型语言模型通过领域参与、文化解析和答案选择这一连贯的三阶段轨迹来进行文化推理,同时也暴露了模型在处理代表性较低的文化时存在的失衡问题。

原作者: Haeun Yu, Arnav Arora Seogyeong Jeong, Nadav Borenstein, Siddhesh Pawar, Jisu Shin, Jiho Jin, Junho Myung, Alice Oh, Isabelle Augenstein

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Haeun Yu, Arnav Arora Seogyeong Jeong, Nadav Borenstein, Siddhesh Pawar, Jisu Shin, Jiho Jin, Junho Myung, Alice Oh, Isabelle Augenstein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大型语言模型是当今我们使用的许多人工智能工具背后的引擎,它们能够针对几乎任何话题生成类人文本。这些系统是在来自互联网的海量数据上进行训练的,通过学习如何根据之前见过的模式来预测句子中的下一个词。由于这些训练数据来自世界各地,人们越来越期望这些模型能够理解并尊重不同文化的细微差别,从地方习俗到地域美食。然而,当这些模型在文化细节上出错时,人们往往很难理解原因。传统的测试方法只关注模型给出的最终答案,就像在不看学生解题过程的情况下给学生的考试评分一样。这种方法告诉我们答案是否正确,但却隐藏了导致该答案的思维过程,让研究人员对机器内部究竟在哪里发生混淆感到茫然。

为了解决这个问题,来自哥本哈根大学和韩国科学技术院(KAIST)的一个研究小组开发了一种观察这些模型内部的新方法。他们创建了一种名为 CulTrace 的方法,它就像一扇通往模型内部思维的窗口。这项技术不再仅仅等待最终输出,而是允许研究人员逐层读取模型的“想法”。请将大型语言模型想象成一座拥有许多生产阶段的深层工厂:在早期阶段,原材料被分类和准备;在中间阶段,它们被塑形和精炼;在最后阶段,产品被组装和包装。CulTrace 让研究人员可以窥视这座工厂的每一个阶段,以观察模型在每一步到底在关注什么。他们发现,模型并不仅仅是直接跳向一个答案。相反,它遵循一条特定的路径:首先,它确定问题的总体主题;然后,它尝试识别涉及的具体文化;最后,它缩小范围锁定到正确答案。

研究人员利用关于十种不同文化(从韩国、西班牙到埃塞俄比亚和阿尔及利亚)的问题,对这种方法在三种不同的流行语言模型上进行了测试。他们向模型提问有关日常文化知识的问题,例如韩国购物中心里流行的零食是什么,或者与特定地区相关的传统饮料有哪些。通过解码模型在每一层的内部信号,他们可以实时观察推理过程的展开。他们发现了一个关于这些模型如何处理文化信息的连贯模式。模型总是先理解广泛的主题,比如“食物”或“节日”。然后,它们转向识别文化。然而,这正是过程变得混乱的地方。在确定正确的文化之前,模型经常会游荡到附近或相似文化的领地。例如,在被问及阿尔及利亚时,模型可能会先想到北非或法国。在被问及伊朗时,它最初可能会考虑更广泛的中东地区。

这种向“默认”或邻近文化漂移的倾向正是错误经常开始的地方。研究表明,对于像美国、中国或韩国这样代表性强的文化,模型能相对较快地识别出正确的文化,通常是在其处理过程的中层阶段。但对于在训练数据中出现频率较低的文化,如阿尔及利亚或阿塞拜疆,模型需要更长时间才能找到正确的文化背景。它会在早期、混乱的阶段停留更久,经常退回到一个通用的地域标签,或者退回到一个模型似乎默认偏好的文化,例如在测试的一个模型中是日本。这表明,偏差不仅是输出中的最终错误,更是模型在内部处理过程中检索和精炼文化知识时的一个根本性问题。模型不仅仅是在猜测;它正在积极地进行推理,但对于代表性较低的文化,其推理路径更长,也更容易产生困惑。

这一发现对于我们如何构建更好的人工智能具有重要意义。如果问题在于模型在思考的中期阶段卡在了错误的文化邻域,那么仅仅修正最终答案是不够的。研究人员建议,改进需要在过程更早的阶段进行,特别是模型试图解析文化背景的那些层级。通过了解模型究竟在哪里以及如何产生混淆,开发者可以更精准地针对其训练工作。与其仅仅教模型正确答案,不如帮助它学会更早地识别正确的文化,并避免那些导致误判的弯路。这项工作使该领域超越了仅仅检查模型是对是错,而是提供了一张清晰的地图,展示了文化知识是如何在复杂的层层人工智能结构中被构建、精炼,有时又是如何丢失的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →