Characterizing Cultural Localization in AI-Generated Stories
本文介绍了一种区分人工智能生成的叙事中表层的“模板化”与深层的“整体性”文化本土化差异的方法,揭示了模型如何依赖一小组刻板或具有攻击性的文化标记来区分涵盖 193 个国籍的叙事,而其情节结构在很大程度上仍遵循一种共享的、去文化特征的模式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你请五位不同的厨师为一名印度儿童烹饪一个关于“诚实”的故事,然后又为一名美国儿童烹饪完全相同的同一个故事。你可能会预期印度的故事听起来像是充满茶香和板球运动的孟买街头,而美国的版本则像是充满棒球和咖啡的芝加哥公园。
这篇论文研究的是:AI 厨师到底是在烹饪两道不同的菜肴,还是仅仅在同一盘菜上更换了装饰物?
AI “本土化”故事的两种方式
作者定义了 AI 尝试让故事具有本土感的两种方式:
- “贴纸”法(模板化本土化): 想象一个关于男孩归还丢失钱财的通用故事。AI 写好整个故事后,只是简单地将“芝加哥”替换为“班加罗尔”,将“咖啡”替换为“茶”,将“棒球”替换为“板球”。情节、价值观和结构完全保持不变;改变的仅仅是表面标签。
- “混搭”法(整体式本土化): 在这种情况下,AI 会改变故事本身。也许印度的故事是关于一名人力车夫在拥挤的交通中归还了一个包,而美国的故事则是关于一名学生在学校走廊里归还了一个钱包。情节、环境和文化价值观都编织进故事的肌理之中。
实验:“剥洋葱”测试
研究人员想看看 AI 使用的是哪种方法。他们要求五个不同的 AI 模型为 193 个不同的国籍编写 125 个不同的故事。
为了测试他们的理论,他们玩了一个“移除并比较”的游戏:
- 识别“贴纸”: 他们使用计算机程序来寻找使故事听起来像“印度”或“美国”的特定词汇(如名字、地点或特定的食物)。
- 将它们“剥离”: 他们从故事中数字地移除了这些特定词汇。
- 比较剩余部分: 他们问道:“如果我们拿掉‘印度’词汇和‘美国’词汇,剩下的故事看起来是否一样?”
研究结果:
这就像是在剥洋葱,发现核心是完全相同的。当他们仅移除 9% 到 17% 的词汇(即“贴纸”)时,来自不同国家的故事变得几乎无法区分。剩余的文本如此相似,以至于证明了 AI 为所有人使用了一个单一的、通用的、“文化中立”的模板。
比喻:
把它想象成一个“填词游戏”(Mad Libs),AI 有一个预先写好的剧本。它只是根据国家情况更改名词和形容词,但句式结构、故事的寓意以及事件的顺序都是完全一样的。AI 并不是在为每个文化编写新故事,它只是在主模板上填空。
“风味”问题:刻板印象与冒犯
研究人员还观察了他们移除的那些“贴纸”。这些文化标记是准确的,还是仅仅是刻板印象?
他们发现,虽然许多标记是无害的(如“茶”或“萨莫萨炸饺”),但 19 个国家 的标记平均被来自这些地区的受访者评定为具有冒犯性。
- 谁得到了负面标签? 具有冒犯性的标记几乎全都是针对全球南方国家(主要是非洲和西亚)的。
- 标签是什么? AI 并没有提供丰富的文化细节,而是经常诉诸负面刻板印象。例如,某些国家的标记包括了“乞丐”、“不可靠”、“恐怖分子”或“臭气熏天”等词汇。
大局观
论文得出结论,目前的 AI 模型并不具备真正的“文化胜任力”。它们并不理解不同文化的深层价值观或独特的叙事风格。相反,它们正在做的是:
- 使用一种“一刀切”的模板 来处理实际的故事内容。
- 贴上表面层级的标签 让它看起来具有本土特色。
- 有时甚至使用具有冒犯性的刻板印象 作为这些标签,尤其是针对较贫穷的国家。
作者警告说,如果我们只看 AI 是否“提到”了当地事物,我们可能会认为它做得很好。但如果我们观察故事本身,它往往只是换了个名字标签的旧故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。