← 最新论文
💻 computer science

High-Risk Memories? Comparative audit of the representation of Second World War atrocities in Ukraine by generative AI applications

该论文通过实证审计三种主流生成式人工智能应用在二战乌克兰大屠杀记忆中的表现,揭示了其在事实幻觉、群体描绘失真及选择性道德化等历史误述方面的风险,并探讨了其对未来记忆实践的深远影响。

原作者: Mykola Makhortykh, Victoria Vziatysheva, Maryna Sydorova

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Mykola Makhortykh, Victoria Vziatysheva, Maryna Sydorova

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给三位“超级 AI 历史老师”(ChatGPT、Bing/Copilot、Google Bard)做了一次突击考试

考试的主题非常敏感且沉重:第二次世界大战期间,乌克兰土地上发生的各种大屠杀和暴行

作者们担心,这些 AI 虽然聪明,但它们对历史的记忆方式和我们人类完全不同,这可能会导致它们“编造历史”或者“歪曲事实”。以下是用通俗语言和比喻对论文核心内容的解读:

1. 核心比喻:AI 是“概率预测机”,不是“历史学家”

想象一下,人类的历史学家像是一个严谨的档案管理员,他们查阅文件、核实证据,力求还原真相。

而生成式 AI(GenAI)更像是一个极其擅长猜谜的“接龙大师”。它并不真正理解“大屠杀”意味着什么,也不理解“道德”的重量。它只是根据以前读过的海量文字,计算下一个字最可能是什么。

  • 风险点:如果它读过的书里,关于某个历史事件的描述是混乱的、互相矛盾的(这在战争记忆争夺中很常见),或者它读到的资料本身就包含谎言,它就会把这些混乱和谎言“猜”出来,并一本正经地告诉你:“这就是事实。”

2. 考试结果:三位老师的表现参差不齐

研究人员问了这三位老师 74 个关于乌克兰二战暴行的问题(用英语、乌克兰语和俄语提问),看看它们回答得准不准。

  • 整体得分不高:平均下来,只有**50%**的回答是准确的。也就是说,你问它两个问题,它可能就会瞎编一个。
  • 语言歧视
    • 英语:表现相对较好。
    • 乌克兰语和俄语:表现很差。特别是用乌克兰语问一些具体的历史细节时,AI 经常“卡壳”或者胡编乱造。
    • 比喻:这就像是一个老师,讲英语故事时很流利,但一让他用乌克兰语讲本地故事,他就开始胡言乱语,甚至编造从未发生过的惨案。

3. 两大“作弊”行为

论文发现 AI 主要通过两种方式“歪曲历史”:

A. 幻觉(Hallucinations):无中生有

这是最危险的部分。AI 会一本正经地胡说八道。

  • 例子:Bard 曾编造说,乌克兰民族主义领袖班德拉(Stepan Bandera)因为拒绝与纳粹合作而被捕(实际上情况复杂得多,且并非如此简单);或者编造一些根本不存在的目击者证词。
  • 比喻:这就像是一个学生为了应付考试,把没背过的知识点全编成了故事,而且编得头头是道,连老师(普通用户)都看不出来是假的。

B. 道德说教的不一致性:看人下菜碟

AI 喜欢在回答时加上“道德评语”,比如“这是黑暗的一页”、“我们要铭记历史”。但问题是,它什么时候说,什么时候不说,完全看运气和语言

  • 现象
    • 用英语问,它可能说:“这是人类历史上的悲剧,我们要反思。”
    • 用乌克兰语问同样的事,它可能只干巴巴地列数据,完全不提道德教训。
    • 或者,它可能把针对波兰人的暴行描述得极其惨烈,却对针对乌克兰人的暴行轻描淡写。
  • 比喻:这就像是一个双标裁判。他吹哨子(进行道德评判)毫无规律。有时候他对着一个犯规动作大喊“太恶劣了!”,对着另一个更严重的犯规却视而不见。这让用户很难判断到底什么才是真正值得铭记的。

4. 为什么这很危险?

  • 记忆被“污染”:现在很多人(尤其是年轻人)习惯直接问 AI 获取历史知识。如果 AI 给出的答案是编造的,或者道德立场是摇摆不定的,那么集体的历史记忆就会被悄悄篡改
  • 被坏人利用:在乌克兰,关于二战的历史记忆本身就是一场激烈的“战争”(俄罗斯和乌克兰对同一事件有不同解读)。AI 的不准确和混乱,很容易被政治宣传利用,用来混淆视听,甚至为侵略行为找借口。
  • 低资源语言的受害者:论文特别指出,使用乌克兰语等“小语种”的用户,受到的伤害最大,因为 AI 在这些语言上的训练数据少,更容易出错。

5. 总结与启示

这篇论文告诉我们:现在的 AI 还不足以成为可靠的历史老师。

  • 它不是全知全能的:它经常“一本正经地胡说八道”。
  • 它没有真正的道德感:它的“道德说教”只是模仿人类语言的模式,而不是基于真正的理解。
  • 我们需要警惕:当我们用 AI 查询敏感历史(如大屠杀、战争罪行)时,不能全信。

未来的建议
作者建议,AI 开发者应该给这些模型装上“刹车”。如果 AI 发现自己对某个历史事件了解不够,或者数据太混乱,它应该直接说“我不知道”或者“这个问题很复杂,建议查阅专业资料”,而不是为了讨好用户去编造一个看似合理的答案。

一句话总结
把 AI 当作历史书来读是很危险的,因为它可能会像那个爱吹牛又记性不好的邻居,把你没经历过的惨事编得活灵活现,还顺便给你上一堂忽左忽右的道德课。在涉及人类苦难和记忆的高风险领域,我们还需要人类专家来把关。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →