✨ 要点🔬 技术摘要
在数字时代,我们对过去的理解不再仅仅存储在尘封的档案或长者的记忆中。它存在于互联网庞大且互联的网络中,而人工智能系统正成为新的守门人。这些被称为大型语言模型的系统,是通过海量的人类写作集训练而成的。它们不仅仅是检索事实,更是通过综合信息来构建故事和答案。这向历史学家和社会学家提出了一个深刻的问题:当我们要求一台机器讲述一场战争或一场冲突时,我们得到的是谁的版本?“集体记忆”的概念是指一个群体讲述给自己的关于过去的共同故事,这个故事塑造了他们的身份。如果算法决定包含哪些细节、忽略哪些细节,或者如何构架一场悲剧,它实际上是在重塑那份共同的记忆。人们担心的不仅是日期出错,而是这些工具是否会抹平历史中那些粗糙、痛苦的棱角,将复杂的人类冲突转化为中立、经过净化处理的摘要,从而服务于技术创造者的利益,而非真相本身。
一组研究人员着手测试这些人工智能工具究竟如何处理历史中混乱的现实。他们专注于一种功能强大且特定版本的技术——ChatGPT,要求它讲述四场主要的跨国冲突:南斯拉夫解体后的战争、巴以之间长期的冲突、葡萄牙在非洲进行的殖民战争,以及越南战争。为了观察机器是否对每个人都讲述同样的故事,研究人员不仅使用英语进行提问。他们用参与每场冲突的人民的母语提出了相同的问题,例如克罗地亚语、塞尔维亚语、阿拉伯语、希伯来语、葡萄牙语和越南语。他们不只是把聊天机器人当作搜索引擎,而是将其视为对话中的积极参与者,密切观察它如何构建答案,它选择了记住什么,以及它似乎遗忘了什么。
结果显示,这台机器远非一个中立的观察者。相反,人工智能并没有提供一个单一、一致的历史版本,而是根据提问所使用的语言产生了不同的叙事。当研究人员用不同的语言询问同一事件时,答案往往在重大方面相互矛盾。例如,当被要求识别前南斯拉夫战争中最重要的最终事件时,英文版本指向了2001年北马其顿的一项和平协议;克罗地亚语版本止于1995年的一项和平协议,而塞尔维亚语版本则将时间线延伸到了2022年一名军事领导人的审判。这些不仅仅是措辞上的细微差别,它们是关于冲突何时结束以及什么最为重要的根本不同的故事。研究发现,人工智能往往会镜像其所使用的语言背后的官方国家叙事,有效地强化了该地区特定的政治观点,而非提供一个平衡的全球视角。
除了这些不一致之处,研究人员还发现了一种导致历史记录失真的错误与遗漏模式。人工智能经常弄错日期和姓名,有时甚至捏造从未发生过的事件,或混淆战斗的顺序。更令人担忧的是机器遗漏了什么。在试图表现得“乐于助人”时,它经常跳过关键细节,例如特定暴行的受害者、某些军事力量的角色,或是战争的复杂起因。在一个案例中,人工智能将葡萄牙殖民地的战争描述为一个单一、简单的故事,将不同国家的独特斗争合并成了一个扁平的叙事。这种“简化”剥夺了每场冲突独特的政治和社会现实。研究还指出了一种“中性化”倾向,即人工智能使用模糊的语言来避免归咎。它会将一场种族灭绝描述为“悲剧性事件”或“罪行”,而不指明肇事者的身份,从而有效地洗刷掉相关行为者的具体责任。
研究人员得出结论,这些大型语言模型不仅仅是在反映过去,它们正在积极地重塑过去。因为人工智能是从它所接收的数据中学习的,它继承了数据的偏见和盲点。当它生成关于战争的故事时,它并不是在提取一份完美、客观的记录。相反,它是在基于模式预测下一个可能的词汇,通常优先考虑其数据库中最常见或最主流的声音。这意味着,对于依赖这些工具获取历史知识的用户来说,过去变成了一种算法逻辑的产物,而非批判性反思的结果。研究表明,如果没有人类的监督和强大的伦理框架,我们可能会面临失去复杂共享历史的风险,取而代之的是一个偏好平滑、简化且有时自相矛盾的故事的机器。决定哪些故事被讲述以及如何讲述的力量,已经从历史学家和社区转移到了驱动这些数字系统的代码和数据手中。
技术摘要:“谁的故事被讲述?ChatGPT、集体记忆与人工智能时代的伦理叙事”
问题陈述 本文探讨了大型语言模型(LLMs),特别是 ChatGPT,在数字时代作为集体记忆的媒介和共同创造者所带来的伦理影响。虽然数字技术改变了记忆存储和获取的方式,创造了“影子档案”并实现了内容的“生产者-消费者”(prosumer)模式,但它们也带来了关于历史叙事准确性和中立性的重大风险。作者认为,AI 系统不仅仅是在检索历史事实,而是通过算法逻辑、训练数据偏差和语言框架在积极地重构事实。核心问题在于,这些系统可能通过事实错误、遗漏、叙事中性化以及算法偏差来扭曲集体记忆,从而在缺乏充分的人类监督或批判性推理的情况下,将复杂的历史简化为简化的、去政治化的或被操纵的输出。
研究方法 本研究采用了一种在 2024 年 6 月至 8 月期间进行的多元语言定性研究设计。研究将 ChatGPT-4o 既视为分析对象,也视为研究工具,将其概念化为一个积极参与共同构建叙事的“数字行动者”(digital actant)。
案例选择: 研究聚焦于四个具有历史意义的多国冲突,以确保文化和时间上的多样性:前南斯拉夫战争、巴以冲突、葡萄牙在非洲的殖民战争以及越南战争。
数据收集: 对每个冲突应用了一套由八个标准化问题组成的结构化方案。这些问题针对主要的开端/结束事件、参与者、受害者、起因和后果。
多元语言框架: 提示词以与各冲突相关的国家语言(克罗地亚语、塞尔维亚语、阿拉伯语、希伯来语、葡萄牙语、越南语)以及作为全球参考点的英语进行输入。
分析策略:
专家验证: 由专门研究各冲突的历史学家审查响应的事实准确性。
主题编码: 作者进行开放式编码,以识别模式、异常和空白。
分类: 将问题系统化为跨越三个层级的 十个 分析类别:
响应层面(Response-level): 不准确性、关键信息遗漏、语境错位。
访谈层面(Interview-level): 细节不均、中性化、简化。
事件层面(Event-level): 不一致性(跨语言)、偏见化呈现。 (注:论文共确定了十个不同的类别,详见表 1。)
比较分析: 比较不同语言和冲突之间的响应,以检测事实范围和规范性框架的差异。
主要结果 分析表明,ChatGPT-4o 并非被动地复制历史内容,而是积极地重构它,且经常引入系统性的扭曲。研究确定了 十个 特定的错误和偏差类别:
不准确性(Inaccuracy): 模型生成了错误的日期、名称和事件,包括虚构的引用(例如,误报美国承认克罗地亚或坎达拉战役的日期)。
关键信息遗漏(Omission of Key Information): 关键的参与者、事件和因果动态经常被跳过,从而创造出在历史上看似合理但并不完整的叙事(例如,遗漏了越南战争中约翰逊政府的决策或南斯拉夫战争中的布里奥尼停战协议)。
语境错位(Contextual Mismatch): 响应往往缺乏必要的文化、政治或语言背景,使得象征性事件(如武科瓦尔的陷落)变得模糊不清。
细节不均(Uneven Detail): 叙事表现出不对称的深度;例如,关于越南战争的英语访谈侧重于军事行动,而越南语访谈则侧重于政治转折点。
中性化(Neutralization): 模型经常使用笼统的语言来淡化特定的行为者或情况,避免对责任承担明确立场(例如,将斯雷布雷尼察大屠杀称为“最黑暗时刻之一”,而非确认的大屠杀)。
简化(Simplification): 不同的冲突被合并为单一的、扁平化的故事线(例如,将安哥拉、莫桑比克和几内亚比索的葡萄牙殖民战争合并为一个叙事)。
不一致性(Inconsistency): 同样的问题根据语言的不同会产生根本不同的答案。对于南斯拉夫战争,“最后一个重要事件”在英语中被确定为奥赫里德协议,在克罗地亚语中是代顿协议,在塞尔维亚语中是拉特科·姆拉迪奇的审判,且时间范围各异(1990 年代 vs. 延伸至 2022 年)。
偏见化呈现(Biased Portrayal): 特定语言的输出倾向于特定的国家视角。克罗地亚语输出将“风暴行动”框架为合法的主权恢复,同时遗漏了平民流离失所的情况;塞尔维亚语输出则将同一事件框架为受害者身份的来源,同时完全遗漏了斯雷布雷尼察大屠杀。(注:完整的类型学包括表 1 中呈现的十个类别。)
主要贡献
经验类型学: 本文建立了一个关于 LLM 生成的历史叙事中错误与偏差的 十类别 类型学,超越了对偏差的一般性描述,转向具体的、可观察的扭曲模式(例如,区分“中性化”与“简化”)。
多元语言证据: 通过比较母语和英语的响应,研究证明了叙事的变化不仅是由于不同的文化视角,而且是受到提示词语言和底层训练数据的系统性制约。
概念框架: 研究将 AI 框架化为不仅是一个中立的档案库,更是一个积极的“记忆守门人”,它基于“数据库逻辑”(碎片化、模块化)而非“叙事逻辑”(连贯、因果)进行运作,导致通过统计预测而非基于来源的解释来重构历史。
意义与主张 作者主张,他们的发现证明了 AI 系统并非中立的观察者,而是受其设计和训练数据的假设、优先级和盲点所影响的积极中介。论文认为,如果没有伦理原则、人类能动性和批判性推理,集体记忆面临着成为算法呈现产物而非批判性反思产物的风险。
研究得出结论,通过 AI 实现的历史知识“民主化”正受到记忆扭曲风险的威胁。研究呼吁在历史解释中使用具备伦理基础的 AI,并强调在评估 AI 系统时采用多元语言、具备语境敏感性的方法。该研究强调,保护过去的复杂性需要防范算法扭曲,并保持人类监督,以确保集体记忆仍然是一个进行争论和批判性参与的空间,而不是一个经过净化的、算法化的输出。
每周获取最佳 social_science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。