Artificial intelligence for oral history and disaster experience: a systematic mapping study
这项系统性映射研究通过回顾35篇初级研究,分析了人工智能如何将口述历史从静态档案转变为动态、互动的领域,在强调转录与分析方面取得显著进展的同时,也强调了关键的伦理挑战以及对创伤知情、以人为本方法的必要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几十年来,人类经验的故事——战争幸存者、灾难见证者、保存被遗忘传统的长者——一直被记录在磁带和磁盘上,作为静态录音存储在档案库中。这些口述历史至关重要,因为它们承载了官方文件往往缺失的情感真相和个人视角。然而,一个巨大的障碍长期以来阻碍了这些声音与需要听到它们的人们之间的联系:将数小时的口语转化为可搜索文本的极高难度。对于研究人员或博物馆馆长来说,为了寻找一段特定的记忆而听完每一段录音的每一分钟,是一项可能耗费一生的任务。这种瓶颈使得大量的个人证言被锁在档案中,只有那些有时间倾听的人才能接触到。现在,一个新兴领域正在兴起,人工智能正被用于解锁这些档案,不仅是为了转录文字,更是为了理解其中的情感、模式和沉默。
来自加拿大大学的一个研究小组最近进行了一项全面的综述,以观察这项技术究竟是如何应用的。他们检查了 2004 年至 2025 年间发表的 35 项研究,审视了口述故事如何变为数字记录的每一个阶段。他们的工作表明,虽然计算机在将语音转化为文本的机械任务方面已经变得非常出色,但更深层的挑战在于如何保留文字背后的深层人类意义。研究人员发现,该领域正迅速从简单的转录向复杂的分析演进,但关于如何处理敏感记忆以及谁的声音能被真正听到,仍然存在重大的伦理障碍。
该综述首先绘制了口述历史的旅程图,作者将其分为四个不同阶段:创作、归档、分析和展示。在创作阶段,即故事首次被讲述时,人工智能的使用仍然很少。该领域的大多数研究都在探索实验性想法,例如使用计算机程序采访人类,或生成模拟对话以填补历史记录中的空白。然而,绝大多数研究都集中在第二个阶段:归档。在这里,技术产生了最显著的影响。通过使用先进的语音识别系统,研究人员现在可以自动将数千小时的音频转换为文本。这解决了一个曾经使大型收藏无法使用的关键问题。综述指出,仅在 2024 年和 2025 年,该领域近一半的研究成果就已发表,这标志着该领域正从实验性原型转向能够积极处理大规模录音积压的现实工具。
这项研究的地理分布讲述了两种不同方法的故事。在美国,拥有像南加大州立大学(USC)肖阿基金会这样持有数百万份来自大屠杀和其他冲突的证言的庞大档案库,研究重点在于文本能告诉我们关于人类心理的什么信息。那里的研究人员正在利用计算机程序分析这些故事,以寻找创伤的迹象,例如预测 9/11 事件幸存者的创伤后应激症状。相比之下,在中欧地区(特别是德国和捷克共和国)的一组研究则致力于工程本身。这些团队致力于完善底层技术,确保计算机能够准确地听到并转录不同语言、方言以及在嘈杂录音条件下的语音。美国的研究在问“这个故事意味着什么?”,而欧洲的研究在问“我们如何确保计算机能正确听到它?”
除了书写文字之外,流程中的第三个阶段涉及利用人工智能在故事中寻找模式和情感。综述发现,研究人员越来越多地使用这些工具将相似的叙事归为一类,或检测说话者声音的情感重量。一些研究甚至走得更远,分析非言语声音,如呼吸、停顿和沉默。这些声音往往承载着与文字本身同样重要的意义,指示着简单的转录文本会错过的痛苦或犹豫。第四阶段是可视化,即数字故事回到公众面前的阶段。在这里,人工智能有助于创造沉浸式体验,例如虚拟现实展览,观众可以在数字空间中行走并与证言进行互动,使历史变得即时且具有个人色彩。
尽管取得了这些技术飞跃,研究人员也指出了不容忽视的严重问题。最紧迫的问题是失去故事“人性”元素的风险。当计算机转录录音时,它往往会剥离停顿、呼吸和声音中的情感颤动,将复杂的生命体验简化为平淡的文本。当处理创伤性历史时,这一点尤其危险,因为表达方式与表达的内容同样重要。还存在偏差问题。用于这些任务的人工智能模型通常是在标准的高资源语言和数据上训练的。当这些模型遇到来自原住民社区、使用稀有方言或特定文化冲突的幸存者的故事时,它们往往无法理解细微差别,有时会误解情感或削弱文化背景。
该综述还强调了照看这些故事的历史学家与构建这些工具的工程师之间日益扩大的鸿沟。随着档案越来越依赖于商业公司提供的复杂、“黑箱”系统,历史学家越来越难以理解技术是如何进行分类和检索信息的。这种透明度的缺乏引发了关于谁控制叙事权的疑问。此外,研究人员指出,训练这些庞大计算机模型的环境成本是巨大的,这为该领域增加了一层新的伦理考量。作者强调,要使人工智能真正发挥作用,必须采用“人类在环”(human-in-the-loop)的方法,即由人类专家主导过程,确保技术是服务于故事而非扭曲故事。
最终,这项系统性综述表明,我们正处于一个转折点。使口述历史向所有人开放的技术终于来到了,但前进的道路需要的不仅仅是更好的软件。它需要机器的效率与保护人类记忆的伦理责任之间的谨慎平衡。研究人员总结道,该领域的未来取决于开发新的衡量成功的方法,这些方法要超越简单的准确率。我们不应仅仅计算计算机写对了多少个词,而必须学习去评估技术是否保留了它所帮助讲述的故事的情感真相和文化完整性。只有通过解决这些挑战,我们才能确保过去的各种声音不仅被听到,而且被真正理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。