ROUGE : A database of disaster impacts in the Global South using Red Cross reports and Large Language Models
本文介绍了 ROUGE,这是一个针对全球南方的全新社会经济灾害影响数据库,它利用大语言模型从红十字会与红新月会国际联合会的报告中提取详细的非货币数据,从而解决了现有地理覆盖范围和数据偏差的问题。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,世界是一个巨大的、繁忙的舞台,而大自然偶尔会在这里大发雷霆。有时是风暴掀翻了布景,有时是干旱枯竭了道具,有时是地震震动了地板。几十年来,科学家和救援人员一直试图记录这些灾难的得分,以了解它们造成了多少破坏以及谁受到了伤害。但问题在于:我们目前拥有的这些“计分卡”有点像一座图书馆,书架上只有富裕国家的书籍。来自全球南方(那些较贫穷且往往更脆弱的地区)的故事却缺失了,而且我们现有的书籍大多只计算经济损失,忽略了人类的故事、破碎的家园和患病的社区。为了解决这个问题,我们需要一种能够阅读数百万份杂乱的手写笔记和官方报告的方法,以寻找那些隐藏的痛苦与恢复的故事。这正是某种新型“超级阅读器”发挥作用的地方:大语言模型(LLMs)。把它们想象成极其聪明的 AI 侦探,它们可以在几秒钟内阅读数千页文本,发现模式并提取出人类需要花费一生才能找到的具体事实。通过教导这些 AI 侦探阅读灾难报告,科学家们希望能够构建出一幅关于自然灾害究竟如何影响全球人类的完整且公平的图景。
由此诞生了 ROUGE,这是一个由研究团队创建的新型数据库,他们决定不再靠猜测,而是开始阅读真实的故事。他们收集了来自红十字会与红新月会国际联合会(IFRC)——即在灾后迅速奔赴前线的全球红十字志愿者网络——的大量官方报告,并将这些报告喂给了一名 AI 侦探。这些自 1919 年以来由一线工作人员撰写的报告充满了关于发生了什么、谁受伤了以及什么被破坏了的细节,但它们是以纯文本形式呈现的,而非整齐的电子表格。研究人员使用了一个特定的 AI 模型(称为 meta-llama/llama-4-scout-17b-16e-instruct)充当数字考古学家,在 2016 年至 2025 年间的 2,610 份报告中进行挖掘,提取出了 15,147 条特定的影响记录。
其结果是一张涵盖了 145 个国家、776 个独特事件的灾难影响“藏宝图”。不同于以往主要关注资金或仅关注国家层面的旧数据库,ROUGE 进行了深度聚焦。它捕捉了 20 种不同类型的冲击,从显而易见的(如“死亡人数”或“受伤人数”)到经常被忽视的(如“无家可归者”、“非正式定居点”或“获取食物的能力”)。它甚至追踪了灾难如何影响学校、医院和电网等设施。研究团队发现,在他们的数据库中,洪水和风暴是最频繁的“麻烦制造者”,而非洲和亚洲则是这些影响在新数据库中记录最为密集的地区。
然而,研究人员谨慎地表示,这并非一个完美的、神奇的解决方案。他们承认 AI 有时会犯错,比如猜测一个并不存在的日期,或者混淆两个听起来相似的地方。为了确保工作的严谨性,他们将 AI 与一组由人类手动阅读并标注的“金标准”报告进行了对比测试。结果显示,AI 掌握了大约四分之三的事实(精确率和召回率约为 0.73)。它在寻找定性故事(如“人们流离失所”)方面表现出色,但在处理密集的数字列表时有时会感到吃力。他们还将新数据与 EM-DAT 和 IFRC GO 等现有数据库进行了对比,发现 ROUGE 经常能发现其他数据库遗漏的数据——特别是在“失踪人员”或“无家可归者”等方面,新数据库在高达 92% 的覆盖事件中提供了独特的数据。
论文指出,虽然这个新数据库是填补全球灾难知识空白的有力工具,但它并不是人类判断的替代品。研究人员建立了一套“质量标记”系统,用于提醒用户 AI 可能存在不确定性的情况,或者当某条数据缺失日期或地点时发出警告。他们鼓励任何使用该数据的人员,如果发现某些内容看起来可疑,请务必核对原始文本片段。最终,ROUGE 表明,通过将 AI 不知疲倦的阅读能力与红十字会丰富的实地故事相结合,我们终于可以开始看到一个关于自然灾害如何影响世界上最脆弱社区的完整、未经滤镜处理的全貌——从仅仅统计美元损失,转向统计生命与生计。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。