Geolocating News about Extreme Climate Events: A Comparative Analysis of Off-the-Shelf Tools for Toponym Identification in German
本研究对三种现成的命名实体识别工具(Flair、Spacy 和 Stanza)进行了比较分析,以识别关于极端气候事件的德国新闻文章中的地名,并展示了它们不同的输出结果如何在下游地理定位任务中传播,从而显著影响关于各国在媒体报道中突出程度的结论。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,正在试图解开一个谜团:“这场极端天气事件究竟发生在哪里?”
你手头有一堆德语新闻文章。有些谈论巴西的洪水,有些则讨论德国的热浪。问题在于,这些文章杂乱无章。一篇文章可能会说:“巴西阿雷格里港的洪水让我们想起了德国的洪斯吕克地区。”人类读者会立刻明白灾难发生在巴西。但计算机呢?它可能会因为“德国”这个词而感到困惑,误以为洪水就发生在那里。
本文旨在测试三种不同的“计算机侦探”(软件工具),看看哪一种最擅长在这些新闻故事中找出正确的位置。
三位侦探
研究人员测试了三种流行的现成软件工具(可以将它们想象为三种不同品牌的 GPS):
- Flair
- Spacy
- Stanza
它们的工作是命名实体识别(NER)。用通俗的话来说,就是扫描句子并高亮显示那些看起来像地名的词(例如“巴黎”、“亚马逊”或“洪斯吕克”)。
实验:一场“盲测”
通常,要测试一名侦探,你会给他一份已知正确答案的清单(即“黄金标准”)。但在现实世界中,研究人员往往没有这份清单。因此,作者设计了一个棘手的测试:
- 他们将所有三种工具喂给一组包含 983 篇关于灾害(洪水、火灾、热浪)的德语新闻文章。
- 他们要求每个工具列出它发现的所有地点。
- 随后,他们尝试仅根据这些列表来推测灾害发生的国家。
他们的发现:侦探们意见不一
这里有一个大惊喜:这三种工具彼此之间并不经常达成一致。
- 不同的列表:如果你将同一篇文章交给所有三个工具,它们会高亮显示不同的词组作为“地点”。一个可能识别出 14 个地点,另一个识别出 15 个,甚至它们可能连是哪 14 个都无法达成一致。
- “噪声”问题:
- Spacy 就像一名看到太多的侦探。它将“城市”、“市中心”或“机场”等通用词汇标记为具体地点。这产生了大量“噪声”(误报)。
- Stanza 有时会被那些听起来像地名但实际上不是的词搞糊涂,比如形容词(例如,“意大利”会触发对意大利地点的搜索,即使文章是关于法国的一家意大利大使馆)。
- Flair 最为谨慎。它找到的地点较少,但它找到的那些更可能是真实有效的地点。
连锁反应:为何这很重要
这篇论文表明,选择错误的侦探会改变最终的判决。
- 错误的国家推测:由于这些工具找到的地点列表不同,它们对灾害发生国家的推测也不同。在某些情况下,工具的选择会使预测的国家发生变化超过 10%。
- “热度”排名:研究人员试图根据各国在新闻中出现的频率进行排名。
- 如果使用 Flair,排名与人工标注的事实非常接近。
- 如果使用 Spacy 或 Stanza,排名则略有偏差。例如,某个工具可能认为瑞士是讨论最多的国家,而人类知道实际上是巴西。
结论
作者并非声称某一种工具是完美的,或者说其他工具毫无用处。他们想说的是:不要仅仅因为某个工具很流行就选择它。
如果你是一名试图了解气候变化报道的研究人员,你所选择的工具就像是一个过滤器。一个略有不同的过滤器可能会改变你关于哪些国家受影响最大或讨论最多的结论。
简而言之:即使你使用的是“现成”的软件,你也必须检查它的工作。如果你不这样做,你可能会意外地写出一份报告,声称洪水发生在德国,而实际上它们发生在巴西,仅仅因为你的计算机被文本中出现的“德国”这个词搞糊涂了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。