Quantifying Geospatial in the Common Crawl Corpus
本文利用 Gemini 1.5 量化了 Common Crawl 语料库中地理空间信息的普遍性,估计 18.7% 的网页文档包含此类数据,且英语与非英语语言之间差异极小,从而为研究大型语言模型中的地理空间偏差奠定了基础。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象互联网是一座容纳数十亿本书籍、文章和网页的庞大而混乱的图书馆。这座图书馆被称为Common Crawl。它是那些驱动聊天机器人的“超级大脑”(大型语言模型或 LLM)在“童年”时期用来学习如何说话和思考的原始文本巨堆。
最近,科学家注意到这些“超级大脑”在理解地理方面变得出奇地出色。它们能告诉你从伦敦到巴黎有多远,或者描述一座城市的外观。但一个重大问题依然存在:它们是从哪里学到这些的? 它们所学习的图书馆里,真的包含足够的地图和地址来教导它们吗?
这篇论文就像一支图书管理员团队,进入那座庞大的图书馆,精确计算有多少页包含位置信息。
任务:统计“何处”
研究人员想知道:在这座巨型图书馆中,究竟有多少网页提到了具体的地点?
他们将“具体地点”定义为两种简单的方式:
- 坐标:将某个位置固定在地图上的确切数字(如纬度和经度)。
- 地址:街道名称、城市和门牌号(如“主街 123 号”),你可以用它来寄信或找到一栋建筑。
他们决定不统计模糊的提及(如“埃菲尔铁塔”),除非它附带了地址,因为他们希望确保该位置精确到足以在地图上找到。
侦探工作:使用超级扫描仪
这座图书馆太过庞大,人类无法逐页阅读。因此,研究人员使用了一种名为Gemini 1.5的强大 AI 工具作为他们的“超级扫描仪”。
把 Gemini 想象成一个非常快速、非常聪明的实习生。研究人员给它一堆随机网页,并问道:“嘿,这个页面有街道地址或一组地图坐标吗?如果有,请给我举个例子。”
由于图书馆如此巨大,他们无法检查每一页。相反,他们使用了一种统计技巧(就像民意调查员询问 1000 人来推测整个国家的意见),从三个不同时期(2019 年、2021 年和 2024 年)中选取了约120,000 页的代表性样本。
重大发现
在 AI 扫描了网页且人类对结果进行了双重检查以确保 AI 没有“幻觉”(编造内容)之后,他们发现了一些有趣的数字:
- 金矿:图书馆中约18.7%的网页包含某种具体的位置数据。这大约是每 5 页中就有 1 页。
- 混合情况:
- 有些页面只有地址(16.1%)。
- 有些页面只有坐标(7.0%)。
- 有些页面两者都有(4.3%)。
- 语言平衡:令人惊讶的是,无论页面是英文还是其他语言,结果都无关紧要。“位置密度”在两者之间几乎相同。无论页面是西班牙语、中文还是英语,其包含地址或坐标的几率大致相等。
- “谷歌地图”效应:发现的许多坐标只是指向谷歌地图的链接。这意味着在谷歌地图不是主要地图应用的国家(如中国或俄罗斯),坐标链接的数量较少,这可能解释了为什么某些语言中的位置数据略少。
这对“超级大脑”意味着什么
该论文得出结论,AI 从中学习的图书馆实际上充满了地理信息。它并非空无一物。
由于 AI 阅读了大量包含地址和坐标的页面,它学会理解空间、方向和距离也就合情合理了。然而,研究人员也指出了图书馆中存在一种“风味失衡”:
- 英文和.com 网站被过度代表(它们构成了图书馆的很大一部分)。
- 这意味着 AI 可能“偏向”于通过英语国家、以美国为中心的视角所看到的世界,从而可能错过世界其他地区的细微差别。
核心结论
研究人员并没有构建新地图或新应用。他们只是对互联网的原始数据进行了人口普查。他们发现,在用于训练 AI 的数据中,地理无处不在。这解释了为什么 AI 擅长地理,但也提醒我们,AI 对世界的“看法”在很大程度上是由其研究的图书馆中最常见的网站所塑造的。
论文最后建议,这一庞大的位置数据集合(约 460 亿页!)可能成为未来研究人员的“金矿”,他们希望专门针对地理任务训练 AI,但这将是未来研究的任务,而非本研究的内容。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。