← 最新论文
💬 NLP

CC-GPX: Extracting High-Quality Annotated Geospatial Data from Common Crawl

本文介绍了 CC-GPX,这是一个高效的处理流程,它从 Common Crawl 的 GPX 文件中提取出包含 1,416 条人工撰写描述与 MultiLineString 矢量数据配对的多模态数据集,以支持户外行为模式、自然语言处理和轨迹生成领域的研究。

原作者: Ilya Ilyankou, Meihui Wang, Stefano Cavazzi, James Haworth

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Ilya Ilyankou, Meihui Wang, Stefano Cavazzi, James Haworth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一座巨大而混乱的图书馆,里面收藏着自 2008 年以来在线发布的所有书籍、网页和文件。这座图书馆被称为Common Crawl,其规模如此庞大,以至于包含了超过 9.5 PB 的数据(这相当于堆叠数十亿张 DVD)。通常,研究人员利用这座图书馆来教计算机说人类语言,寻找用于训练 AI 聊天机器人的文本。

但在这篇论文中,作者提出了一个不同的问题:“如果我们在这座图书馆中寻找隐藏的地图和步行路线呢?”

以下是他们如何发现这些路线、清理数据并将其转化为新宝藏地图的故事。

1. 寻找隐藏宝藏(数据收集)

将互联网想象成一片广阔的海洋。大多数人只关注那些大而热门的岛屿(如 Strava 或 AllTrails),但这些地方通常对谁可以使用其数据有严格的规定。然而,Common Crawl 就像一片公共海滩,只要遵守规则,任何人都可以拾取贝壳。

作者构建了一个数字“渔网”,专门捕捞一种特定类型的贝壳:.GPX 文件

  • 什么是 GPX 文件? 想象它是徒步、跑步或骑行的数字日记条目。它包含一串 GPS 坐标(你走过的路径),通常还附有旅行者写下的小笔记。
  • 挑战: 图书馆杂乱无章。作者必须从 30 亿个文件中筛选出正确的文件。
  • 技巧: 与其下载整个海洋(那将耗费无穷时间),他们使用了一个巧妙的技巧,直接从巨大的文件中提取所需的特定“贝壳”,从而节省了大量时间。他们找到了超过 112,000 个潜在的 GPX 文件。

2. 过滤器(数据清洗)

并非每个贝壳都是珍珠。作者必须过滤掉垃圾,只保留高质量的宝石。他们像一位严格的图书管理员那样行事:

  • “太长”规则: 他们丢弃了超过 100 公里(62 英里)的路线。为什么?因为很难为跨越欧洲的多日旅程写出一篇简短而精彩的故事。他们想要的是感觉像一次完整冒险的路线。
  • “太短”规则: 他们忽略了任何短于绕街区快速散步(0.5 公里)的内容。
  • “故事”检查: 没有描述的路线只是地图上的一条线。作者使用了一个智能 AI 助手(Llama-3)来阅读笔记。
    • 好笔记: “一次愉快的 4 小时徒步,从塔楼俯瞰美景。”(保留!)
    • 坏笔记: “来自我手表的带点文件”或“查看开放时间。”(丢弃!)
  • 隐私盾牌: 正如你不想让家庭住址刊登在书中一样,作者清理了数据。他们使用数字“黑色记号笔”隐藏了电子邮件地址、电话号码和姓名,确保无法识别任何真实人物。
  • 语言桥梁: 许多笔记是用法语、德语或其他语言撰写的。作者使用翻译工具将它们全部转换为英语,以便每个人都能阅读。

3. 填补缺失部分

有些数字日记缺少路径的“高度”(海拔)。想象一张地图显示了蜿蜒的道路,却没有告诉你是在爬上山丘还是走下山谷。

  • 作者使用卫星“地形图”(地球表面的数字模型)来推测原始数据缺失处路径上每个点的高度。现在,每条路线都是一个三维物体,而不仅仅是一条平面线。

4. 最终结果:一个新数据集

经过所有这些清理工作,他们最终得到了1,416 对高质量数据

  • 第一对: 一篇关于户外冒险的详细、人类撰写的故事。
  • 第二对: 该冒险的确切 GPS 路径(一条三维线)。

这些路线来自 25 个不同的国家,主要集中在欧洲,涵盖了徒步、骑行和跑步等活动。

这为何重要?

作者建议,这个数据集是研究人员和 AI 开发者的新工具:

  • 对于 AI: 它可以教计算机如何撰写类似人类的地点描述,或如何生成逼真的步行路线,用真实的人类体验取代虚假的、计算机生成的路径。
  • 对于科学: 它有助于我们了解人们如何描述他们的户外体验,以及他们注意到了哪些地标。

简而言之,作者将互联网上杂乱无章、规模庞大的数据堆清理、翻译并整理成一系列真实人类故事与真实地图的精美集合。他们证明,即使是在像 Common Crawl 这样混乱的图书馆中,只要懂得如何寻找,也能发现美丽且结构化的地理空间数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →