← Últimos artículos
🤖 AI

Quantifying Geospatial in the Common Crawl Corpus

Este artículo utiliza Gemini 1.5 para cuantificar la prevalencia de la información geoespacial en el corpus Common Crawl, estimando que el 18,7 % de los documentos web contienen dichos datos con variación mínima entre los idiomas en inglés y los no ingleses, estableciendo así una base para estudiar los sesgos geoespaciales en los modelos de lenguaje grandes.

Autores originales: Ilya Ilyankou, Meihui Wang, Stefano Cavazzi, James Haworth

Publicado 2026-05-07
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ilya Ilyankou, Meihui Wang, Stefano Cavazzi, James Haworth

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina internet como una biblioteca masiva y caótica que contiene miles de millones de libros, artículos y páginas web. Esta biblioteca se llama Common Crawl. Es el montón gigante de texto crudo que los "super-cerebros" (Modelos de Lenguaje Grandes o LLM) como los que impulsan los chatbots consumen durante su "niñez" para aprender a hablar y pensar.

Recientemente, los científicos notaron que estos super-cerebros están resultando sorprendentemente buenos entendiendo la geografía. Pueden decirte qué distancia hay de Londres a París o describir cómo se ve una ciudad. Pero quedaba una gran pregunta: ¿Dónde aprendieron esto? ¿Contenía realmente la biblioteca que estudiaron suficientes mapas y direcciones para enseñárselo?

Este artículo es como un equipo de bibliotecarios que entra en esa biblioteca masiva para contar exactamente cuántas páginas contienen información de ubicación.

La Misión: Contar el "Dónde"

Los investigadores querían saber: ¿Cuántas páginas web en esta biblioteca gigante mencionan realmente un lugar específico?

Definieron "lugar específico" de dos maneras simples:

  1. Coordenadas: Los números exactos (como latitud y longitud) que fijan un punto en un mapa.
  2. Direcciones: Un nombre de calle, ciudad y número (como "Calle Principal 123") que podrías usar para enviar una carta o encontrar un edificio.

Decidieron no contar menciones vagas como "la Torre Eiffel" a menos que tuvieran una dirección adjunta, porque querían estar seguros de que la ubicación era lo suficientemente precisa para ser encontrada en un mapa.

El Trabajo de Detective: Usando un Escáner Súper

La biblioteca es demasiado grande para que los humanos lean página por página. Así que los investigadores utilizaron una potente herramienta de IA llamada Gemini 1.5 como su "escáner súper".

Piensa en Gemini como un becario muy rápido y muy inteligente. Los investigadores le dieron una pila de páginas web aleatorias y preguntaron: "Oye, ¿tiene esta página una dirección de calle o un conjunto de coordenadas de mapa? Si es así, muéstrame un ejemplo."

Como la biblioteca es tan grande, no pudieron revisar cada página individual. En su lugar, usaron un truco estadístico (como un encuestador que pregunta a 1.000 personas para adivinar la opinión de todo un país) para seleccionar una muestra representativa de aproximadamente 120.000 páginas de tres períodos diferentes (2019, 2021 y 2024).

La Gran Revelación

Después de que la IA escaneó las páginas y los humanos verificaron los resultados para asegurarse de que la IA no estaba "alucinando" (inventando cosas), encontraron algunos números interesantes:

  • La Mina de Oro: Alrededor del 18,7% de todas las páginas web en la biblioteca contienen algún tipo de datos de ubicación específicos. Eso es aproximadamente 1 de cada 5 páginas.
  • La Mezcla:
    • Algunas páginas tenían solo una dirección (16,1%).
    • Algunas tenían solo coordenadas (7,0%).
    • Algunas tenían ambas (4,3%).
  • El Equilibrio Lingüístico: Sorprendentemente, no importaba si la página estaba en inglés o en otro idioma. La "densidad de ubicación" era casi la misma para ambos. Ya fuera la página en español, chino o inglés, la probabilidad de que tuviera una dirección o coordenadas era aproximadamente igual.
  • El Efecto "Google Maps": Muchas de las coordenadas encontradas eran simplemente enlaces a Google Maps. Esto significa que en países donde Google Maps no es la aplicación de mapas principal (como China o Rusia), el número de enlaces de coordenadas es menor, lo que podría explicar por qué algunos datos de ubicación son ligeramente menos comunes en esos idiomas.

Qué Significa Esto para los "Super-Cerebros"

El artículo concluye que la biblioteca de la que aprendió la IA está realmente llena de geografía. No está vacía.

Como la IA consumió tantas páginas con direcciones y coordenadas, tiene sentido que haya aprendido a entender el espacio, las direcciones y las distancias. Sin embargo, los investigadores también notaron un "desequilibrio de sabor" en la biblioteca:

  • Los sitios web en inglés y .com están sobre-representados (constituyen una gran parte de la biblioteca).
  • Esto significa que la IA podría estar "sesgada" hacia el mundo visto a través de sitios web de habla inglesa y centrados en Estados Unidos, perdiendo potencialmente los matices de otras partes del mundo.

La Conclusión

Los investigadores no construyeron un nuevo mapa ni una nueva aplicación. Simplemente tomaron un censo de los datos crudos de internet. Descubrieron que la geografía está en todas partes en los datos utilizados para entrenar a la IA. Esto explica por qué la IA es buena en geografía, pero también nos advierte que la "visión" de la IA del mundo está moldeada fuertemente por qué sitios web eran más comunes en la biblioteca que estudió.

El artículo termina sugiriendo que esta colección masiva de datos de ubicación (¡unas 46 mil millones de páginas!) podría ser una "mina de oro" para futuros investigadores que quieran entrenar a la IA específicamente en tareas de geografía, pero eso es un trabajo para estudios futuros, no para este.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →