← 최신 논문
🤖 AI

Quantifying Geospatial in the Common Crawl Corpus

본 논문은 Gemini 1.5 를 활용하여 Common Crawl 코퍼스 내 지리 공간 정보의 존재 비율을 정량화하여, 영어와 비영어권 언어 간에 거의 차이가 없는 웹 문서의 18.7% 가 이러한 데이터를 포함하는 것으로 추정함으로써 대규모 언어 모델의 지리 공간 편향 연구의 기초를 마련한다.

원저자: Ilya Ilyankou, Meihui Wang, Stefano Cavazzi, James Haworth

게시일 2026-05-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ilya Ilyankou, Meihui Wang, Stefano Cavazzi, James Haworth

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 수십억 권의 책, 기사, 웹페이지가 담긴 거대하고 혼란스러운 도서관으로 상상해 보세요. 이 도서관은 Common Crawl이라고 불립니다. 이는 챗봇을 구동하는 것과 같은 '초지능'(대형 언어 모델 또는 LLM) 이 말하고 사고하는 법을 배우기 위해 '유년기' 동안 섭취하는 거대한 원시 텍스트 더미입니다.

최근 과학자들은 이러한 초지능이 지리를 이해하는 데 놀라울 정도로 능숙해졌음을 발견했습니다. 그들은 런던에서 파리까지의 거리를 알려주거나 도시가 어떻게 생겼는지 설명할 수 있습니다. 하지만 큰 의문이 남았습니다: 그들은 이 지식을 어디서 배웠을까요? 그들이 공부한 도서관에 실제로 그들을 가르칠 만큼 충분한 지도와 주소가 포함되어 있었을까요?

이 논문은 그 거대한 도서관에 들어가 정확히 몇 페이지에 위치 정보가 포함되어 있는지 세어보는 도서관 사서 팀과 같습니다.

미션: '어디'를 세기

연구자들은 알고 싶었습니다: 이 거대한 도서관의 웹페이지 중 실제로 특정 장소를 언급하는 페이지는 얼마나 될까요?

그들은 '특정 장소'를 두 가지 간단한 방식으로 정의했습니다:

  1. 좌표: 지도상의 한 지점을 고정하는 정확한 숫자 (위도와 경도 등).
  2. 주소: 편지를 보내거나 건물을 찾을 수 있는 거리 이름, 도시, 번지수 (예: "메인 거리 123 번지").

그들은 위치가 지도에서 찾을 수 있을 만큼 정밀한지 확실히 하기 위해, 주소가 붙어 있지 않은 한 "에펠탑"과 같은 모호한 언급은 세지 않기로 결정했습니다.

탐정 작업: 슈퍼 스캐너 사용

도서관이 너무 거대하여 인간이 페이지를 하나씩 읽을 수 없기 때문에, 연구자들은 Gemini 1.5라는 강력한 AI 도구를 그들의 '슈퍼 스캐너'로 사용했습니다.

Gemini 를 매우 빠르고 매우 똑똑한 인턴으로 생각하세요. 연구자들은 무작위 웹페이지 더미를 그에게 주고 이렇게 물었습니다: "이 페이지에 거리 주소나 지도 좌표 세트가 있나요? 있다면 예를 보여주세요."

도서관이 너무 크기 때문에 모든 페이지를 확인할 수 없었습니다. 대신, 그들은 전체 국가의 의견을 추측하기 위해 1,000 명에게 질문하는 여론 조사자와 같은 통계적 트릭을 사용하여 2019 년, 2021 년, 2024 년의 세 가지 다른 시점에서 약 120,000 페이지의 대표 표본을 추출했습니다.

큰 발견

AI 가 페이지를 스캔하고 인간이 AI 가 '환각'(사실을 만들어내는 것) 을 일으키지 않았는지 결과를 이중 확인한 후, 그들은 흥미로운 숫자들을 발견했습니다:

  • 황금광: 도서관의 모든 웹페이지 중 약 **18.7%**가 어떤 형태의 구체적인 위치 데이터를 포함하고 있습니다. 이는 대략 5 페이지 중 1 페이지에 해당합니다.
  • 혼합:
    • 일부 페이지에는 주소만 있었습니다 (16.1%).
    • 일부에는 좌표만 있었습니다 (7.0%).
    • 일부에는 둘 다 있었습니다 (4.3%).
  • 언어 균형: 놀랍게도 페이지가 영어인지 다른 언어인지 여부는 중요하지 않았습니다. '위치 밀도'는 두 언어 모두에서 거의 동일했습니다. 페이지가 스페인어, 중국어, 영어 중 어떤 언어로 되어 있든 주소나 좌표를 가질 확률은 대략 같았습니다.
  • "구글 지도" 효과: 발견된 좌표의 상당수는 구글 지도 링크였습니다. 이는 구글 지도가 주요 지도 앱이 아닌 국가들 (중국이나 러시아 등) 에서 좌표 링크 수가 더 낮다는 것을 의미하며, 이는 왜 일부 언어에서 위치 데이터가 약간 덜 흔한지 설명할 수 있습니다.

초지능을 위한 의미

이 논문은 AI 가 학습한 도서관이 실제로 지리로 가득 차 있다고 결론지었습니다. 비어 있는 것이 아닙니다.

AI 가 주소와 좌표가 포함된 수많은 페이지를 섭취했기 때문에, 공간, 방향, 거리를 이해하는 법을 배운 것은 당연합니다. 그러나 연구자들은 도서관에 '맛의 불균형'이 있음을 또한 지적했습니다:

  • 영어와 .com 웹사이트가 과대표되어 있습니다 (도서관의 거대한 부분을 차지함).
  • 이는 AI 가 영어권, 미국 중심의 웹사이트를 통해 바라본 세계에 '편향'될 수 있음을 의미하며, 세계 다른 부분의 뉘앙스를 놓칠 수 있음을 시사합니다.

결론

연구자들은 새로운 지도나 앱을 만들지 않았습니다. 그들은 단순히 인터넷의 원시 데이터에 대한 인구 조사를 실시했을 뿐입니다. 그들은 지리가 AI 학습에 사용된 데이터 전반에 걸쳐 존재한다는 사실을 발견했습니다. 이는 AI 가 지리에 능숙한 이유를 설명하지만, 동시에 AI 의 '세계관'이 연구한 도서관에서 가장 흔했던 웹사이트가 어떻게 형성되었는지에 크게 영향을 받았음을 경고합니다.

이 논문은 약 460 억 페이지에 달하는 이 거대한 위치 데이터 컬렉션이 지리 작업에 특화된 AI 를 훈련시키고자 하는 미래 연구자들에게 '황금광'이 될 수 있다고 제안하며 마무리합니다. 하지만 그것은 이 연구가 아닌 미래의 연구들이 할 일입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →