← 최신 논문
💰 quantitative finance

A harmonised dataset for Earth system foundation models

본 논문은 인간과 환경의 결합된 역동성을 포착하는 멀티모달 지구 시스템 파운데이션 모델의 학습을 가능하게 하기 위해, 다양한 환경 및 사회경제적 변수들을 표준화된 0.25° 격자와 연간 프레임워크에 정렬한 조화로운 글로벌 데이터셋인 WorldTensor를 소개한다.

원저자: Carlos Rodriguez-Pardo, Massimo Tavoni

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Carlos Rodriguez-Pardo, Massimo Tavoni

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

지구를 두 개의 주요 엔진을 가진 거대하고 복잡한 기계라고 상상해 보십시오. 첫 번째 엔진은 자연 세계(날씨, 해양, 삼림)이고, 두 번째 엔진은 인간 세계(도시, 농장, 발전소, 경제)입니다. 오랫동안 과학자들은 이 엔진들이 어떻게 작동하는지 이해하기 위해 "슈퍼 브레인"(파운데이션 모델이라고 불리는 것들)을 구축해 왔습니다. 하지만 여기에는 중대한 문제가 있었습니다. 이 슈퍼 브레인들은 자연 엔진에 대한 데이터만 학습했을 뿐, 인간이 어떻게 도시를 건설하고, 연료를 태우며, 돈을 움직이는지에 대해서는 거의 눈이 먼 상태였다는 점입니다.

이 논문은 이러한 사각지대를 해결하기 위해 설계된 거대하고 새로운 "사용 설명서"인 WorldTensor를 소개합니다. WorldTensor를 단순한 책 한 권이 아니라, 지구에 관한 모든 사실—빗방울 하나부터 공장의 굴뚝까지—이 동일한 종류의 종이에, 동일한 언어로, 동일한 서랍에 정리되어 있는 거대하고 완벽하게 조직된 도서관이라고 생각하십시오.

이 논문은 내용을 다음과 같이 나누어 설명합니다.

1. 문제점: 엉망진창으로 뒤섞인 퍼즐 조각들

WorldTensor 이전에는 지구와 인간을 함께 연구하려는 시도가 마치 퍼즐을 맞추는 것과 같았습니다. 그런데 퍼즐 조각의 절반은 바다 그림에서 온 것이고, 나머지 절반은 도시 그림에서 온 데다, 크기도 모양도 언어도 제각각이었기 때문입니다.

  • 어떤 데이터는 일 단위(날씨 등)이고, 어떤 데이터는 몇 년에 한 번씩만 나타납니다(인구 통계 등).
  • 어떤 데이터는 격자 형태의 사각형(지도 등)이고, 어떤 데이터는 단순히 점들의 목록(발전소 위치 등)입니다.
  • 어떤 지도는 서로 다른 좌표계를 사용하여 서로 맞출 수가 없었습니다.

과학자들은 연구를 시작하기도 전에 이 데이터를 정제하고 정렬하는 데에만 수개월을 소비해야 했습니다.

2. 해결책: "WorldTensor" 도서관

저자들은 만능 번역기이자 마스터 정리자 역할을 하는 조화로운 데이터셋인 WorldTensor를 만들었습니다.

  • 격자(The Grid): 그들은 수백 개의 서로 다른 데이터 소스를 가져와 하나의 표준 격자(약 대도시 한 블록 크기인 0.25도) 위에 강제로 배치했습니다. 고해 resolución 사진, 스케치, 그리고 숫자 목록을 가져와서 모두 똑같은 모눈종이 위에 인쇄하여 완벽하게 정렬한다고 상상해 보십시오.
  • 시간(The Time): 그들은 시간을 연간 리듬으로 표준화했습니다. 만약 어떤 자료가 일 단위 데이터라면 이를 연간 평균값으로 요약했습니다. 만약 어떤 자료가 5년마다 한 번씩만 있다면, 그 사이의 빈칸을 채워 매끄러운 연간 타임라인을 만들었습니다.
  • 내용(The Content): 이것은 "멀티모달(multimodal)"의 혼합체입니다. 단순히 날씨만 있는 것이 아니라 다음을 포함합니다:
    • 자연: 해양, 빙하, 토양, 삼림, 그리고 대기 질.
    • 인간: 인구, GDP(부), 발전소, 도로, 심지어 분쟁 지역까지.
    • 결합: 인간이 자연을 변화시키는 방식(예: 삼림 벌채)과 자연이 인간에게 미치는 영향(예: 홍수가 도시에 미치는 영향).

3. 제작 과정 (주방의 비유)

데이터 소스들을 서로 다른 시장에서 가져온 가공되지 않은 식재료라고 생각해 보십시오. 어떤 것은 신선한 생선(일일 날씨)이고, 어떤 것은 말린 콩(연간 인구 조사), 어떤 것은 향신료(공장 등의 지점 위치)입니다.

  • 재격자화(Regridding): 그들은 "생선"을 가져와서 "콩"과 같은 크기의 조각으로 잘랐습니다.
  • 래스터화(Rasterizing): 그들은 "향신료"(지도 위의 점들)를 가져와서 격자 위에 부드러운 양념 층처럼 넓게 펼쳤습니다.
  • 표준화(Standardizing): 그들은 모든 재료가 동일한 단위(예: 컵을 그람으로 변환)로 측정되고 명확하게 라벨링되었는지 확인했습니다.
  • 품질 관리(Quality Control): 그들은 재료가 상하지 않았는지 확인했습니다. 만약 물리적으로 불가능한 수치(예: 지구 온도가 500°C인 경우)가 나타나면 이를 표시했습니다. 또한 지도의 가장자리가 맞지 않아 틈이나 이음새가 생기지는 않았는지도 확인했습니다.

4. 구성 모습

이 논문은 이 데이터셋이 얼마나 방대한지를 보여줍니다. 이 데이터셋은 1900년부터 2025년까지의 기간을 다루는 52,000개 이상의 파일을 포함하고 있습니다.

  • 14개의 서로 다른 "부서"(기후, 에너지, 인간 시스템, 재해 등)를 포함합니다.
  • 이를 통해 컴퓨터는 배출량(인간)의 변화가 대기 질(자연)의 변화와 연결되어 있다는 점이나, 도시화(인간)가 홍수 위험(자연)과 연결되어 있다는 점을 파악할 수 있습니다.

5. 왜 중요한가 ("슈퍼 브레인" 훈련)

WorldTensor의 주요 목표는 **파운데이션 모델(Foundation Models)**을 훈련시키는 것입니다.

  • 이전에는: 슈퍼 브레인이 날씨를 예측하는 법은 배웠지만, 댐을 건설하면 강의 흐름이 바뀐다는 사실이나 전쟁이 일어나면 사람들이 농사를 멈춘다는 사실은 이해하지 못했습니다.
  • 이제는: WorldTensor를 통해 슈퍼 브레인은 **결합된 역학 관계(coupled dynamics)**를 배울 수 있습니다. 인간의 행동과 자연의 힘이 전 지구적 규모에서 어떻게 서로 밀고 당기는지를 배울 수 있습니다.

논문은 이 데이터가 실제로 작동함을 입증함으로써 이를 검증했습니다. 연구진이 실제 역사적 사건(예: 1997년 엘니뇨 또는 2020년 팬데믹)과 대조하여 테스트했을 때, 데이터는 온도, 배출량, 분쟁의 급증과 급락을 정확하게 보여주었습니다. 이는 이 "도서관"이 정확하며 컴퓨터가 읽을 준비가 되었음을 증명했습니다.

요약

WorldTensor는 "인간"과 "지구"라는 두 엔진을 마침내 같은 페이지에 올려놓은 거대하고 깨끗하며 조직된 데이터셋입니다. 이것은 무질서하게 뒤섞인 지도와 숫자 더미를 우리 행성에 대한 단일하고 일관된 그림으로 바꾸어 놓으며, 이를 통해 AI가 단순히 지구를 고립된 대상으로 연구하는 것을 넘어, 우리가 지구 위에서 그리고 지구와 함께 어떻게 살아가는지를 마침내 학습할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →