← 최신 논문
💻 computer science

No One Knows the State of the Art in Geospatial Foundation Models

본 논문은 지리공간 기반 모델(GFM) 커뮤니티가 일관되지 않은 평가 기준, 데이터, 모델 공개로 인해 명확한 최첨단 기술이 부재하다고 주장하며, 의미 있는 비교와 발전을 위한 필수적인 커뮤니티 규범을 확립하기 위해 여섯 가지 구체적인 기대 사항을 제안합니다.

원저자: Isaac Corley, Nils Lehmann, Caleb Robinson, Gabriel Tseng, Anthony Fuller, Hamed Alemohammad, Evan Shelhamer, Jennifer Marcus, Hannah Kerner

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Isaac Corley, Nils Lehmann, Caleb Robinson, Gabriel Tseng, Anthony Fuller, Hamed Alemohammad, Evan Shelhamer, Jennifer Marcus, Hannah Kerner

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 혼란스러운 시장이 있다고 상상해 보세요. 수백 명의 상인들이 "마법 지도"(지리 공간 기초 모델) 를 팔고 있습니다. 이 지도들은 홍수 예측, 산림 벌채 추적, 농작물 찾기 같은 큰 문제들을 해결하는 데 도움이 된다고 합니다. 모두들 자신의 지도가 가장 좋다고 주장하지만, 비교해 보면 누구도 실제로 누가 이기고 있는지 알지 못한다는 사실을 깨닫게 됩니다.

이 논문은 "지리 공간 기초 모델" 분야가 현재 상인들이 같은 게임 규칙을 따르지 않기 때문에 혼란 상태에 있다고 주장합니다. 여기서는 간단한 비유를 사용하여 문제의 개요와 제안된 해결책을 설명합니다.

문제: 규칙서가 없는 시장

저자들은 152 편의 연구 논문(152 명의 상인의 영수증을 확인하는 것과 같음)을 감사했고, 어떤 모델이 실제로 가장 좋은지 판단할 수 없게 만드는 세 가지 주요 문제를 발견했습니다.

1. "비밀 레시피" 문제 (가중치 누락)

  • 문제: 논문의 39% 가 실제 "마법 지도"(모델 가중치) 를 공유하지 않습니다. 마치 요리사가 "내 수프가 세계 최고다"라고 말하면서도 아무도 맛보게 하거나 레시피를 보여주기를 거부하는 것과 같습니다.
  • 결과: 수프를 볼 수 없다면 그것이 실제로 좋은지 확인할 수 없고, 직접 만들어 보아 작동하는지 확인할 수도 없습니다.

2. "다른 놀이터" 문제 (공유된 벤치마크 부재)

  • 문제: A 팀은 뉴욕의 농구 코트에서 농구를 하고, B 팀은 런던의 축구장에서 축구를 하고, C 팀은 도쿄의 테니스 코트에서 테니스를 하는 스포츠 리그를 상상해 보세요. 그런 다음 그들이 모두 "최고의 운동선수"라고 주장합니다.
  • 현실: 논문들은 401 개의 서로 다른 테스트 데이터셋 (놀이터) 을 사용합니다. 상위 3 개 가장 일반적인 데이터셋조차 테스트의 10% 에서만 사용됩니다. 대부분의 논문은 다른 누구도 사용하지 않는 고유한 일회성 데이터셋에서 테스트합니다.
  • 결과: A 팀의 농구 점수와 B 팀의 축구 점수를 비교할 수 없습니다. 저자들은 논문의 35% 가 가장 일반적인 데이터셋조차 테스트하지 않는다는 사실을 발견했으며, 이로 인해 공정한 순위 매기기가 불가능합니다.

3. "마법 숫자" 문제 (일관성 없는 결과)

  • 문제: 이것이 가장 충격적인 발견입니다. 서로 다른 두 논문이 정확히 같은 모델을 정확히 같은 데이터셋에서 테스트할 때, 완전히 다른 점수를 얻습니다.
  • 비유: 두 사람이 같은 트랙에서 같은 차를 테스트한다고 상상해 보세요. 한 사람은 시속 60 마일이라고 하고, 다른 사람은 시속 120 마일이라고 합니다. 둘 다 같은 차와 같은 트랙을 사용했지만 측정 방법에 대해 동의하지 않았습니다.
  • 현실: 저자들은 46 건의 사례를 발견했는데, 같은 모델이 테스트 실행 방식을 변경함으로써만 최소 10 점 (심지어 56 점까지!) 의 점수 차이를 보였습니다.这意味着 만약 논문을 읽어서 모델이 "90% 정확도"라고 주장한다면, 그 숫자가 실제인지 아니면 테스트 실행 방식의 우연에 불과한지 알 수 없습니다.

4. "혼합 스무디" 문제 (혼란스러운 변수)

  • 문제: 때로는 논문이 "우리의 새로운 모델이 더 좋습니다!"라고 말하지만, 동시에 학습에 사용된 데이터도 변경합니다.
  • 비유: 제빵사가 "내 새로운 케이크가 맛있어졌는데, 그 이유는 오븐 온도를 바꿨기 때문입니다!"라고 말하는 것과 같습니다. 하지만 그들은 맛을 좋게 만든 비밀 재료 (더 나은 데이터) 를 몰래 추가했습니다. 오븐이 진짜 영웅인지 비밀 재료가 진짜 영웅인지 알 수 없습니다.
  • 현실: 논문들은 거의 "더 나은 아키텍처"와 "더 나은 데이터"를 분리하지 않으므로, 무엇이 실제로 개선을 일으켰는지 알 수 없습니다.

해결책: 공정한 게임을 위한 여섯 가지 규칙

저자들은 모델이 쓸모없다고 말하는 것이 아니라, 보고 방식이 고장 났다고 말합니다. 그들은 시장을 고치기 위해 여섯 가지 간단한 규칙을 제안합니다.

  1. 레시피 공유 (가중치 공개): 모델이 재사용 가능하다고 주장한다면 명확한 라이선스와 함께 실제 모델 파일을 공유해야 합니다. (개인정보 보호나 법률로 인해) 공유할 수 없다면 그 이유를 명확히 밝혀야 합니다.
  2. 같은 경기장에서 플레이 (공유 벤치마크): 저자들은 자신의 모델을 소수의 공유된 표준 데이터셋 (가장 인기 있는 상위 10 개 등) 에서 테스트해야 합니다. 그래야 모두 같은 게임을 하는 것입니다.
  3. 숫자 라벨링 (복제 대 재실행): 다른 논문에서 가져온 점수를 사용한다면 "복제"라고 표시해야 합니다. 직접 테스트를 실행했다면 "재실행"이라고 표시하고 설정을 보여줘야 합니다. 둘을 섞어서는 안 됩니다.
  4. 분산 표시 (불확실성 보고): 테스트를 한 번만 실행했다면 그렇게 말해야 합니다. 다섯 번 실행했다면 평균과 범위를 보여줘야 합니다. 단일 운 좋은 실행을 확실한 사실인 것처럼 가장해서는 안 됩니다.
  5. 보편적 테스트기 구축 (공유 하네스): 커뮤니티는 모든 사람이 테스트를 실행하는 데 사용하는 단일 자동화 도구 (보편적인 심판과 같은) 가 필요합니다. 이렇게 하면 "규칙"(예: 정확도 측정 방법) 이 모두에게 동일하게 적용됩니다.
  6. 변화 격리 (통제 실험): 모델과 데이터를 모두 변경했다면, 데이터는 동일하게 유지하면서 모델 변경이 실제로 도움이 되었음을 증명하는 테스트를 실행해야 합니다.

결론

이 논문은 증거가 너무 엉망이라 비교할 수 없기 때문에 현재의 "최첨단 (State of the Art)"을 아무도 알지 못한다고 결론 내립니다. 이는 개별 과학자들의 실패가 아니라 조정 실패입니다.

만약 커뮤니티가 이 여섯 가지 규칙을 따른다면, 상충되는 주장이 난무하는 혼란스러운 시장으로부터 명확하고 신뢰할 수 있는 리더보드로 이동할 수 있습니다. 그러면 농부가 홍수 지도가 필요하거나 도시 계획가가 건물 탐지기가 필요할 때, 리더보드를 보고 혼란스러운 숫자에 기반한 추측이 아니라 실제로 어떤 도구가 가장 좋은지 알 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →