← 최신 논문
🤖 AI

TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?

이 논문은 언어 모델을 환경 분석, 시뮬레이션 및 검증을 위한 전문적인 과학적 도구와 결합함으로써, 이질적인 지구 시스템 데이터 전반에 걸쳐 접지된 다단계 추론을 수행하는 AI 에이전트의 능력을 평가하고 발전시키기 위해 설계된 포괄적인 벤치마크이자 실행 가능한 프레임워크인 TerraBench를 소개한다.

원저자: Dat Tien Nguyen, Thao Nguyen, Fadillah Adamsyah Maani, Huy M. Le, Muhammad Umer Sheikh, Numan Saeed, Muhammad Haris Khan, Salman Khan

게시일 2026-06-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dat Tien Nguyen, Thao Nguyen, Fadillah Adamsyah Maani, Huy M. Le, Muhammad Umer Sheikh, Numan Saeed, Muhammad Haris Khan, Salman Khan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 기상 현상에 관한 복잡한 미스터리를 풀기 위해 노력하고 있다고 상상해 보십시오. 그런데 당신의 팀에는 매우 서로 다른 두 종류의 탐정이 있습니다:

  1. "단어 마법사" (대규모 언어 모델): 이 탐정은 책을 읽고, 언어를 이해하며, 전략을 짜는 데 매우 뛰어납니다. 그들은 문제를 해결하기 위해 어떤 단계를 밟아야 하는지 말해줄 수 있습니다. 하지만 그들은 기상도를 본 적도 없고, 위성 사진을 읽을 줄도 모르며, 만약 당신이 숫자 하나를 계산해 달라고 요청한다면 그저 추측해 버릴 수도 있습니다.
  2. "데이터 처리기" (과학적 도구들): 이 탐정은 슈퍼컴퓨터를 탑재한 로봇입니다. 위성 이미지를 즉각적으로 읽고, 복잡한 기후 시뮬레이션을 실행하며, 정확한 숫자를 계산할 수 있습니다. 하지만 이들은 인간의 언어를 구사하지 못하며, 질문을 이해하지 못하고, 누군가가 자신에게 정확히 무엇을 해야 할지 알려주어야만 움직입니다.

문제점:
현재 이 두 탐정은 서로 잘 협력하지 못합니다. 단어 마법사는 데이터 처리기의 도구들을 효과적으로 사용할 수 없고, 데이터 처리기는 단어 마법사의 계획을 이해할 수 없습니다. 이로 인해 AI가 기후 변화, 농업 또는 재난 대응과 같은 실제 의사결정을 돕는 데 기여하는 것이 매우 어렵습니다.

해결책: TerraBench와 TerraAgent
이 논문의 저자들은 AI가 마침내 이 두 탐정을 한 팀으로 만드는 법을 배울 수 있는지 확인하기 위해, 새로운 테스트 환경인 TerraBench와 새로운 "관리자"인 TerraAgent를 구축했습니다.

TerraAgent를 프로젝트 매니저라고 생각해 보십시오. 당신이 *"다음 주에 허리케인이 플로리다의 농작물에 어떤 영향을 미칠까?"*와 같은 질문을 던지면, 이 매니저는 다음과 같이 행동합니다:

  • 계획(Plans): 질문을 여러 단계로 나눕니다.
  • 도구 호출(Calls Tools): 데이터 처리기에게 위성 이미지를 찾아보고, 과거 기상 기록을 확인하며, 시뮬레이션을 실행하라고 명령합니다.
  • 작업 검토(Checks Work): 로봇이 돌려준 결과물을 검토합니다.
  • 보고(Reports): 명확하고 구조화된 형식으로 최종 답변을 작성합니다.

테스트 (TerraBench)
이 매니저가 유능한지 확인하기 위해, 저자들은 TerraBench라는 거대한 시험을 만들었습니다. 이것은 단순한 객관식 테스트가 아닙니다. 이것은 AI가 다음을 수행해야 하는 403개의 복 복잡한 "미션"들의 집합체와 같습니다:

  • 기초(Fundamentals): 지도와 기상 차트를 읽고 기본적인 질문에 답하기.
  • 시뮬레이션(Simulation): 홍수와 같은 재난이 발생했다고 가정하고, 시뮬레이터를 사용하여 피해를 예측하기.
  • 검증(Verification): AI의 답변이 실제 과학 논문 및 데이터와 일치하는지 확인하기.

이 테스트는 매우 엄격합니다. 단순히 AI가 올바른 도구를 선택했는지만 보는 것이 아니라, AI가 그 도구의 올바른 설정값을 사용했는지, 그리고 최종 숫자가 아주 미세한 오차 범위 내에서 정확한지를 따집로 합니다.

결과: 현실 점검
저자들은 현존하는 가장 똑똑한 AI 모델들(Claude Sonnet 4.6 및 Qwen3.5 등)을 이 시험에 투입했습니다. 결과는 놀라웠습니다:

  • 계획은 잘하지만, 수학에는 젬병: 상위 AI 모델들은 어떤 도구를 어떤 순서로 사용할지 결정하는 것(프로세스 부분)은 준수했습니다(약 59%의 점수).
  • 정밀도에는 형편없음: 그러나 최종 숫자를 정확하게 맞추는 데 있어서는 처참하게 실패했습니다. 가장 뛰어난 모델조차 최종 정답을 맞힌 비율은 약 23%에 불과했습니다.
  • "거의 다 왔지만 틀린" 함정: 대부분의 경우, AI는 올바른 도구를 선택했지만 잘못된 설정값(예: 엉뚱한 날짜나 잘못된 위치를 참조함)을 사용했습니다. 이로 인해 결과값은 근사치에 가깝긴 하지만 과학적으로는 무용지물인 답변이 나왔습니다.

"잘못된 레시피"의 비유
요리사(AI)에게 특정 레시피(과학적 데이터)를 사용하여 케이크를 구우라고 명령한다고 상상해 보십시오.

  • 요리사는 어떤 재료를 집어야 할지는 정확히 알고 있습니다 (도구 선택).
  • 하지만 밀가루를 측정할 때, 전자저울 대신 계량컵을 사용합니다 (잘못된 인자/설정값).
  • 그 결과, 케이크처럼 보이지만 맛은 모래알 같은 케이크가 만들어집니다.

이 논문은 현재의 AI가 무엇을 해야 할지는 잘 알지만, 그것을 실제 과학 분야에서 신뢰할 수 있을 만큼 정밀하게 수행하는 데는 어려움을 겪고 있다는 점을 보여줍니다.

결론
논문은 지구 과학을 위한 진정으로 유용한 AI를 구축하기 위해서는 단순히 도구에 대한 접근 권한을 주는 것만으로는 부족하다고 결론짓습니다. 우리는 AI에게 극도로 정밀하게 도구를 조정하는 법, 복잡한 워크플로우를 처리하는 법, 그리고 최종 숫자가 과학적으로 정확하도록 보장하는 법을 가르쳐야 합니다. TerraBench는 우리가 그 목표로부터 얼마나 멀리 떨어져 있는지를 정확히 측정하는 첫 번째 도구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →