← 최신 논문
💬 NLP

OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions

이 논문은 대규모 언어 모델이 장기적이고 능동적이며 귀납적인 상호작용을 수행하는 능력을 평가하기 위해 설계된 120개의 표준화된 과업과 극한의 스트레스 테스트로 구성된 새로운 벤치마크인 OdysseyArena를 소개하며, 이를 통해 최첨단 모델들조차 복잡한 환경에서 잠재적인 전이 법칙을 자율적으로 발견하는 데 어려움을 겪는다는 점을 밝혀낸다.

원저자: Hang Yan, Fangzhi Xu, Qiushi Sun, Jinyang Wu, Zixian Huang, Muye Huang, Jingyang Gong, Zichen Ding, Kanzhi Cheng, Yian Wang, Xinyu Che, Zeyi Sun, Jian Zhang, Zhangyue Yin, Haoran Luo, Ben Kao, Qika Li
게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hang Yan, Fangzhi Xu, Qiushi Sun, Jinyang Wu, Zixian Huang, Muye Huang, Jingyang Gong, Zichen Ding, Kanzhi Cheng, Yian Wang, Xinyu Che, Zeyi Sun, Jian Zhang, Zhangyue Yin, Haoran Luo, Ben Kao, Qika Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇에게 새로운, 복잡한 보드게임을 가르치고 있다고 상상해 보세요.

옛날 방식 (연역적 방법):
현재 대부분의 AI 테스트는 로봇에게 게임을 시작하기 전에 규칙 설명서를 주는 것과 같습니다. 당신은 이렇게 말합니다. "규칙은 이래: 만약 빨간색 칸에 도착하면 뒤로 두 칸 가. 주사위에서 6이 나오면 앞으로 가." 로봇은 그저 명시적인 지침을 따를 뿐입니다. 이는 명령을 따르는 데는 뛰어나지만, 규칙이 왜 존재하는지, 혹은 규칙 설명서가 없을 때 어떻게 규칙을 찾아내야 하는지는 정말로 이해하지 못합니다.

새로운 방식 (귀납적 방법):
ODYSSEYARENA 논문은 진정한 현실 세계의 지능이란 규칙을 따르는 것이 아니라, 게임을 플레이하면서 규칙을 '발견'하는 것이라고 주장합니다. 로봇에게 보드게임은 건네주되, 규칙 설명서는 숨긴 채로 준다고 상상해 보세요. 로봇은 스스로 움직여 보고, 어떤 일이 일어나는지 관찰하고, 혼란을 겪고, 다시 시도하며, 숨겨진 논리를 스스로 천천히 파악해 나가야 합니다. 이것을 "귀납적 추론"이라고 부릅니다.

문제점

연구진은 오늘날의 가장 똑똑한 AI 모델들조차 이 작업에 매우 서투르다는 것을 발견했습니다. 그들은 지침을 따르는 것(연역)에는 능숙하지만, 규칙이 숨겨져 있을 때 경험으로부터 배우는 것(귀납)에는 어려움을 겪습니다. 그들은 루프(반복되는 오류)에 빠지거나, 배운 것을 잊어버리거나, 게임이 길고 복잡해지면 포기해 버립니다.

해결책: ODYSSEYARENA

이를 테스트하기 위해 연구팀은 ODYSSEYARENA라는 새로운 "체육관(gym)"을 구축했습니다. 짧고 단순한 과제 대신, AI가 탐정이 되도록 강요하는 네 가지 서로 다른 "게임"을 만들었습니다. 이 게임들은 AI가 적극적으로 탐색하도록 설계되었으며, 호흡이 깁니다(수백 단계).

다음은 네 가지 게임을 쉬운 비유로 설명한 것입니다:

  1. 불 켜기 (논리 퍼즐):

    • 설정: 전구 벽이 있습니다. 어떤 것은 켜져 있고, 어떤 것은 꺼져 있습니다. 스위치를 누를 수 있지만, 배선이 어떻게 되어 있는지는 모릅니다.
    • 도전 과제: 스위치 하나를 누르면 전구가 켜질 수도 있지만, 숨겨진 연결 때문에 실수로 다른 전구 세 개를 끌 수도 있습니다. AI는 시행착오를 통해 스위치를 누르고, 결과를 관찰하며, 비밀 배선도를 알아내야 합니다.
    • 비유: 매뉴얼 없이 크리스마스 전구를 고치려고 애쓰는 것과 같습니다. 어떤 전구가 다른 전구에 영향을 주는지 추측해야 하는 상황입니다.
  2. AI 트레이딩 (주식 시장):

    • 설정: AI는 주식 포트폴리오를 가진 트레이더입니다. 매일 시장은 AI가 직접 볼 수 없는 숨겨진 "요인들"(예: 날씨나 뉴스)에 따라 움직이며, AI는 오직 힌트만을 얻을 수 있습니다.
    • 도전 과제: AI는 주가와 뉴스를 관찰하고, 이들을 연결하는 숨겨진 수학적 관계를 추측하며, 돈을 벌기 위해 미래를 예측해야 합니다.
    • 비유: 하늘을 직접 보는 대신, 사람들이 옷을 어떻게 입었는지만 보고 날씨를 예측하려는 것과 같습니다. "코트를 입은 사람들"과 "비" 사이의 패턴을 찾아내야 합니다.
  3. 에너지 디스패치 (전력망):

    • 설정: AI는 발전소 관리자입니다. 도시가 계속 돌아갈 수 있도록 태양광, 풍력, 석탄 에너지를 조절해야 합니다.
    • 도전 과제: 태양과 바람은 예측 불가능하며 숨겨진 주기(예: 계절)를 따릅니다. 만약 AI가 사흘 연속으로 실수를 하면 전력망 전체가 붕괴됩니다. AI는 불을 밝히기 위해 자연의 숨겨진 리듬을 배워야 합니다.
    • 비유: 바람의 방향이 매 시간 바뀌는 폭풍우 치는 밤에 캠프파이어를 완벽하게 유지하려고 노력하는 것과 같습니다. 당신은 그 변화의 패턴을 추측해야 합니다.
  4. Repo 시스템 (소프트웨어 해결사):

    • 설정: AI는 소프트웨어 패키지를 설치하려는 컴퓨터 프로그래머입니다.
    • 도전 과제: 소프트웨어 하나를 설치하면 숨겨진 버전 충돌 때문에 다른 소프트웨어가 고장 날 수 있습니다. AI는 설치하고, 테스트하고, 고장 내고, 고치고, 다시 설치하는 과정을 통해, 서로 다른 프로그램들 사이의 보이지 않는 의존성 웹을 천천히 그려나가야 합니다.
    • 비유: 새 문을 사는 것이 어제 세워둔 벽을 무너뜨릴 수도 있는 집을 짓는 것과 같습니다. 당신은 진행하면서 청사진을 파악해야 합니다.

연구 결과

연구진은 세계에서 가장 똑똑한 15개 이상의 AI 모델(최고의 상용 및 오픈 소스 모델 포함)을 이 게임들로 테스트했습니다.

  • 결과: 최고의 모델들도 긴 호흡의 과제에서는 처참하게 실패했습니다. 그들은 루프에 빠지거나(같은 실수를 반복함), 이전에 배웠던 것을 잊어버리거나, 숨겨진 규칙을 파악하지 못했습니다.
  • 격차: 만약 연구진이 모델들에게 규칙을 미리 알려준다면, 모델들은 아주 잘 해냅니다. 하지만 스스로 규칙을 '발견'해야 할 때는 성능이 거의 0에 가깝게 떨어졌습니다.
  • 결론: 현재의 AI는 교과서를 암기하는 데는 탁월하지만, 책 없이 문제를 풀어보라고 하면 완전히 무너지는 학생과 같습니다. 진정한 자율형 에이전트를 만드는 가장 큰 병목 현상은 AI를 더 크게 만들거나 더 빠르게 만드는 것이 아니라, 자신의 실수를 통해 배우고 세상의 숨겨진 패턴을 발견하는 법을 가르치는 것입니다.

요약하자면, ODYSSEYARENA는 AI에게 "명령을 따를 수 있는가?"라고 묻는 대신, "스스로 세상이 어떻게 돌아가는지 알아낼 수 있는가?"라고 묻는 새로운 방식의 테스트입니다. 현재까지의 대답은 "그다지 그렇지 않다"입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →