← 최신 논문
🤖 AI

AGI Maze as a Benchmark Framework for World-Modeling Agents

이 논문은 작업 기억 메커니즘이 제공되더라도 부분적으로 관찰 가능하고 상태가 있는 과제를 해결하는 데 필요한 지속적이고 조작 가능한 세계 상태 표현을 구축하지 못하는 현재의 거대 언어 모델들의 무능력을 드러내기 위해 설계된 경량 그리드 기반 벤치마크 프레임워크인 AGI Maze를 소개한다.

원저자: Alexey Potapov

게시일 2026-07-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alexey Potapov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 이 논문을 쉬운 언어와 일상적인 비유를 사용하여 설명한 내용입니다.

핵심 아이디어: 왜 "똑똑한" 챗봇들이 미로에서 길을 잃는가

당신에게 시를 쓰고, 수학 문제를 풀고, 농담도 할 줄 아는 매우 똑똑한 친구가 있다고 상상해 보세요. 이 친구는 **거대 언어 모델(LLM)**과 같습니다. 이들은 문장에서 다음에 올 단어를 예측하는 데 매우 뛰어납니다.

하지만 이 논문은 만약 이 친구를 바로 앞의 벽만 볼 수 있는 어둡고 뒤틀린 미로 속에 넣는다면, 그 친구가 길을 잃게 될 것이라고 주장합니다. 그들은 다음 단계를 추측할 수는 있겠지만, 머릿속에 전체 미로의 정신적 지도를 구축하지는 못합니다. 그들은 이야기를 완성하는 데는 뛰어나지만, 세상을 시뮬레이션하는 데는 서툽니다.

이를 증명하기 위해 저자들은 AGI Maze라는 새로운 테스트를 만들었습니다.


AGI Maze란 무엇인가? ("텍스트 기반 비디오 게임")

AGI Maze를 텍스트 메시지로만 플레이하는 비디오 게임이라고 생각해보세요.

  • 설정: 당신은 격자판(체스판 같은 형태) 안에 있습니다. 시작 지점, 보물 상자, 열쇠, 그리고 출구가 있습니다.
  • 제약 조건: 당신은 지도를 볼 수 없습니다. 벽이 어디에 있는지 모릅니다. 오직 어디서 시작했는지만 압니다.
  • 게임 플레이: 당신이 "오른쪽으로 가"라고 입력하면, 게임은 "벽에 부딪혔습니다"라고 답합니다. 그다음 당신이 "아래로 가"라고 입력하면, 게임은 "열쇠를 찾았습니다!"라고 말합니다.
  • 목표: 당신은 한 번도 그림을 본 적이 없으면서도, 자신이 어디에 있었는지와 벽이 어디에 있는지를 기억하며 미로의 구조를 파악하고, 열쇠를 찾아 상자를 연 뒤 탈출해야 합니다.

왜 어려운가요?
미로에는 난이도를 높이는 "함정"들이 있습니다:

  1. 강(Rivers): 강에 발을 들이면 자동으로 하류로 휩쓸려 내려가지만, 게임은 물이 어느 방향으로 흐르는지 알려주지 않습니다. 당신은 직접 추측해야 합니다.
  2. 구덩이(Pits): 구덩이에 빠지면 미로의 완전히 다른 부분으로 이동할 수도 있습니다.
  3. 시간 제한: 미로를 완료하기 위해 사용할 수 있는 단계(step)가 정해져 있습니다. 목적 없이 방황하다가는 시간이 다 되어 버립니다.

실험: AI가 이를 해결할 수 있을까?

저자들은 몇몇 유명한 AI 모델(GPT-4o나 Gemini 등)을 이 미로들로 테스트했습니다. 그들은 AI를 오직 텍스트 설명에만 의존하는 인간 플레이어처럼 취급했습니다.

결과는 놀라웠습니다:

  • "순수(Vanilla)" AI: AI가 단순히 대화 기록을 바탕으로 다음 움직임을 예측하려고 했을 때, 처참하게 실패했습니다. 작은 미로에서는 단순히 무작위 방향을 선택하는 프로그램(random-walk)보다 성적이 더 나쁜 경우도 많았습니다.
  • 문제점: AI는 자신의 "마음" 속에 지도를 구축하지 못했습니다. 그저 마지막 몇 문장에 기반하여 다음 단어를 추측하고 있었을 뿐입니다. "내가 어디에 있는지"와 "벽이 어디에 있는지"에 대한 안정적인 이미지를 유지하지 못했습니다.

"노트(Notebook)" 기법

저자들은 인간이 복잡한 미로를 풀 때 연필과 종이 없이 할 수 없다는 사실을 깨달았습니다. 우리는 이동하면서 지도를 그립니다. 그래서 그들은 AI에게 "노트"(이동하기 전에 자신의 채팅 기록에 메모를 남기게 하는 방식)를 주었습니다.

  • 설정: AI가 "오른쪽으로 가"라고 말하기 전에, 먼저 다음과 같이 노트를 작성합니다. "나는 왼쪽 하단에 있다. 위로 올라갔더니 벽에 부딪혔다. 열쇠는 오른쪽에 있는 것 같다."
  • 결과: 이 방식은 더 강력한 AI 모델들에게 큰 도움이 되었습니다. 그들은 실패하던 수준에서 약 60~70%의 미로를 해결하는 수준으로 올라섰습니다.
  • 함정: 노트를 사용하더라도 AI는 여전히 어려움을 겪었습니다. AI는 자연스럽게 완벽하고 구조화된 지도를 구축하지 못했습니다. 그저 지저한 메모를 적을 뿐이었습니다. 또한, 규모가 작고 성능이 낮은 AI 모델들의 경우, 노트 기법이 전혀 도움이 되지 않았으며 여전히 길을 잃었습니다.

이것이 우리에게 말해주는 것은?

논문은 몇 가지 핵심적인 결론을 내립니다:

  1. 예측 vs 이해: 현재의 AI는 문장에서 다음 단어를 예측하는 데(이야기를 완성하는 것과 같은)는 뛰어나지만, 변화하는 세상을 시뮬레이션하는 데(미로를 항해하는 것과 같은)는 서툽니다. AI는 현실에 대한 "정신적 모델"을 자연스럽게 유지하지 못합니다.
  2. 기억은 어렵다: AI에게 긴 과거 메시지 목록(그들의 "기억")을 주는 것만으로는 충분하지 않습니다. AI는 그 정보를 지도나 계획으로 능동적으로 조직해야 하는데, 현재는 이를 스스로 해내는 데 어려움을 겪고 있습니다.
  3. 테스트는 도구이지 최종 점수가 아니다: 저자들은 "AI가 쓸모없다"고 말하는 것이 아닙니다. "AI가 정확히 어느 부분에서 실패하고 있는지 보여주는 특정 도구(AGI Maze)를 제시한다"는 것입니다. 이는 진정한 지능형 에이전트를 만들기 위해서는 단순히 대화하는 법이 아니라, 세상의 내부 지도를 구축하고 사용하는 법을 가르쳐야 함을 강조합니다.

비유 요약

  • 현재의 LLM대본을 암기한 투어 가이드와 같습니다. 당신이 가본 적 없는 도시를 묘사해달라고 하면 단어들은 잘 골라내겠지만, 눈을 가린 채 미로를 헤매라고 하면 지도가 없기 때문에 비틀거릴 것입니다.
  • AGI Maze는 그 눈 가린 미로 테스트입니다.
  • **"노트"**는 투어 가이드에게 펜과 종이를 주는 것입니다. 도움이 되긴 하지만, 그들이 자연스럽게 지도 제작자가 되는 것은 아닙니다.

이 논문은 AI가 진정한 지능(AGI)에 도달하려면, 단순히 다음 문장을 추측하는 것이 아니라 자신만의 지도를 그리고 탐험하면서 그 지도를 업데이트하는 법을 배워야 한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →