← 최신 논문
💬 NLP

AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents

이 논문은 탐험, 지식 습득, 에피소드 기억 유지, 그리고 장기적 관점의 계획 수립에 있어서 테스트 시간 지속 학습 에이전트의 능력을 평가하고 진단하기 위해 절차적으로 생성된 개방형 텍스트 게임인 AgentOdyssey를 소개하며, 성능이 더 강력한 모델에 따라 확장되는 반면 현재의 에이전트와 인간 수준의 숙련도 사이에는 여전히 상당한 격차가 존재함을 밝힌다.

원저자: Zheyuan Zhang, Zehao Wen, Alvin Zhang, Andrew Wang, Jianwen Xie, Daniel Khashabi, Tianmin Shu

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zheyuan Zhang, Zehao Wen, Alvin Zhang, Andrew Wang, Jianwen Xie, Daniel Khashabi, Tianmin Shu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 매우 복잡하고 끝없이 이어지는 비디오 게임을 가르치고 있다고 상상해 보세요. 대부분의 AI용 비디오 게임은 짧은 단거리 경주와 같습니다. 로봇이 한동안 훈련을 받고, 테스트를 치르면 그것으로 끝이죠. 하지만 이 논문은 현실 세계가 단거리 경주가 아니라, 달리면서 계속 배워야 하는 마라톤이라고 주장합니다.

AI 에이전트가 실제로 실시간으로 학습할 수 있는지 테스트하기 위해, 연구진은 AgentOdyssey를 만들었습니다. 이것을 단 하나의 게임이 아니라, 하나의 게임 공장이라고 생각하세요. 이 공장은 똑똑한 컴퓨터 프로그램을 사용하여 매번 고유한 (마치 옛날 방식의 '당신의 선택에 따라 결말이 달라지는' 모험 소설 같은) 텍-기반 어드벤처 게임을 끊임없이 생성해 냅니다.

연구진이 수행한 작업과 발견한 내용을 쉬운 비유를 들어 정리했습니다.

1. 필요한 다섯 가지 초능력

연구진은 AI가 변화하는 세상에서 생존하고 번창하기 위해서는 다섯 가지 특정한 "초능력"이 필요하다고 믿습니다. 그들은 바로 이 능력들을 테스트하기 위해 게임을 설계했습니다.

  • 탐험 (탐험가): 에이전트가 새로운 도구나 단서를 찾기 위해 정해진 길을 벗어나 헤맬 수 있는가, 아니면 단순히 자신이 아는 것에만 머무르는가?
  • 에피소드 기억 (일기장): 만약 에이전트가 200단계 전의 방에 열쇠를 떨어뜨렸다면, 그 위치를 기억할 수 있는가? 아니면 3초짜리 기억력을 가진 금붕드처럼 행동하는가?
  • 세계 지식 (백과사전): 에이전트가 새로운 규칙을 배울 수 있는가? 예를 들어, "아, 밤에는 적들이 더 강해지는구나"라거나 "이 특정 돌이 검을 만드는 데 필요하구나"와 같은 규칙 말입니다.
  • 기술 학습 (도제): 에이전트가 나중에 아이템을 제작하는 방법을 잊지 않도록 레시피를 적어두는 것과 같이, 무언가를 '하는 법'을 배울 수 있는가?
  • 장기 계획 (설계자): 에이전트가 당장 다음 동작에만 반응하는 것이 아니라, 수백 단계에 걸친 복잡한 여정을 계획할 수 있는가?

2. "게임 공장" 엔진

이러한 게임들을 일일이 손으로 만드는 것은 시간이 너무 오래 걸릴 것입니다. 그래서 팀은 자동으로 새로운 세계를 구축하는 엔진(레고 기계 같은 것)을 만들었습니다.

  • 이 엔진은 새로운 장소, 아이템, 캐릭터를 발명합니다.
  • 세상이 어떻게 돌아가는지에 대한 새로운 규칙을 씁니다 (예: "소음을 너무 많이 내면 몬스터가 나타난다").
  • 결정적으로, 이 엔진은 스스로의 작업을 검토합니다. 만약 기계가 고장 났거나 클리어할 수 없는 게임을 만들었다면, AI가 이를 접하기 전에 스스로 수정합니다.

3. 실험: 누가 승리했는가?

그들은 이 게임들에서 다양한 유형의 AI "두뇌"를 테스트했습니다. 어떤 두뇌는 거대한 기억력(Long Context)을 가졌고, 어떤 두뇌는 외부 데이터베이스(RAG)를 사용했으며, 어떤 두뇌는 플레이하는 동안 자신의 뇌 구조를 스스로 재구성(Test-Time Training)하려고 시도했습니다.

주요 발견 사항:

  • 기억력이 왕이다: 과거의 사건을 가장 많이 기억할 수 있는(자신의 역사가 담긴 책 한 권을 통째로 읽는 것과 같은) 에이전트들이 가장 좋은 성적을 거두었습니다. 하지만 가장 똑똑한 에이전트들조차 인간 수준의 성능에는 훨씬 미치지 못했습니다.
  • "금붕어" 문제: 많은 에이전트가 반복 루프에 빠졌습니다. 그들은 잠긴 문을 열려고 시도했다가 "안 된다"는 말을 들으면, 곧바로 다시 그 잠긴 문을 열려고 시도하는 과정을 반복했습니다. 그들은 실수로부터 배우지 못했습니다.
  • "단기 기억"의 효과: 놀랍게도, 에이전트들에게 즉각적인 목표를 유지할 수 있는 작은 고정형 "메모장"(단기 기억)을 주는 것이 거의 모든 에이전트에게 도움이 되었습니다. 이는 마치 세금 계산을 하는 동안 모니터에 "우유 사는 거 잊지 말 것"이라고 적힌 포스트잇을 붙여두는 것과 같습니다.
  • 생각의 비용: 가장 똑똑한 에이전트들은 가장 비싼 대가를 치렀습니다. 그들은 모든 것을 기억하기 위해 너무 많은 컴퓨터 자원(토큰)을 사용했기 때문에, 예산을 매우 빠르게 소진해 버릴 것입니다. 이는 퍼즐을 풀면서 동시에 사전 전체를 읊고 있는 것과 같습니다. 결국 정답은 맞히겠지만, 그전에 에너지가 먼저 바닥날 것입니다.

4. 결론

이 논문은 AI가 추론 능력은 좋아지고 있지만, 여전히 **지속적 학습(continual learning)**에는 어려움을 겪고 있다고 결론짓습니다.

  • 그들은 반복적인 루프에 갇힙니다 (부족한 에피소드 기억).
  • 사실을 환각합니다 (부족한 세계 지식).
  • 장기적인 목표를 잊어버립니다 (부족한 계획 능력).

연구진은 단기 기억이 에이전트가 플레이하는 동안 학습하도록 돕는 핵심적인 요소라는 것을 발견했습니다. 그러나 현재 최고의 AI 에이전트들조차, 숙제를 마치고 문 밖을 나서는 순간 숙제 내용을 까먹어 버리는 아주 똑똑한 학생과 같습니다. 이 에이전트들이 학습하는 방식과 인간이 현실 세계에서 학습하는 방식 사이에는 여전히 거대한 격차가 존재합니다.

요약하자면: AgentOdyssey는 AI 에이전트들이 실시간으로 학습하는 연습을 하기 위한 체육관입니다. 결과에 따르면, 그들이 점점 강해지고는 있지만, 게임이 길고 복잡해지면 여ً전히 서투르고, 잘 잊어버리며, 쉽게 혼란에 빠집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →