StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley
StarDojo는 1,000개의 큐레이션된 과업을 통해 복잡한 생산-생활 시뮬레이션 내에서 개방형 에이전트 멀티모달 LLM을 평가하는 게임 스타듀 밸리 기반의 새로운 벤치마크로, GPT-4.1과 같은 최첨단 모델조차 시각적 이해, 추론, 그리고 저수준 조작 능력에서 큰 어려움을 겪으며 단 12.7%의 성공률만을 달성했다는 사실을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 단순히 질문에 답하거나 시를 쓰는 법이 아니라, 일어나는 법, 출근하는 법, 친구를 사귀는 법, 예산을 관리하는 법, 그리고 갑작스러운 폭우에 대처하는 법 등 인간의 온전한 삶을 사는 법을 가르치려 한다고 상상해 보십시오. 이 모든 것을 동시에 수행하는 법 말입니다.
이것이 바로 이 논문의 저자들이 StarDojo를 통해 하려는 작업입니다. 그들은 인기 비디오 게임인 *스타듀 밸리(Stardew Valley)*를 활용하여 인공지능(AI) 에이전트가 "생산과 생활"이라는 복잡하고 까다로운 현실을 감당할 수 있는지 확인하기 위한 테스트 환경을 구축했습니다.
다음은 이들의 연구를 쉬운 비유를 사용하여 정리한 내용입니다.
1. 문제점: "두 트랙" 사이의 간극
현재의 AI 벤치마크를 운전 시험에 비유해 본다면, 자동차를 직선으로 주차하는 법(생산)만 테스트하거나, 혹은 승객과 대화하는 법(사회적 상호작용)만 테스트하는 것과 같습니다.
- 현실: 현실 세계에서는 단순히 주차만 하거나 대화만 할 수 없습니다. 식료품점에 운전해서 가고(생산), 음식을 사고, 시간을 관리하며 돈을 계산하면서 점원과 대화(사회적 상호작용)도 해야 합니다.
- 간극: 기존의 테스트들은 AI가 이 두 가지를 동시에 수행할 수 있는지 확인하지 못합니다. 기존 테스트들은 너무 단순하거나 한 가지 측면에만 집중되어 있습니다.
2. 해결책: StarDojo ( "인생 시뮬레이션" 시험)
저자들은 스타듀 밸리를 기반으로 한 새로운 벤치마크인 StarDojo를 만들었습니다.
- 게임: 작물을 심고, 돌을 캐고, 동굴에서 슬라임과 싸우며, 마을 주민들과 어울리는 아늑한 농장을 상상해 보십시오.
- 반전: 그들은 이 게임을 AI를 위한 엄격한 시험장으로 탈바로 바꿨습니다. 사람이 게임을 플레이하는 대신, AI 에이전트가 특정 과제를 완수하도록 했습니다.
- 과제: 그들은 "쉬움"(식물에 물 주기)부터 "어려움"(이웃과 관계를 쌓고 몬스터와 싸우는 동시에 농사 한 시즌을 계획하기)까지 1,000가지의 서로 다른 도전 과제를 만들었습니다.
- "라이트(Lite)" 버전: 테스트를 더 쉽게 만들기 위해, 기초적인 내용을 다루는 100개의 대표 과제(StarDojo-Lite)를 별도로 선정했습니다.
3. AI와 게임을 연결하는 방법
보통 비디오 게임을 제어하려면 키보드와 마우스가 필요합니다. 하지만 로봇의 뇌에 키보드를 직접 연결하기는 쉽지 않습니다.
- 가교: 저자들은 AI가 게임 엔진과 직접 대화할 수 있게 해주는 특수한 "번역기"(StarDocjoMod)를 구축했습니다.
- 비유: AI가 인간처럼 화면을 "보고" 버튼을 "누르는" 대신, AI가 게임의 내부 컴퓨터와 직접 연결된 전용 전화선을 가진 것과 같습니다. AI는 "내 에너지 수치는 얼마인가요?"라고 묻거나 "나를 왼쪽으로 이동시켜 줘"라고 말할 수 있고, 게임은 이를 즉시 수행합니다. 이를 통해 많은 게임을 동시에 실행하여 AI를 빠르게 테스트할 수 있습니다.
4. 결과: AI는 "성장"하는 데 어려움을 겪다
저자들은 현재 사용 가능한 가장 똑똑한 AI 모델들(GPT-4.1, Claude, Gemini 등)을 이 시험에 투입했습니다. 결과는 냉혹했습니다.
- 점수: 최고의 AI조차 과제의 약 **12.7%**만을 성공했습니다.
- 쉬운 과제: AI는 간단하고 짧은 과제(이미 손에 들고 있는 도구를 집는 것 등)에는 어느 정도 능숙했습니다.
- 어려운 과제: 긴 계획이 필요하거나 맵을 이동해야 하는 과제에서는 완전히 실패했습니다. 과제가 몇 단계 이상의 과정을 거쳐야 하면, AI는 길을 잃거나 자신이 무엇을 하고 있었는지 잊어버렸습니다.
5. AI는 왜 실패했는가? ("네 가지 사각지대")
저자들은 오류를 분석하여 AI가 이 "인생 시뮬레이터"를 감당하지 못한 네 가지 주요 원인을 찾아냈습니다.
- 시각적 맹목 (오류의 42%): AI는 게임 화면을 보고 있지만 무엇이 무엇인지 구별하지 못했습니다. 돌을 나무라고 생각하거나, 문이 바로 앞에 있다는 사실을 인지하지 못하기도 합니다. 이는 마치 안개가 낀 안경을 쓰고 방 안을 돌아다니는 것과 같습니다.
- 추론 혼란 (21%): AI가 올바른 정보(예: "당신은 지금 외양간 근처에 있습니다"라는 텍text 리스트)를 가지고 있음에도 불구하고, 텍스트를 무시하고 흐릿한 시각 정보에 의존하여 혼란을 겪었습니다.
- 짧은 주의력 (21%): AI는 앞을 내다보며 계획하지 못했습니다. 수확하기 전에 반드시 물을 주어야 한다는 사실을 잊거나, 과제를 수행하는 도중에 목표를 바꿔버리곤 했습니다.
- 서툰 손놀림 (16%): AI는 무엇을 해야 할지는 알았지만, '어떻게' 해야 하는지에서 실수했습니다. 도구를 잘못된 방향으로 사용하려 하거나 인벤토리에서 엉뚱한 아이템을 집기도 했습니다.
6. 시사점
이 논문은 AI가 질문에 답하거나 코드를 작성하는 데는 뛰어나지만, 현재로서는 **체화된 생활(embodied living)**에는 매우 취약하다고 결론짓습니다. AI는 시간이 흐르고 상황이 변하는 역동적인 세상 속에서 보고, 생각하고, 계획하고, 행동하는 것을 결합하는 데 어려움을 겪고 있습니다.
StarDojo는 이제 연구자들이 사용할 수 있도록 공개된 도구입니다. 이는 AI가 시뮬레이션된 삶이라는 복잡하고 무질서하며 아름다운 도전에 적응하기 위해 훈련할 수 있는 일종의 "체육관"과 같습니다. 이 논문은 AI가 내일 당장 농장을 운영하게 될 것이라고 약속하는 것이 아닙니다. 단지 AI가 어디에서 넘어지는지를 정확히 보여줌으로써, 우리가 AI가 학습할 수 있도록 도울 수 있는 지점을 제시하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.