HERO'S JOURNEY: Testing Complex Rule Induction with Text Games
이 논문은 목표 지향적 텍스트 게임에서의 규칙 유도를 평가하기 위한 벤치마크인 HERO'S JOURNEY를 소개하며, 최첨단 거대언어모델(LLM)들이 숨겨진 규칙을 추론하는 데 어느 정도의 능력을 보여주기는 하지만, 특히 절차적 유도와 다단계 실행 측면에서 그 성능이 제한적이고 불균일하다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
큰 그림: AI의 두뇌를 위한 비디오 게임
당신이 텍스트 기반 어드벤처 게임(고전적인 Zork나 선택형 모험 소설 같은 것)을 플레이하고 있다고 상상해 보세요. 당신은 포로를 구출하려는 전사입니다. 승리하려면 수호자 몬스터를 물리쳐야 합니다. 하지만 여기 함정이 있습니다. 어떤 무기가 어떤 몬스터를 쓰러뜨리는지 아무도 알려주지 않습니다.
당신이 가진 유일한 단서는 이전에 도전했다가 실패했거나 성공했던 다른 전사들의 "일기"뿐입니다. 당신은 그들의 이야기를 읽고, 숨겨진 패턴(예: "아, 드래곤에게는 불의 검이 필요하지만, 고블린에게는 물의 검이 필요하구나")을 파악한 다음, 그 규칙을 한 번도 본 적 없는 새로운 몬스터에게 적용해야 합니다.
이 논문은 HERO'S JOURNEY라는 새로운 테스트 스위트를 소개합니다. 이것은 인공지능(AI)이 단순히 답을 추측하거나 암기하는 것이 아니라, 실제로 예시로부터 규칙을 학습하고 이를 정확하게 실행할 수 있는지 테스트하기 위한 일종의 체육관과 같습니다.
두 가지 주요 과제
연구진은 현재의 AI 모델들(똑똑한 컴퓨터들)이 이 게임에서 두 가지 특정 부분에서 어려움을 겪는다는 것을 발견했습니다.
1. "탐정" 문제 (규칙 귀납, Rule Induction)
AI는 탐정처럼 행동해야 합니다. 단서(다른 전사들의 이야기)를 살펴보고 우주의 비밀 법칙을 추론해야 합니다.
- 비유: 세 사람이 클럽에 들어가는 것을 본다고 가정해 봅시다.
- A라는 사람 (빨간 옷 착용)은 VIP 패스를 받습니다.
- B라는 사람 (파란 옷 착용)은 일반 패스를 받습니다.
- C라는 사람 (빨간 옷 착용)은 VIP 패스를 받습니다.
- 규칙: "빨간색은 VIP를 의미한다."
- 테스트: 만약 새로운 사람(D라는 사람)이 빨간 옷을 입고 나타났을 때, AI가 그에게 VIP 패스를 주어야 한다는 것을 알까요?
- 논문의 발견: AI는 이런 단순한 탐정 업무에는 능숙하지만, 규칙이 복잡해지면(예: "빨간색이 VIP이지만, 모자를 쓰고 있다면 제외"와 같은 경우) 종종 혼란을 겪습니다.
2. "집사" 문제 (절차적 실행, Procedural Execution)
규칙을 아는 것과 그 단계를 수행하여 승리하는 것은 별개의 문제입니다. AI는 단순히 "어떤 무기가 필요한가?"라는 질문을 받는 것이 아닙니다. AI는 실제로 게임을 플레이해야 합니다: "상점에 가서," "검을 사고," "성으로 걸어가서," "몬스터와 싸워라."
- 비유: 당신이 케이크 레시피(규칙)를 알고 있다고 상상해 보세요. 하지만 막상 만들려고 할 때, 오븐을 켜는 것을 잊어버리거나, 케이크를 오븐에 넣은 후에 밀가루를 섞는 실수를 합니다.
- 논문의 발견: 바로 이 지점에서 AI는 정말 큰 어려움을 겪습니다. AI는 올바른 무기가 무엇인지 알아내더라도, 행동의 순서를 틀리는 경우가 많습니다. 이는 마치 레시피는 잘 알지만 계속 달걀을 바닥에 떨어뜨리는 유능한 요리사와 같습니다.
8단계 난이도
연구진은 다양한 유형의 사고력을 테스트하기 위해 이 게임에 8가지 서로 다른 "레벨"을 구축했습니다.
- 단순 산수 (가산, Additive): "무기의 크기는 몬스터의 키 + 몸무게이다." (쉬운 덧셈).
- 믹스 앤 매치 (구성, Compositional): "무기의 크기는 몬스터의 키에서 오고, 색상은 몸무게에서 온다." (두 개의 별개 규칙이 동시에 작동).
- "If/Then" 스위치 (조건부, Conditional): "만약 몬스터가 드래곤이라면, 몸무게가 색상을 결정한다. 만약 고블린이라면, 몸무게가 크기를 결정한다." (상황에 따라 규칙이 변함).
- "특별 예외" (오버라이드, Override): "보통 몬스터의 키가 무기를 결정한다. 하지만, 만약 몬데가 '치러전(Chirurgeon, 특수 역할)'이라면, 키와 상관없이 항상 거대한 검이 필요하다." (하나의 규칙이 다른 모든 규칙을 깨뜨림).
그들은 속성(Attribute) 작업(어떤 아이템을 사용할지 결정)과 절차(Procedural) 작업(어떤 순서로 행동할지 결정)을 모두 테스트했습니다.
무엇을 발견했는가?
1. 인간은 승리하고, AI는 비틀거린다
인간이 이 게임을 플레이했을 때, 규칙을 파악하고 단계를 실행하는 데 있어 훨씬 더 뛰어난 모습을 보였습니다.
- 격차: 평균적으로 인간은 게임을 더 효율적으로 완수하는 데 13% 더 뛰어났고, 규칙을 말로 설명하는 데 30% 더 뛰어났습니다.
- "맹점": 일부 AI 모델은 게임을 성공적으로 마칠 수는 있었지만, 어떻게 했는지 설명하라고 하면 설명하지 못했습니다. 이는 AI가 진정한 논리를 이해하기보다는 예시의 패턴을 복사하거나 추측하며 "속임수"를 쓰고 있을 가능성을 시사합니다.
2. "실행 병목 현상" (Execution Bottleneck)
논문은 AI에게 가장 어려운 부분이 항상 '생각'하는 것이 아니라 '행동'하는 것이라는 점을 발견했습니다.
- 비유: 목적지까지 가는 완벽한 경로를 알고 있는 GPS가 있지만, 이미 주유소에 도착했는데도 왼쪽으로 가라고 계속 안내하는 상황과 같습니다.
- AI는 정답을 알고 있음에도 불구하고, 게임 환경 내에서 일련의 행동 순서를 올바르게 수행하는 데 실패하곤 합니다.
3. "마법의 단어"는 큰 도움이 되지 않는다
연구진은 실제 이름(예: "드래곤", "검")과 무의미한 단어(예: "크레브(Krev)", "조프(Zorp)")를 사용하여 AI를 시험해 보았습니다.
- 결과: 결과는 큰 차이가 없었습니다. AI는 "드래곤"이 보통 무엇을 필요로 하는지에 대한 기존 지식으로부터 도움을 받지 못했습니다. 이는 이 테스트가 단순히 AI의 기억력(영화나 책의 기억)을 측정하는 것이 아니라, 실제 논리를 측정하고 있음을 증명합니다.
4. 현재의 "해결책"은 미흡하다
연구진은 AI를 돕기 위해 특별한 "프롬프팅 기술"(예: "단계별로 생각하라" 또는 "네 작업을 검토하라"고 지시하는 것)을 사용해 보았습니다.
- 결과: 이러한 기술들은 단순한 "어떤 아이템을 살 것인가" 작업에는 약간 도움이 되었지만, 복잡한 "어떻게 단계를 수행할 것인가" 작업에는 도움이 되지 않았습니다. AI와 인간의 성능 격차는 여전히 큽니다.
결론
HERO'S JOURNEY는 AI가 단순히 답을 암기하는 것이 아니라, 경험으로부터 실제로 배울 수 있고 그 지식을 바탕으로 행동할 수 있는지 테스트하는 새로운 방법입니다.
이 논문은 AI가 패턴을 찾아내는 데는 점점 똑똑해지고 있지만, 복잡한 다단계 실제 시나리오에 그 패턴을 적용하는 데는 여전히 서투르다고 결론짓습니다. 이는 수학 문제를 풀 줄은 알지만, 그 수학을 이용해 다리를 건설하는 법은 모르는 학생과 같습니다. 연구진은 이 게임이 개발자들이 단순히 "말하는" AI가 아닌, 실제로 "행동할 수 있는" AI를 만드는 데 도움이 되기를 기대하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.