DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat
이 논문은 최첨단 언어 모델들이 단일 조우와 다중 조우가 있는 날 모두에서 복잡한 규칙, 기하학, 자원 관리를 탐색하도록 도전함으로써 던전앤드래곤 전투에서의 전술적 추론을 평가하기 위한 포괄적인 벤치마크인 DungeonBench를 소개하며, 즉각적인 전술적 이점과 장기적인 전략적 지속 가능성 사이의 균형을 맞추는 데 있어 모델들의 상당한 격차를 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 게임을 하는 법을 가르치려 한다고 상상해 보십시오. 오랫동안 과학자들은 격자 위에서 말을 움직이거나 목표물을 맞히는 것처럼 규칙이 단순하고 목표가 명확한 게임을 로봇에게 가르치는 데 매우 능숙했습니다. 하지만 가르치기 훨씬 더 어려운 특별한 종류의 사고방식이 있습니다. 바로 **전술적 추론(tactical reasoning)**입니다. 이것은 단순히 규칙을 아는 것이 아니라, 규칙들이 서로 어떻게 '충돌'하는지를 이해하는 것입니다. 이는 당신이 점프할 수 있다는 것을 아는 것과, 지금 점프하면 물웅덩이에 빠져 미끄러질 수 있다는 것, 혹은 나중에 점프해야 타이머가 끝나기 전에 파워업 아이템을 잡을 수 있다는 것을 아는 것 사이의 차이와 같습니다. 이런 종류의 사고는 기하학(사물이 어디에 있는지), 타이론(언제 일이 일어나는지), 그리고 희소한 자원(제한된 에너지나 탄약 같은 것)을 동시에 다루는 능력을 요구합니다. 과학자들이 이 분야에 관심을 갖는 이유는, 만약 우리가 컴퓨터에게 이런 복잡하고 "만약에"라는 가정을 고려해야 하는 선택을 내리는 법을 가르칠 수 있다면, 모든 것이 연결되어 있고 결코 단순하지 않은 현실 세계의 문제들을 해결할 수 있는 AI를 구축하는 데 더 가까워질 수 있기 때문입니다.
여기에 인공지능이 정말로 이런 복잡하고 규칙이 많은 사고를 마스터할 수 있는지 확인하기 위해 설계된 새로운 "테스트 트랙"인 **던전벤치(DungeonBench)**가 등장했습니다. 연구진은 유명한 테이블탑 게임인 *던전앤드래곤(Dungeons & Dragons)*을 기반으로 한 디지털 시뮬레이터를 만들었지만, 스토리텔링과 인간 던전 마스터(사회자)는 제거했습니다. 대신 그들은 모든 움직임, 주문, 몬스터의 능력이 하드코딩된 규칙인 엄격하고 수학적인 버전의 전투를 만들었습니다. 그들은 AI에게 단 한 번의 전투에서 이기는 것을 요구한 것이 아닙니다. 대신, 첫 번째 전투에서 마법을 너무 많이 사용하면 마지막 전투에서 팀이 무력해질 수 있다는 점을 고려하며, 여러 번의 전투로 이루어진 전체 "모험의 하루" 동안 살아남으라고 요구했습니다.
이 논문은 현재 사용 가능한 가장 똑똑한 AI 모델들(예: GPT-5.5 및 Gemini 3.1 Pro)을 테스트하여, 이들이 숙련된 던전 마스터처럼 행동할 수 있는지 시험합니다. 설정은 공정합니다. AI는 전체 전장을 보고, 모든 규칙을 알며, 선택할 수 있는 합법적인 이동 목록을 가지고 있습니다. 과제는 "내가 여기에 화염구를 던지면 보스에게 적중하겠지만 내 동료도 태워버리게 될까?" 또는 "지금 치유 물약을 써야 할까, 아니면 이 전투를 빨리 끝내기 위해 아껴두어야 할까?"와 같은 요소들을 고려하여 수백 개의 옵션 중 최선의 수를 고르는 것입니다.
결과는 인상적인 기술과 우스꽝스러운 실패가 뒤섞여 나타났습니다. AI가 단 한 번의 전투( "엔카운터" 트랙)에 직면했을 때, 상위 모델들은 약 **82%에서 83%**의 승률을 기록하며 꽤 잘 해냈습니다. 그들은 위치를 잘 잡고 주문을 효과적으로 사용하는 등 영리하게 행동했습니다. 하지만 연구진이 이 전투들을 연결하여 전체적인 하루( "데이" 트랙)로 만들었을 때, AI의 성능은 폭락했습니다. 이 더 어려운 모드에서 최고의 모델들은 단 **40%**의 날들만을 통과했으며, 한 모델은 단 하나의 날도 통과하지 못했습니다.
왜 실패했을까요? 논문은 이 AI들이 "현재 이 순간"에는 뛰어나지만, **자원 배분(resource budgeting)**에는 어려움을 겪고 있다고 제안합니다. 그들은 첫 번째 쉬운 전투에서 이기기 위해 최고의 주문과 치유 물약을 사용해 버리는 경향이 있으며, 이로 인해 정작 마지막 보스를 상대할 때는 빈손과 낮은 체력 상태가 됩니다. 전투에서는 이기지만 전쟁에서는 지는 것입니다. 연구진은 AI가 앞선 일정의 모든 전투를 미리 볼 수 있음에도 불구하고, 나중을 위해 힘을 아끼는 법은 알아내지 못했다는 것을 발견했습니다.
요약하자면, 던전벤치는 현재의 AI가 규칙을 따르고 국지적인 결정을 내리는 데는 매우 능숙해지고 있지만, 장기적인 전략을 구사하는 기술은 아직 완전히 익히지 못했음을 보여줍니다. 이는 마치 상대방을 속여서 단 한 판의 게임은 이길 수 있지만, 토너먼트가 끝나기도 전에 계속해서 자신의 기물을 다 써버리는 체스 선수와 같습니다. 이 논문은 우리가 진전을 이루고 있기는 하지만, 언제 물러나고 언제 공격해야 하는지를 아는 전술적 천재처럼 생각하는 AI에 도달하기까지는 아직 갈 길이 멀다고 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.