VideoGameBench: Can Vision-Language Models complete popular video games?
이 논문은 비전 - 언어 모델이 오직 원시 시각 입력과 고수준 지시만을 사용하여 1990 년대 비디오 게임을 플레이해야 하는 벤치마크인 VideoGameBench 를 소개하며, 지각, 공간 탐색, 추론 지연의 한계로 인해 최첨단 모델조차 실시간 게임 플레이에서 현저히 어려움을 겪는다는 점을 드러냅니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 도서관에 있는 모든 책을 읽었고 복잡한 수학 문제를 풀 수 있는 매우 똑똑한 로봇이 있다고 가정해 봅시다. 당신은 아마 "좋아! 이 로봇이 비디오 게임을 할 수 있는지 확인해 보자"라고 생각할 것입니다.
바로 프린스턴 대학교의 연구자들이 그렇게 했습니다. 그들은 이러한 첨단 AI 모델들 (비전 - 언어 모델이라고 불림) 이 실제로 인간처럼 1990 년대의 인기 있는 비디오 게임을 할 수 있는지 확인하기 위해 VideoGameBench라는 새로운 테스트를 만들었습니다.
다음은 그들의 실험 구성, 결과, 그리고 그 의미를 간단한 비유를 통해 설명한 것입니다.
설정: "눈가리개 한 게이머" 테스트
보통 과학자들이 AI 를 게임으로 테스트할 때는 AI 에게 치트 시트를 제공합니다. 그들은 AI 에게 "적의 좌표는 X, Y 입니다"라고 말하거나 레벨의 지도를 제공하기도 합니다. 이는 무릎 위에 가이드북을 펼쳐놓고 비디오 게임을 하는 것과 같습니다.
VideoGameBench는 규칙을 바꿨습니다.
- 규칙: AI 에게는 화면의 원본 이미지 (TV 를 보는 것과 같음) 와 버튼의 기능을 설명하는 간단한 텍스트 (예: "점프하려면 'A'를 누르세요") 만 제공됩니다.
- 도전 과제: AI 는 게임을 파악하고, 어디를 갔는지 기억하며, 인간 플레이어처럼 실시간으로 적에게 반응해야 합니다.
- 게임: 그들은 1990 년대의 고전 게임 10 개를 선정했는데, 빠른 슈팅 게임인 Doom II부터 느린 전략 게임인 Civilization, 그리고 롤플레잉 어드벤처인 Pokémon까지 다양했습니다.
심지어 그들은 AI 에게 세 개의 비밀 게임을 숨겨 두었습니다. 이는 AI 가 단순히 훈련 데이터에서 정답을 외운 것이 아니라, 실제로 새로운 것들을 즉석에서 배우고 플레이하는지 확인하기 위함이었습니다.
결과: "신생아" 문제
결과는 놀라웠습니다. 오늘날 이용 가능한 가장 똑똑하고 강력한 AI 모델들 (Gemini 2.5 Pro 와 Claude 3.7 등) 도 극심한 어려움을 겪었습니다.
- 점수: 가장 좋은 모델들도 게임의 약 0.48% 만 완수했습니다.
- 현실: 쉽게 말해, 이는 AI 가 게임 시작 부분에 막혀버렸다는 뜻입니다. 첫 번째 레벨조차 끝내지 못했습니다.
이렇게 생각해 보세요. 천재 수학자에게 새 비디오 게임 콘솔을 건네줍니다. 그들은 로켓의 궤적을 계산할 수는 있지만, Super Mario를 플레이하려 할 때는 화면 속의 "아래"가 "떨어지는 것"을 의미한다는 것을 이해하지 못해 절벽으로 계속 떨어지거나, 3 분 전에 이미 열쇠를 줍겼다는 사실을 잊어버립니다.
왜 실패했을까요?
논문은 AI 가 막힌 세 가지 주요 원인을 지적합니다.
- "알고 있음 - 행동함" 간극: AI 는 종종 무엇을 해야 하는지 "알고" 있었습니다 (예: "문으로 가야 해"). 하지만 잘못된 버튼을 계속 누르곤 했습니다. 이는 가게로 가려면 왼쪽으로 돌아야 한다는 것을 알고 있는 사람이지만, 발은 계속 오른쪽으로 내디디는 것과 같습니다.
- 시각적 혼란: AI 는 때때로 무엇을 보고 있는지 구분하지 못했습니다. Doom II에서 AI 는 돌무더기로 보이는 죽은 적에게 총을 쏘아 모든 탄약을 낭비할 수 있습니다. Zelda에서는 대화조차 없었는데 옆에 서 있기만 했을 뿐인데 캐릭터와 대화했다고 생각할 수도 있습니다.
- 짧은 기억력: 비디오 게임은 오랫동안 무언가를 기억해야 합니다 (예: "빨간 문을 열려면 파란 열쇠를 찾아야 해"). AI 는 몇 단계만 지나도 주요 목표를 잊어버리고, 덜 중요한 새로운 생각으로 기억을 덮어씌웁니다.
"일시정지 버튼" 실험
연구자들은 일부 게임이 매우 빠르다는 점 (실시간) 과 AI 의 사고 속도가 느리다는 점을 깨달았습니다. AI 가 버튼을 누르기로 결정할 때까지는 이미 게임이 변해버려서 그 행동이 무용지물이 되어버렸습니다.
이를 해결하기 위해 그들은 VideoGameBench Lite를 만들었습니다.
- 변경 사항: AI 가 생각하는 동안 게임의 "일시정지" 버튼을 눌렀습니다. 게임은 AI 가 명령을 내릴 때만 움직였습니다.
- 결과: 점수는 약간 상승했습니다 (약 1.6% 까지). 하지만 AI 는 여전히 게임을 완수하지 못했습니다. 이는 문제가 단순히 AI 가 느리다는 점에 있는 것이 아니라, AI 가 게임 논리를 효과적으로 추론하지 못한다는 점에 있음을 증명했습니다.
"실기 시험"
AI 가 기본 작업을 처리할 수 있는지 확인하기 위해 그들은 세 가지 아주 작고 간단한 실기 게임을 만들었습니다.
- 클릭: 움직이는 점을 클릭합니다.
- 드래그: 점을 선을 따라 드래그합니다.
- 미로: 정사각형을 간단한 미로로 이동시킵니다.
여기서도 AI 는 어려움을 겪었습니다. 일부 모델은 점을 클릭할 수는 있었지만, 거의 모든 모델이 드래그하거나 미로를 탐색하는 데 실패했습니다. 이는 AI 가 복잡한 게임 논리뿐만 아니라 기본적인 물리적 상호작용과 공간적 추론에도 어려움을 겪고 있음을 시사합니다.
결론
이 논문은 AI 가 수학이나 코딩에는 놀라울 정도로 뛰어나지만, 오직 자신이 보는 것과 자신의 기억에만 의존해야 할 때 비디오 게임을 플레이하는 데는 끔찍하게 못한다고 결론 내립니다.
연구자들은 이러한 어려운 테스트를 만들어 AI 개발자들이 다음 분야에서 더 나은 시스템을 구축하도록 독려하기를 바랍니다.
- 자신이 보는 것을 이해하는 것 (지각).
- 이전에 일어난 일을 기억하는 것 (기억).
- 앞으로의 단계를 계획하는 것 (전략).
AI 가 치트 시트 없이 Doom이나 Pokémon을 이길 수 있을 때까지, 그것은 새로운 복잡한 환경에 적응하고 학습하는 인간의 능력을 완전히 습득했다고 볼 수 없습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.