← 최신 논문
💬 NLP

GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

이 논문은 코딩 에이전트가 완전하고 실행 가능한 게임을 엔드 투 엔드로 생성하는 능력을 평가하기 위해 설계된 140개의 Godot 기반 태스크로 구성된 벤치마크인 GameCraft-Bench를 소개하며, 현재의 프런티어 모델들이 인지 가능한 메카닉을 구현함에도 불구하고 결과물의 완성도와 상호작용적 일관성을 달성하는 데 있어 상당한 어려움을 겪고 있음을 밝히고 있습니다.

원저자: Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao Du, Fan Bu, Wenyu Du, Xiaotong Zhang, Kyle Li, Shaobo Wang, Linfeng Zhang, Yuxuan
게시일 2026-06-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao Du, Fan Bu, Wenyu Du, Xiaotong Zhang, Kyle Li, Shaobo Wang, Linfeng Zhang, Yuxuan Liu, Xin Lai, Chenxin Li, Yiduo Guo, Zhexin Zhang, Xinyuan Wang, Tianyi Bai, Ziniu Li, Benyou Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇 셰프를 고용하여 복잡하고 다채로운 코스 요리 레시피를 주었다고 상상해 보십시오. 당신은 단순히 로봇이 종이 위에 레시피를 적는 것을 원하는 것이 아니라, 실제로 요리를 하고, 플레이팅을 하고, 서빙까지 해서 당신이 한 입 먹고 맛을 볼 수 있기를 원합니다.

이것이 본질적으로 이 논문, GameCraft-Bench가 다루고 있는 내용입니다. 이것은 AI 코딩 에이전트가 단순히 게임을 위한 코드를 작성하는 것을 넘어, 실제로 처음부터 플레이 가능한 비디오 게임을 "요리"할 수 있는지 확인하기 위한 테스트입니다.

다음은 이 논문의 주요 아이디어를 쉬운 비유를 사용하여 정리한 것입니다.

1. 문제점: "레시피 vs 실제 요리"

과거에 우리가 AI의 코딩 능력을 테스트할 때는 주로 코드가 서류상으로 올바르게 보이는지(마치 레시피의 재료 목록이 제대로 적혀 있는지 확인하는 것처럼)를 체크했습니다. 하지만 비디오 게임의 경우, 코드만 보는 것으로는 충분하지 않습니다. 게임은 실제로 실행되어야 하고, 그래픽이 나타나야 하며, 플레이어가 캐릭터를 움직여 어떤 일이 일어나는지 볼 수 있어야 합니다.

저자들은 AI가 게임을 만드는 능력을 진정으로 테스트하려면 세 가지가 필요하다고 주장합니다.

  • 실제 주방 (엔진 그라운딩/Engine Grounding): AI는 가짜나 단순화된 버전이 아닌, 실제 게임 엔진(그들은 인기 있는 무료 도구인 Godot를 사용했습니다)에서 작업해야 합니다. 이는 셰프에게 장난감 가스레인지가 아닌 진짜 가스레인지를 사용하라고 요구하는 것과 같습니다.
  • 완성된 요리 (아티팩트 완결성/Artifact Completeness): AI는 단 하나의 재료(예: 점프하는 캐릭터를 위한 스크립트 하나)만 던져주어서는 안 됩니다. AI는 실행 준비가 된 전체 패키지 형태의 완성된 게임을 전달해야 합니다. 누락된 부분이 없어야 합니다.
  • 맛 테스트 (상호작용 검증/Interactive Verification): 완성된 음식을 그냥 바라보기만 하는 것이 아니라, 직접 먹어봐야 합니다. 게임은 반드시 실행되어야 합니다. AI의 성공 여부는 실제로 게임을 실행하고, 버튼을 누르고, 세상이 올바르게 반응하는지 확인하는 것에 의해 판단됩니다.

2. 테스트: GameCraft-Bench

연구진은 GameCraft-Bench라는 거대한 테스트 주방을 구축했습니다.

  • 메뉴: 그들은 15가지 유형의 게임(플랫폼 게임, 레이싱 게임, 전략 게임, 공포 게임 등)에 걸쳐 140개의 서로 다른 챌린지를 만들었습니다.
  • 과정:
    1. AI에게 자연어 설명(예: "코인을 모으고 적을 피하는 2D 플랫폼 게임을 만들어줘")을 제공합니다.
    2. AI는 Godot 엔진에서 게임을 구축합니다.
    3. AI는 또한 게임을 플레이하는 방법을 정확히 보여주는 "데모 트레이스(demo trace)"—즉, 영상 스크립트—를 기록해야 합니다.
    4. 컴퓨터 시스템이 그 스크립트를 사용하여 게임을 "플레이"하고, 영상을 녹화한 뒤, 스마트한 AI 심판이 영상을 보고 점수를 매깁니다.

3. 결과: "글쓰기는 잘하지만, 요리는 못한다"

결과는 놀라웠고 AI 커뮤니티에 다소 겸허함을 안겨주었습니다. 가장 똑똑하고 발전된 AI 모델들(Opus-4.7 및 GPT-5.5 등)조차 고전했습니다.

  • 점수: 가장 뛰어난 AI도 이 테스트에서 약 **41%**를 득점했습니다. 대부분은 40% 미만의 점수를 받았습니다.
  • 잘한 점: AI들은 "핵적인 루프(core loop)"를 구축하는 데는 준수한 모습을 보였습니다. 만약 캐릭터가 점프하는 게임을 요청했다면, 캐릭터는 보통 점프할 수 있었습니다. 그들은 엔진의 부품들을 만들 수 있었습니다.
  • 실패한 점: 그들은 이 모든 것을 하나의 완전한 경험으로 결합하는 데 어려움을 겪었습니다.
    • 콘텐츠 누락: 그들은 종종 너무 짧거나 진행을 위한 레벨이 없는 게임을 만들었습니다.
    • 깨진 비주얼: 그래픽은 존재할 수 있지만, 그것이 논리적으로 맞지 않았습니다(예: 플레이어가 적을 볼 수 없거나, UI가 깨져 있는 경우).
    • "데모"의 간극: 많은 AI가 게임을 구축했지만, 작동함을 증명하기 위해 필요한 "데모 트레이스"를 기록하는 것을 잊었습니다. 이는 마치 셰프가 요리는 다 해놓고 정작 심판에게 내놓을 플레이팅을 잊어버린 것과 같습니다.

4. 핵심 발견 (이유)

논문은 AI가 왜 실패했는지 그 이유를 파헤쳤습니다.

  • 보는 것이 믿는 것이다: 가장 성적이 좋았던 AI는 게임을 구축하는 동안 게임 화면을 직접 관찰한 모델들이었습니다. 그들은 시각적 출력을 디버깅 도구로 활용했습니다. 캐릭터가 이상해 보이면 코드를 수정했습니다. 화면을 보지 않고 코드만 작성한 AI들은 더 많은 실수를 저질렀습니다.
  • 바쁜 것이 더 나은 것은 아니다: 한 AI 모델(MiMo)은 엄청나게 많은 코드를 작성하고 많은 명령을 실행했지만, 더 높은 점수를 받지는 못했습니다. 이는 마치 셰프가 채소를 미친 듯이 다지기만 할 뿐, 정작 요리는 완성하지 못하는 것과 같았습니다. 최종 단계가 빠진다면 더 많은 일을 하는 것이 반드시 더 나은 결과를 보장하지는 않습니다.
  • 서로 다른 기술: "점프" 메커니즘을 작동시키는 것(메카닉스)은 게임을 예쁘게 만드는 것(아트)이나 충분한 레벨을 만드는 것(콘텐츠)과는 다릅니다. AI는 하나는 잘할 수 있지만 다른 것에는 서툴 수 있습니다. 이 기능들은 모두 연결되어 있지 않습니다.

5. 결론

이 논문은 AI가 코드를 작성하는 데는 매우 능숙해지고 있지만, 엔드 투 엔드(end-to-end) 게임 제작은 여전히 거대한 도전 과제라고 결론짓습니다.

현재의 AI는 게임의 "파편"이나 간단한 프로토타입은 만들 수 있지만, 인간의 창의적인 아이디어를 받아들여 스스로 세련되고 플레이 가능하며 완전한 게임 패키지로 변환하는 일은 아직 신뢰할 만한 수준에 도달하지 못했습니다. "올바르게 보이는 코드를 쓰는 것"과 "작동하는 시스템을 전달하는 것" 사이의 간극은 여전히 매우 넓습니다.

요약하자면: AI는 레시피를 쓸 수는 있지만, 아직 온전한 식사를 요리하고 고객에게 서빙하는 법을 배우는 중입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →