← 최신 논문
🤖 AI

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

이 논문은 게임 개발의 전체 생애주기에 걸쳐 코딩 에이전트를 평가하는 세 가지 트랙(GameGen, GameFix, GameOpt)으로 구성된 종합 벤치마크 스위트인 GameXpert-Bench를 소개하며, 현재의 에이전트들이 플레이 가능한 기초를 생성하고 명시적인 요구사항을 구현하는 데는 뛰어나지만 결함 발견, 런타임 동작 검증, 그리고 반복적인 최적화 과정 중 기능을 보존하는 데는 어려움을 겪고 있음을 밝힌다.

원저자: Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno Zeng

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno Zeng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터에게 게임을 설명하기만 하면, 컴퓨터가 단순히 코드를 작성하는 것을 넘어 당신을 위해 탐험 가능한 완전한 플레이 가능한 세계를 구축해 주는 세상을 상상해 보십시오. 이것이 바로 코딩 에이전트로서의 현대 인공지능이 약속하는 바입니다. 수년 동안 이러한 시스템들은 지시사항을 따르는 방식으로 소프트웨어를 작성하는 법을 학습해 왔지만, 게임 개발은 완전히 다른 차원의 문제입니다. 단순한 계산기나 텍스트 편집기와 달리, 비디오 게임은 논리, 사운드, 비주얼, 그리고 플레이어의 움직임이 모두 완벽하게 조화를 이루어야 하는 살아 숨 쉬는 기계입니다. 캐릭터의 점프 코드가 아주 조금만 어긋나도 게임은 충돌(crash)할 수 있습니다. 음악이 액션과 동기화되지 않으면 경험은 망가진 것처럼 느껴집니다. 지능형 기계의 진정한 시험대는 단순히 한 줄의 코드를 쓸 수 있느냐가 아니라, 실제 플레이의 혼돈 속에서도 살아남을 수 있는 완전하고 안정적이며 재미있는 경험을 구축할 수 있느냐에 달려 있습니다.

텐센트(Tencent)의 훈위안(Hunyuan) AI 부서와 라이트스피드 스튜디오(Lightspeed Studios)에서 협력하는 연구진은 이 코딩 에이전트들을 궁극의 시험대에 올리기로 했습니다. 그들은 이 인공지능의 정신들이 진정한 게임 개발자에 얼마나 가까워졌는지 확인하기 위해 'GameXpert-Bench'라는 엄격한 평가 시스템을 구축했습니다. 연구진은 단순히 AI에게 게임을 한 번 써보라고 하고 실행 여부를 확인하는 대신, AI가 게임 제작의 복잡하고 무질서한 전체 생애 주기를 어떻게 다루는지 관찰했습니다. 그들은 세 가지 뚜렷한 단계를 살펴보았습니다: 처음부터 게임을 만드는 것, 숨겨진 버그를 찾아 수정하는 것, 그리고 인간의 피드백을 바탕으로 작동 중인 게임을 개선하는 것입니다. 그들의 연구 결과는 냉혹한 현실을 보여주었습니다. 이 에이전트들이 게임의 뼈대를 구축하는 데는 놀라울 정도로 뛰어나지만, 자신의 실수를 스스로 찾아내거나 변화 속에서도 게임이 원활하게 작동하도록 유지하는 데는 상당한 어려움을 겪는다는 사실입니다.

첫 번째 단계인 'GameGen'은 AI에게 단 한 문장의 지시사항만으로, 빈 컴퓨터 화면과 사전 제작된 도구가 없는 상태에서 완전한 게임을 구축하도록 요구했습니다. 연구진은 단순한 2차원 퍼즐부터 복잡한 3차원 모험에 이르기까지 97가지의 서로 다른 과제를 제시했습니다. 결과는 최고의 AI 모델들이 실제로 플레이 가능한 게임을 생성할 수 있음을 보여주었습니다. 그들은 캐릭터를 움직이거나 아이템을 수집하는 것과 같은 핵심 메커니즘을 높은 신뢰도로 구축해 냈습니다. 그러나 과제가 기초적인 수준 이상의 것을 요구할 때 품질은 급격히 떨어졌습니다. 에이전트들은 풍부하고 상세한 세계를 만들거나, 사용자 인터페이스와 같은 시각적 요소들이 완벽하게 정렬되도록 보장하는 데 자주 실패했습니다. 흔한 실패 사례는 버튼이 다른 그래픽과 겹치거나, 비주얼을 위한 코드와 움직임을 위한 코드가 일치하지 않아 게임이 충돌하는 경우였습니다. 이 연구는 AI가 집을 지을 수는 있지만, 문을 올바른 위치에 놓는 것을 잊거나 지붕이 새지 않도록 보장하는 것을 자주 잊어버린다는 점을 발견했습니다.

두 두 번째 단계인 'GameFix'는 탐정으로서의 AI 능력을 테스트했습니다. 연구진은 인간이 검증한 50개의 고품질 게임을 가져와 각 게임에 19개에서 27개 사이의 특정 버그를 몰래 주입했습니다. 이 버그들은 조작 불량부터 불균형한 난이도까지 다양했습니다. 그 후 AI에게 이 오류들을 찾아 수정하도록 요청했습니다. 한 버전의 테스트에서는 연구진이 AI에게 문제의 위치를 정확히 알려주었습니다. 이 시나리오에서 에이전트들은 알려진 문제들을 해결하며 상당히 양호한 성과를 보였습니다. 하지만 더 어려운 버전에서는 AI에게 "게임이 이상하다"와 같은 모호한 불평만을 제공하고 스스로 버그를 발견하게 했습니다. 여기서 성능은 무너졌습니다. 최고의 모델들조차 숨겨진 문제의 극히 일부만을 해결할 수 있었습니다. 이는 결정적인 격차를 드러냈습니다. AI는 지시 목록을 따르는 데는 탁월하지만, 망가진 시스템을 보고 무엇이 잘못되었는지 파악하여 정확히 무엇을 해야 할지 듣지 않고도 수정하는 데는 매우 취약합니다.

마지막 단계인 'GameOpt'는 인간과 AI가 여러 라운드에 걸쳐 협력하여 게임을 개선하는 실제 환경을 시뮬레이션했습니다. 연구진은 작동 중인 게임에서 시작하여 난이도 조절, 아트 스타일 변경, 또는 사운드 미세 조정과 같은 구체적인 개선 사항을 AI에게 요청했습니다. 이 과정은 이전의 변경 사항 위에 새로운 요청이 쌓이는 방식으로 6라운드 연속 진행되었습니다. 목표는 AI가 이미 작동하고 있는 부분들을 망가뜨리지 않으면서 게임을 더 좋게 만들 수 있는지 확인하는 것이었습니다. 결과는 엇갈렸습니다. AI는 종종 새로운 지시를 따를 수 있었지만, 새로운 기능을 구현하려다 기존의 기능을 망가뜨리거나 새로운 문제를 도입하는 경우가 빈번했습니다. 연구는 현재의 기술로 끊임없이 변하는 부품들을 유지하면서 안정적이고 플레이 가능한 게임을 유지하는 것이 거대한 도전임을 보여주었습니다. 에이전트들은 종-종 게임의 핵심 로직을 놓쳤고, 이로 인해 플레이가 불가능하거나 조화롭지 못한 버전을 만들어냈습니다.

이 광범한 테스트의 전반적인 결론은 단 하나의 프롬프트로 게임을 생성할 수 있는 능력이 AI를 진정한 게임 개발자라고 부르기에 충분하지 않다는 것입니다. 현재 세대의 코딩 에이전트들은 플레이 가능한 토대를 생성하고 명시적인 지시를 따르는 데는 신뢰할 만하지만, 전문적인 개발에 필요한 자기 수정 및 장기적 계획 능력은 아직 갖추지 못했습니다. 그들은 자신의 오류를 찾고, 자신의 변경 사항이 실제 세계에서 제대로 작동하는지 검증하며, 개발이 진행됨에 따라 게임의 무결성을 보존하는 데 어려움을 겪습니다. 연구진은 코드를 쓸 수 있는 모델과 게임을 구축할 수 있는 모델의 차이가 예상치 못한 상황을 처리하는 능력에 있다는 것을 발견했습니다. 이러한 시스템이 지속적인 인간의 가이드 없이 스스로의 실수를 발견하고 수정할 수 있을 때까지, 그들은 독립적인 창작자가 아닌 강력한 조력자로 남을 것입니다. 앞으로 나아갈 길은 단순히 더 똑똑한 코드 생성이 아니라, 복잡하고 상호작 작용하는 시스템을 개발 과정의 필연적인 변화 속에서도 원활하게 작동하도록 유지하는 데 대한 더 깊은 이해를 필요로 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →