← 최신 논문
🤖 AI

Distilling Game Code World Model Generation into Lightweight Large Language Models

본 논문은 프런티어 모델로부터 게임 코드 월드 모델 생성 능력을 경량 3B 파라미터 LLM 으로 증류하기 위해 지도 미세조정과 검증 가능한 보상을 활용한 강화학습을 결합한 확장 가능한 사후 학습 파이프라인을 제안하며, 이를 통해 자연어 규칙으로부터 실행 가능한 게임 환경을 정확하게 생성할 수 있도록 합니다.

원저자: Tyrone Serapio, Arjun Prakash, Haoyang Xu, Kevin Wang, Amy Greenwald

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tyrone Serapio, Arjun Prakash, Haoyang Xu, Kevin Wang, Amy Greenwald

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 체스부터 포커까지 당신이 설명하는 어떤 보드 게임이라도 플레이할 수 있는 로봇을 만들고 싶다고 상상해 보세요. 이를 위해 로봇은 말 그대로 게임이 어떻게 작동하는지, 말뚝이 어떻게 움직이는지, 무엇이 승리로 간주되는지, 그리고 플레이어가 실수를 했을 때 어떤 일이 일어나는지를 정확히 알려주는 '규칙집'이 필요합니다.

과거에 새로운 게임에 대한 이러한 규칙집을 만드는 것은 매번 처음부터 코드를 작성하도록 전문가 엔지니어 팀을 고용하는 것과 같았습니다. 이는 느리고 비쌌으며, 세부 사항을 파악하기 위해 매우 똑똑하고(그리고 매우 비싼) 컴퓨터가 필요했습니다.

이 논문은 이를 수행하는 새로운 방식을 제안합니다: 작고 저렴한 컴퓨터에게 규칙집을 스스로 작성하도록 가르치는 것입니다.

간단한 비유를 사용하여 그들의 접근 방식을 다음과 같이 정리해 보겠습니다:

1. 문제: '천재 튜터' 대 '견습생'

현재 컴퓨터에게 게임 규칙집 (저자들이 게임 코드 월드 모델이라고 부르는 것) 을 생성하게 하려면, GPT-4 나 Gemini 와 같은 거대하고 비싼 AI 인 '천재 튜터'에게 요청해야 합니다.

  • 옛날 방식: 당신은 천재 튜터에게 "이 새로운 게임의 규칙을 작성해 주세요"라고 요청합니다. 만약 실수가 있다면, 코드를 확인하고 오류를 지적한 뒤 천재에게 다시 시도해 보라고 요청합니다. 당신은 이 루프를 수십 번 반복해야 할지도 모릅니다. 이는 세계적 셰프에게 간단한 샌드위치를 요리하게 하지만, 완벽해질 때까지 계속 맛을 보고 부엌으로 다시 보내야 하는 것과 같습니다. 작동은 하지만 느리고 천문학적인 비용이 듭니다.

2. 해결책: 지식의 증류

저자들은 매번 천재 튜터가 작업을 점검할 필요 없이 이 일을 수행할 수 있도록 작고 가벼운 AI( '견습생') 를 훈련시킬 수 있는지 확인하고자 했습니다. 그들은 이 과정을 **"증류 (Distilling)"**라고 부릅니다.

이는 거대 AI 인 '마스터 셰프'가 작은 AI 인 '주니어 셰프'에게 요리하는 법을 가르치는 것과 같습니다. 주니어 셰프가 양파를 썰 때마다 매번 마스터에게 도움을 요청하는 대신, 마스터는 주니어 셰프가 혼자서 완벽하게 요리를 할 수 있을 때까지 훈련하는 데 시간을 투자합니다.

3. 훈련 과정: 두 단계

저자들은 작은 AI(Qwen2.5-3B) 를 게임 규칙 전문가로 만들기 위해 두 단계의 훈련 파이프라인을 사용했습니다:

  • 1 단계: 지도 미세 조정 (SFT) - "요리책"
    그들은 작은 AI 에게 틱택토, 포커, 블랙잭 등 30 가지 다른 게임과 해당 게임이 작동하는 올바른 코드를 함께 보여주었습니다. 이는 견습생에게 완벽한 요리책 더미를 주고 "이 레시피들을 암기하라"고 말하는 것과 같습니다.

    • 결과: AI 는 오타나 구문 오류 (콤마나 대괄호를 잊는 것 등) 가 없는 코드를 작성하는 능력이 크게 향상되었습니다.
  • 2 단계: 검증 가능한 보상을 통한 강화 학습 (RLVR) - "맛보기 테스트"
    레시피를 암기하는 것만으로는 부족합니다. 음식이 제대로 맛나야 합니다. 저자들은 자동화된 '맛보기 테스터 (검증 프레임워크)'를 구축했습니다.

    • AI 는 게임 규칙집을 작성해 봅니다.
    • '맛보기 테스터'는 코드를 실행합니다. 게임이 충돌하나요? 규칙이 논리적인가요? 게임이 올바르게 종료되나요?
    • 코드가 테스트를 통과하면 AI 는 '보상'(점수) 을 받습니다. 실패하면 페널티를 받습니다.
    • AI 는 이 보상들을 통해 배우며 다시 시도하고 다시 시도하여, 단순히 잘 보이는 코드가 아니라 실제로 작동하는 코드를 작성하도록 학습합니다.

4. 결과: 무엇이 작동했고 무엇이 작동하지 않았는지

저자들은 훈련된 '견습생'을 이전에 본 적이 없는 게임 (분포 외 게임) 에 대해 테스트했습니다.

  • 좋은 소식: 작고 훈련된 AI 는 유효한 게임 코드를 작성하는 능력이 크게 향상되었습니다. 구문 오류를 피하고 훈련 전보다 게임 규칙의 기본 구조를 훨씬 잘 따르는 법을 배웠습니다. 이는 비싼 '천재 튜터'가 코드 한 줄 한 줄을 점검할 필요 없이 작은 모델에게 이 일을 가르칠 수 있음을 증명했습니다.
  • 나쁜 소식: AI 는 여전히 가장 복잡한 게임, 특히 숨겨진 정보(상대의 카드가 무엇인지 모르는 포커 등) 가 있는 게임에서 어려움을 겪었습니다.
    • 비유: 견습생은 완벽한 그릴드 치즈 샌드위치 (단순한 게임) 를 요리할 수 있고 심지어 복잡한 라자냐 (완전 정보 게임) 도 요리할 수 있습니다. 하지만 상대방이 무엇을 생각하는지 추측해야 하는 요리를 하라고 요청받으면 (불완전 정보 게임), 견습생은 혼란을 겪고 때로는 포기하거나 단순화되고 잘못된 버전을 작성합니다.
    • 흥미롭게도 '천재 튜터'(GPT-4) 조차도 이러한 복잡한 숨겨진 정보 게임을 처리하는 데 어려움을 겪었으며, 이는 모든 현재 AI 에게 매우 어려운 문제임을 시사합니다.

5. 결론

이 논문은 복잡하고 거대한 AI 모델로부터 복잡한 게임 규칙 생성 능력을 추출하여 훈련을 통해 더 작고 저렴한 모델로 '증류'할 수 있음을 보여줍니다.

  • 이전: 게임 엔진을 생성하려면 슈퍼컴퓨터와 많은 시간이 필요했습니다.
  • 이제: 게임이 너무 복잡하지 않다면 작고 효율적인 모델을 훈련시켜 이를 수행할 수 있습니다.

저자들은 이 작은 모델이 아직 완벽하지는 않지만 (특히 숨겨진 비밀이 있는 까다로운 게임의 경우), AI 에이전트가 플레이할 수 있는 디지털 세계를 자동화하여 쉽고 저렴하게 만드는 데 있어 중요한 단계라고 결론지었습니다. 그들은 이것이 의료 진단, 금융 거래 또는 기타 실제 응용 프로그램에 작동한다고 주장한 것이 아니라, 게임 환경을 시뮬레이션하는 코드를 생성하는 데에만 해당한다고 명시했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →