← 최신 논문
🤖 machine learning

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

이 논문은 거대 언어 모델이 합성한 코드 기반 세계 모델(Code World Models)이 샘플링된 데이터에 대해 완벽에 가까운 전이 정확도를 달 달성할 수 있음에도 불구하고, 희귀하지만 결정적인 규칙들을 놓침으로써 계획 수립 단계에서 체계적으로 실패한다는 점을 입증하며, 이는 예측 정확도가 플레이 성능이나 탐색 분포 커버리지와 비교했을 때 계획 지향적 세계 모델을 평가하기에 부적절한 지표임을 드러낸다.

원저자: Javier Aguilar Martín

게시일 2026-07-17
📖 5 분 읽기🧠 심층 분석

원저자: Javier Aguilar Martín

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마법의 상자와 사각지대

당신이 아주 똑똑한 로봇에게 새로운 보드게임을 가르치고 있다고 상상해 보세요. 당신은 로봇이 지금까지 본 모든 움직임을 단순히 암기하기를 원치 않습니다. 대신 로봇이 앞을 내다보고 승리할 수 있도록 '규칙'을 이해하기를 원합니다. 인공지능의 세계에는 "코드 월드 모델(Code World Model)"이라는 영리한 기술이 있습니다. 로봇이 단순히 추측하게 하는 대신, 우리는 거대 언어 모델(이야기를 쓰거나 코드를 작성하는 모델들 같은 것)에게 규칙서를 읽게 하고, 게임을 완벽하게 시뮬레이션하는 컴퓨터 프로그램을 작성하도록 요청합니다. 일단 로봇이 이 프로그램을 갖게 되면, 로봇은 머릿속에서 수백만 번의 가상 게임을 실행하여 최선의 수를 찾아낼 수 있습니다.

하지만 여기에 까다로운 문제가 있습니다. 로봇이 프로그램을 올바르게 작성했는지 어떻게 알 수 있을까요? 보통 우리는 로봇을 상대로 몇 판의 무작위 게임을 플레이하며 테스트합니다. 만약 로봇의 프로그램이 그 무작위 게임들의 결과를 정확하게 예측한다면, 우리는 "좋아! 모델이 검증되었다!"라고 말하며 실제로 경기를 치르게 합니다. 이 논문은 무서운 질문을 던집니다. 만약 로봇의 프로그램이 무작위 게임을 예측하는 데는 완벽하지만, 실제로 승리하는 데 결정적인 특정 순간에는 완전히 틀린다면 어떻게 될까요? 결과적으로, 모델이 무작위 테스트를 통과했다고 해서 반드시 실전 투입 준비가 되었다는 뜻은 아닙니다.

사라진 규칙의 이야기

이 논문의 연구자들은 AI 게임 플레이어를 테스트하는 방식에 숨겨진 함정을 발견했습니다. 그들은 AI가 "검증 관문(verification gate)"을 아주 훌륭하게 통과하여 무작위 테스트 게임의 100%를 맞히더라도, 숙련된 상대와 벌이는 실제 게임에서는 매번 패배할 수 있다는 사실을 발견했습니다.

이를 이해하기 위해, 당신이 새로운 비디오 게임 엔진을 테스트하고 있다고 상상해 보세요. 당신은 버튼을 마구 누르고 캐릭터를 원형으로 돌리며 40번의 무작위 매치를 진행합니다. 엔진은 그 40번의 매치에서 일어나는 일을 정확히 예측합니다. 당신은 그 엔진에 금메달을 주며 "완벽해!"라고 말합니다. 하지만 만약 게임에 비밀 규칙이 있다면 어떨까요? 예를 들어 "게임이 100턴 이상 지속되면, 골드가 가장 많은 플레이어가 승리한다"라는 규칙 말입니다. 그 40번의 무작위 버튼 누르기 게임에서는 게임이 그렇게 오래 지속되지 않았기 때문에, 엔진은 이 규칙을 테스트받을 기회가 없었습니다. 그래서 엔진은 테스트를 통과했습니다.

하지만 '똑똑한' 플레이어(AI의 상대방)가 플레이할 때는 다릅니다. 그들은 승리하기 위해 게임을 100턴까지 끌고 가는 방법을 알고 있습니다. 하지만 "검증된" 엔진을 사용하는 AI는 이 비밀 규칙이 존재한다는 사실조차 모릅니다. AI는 게임이 무승부로 끝날 것이라고 생각합니다. 이 하나의 작은, 희귀한 규칙을 놓쳤기 때문에 AI는 치명적인 실수를 저지르고 패배하게 됩니다. 연구자들은 이를 **"검증된 모델과 올바른 모델 사이의 간극(verified-vs-correct gap)"**이라고 부릅니다. 모델은 검증되었지만(verified), 실제 세상에서는 틀린(not correct) 것입니다.

희귀한 실수의 법칙

이 논문은 단순히 이런 일이 일어난다고 말하는 데 그치지 않고, 언제 이런 일이 발생하는지 정확히 예측할 수 있는 수학적 공식을 제시합니다. 그들은 이를 **"위험 법칙(Danger Law)"**이라고 부릅니다.

검증 테스트를 낚시 그물이라고 생각해 보세요. 비밀 규칙의 "희귀성"은 그 규칙을 촉발하는 물고기를 잡기가 얼마나 어려운가와 같습니다. 만약 규칙이 게임의 50%에서 발생한다면, 작은 그물이라도 쉽게 물고기를 잡을 것입니다. 하지만 만약 규칙이 2.5%의 게임에서만 발생한다면(실험에서의 '100턴' 규칙처럼), 그리고 당신이 그물을 단 40번만 던진다면, 그 규칙을 완전히 놓칠 가능성이 매우 높습니다.

공식은 다음과 같습니다: 위험(Danger) = (실수가 얼마나 나쁜가) × (테스트가 규칙을 놓칠 확률).

실험에서 연구자들은 게임이 시간 제한에 도달했을 때 발생하는 비밀 규칙이 포함된 army5x5a라는 게임을 만들었습니다. 그들은 규칙이 희귀할 때(무작위 게임의 약 2.5%에서 발생할 때), AI가 테스트는 통과했지만 실제 게임에서는 승률이 0.404(약 40%)에 불과했다는 것을 발견했습니다. 이는 공정한 기준선인 0.495(약 50%)와 비교됩니다. 이것이 엄청난 차이처럼 들리지 않을 수도 있지만, 경쟁적인 게임의 세계에서 1번 이길 때마다 1.6번을 진다는 것은 재앙입니다. "검증된" 모델은 가장 중요한 한 가지 요소에 눈이 멀어 체계적으로 전략에 밀린 것입니다.

왜 더 많은 예시가 도움이 되지 않는가

당신은 이렇게 생각할지도 모릅니다. "알겠어요, 테스트가 너무 작았군요. 그럼 그 희귀한 규칙에 대한 예시를 AI에게 더 많이 주면 되잖아요!" 연구자들도 이 방법을 시도했습니다. 그들은 AI에게 게임이 타이브레이커(결정적 승부)로 끝나는 수천 개의 예시를 입력하여, AI가 그 규칙을 "학습"하기를 바랐습니다.

하지만 놀라운 반전이 있었습니다. 효과가 없었습니다. AI는 탐정이 아니라 번역가처럼 행동했습니다. 만약 당신이 "이것이 규칙이다"라고 말해주면, AI는 코드를 완벽하게 작성했습니다. 하지만 단순히 예시를 보여주며 "규칙을 알아내 봐"라고 한다면, AI는 실패했습니다. 수백 개의 예시가 있어도 AI는 데이터만으로는 누락된 규칙을 추론해낼 수 없었습니다. AI는 명시적으로 적혀 있지 않은 것을 스스로 추측해낼 수 없었던 것입니다. 이는 이러한 AI 시스템에게는 "예시로부터 배우는 것"보다 "명세의 완전성(specification completeness, 전체 규칙을 주는 것)"이 훨씬 더 중요하다는 것을 시사합니다.

포커 문제: 카드가 보이지 않을 때

논문은 또한 포커처럼 모든 것을 볼 수 없는 게임에 대해서도 살펴보았습니다. 이런 게임에서 AI는 상대방이 어떤 카드를 들고 있는지 추측해야 합니다. 이것이 모델의 "추론(inference)" 부분입니다.

연구자들은 단순한 포커 게임의 경우, 무작위 테스트가 실제로 안전하다는 것을 증축했습니다. 게임이 너무 얕아서(shallow), 짧은 게임 안에 비밀 규칙을 숨길 수 없기 때문입니다. 하지만 그들은 더 깊고 복잡한 게임에서도 동일한 함정이 존재함을 증명하기 위해 Beacon이라는 작은 커스텀 게임을 만들었습니다. Beacon에서 AI는 상대방의 움직임을 바탕으로 숨겨진 유형을 추측해야 했습니다. AI는 테스트를 완벽하게 통과했습니다(8,156개의 테스트 케이스에서 오류 0건). 하지만 실제 게임에서는 모든 게임에서 패배했습니다(승률 0%).

왜 그랬을까요? 테스트에 사용된 무작위 움직임들은 비밀이 숨겨져 있는 게임의 깊은 부분에 거의 도달하지 못했기 때문입니다. AI의 "추측하는 뇌"는 틀렸지만, 테스트는 너무 얕아서 그 오류를 발견하지 못했습니다. 이는 마치 탐정의 범죄 해결 능력을 테스트하기 위해, 살인 사건이 아닌 양말 한 짝이 없어진 사건을 해결하게 하는 것과 같습니다. 탐정은 양말 사건은 잘 해결할지 모르지만, 살인 사건에서는 실패할 것입니다.

결론

이 논문의 핵심 교훈은 게임을 하거나 계획을 세우는 AI를 만드는 모든 이들에게 주는 경고입니다. 단순히 무작위 테스트를 통과했다고 해서 모델을 신뢰하지 마십시오.

만약 AI가 깊고 전략적인 움직임을 찾는 똑똑한 플래너(planner)에 의해 사용될 예정이라면, 무작위의 얕은 테스트로는 검증할 수 없습니다. 당신은 다음 중 하나를 해야 합니다:

  1. 실제 전략으로 테스트하십시오: AI를 똑똑한 상대와 대결시켜 보고, 단순히 무작위 움직임을 잘 예측하는지가 아니라 실제로 승리하는지를 확인하십시오.
  2. 전체 규칙서를 제공하십시오: AI에게 코드를 작성하게 하기 전에 지침이 100% 완전한지 확인하십시오.

이 논문은 모델이 "검증"되었음에도 불구하고 여전히 위험하게 틀릴 수 있음을 보여줍니다. 이는 테스트가 게임의 승패가 갈리는 단 하나의 희귀하고 결정적인 순간을 놓쳤기 때문입니다. 이는 AI의 세계에서, 테스트를 통과하는 것이 곧 실전에 준비되었다는 것을 의미하지 않는다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →