← 최신 논문
🤖 machine learning

The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom

LeWorldModel에 대한 이 독립적인 재현은 해당 모델이 TwoRoom 환경에서 보고한 성공이 모델 자체의 내재적 능력보다는 문서화되지 않은 평가 관례와 설정 선택에 전적으로 의존하고 있음을 드러내며, 저자 본인의 가중치조차 발표된 설정 하에서 실패하고 예측 정확도가 장기 계획 성공과 무관하다는 사실을 보여준다.

원저자: Joyjeet Singh

게시일 2026-08-12
📖 5 분 읽기🧠 심층 분석

원저자: Joyjeet Singh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

탐정의 딜레마: 지도가 영토와 일치하지 않을 때

당신이 로봇에게 미로를 통과하는 법을 가르치고 있다고 상상해 보세요. 당신은 단순히 로봇이 경로를 암기하기를 원하는 것이 아니라, 로봇의 뇌 속에 '세계 모델(world model)'—즉, 왼쪽이나 오른쪽으로 회전했을 때 어떤 일이 일럴지 예측할 수 있는 정신적 지도를 구축하기를 원합니다. 만약 로봇이 미래를 정확하게 예측할 수 있다면, 로봇은 앞을 내다보며 계획을 세우고 복잡한 퍼즐을 풀 수 있습니다. 이것이 바로 **잠재 세계 모델(latent world models)**의 꿈입니다. 즉, 인간이 손을 잡아주지 않아도 지능적으로 행동할 수 있도록 환경의 숨겨진 규칙을 학습하는 AI 시스템을 말합니다.

하지만 여기서 까다로운 문제가 발생합니다. 로봇의 정신적 지도가 정말로 훌륭한지 어떻게 알 수 있을까요? 보통 과학자들은 로봇이 '다음' 단계를 얼마나 잘 예측하는지를 보고 확인합니다. 만약 로봇이 비디오의 다음 프레임을 완벽하게 추측할 수 있다면, 우리는 그 로봇이 세상을 이해하고 있다고 가정합니다. 그러나 이 논문은 위험한 질문을 던집니다. 만약 로봇이 다음 1초를 예측하는 데는 천재적이지만, 다음 1분 동안의 계획을 세우는 데는 완전히 형편없다면 어떻게 될까요?

이 이야기는 머신러닝, 구체적으로는 AI가 현실을 시뮬레이션하는 법을 배우는 연구 분야에서 왔습니다. 이곳은 연구자들이 물리 법칙, 움직임, 그리고 인과관계를 이해하는 디지털 뇌를 구축하는 곳입니다. 만약 우리가 서류상으로는 훌륭해 보이지만 실제 세상에서는 실패할 모델을 바탕으로 로봇이나 자율주행 자동차를 만든다면, 그 결과는 매우 참혹할 수 있기 때문에 이 일의 이해관계는 매우 높습니다. 이 논문은 LeWorldModel이라는 유명한 새로운 AI 방식의 '마술'이 실제로 작동하는 것인지, 아니면 마술사가 설명서의 몇 가지 중요한 단계를 숨겨둔 것인지 확인하기 위해 '탐정' 놀이를 하기로 결심한 독립 연구팀의 이야기입니다.


사라진 지침서의 사건

연구진은 자신들의 새로운 AI인 LeWorldModel이 단순한 2개 방 미로를 약 **87%**의 확률로 해결할 수 있다는 논문의 결과를 재현하기 위해 나섰습니다. 이는 **97~100%**에 도달하는 다른 방법들에 비하면 낮아 보였지만, 저자는 자신의 방식이 더 단순하며 작동하기 위해 화려한 기술이 필요하지 않기 때문에 특별하다고 주장했습니다.

Joyjeet Singh가 이끄는 독립 연구팀은 AI를 처음부터 다시 구축하기 위해 약간의 컴퓨터 연산 능력(약 24달러 상당의 GPU 시간)을 빌렸습니다. 그들은 동일한 **87%**의 성공률을 볼 것으로 기대했습니다. 하지만 대신 그들은 숨겨진 비밀들의 난장판을 발견했습니다.

네 가지 숨겨진 규칙
연구팀은 원래 논문의 지침이 가장 중요한 재료를 언급하는 것을 잊어버린 레시피와 같다는 것을 발견했습니다. 만약 발표된 설정 파일(configuration files)만 따른다면, AI는 아무것도 배우지 못할 것입니다. 연구진은 모든 것을 결정짓는 네 가지 "문서화되지 않은 관례"가 코드 속에 숨겨져 있음을 발견했습니다.

  1. 조밀한 행동 수집(Dense Action Gathering): AI는 로봇이 하는 모든 미세한 움직임을 봐야 합니다. 단지 몇 개의 스냅샷만 보는 것이 아닙니다.
  2. 프로그래밍 방식의 너비(Programmatic Width): 뇌의 특정 부분의 크기는 설정 파일의 숫자가 아니라 숨겨진 수학 공식에 의해 설정되었습니다.
  3. ImageNet 정규화(ImageNet Normalization): AI에 입력되는 사진들은 단순히 색상을 255로 나누는 것이 아니라, 매우 특정한 방식(ImageNet 표준)으로 처리되어야 했습니다.
  4. Z-점수 적용 행동(Z-Scored Actions): 로봇의 움직임은 전체 데이터셋을 기준으로 수학적으로 조정되어야 했으며, 먼저 이상한 "NaN"(숫자가 아님) 오류들을 제거해야 했습니다.

이 네 가지 숨겨진 수정 사항이 없으면, AI의 '예측기'(미래를 추측하는 부분)는 수렴조차 할 수 없었습니다. 그것은 마치 "밀가루를 넣으라"거나 "오븐을 예열하라"는 말을 빠뜨린 레시피로 케이크를 구는 것과 같았습니다.

기계 속의 유령
설명을 고친 후에도 연구팀은 벽에 부딪혔습니다. 세 번의 훈련 과정 동안 AI는 실패하는 것처럼 보였습니다. '검증 손실(validation loss)'(AI가 얼마나 나쁜지를 측정하는 점수)이 요동치며 모델이 고장 났음을 시사했습니다. 하지만 '훈련 손실(training loss)'(학습 중인 데이터에 대해 얼마나 나쁜지를 나타내는 점수)은 실제로 좋아지고 있었습니다!

그들은 범인을 찾아냈습니다. 바로 배치 정규화(Batch Normalization) 레이어였습니다. 이것을 AI 뇌 속의 온도 조절 장치라고 생각해보세요. 잘못된 모드에서 이 온도 조절 장치는 고장 난 상태였고, 미세한 오류를 300배나 증폭시키고 있었습니다. 이는 AI가 실제로 완벽하게 학습하고 있음에도 불구하고 실패하고 있는 것처럼 보이게 만들었습니다. 일단 이 온도 조절 장치를 "재교정"하자, 진정한 성능이 드러났습니다.

두 가지 서로 다른 지도
연구팀은 또한 원래 논문이 AI를 테스트하기 위한 두 가지 서로 다른 규칙 세트를 발표했으며, 이들이 완전히 다른 결과를 낸다는 것을 발견했습니다.

  • "짧은" 테스트: 코드의 설정 파일은 목표가 25단계 떨어져 있고 예산이 50단계인 상태로 AI를 테스트하라고 되어 있었습니다. 이 규칙 하에서, 원작자들의 AI는 **84.0%**를 기록했습니다.
  • "긴" 테스트: 논문의 부록에는 목표가 100단계 떨어져 있고 예산이 150단계인 상태로 테스트하라고 되어 있었습니다. 이 규칙 하에서, 동일한 AI는 단 **14.0%**만을 기록했습니다.

연구진은 논문이 주장한 "87%"의 성공률은 아마도 "짧은" 테스트를 기반으로 했을 가능성이 높으며, 부록에 설명된 "긴" 테스트가 훨씬 더 어려우며 AI의 약점을 드러낸다는 것을 깨달았습니다.

놀라운 발견: 정확도가 곧 기술은 아니다

가장 충격적인 발견은 숨겨진 규칙에 관한 것이 아니라, 무엇이 "좋음"을 의미하는지에 관한 것이었습니다.

연구팀은 세 가지 다른 버전의 AI를 훈련시켰습니다:

  1. 예측 오류가 높은 "나쁜" AI.
  2. "중간" 수준의 AI (원작자들의 버전).
  3. 예측 오류가 매우 낮은 "훌륭한" AI (연구팀의 수정된 버전).

단기적 승리:
목표가 가까울 때(25단계 거리), "훌륭한" AI가 **94.0%**의 성공률을 기록하며 가장 좋았습니다. "나쁜" AI는 **78.0%**로 가장 나빴습니다. 이는 타당했습니다. 더 나은 예측이 더 나은 계획으로 이어졌기 때문입니다.

장기적 재앙:
하지만 목표가 멀리 있을 때(100단계 거리), 규칙은 완전히 뒤집혔습니다.

  • "훌륭한" AI(가장 정확한 예측기)는 최악의 계획가가 되어 성공률이 **20.0%**에 불과했습니다.
  • "나쁜" AI(가장 정확도가 낮은 예측기)는 최고의 계획가가 되어 **80.0%**의 성공률을 기록했습니다.

가장 정확한 AI는 자신의 완벽한 예측에 너무 확신한 나머지, 거대한 무모한 움직임을 취했고 목표를 지나쳐 버려 결국 116.6 단위만큼 멀리 떨어지게 되었습니다(무작위 추측보다 더 먼 거리!). 반면, 예측에 확신이 없는 "나쁜" AI는 더 신중하게 움직여 실제로 목표에 도달했습니다.

이것이 미래에 의미하는 바

이 논문은 해당 AI 방식이 쓸모없다고 말하는 것이 아닙니다. 실제로 숨겨된 규칙들을 고치자, 연구팀의 AI는 "짧은" 테스트에서 **94.0%**에 도달하여 원래의 주장을 능가했습니다. 표현(정신적 지도)은 탄탄했습니다. 로봇은 자신이 어디에 있는지 알고 있었습니다.

그러나 이 논문은 강력한 경고를 전달합니다. 플래너(planner)를 판단할 때 단순히 다음 단계를 얼마나 잘 예측하는지로 판단해서는 안 된다는 것입니다.

이 특정 미로에서는 "완벽한 예측가"가 되는 것이 오히려 장기적인 계획을 세우는 데 방해가 되었습니다. 연구진은 가장 정확한 모델들이 자신의 경로를 너무 확신한 나머지, 자신을 길을 잃게 만드는 극단적인 행동을 저질렀다는 것을 발견했습니다.

또한 연구팀은 사전 등록된 실험(AI가 같은 방 내부 목표와 방을 가로지르는 목표를 항해하는 데 더 나은지 확인하기 위해 미리 계획된 테스트)이 한 버전의 AI에서는 작동했지만, 다른 버전에서는 완전히 실패했다는 것을 발견했습니다. 이는 AI의 "마법"이 방법론의 일반적인 속성이 아니라, 모델의 정확한 버전에 따라 달라질 수 있음을 시사합니다.

핵심 요약
논문은 만약 장기적인 계획을 세울 수 있는 AI를 만들고 싶다면, 단순히 미래를 가장 정확하게 예측하는 것을 선택해서는 안 된다고 결론짓습니다. 사실, 이 작업에서는 가장 정확한 모델을 선택하는 것이 최악의 플래너를 선택하는 것을 의미했습니다. 미래를 위한 교훈은, 단순한 예측 점수를 넘어 살펴보는 새로운 방식의 AI 테스트가 필요하다는 것입니다. 왜냐하면 완벽한 지도가 항상 운전하는 법을 안다는 것을 의미하지는 않기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →