← 최신 논문
🤖 machine learning

MetaOthello: A Controlled Study of Multiple World Models in Transformers

이 논문은 MetaOthello을 소개하며, 이는 여러 게임 규칙에 대해 학습된 트랜스포머가 학습을 별개의 서브 모델로 격리하는 대신, 층위별 전문화와 기하학적 정렬을 통해 다수의 세계 모델을 조직하는 공유되고 인과적으로 전이 가능한 보드 상태 표현으로 수렴한다는 것을 입증하는 통제된 오델로 변형체 세트이다.

원저자: Aviral Chawla, Galen Hall, Juniper Lovato

게시일 2026-07-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aviral Chawla, Galen Hall, Juniper Lovato

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 매우 똑똑한 로봇 셰프를 상상해 보세요. 보통 우리는 이 로봇들이 한 번에 하나의 레시피만 배우는 것으로 생각합니다. 하지만 현실 세계에서 로봇은 고객이 주문하는 것에 따라 즉각적으로 전환하며 케이크를 굽고, 스테이크를 굽고, 초밥을 만드는 법을 동시에 알아야 할 수도 있습니다.

연구자들이 던진 핵심 질문은 이것입니다: 이 로봇은 어떻게 머릿속에서 이 서로 다른 '세계들'을 혼동하지 않고 유지하는가? 로봇은 머릿속에 세 개의 별도 주방을 만드는 것일까요? 아니면 하나의 큰 주방을 사용하면서 상황에 따라 규칙만 즉석에서 바꾸는 것일까요?

이를 알아내기 위해 저자들은 MetaOthello라는 놀이터를 만들었습니다.

놀이터: 여러 규칙이 존재하는 게임

오델로(리버시라고도 함)를 블랙과 화이트 디스크를 놓는 보드게임이라고 생각해 보세요. 목표는 상대방의 디스크를 자신의 색깔로 뒤집는 것입니다.

연구자들은 단순히 한 가지 버전의 게임만 만든 것이 아닙니다. 그들은 오델로의 "멀티버스"를 만들었습니다:

  1. 클래식 오델로 (Classic Othello): 표준 규칙.
  2. 노미드플립 (NoMidFlip): 클래식과 같지만, 중간에 있는 디스크는 뒤집을 수 없고 오직 가장 바깥쪽 디스크만 뒤집을 수 있음.
  3. 델플랭크 (DelFlank): 디스크를 뒤집는 대신 삭제할 수 있고, 시작 시 조각들이 다르게 퍼져 있는 기이한 버전.
  4. 이아고 (Iago): 클래식과 규칙은 완전히 동일하지만, 수(move)의 이름이 뒤섞인 버전 (예를 들어 "1,1" 대신 "A1"이라고 부름).

그들은 이 게임들을 플레이하도록 작은 AI 모델(트랜스포머)들을 훈련시켰습니다. 때로는 단 하나의 게임에 대해서만 훈련시키기도 했고, 다른 때에는 이 모든 서로 다른 버전들을 무작위로 섞어서 던져주기도 했습니다.

거대한 발견: 하나의 뇌, 여러 개의 모자

연구자들은 만약 AI가 여러 게임을 배운다면, 마치 머릿속에 "클래식 셰프"와 "델플랭크 셰프"가 공존하는 것처럼 별도의 "하위 모델(sub-models)"로 뇌를 분리할 것이라고 예상했습니다.

하지만 그들의 예상은 틀렸습니다.

대신, AI는 보드에 대한 하나의 보편적인 "정신적 지도(mental map)"를 공유하는 법을 배웠습니다.

  • 공유된 지도: AI가 클래식을 플레이하든 노미드플립을 플레이하든, 조각들이 어디에 있는지 이해하기 위해 정확히 동일한 내부 표현(internal representation)을 사용했습니다. 이는 마치 로봇 셰프가 케이크를 만들든 스테이크를 만들든 상관없이 주방 카운터에 대한 동일한 정신적 이미지를 사용하는 것과 같습니다.
  • 증거: 연구자들은 클래식 오델로에 맞춰 훈련된 "프로브(probe, AI의 마음을 읽는 간단한 도구)"를 사용했습니다. 그들이 노미드플립을 플레이하는 AI의 마음을 이 도구로 읽었을 때, 거의 완벽하게 작동했습니다. AI는 두 개의 서로 다른 지도를 사용하는 것이 아니라, 두 게임 모두에 대해 하나의 공유된 지도를 사용하고 있었습니다.

어떻게 혼란을 처리하는가?

여기서 까다로운 부분이 있습니다. 게임의 초반에는 어떤 수가 클래식과 노미드플립 모두에서 유효할 수 있습니다. 하지만 나중에는 어떤 수는 한쪽에서는 유효하지만 다른 쪽에서는 불가능할 수 있습니다. AI는 어떤 규칙서를 따라야 할지 어떻게 알까요?

연구 결과, AI는 뇌의 중간 부분(구체적으로 레이어 5 주변)에 있는 특화된 "교통 경찰" 회로를 사용한다는 것을 발견했습니다.

  • 공유된 기질 (Shared Substrate): AI는 모두를 위한 공유된 지도를 유지합니다.
  • 충돌 감지기: 어떤 수가 클래식에 속하는지 혹은 노미드플립에 속하는지 결정해야 하는 상황이 오면, 특정 부분이 활성화되어 "이것이 클래식 수인가, 노미드플립 수인가?"를 계산합니다.
  • 스위치: 이 교통 경찰은 정보를 경로를 지정합니다. 만약 AI가 "클래식"이라고 결정하면 클래식 규칙을 따르고, "노미드플립"이라고 결정하면 그 규칙을 따릅니다.

이는 마치 메인 궤도(공유된 보드)가 있고, 목적지에 도착하기 직전에 두 개의 다른 노선으로 갈라지는 기차역과 같습니다. AI는 두 개의 별도 역을 만드는 것이 아니라, 스마트한 스위치가 달린 하나의 역을 가지고 있을 뿐입니다.

"분포 외(Out of Distribution)"의 반전

연구자들은 게임이 매우 다를 때(예: 클래식 vs 델플랭크) 어떤 일이 일어나는지도 테스트했습니다. 이 경우, 게임들은 너무 빠르게 갈라지기 때문에 단 몇 수 만에 두 게임 모두에서 유효한 시퀀스를 유지하는 것은 거의 불가능합니다.

이때 AI는 전략을 바꿉니다. 두 가능성을 모두 열어두고 스위치를 기다리는 대신, **조기에 결단(commit early)**을 내립니다. AI는 하나의 세계(보통 더 자주 보는 세계)를 선택하고 다른 하나를 버립니다. 만약 나중에 "잊혀진" 게임을 다시 기억하도록 강제하려면, 생각을 되돌리기 위해 매우 초기에 개입해야 합니다.

"이아고" 실험: 같은 게임, 다른 언어

마지막으로, 규칙은 클래식과 동일하지만 수의 명칭이 뒤섞인 "이아고" 버전을 테스트했습니다.

  • 결과: AI는 정확히 동일한 내부 구조를 학습했습니다. 유일한 차이점은 단순한 수학적 "회전"(예를 들어 지도를 90도 돌리는 것)이었습니다.
  • 의미: AI는 표면적인 단어(어휘)에는 신경 쓰지 않았습니다. AI는 게임의 추상적인 구조를 학습했습니다. 이는 런던의 지도가 영어로 읽히든 프랑스어로 읽히든 지도의 형태는 동일하다는 것을 깨닫는 것과 같습니다.

요약

이 논문은 트랜스포머가 여러 "세계"(서로 다른 규칙이나 맥락)를 학습할 때, 각 세계를 위한 별도의 방을 만드는 것이 아니라고 결론짓습니다. 대신 그들은 다음과 같이 행동합니다:

  1. 상태(보드)에 대한 핵ing한 표현을 공유합니다.
  2. 충돌을 특정한 작은 회로로 국소화하여 스위치 역할을 하게 합니다.
  3. 규칙이 실제로 충돌하는 부분에만 추가적인 장치를 구축함으로써 자원을 절약합니다.

이는 복잡한 AI 모델조차도 놀라울 정도로 효율적임을 시사합니다. 그들은 모든 작업을 위한 별도의 뇌를 가질 필요가 없습니다. 그저 기어를 바꿀 수 있는 스마트한 방법을 갖춘 공유된 뇌가 필요할 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →