← 최신 논문
🤖 machine learning

MapFormer: Self-Supervised Learning of Cognitive Maps with Input-Dependent Positional Embeddings

이 논문은 리 대수 생성자에서 유도된 입력 의존적 위치 임베딩을 활용하여 비지도 인지 지도를 학습하는 새로운 트랜스포머 기반 아키텍처인 MapFormer 를 소개함으로써, 기존 AI 모델에 비해 다양한 인지 작업에서 분포 외 일반화 및 확장성 측면에서 우수한 성과를 달성한다고 주장합니다.

원저자: Victor Rambaud, Salvador Mascarenhas, Yair Lakretz

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Victor Rambaud, Salvador Mascarenhas, Yair Lakretz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 도시를 걷고 있다고 상상해 보세요. 여러분은 보는 모든 건물을 하나하나 외우지 않습니다. 대신 정신적 지도를 구축합니다. 파리에 있든 도쿄에 있든 '왼쪽으로 꺾기'가 항상 거리와의 상대적 위치를 바꾼다는 것을 이해하는 것입니다. 여러분이 '어디에'(구조) 있는지와 '무엇을'(내용) 보는지를 분리하는 이 능력을 과학자들은 '인지 지도 (cognitive map)'라고 부릅니다.

현재 여러분이 대화할 수 있는 대규모 언어 모델과 같은 AI 시스템은 패턴을 암기하는 데 매우 뛰어납니다. 그러나 종종 '취약 (brittle)'합니다. 훈련된 것과 약간 다른 문제를 해결하라고 요청하면 종종 실패합니다. 그들은 상황의 근본적인 규칙을 이해하는 데 어려움을 겪고 대신 표면적인 유사성에 기반한 추측에 의존합니다.

이 논문은 MapFormers라는 새로운 유형의 AI 아키텍처를 소개합니다. MapFormers 를 AI 에게 단순히 풍경을 외우는 것이 아니라 도로의 규칙을 배우는 '정신적 GPS'를 부여하는 것으로 생각하세요.

핵심 아이디어: '어디'와 '무엇'을 분리하기

저자들은 진정으로 똑똑한 AI 가 되기 위해서는 두 가지를 분리해야 한다고 주장합니다.

  1. 내용 (Content): 그것이 보는 구체적인 것들 (예: 빨간 사과, 파란 차).
  2. 구조 (Structure): 사물이 어떻게 움직이거나 관련되는지 규칙 (예: '오른쪽으로 이동'은 항상 한 칸 오른쪽으로 위치를 바꿈).

기존 AI 모델은 이들을 섞어 놓습니다. MapFormers 는 이를 분리하도록 설계되었습니다. 이는 **리 군 (Lie groups)**이라는 수학적 기법을 사용하여 이를 수행합니다 (부드러운 회전과 움직임을 설명하는 세련된 방법). 규칙을 하드 코딩하는 대신, AI 는 입력에 기반하여 '이동 행렬 (movement matrices)'을 생성하도록 학습합니다.

두 가지 유형의 MapFormers

이 논문은 이 시스템의 두 가지 버전을 제시하며, 저자들은 이를 인간의 기억 유형과 비교합니다.

  1. MapEM (에피소드 기억): 이는 일기장과 같습니다. '내가 어디에 있는지'와 '무엇을 보았는지'에 대한 별도의 전용 목록을 유지합니다. 지난 화요일 아침에 정확히 무엇을 먹었는지와 같이 구체적인 과거 사건을 회상하는 데 매우 뛰어나지만, 처리 속도는 다소 느립니다.
  2. MapWM (작업 기억): 이는 뇌의 활성 스케치패드와 같습니다. '어디'와 '무엇'을 실시간으로 섞습니다. 이는 RoPE(인기 있는 현재 AI 기법) 가 작동하는 방식과 유사하여 더 빠르고 효율적이지만, 중요한 업그레이드가 있습니다. 즉, 지도를 동적으로 이동하는 법을 실제로 학습할 수 있다는 점입니다.

학습 방법 (훈련 환경)

이 모델들이 작동함을 증명하기 위해 연구원들은 규칙이 숨겨진 세 가지 특정 '비디오 게임' 스타일의 도전 과제에서 이들을 테스트했습니다.

  • "노이즈 무시" 게임: AI 는 빈 공간 사이의 항목 목록을 복사하되 빈 공간은 무시해야 했습니다. 기존 AI 는 빈 공간에 혼란을 겪는 반면, MapFormers 는 노이즈를 '게이트 (차단)'하고 복사할 항목에만 집중하도록 학습했습니다.
  • "눈가리개 내비게이터" 게임: AI 는 '이동'과 '보기' 명령의 시퀀스를 받았지만 어느 것이 무엇인지 알려주지 않았습니다. '위'는 위쪽으로 이동시키고 '나무 보기'는 단순히 시야를 업데이트한다는 것을 알아내야 했습니다. 일단 지도를 학습하면, 시퀀스가 이전에 본 것보다 훨씬 길더라도 이전에 방문했던 곳으로 돌아갈 때 정확히 무엇을 보게 될지 예측할 수 있었습니다.
  • "중첩 괄호" 게임: 이는 깊은 논리 계층을 처리하는 능력 (예: ((()))) 을 테스트합니다. 기존 AI 는 시퀀스가 길어지면 닫히기를 기다리는 열린 괄호의 개수를 세는 데 어려움을 겪습니다. MapFormers 는 괄호를 여는 것을 '앞으로 이동'하고 닫는 것을 '뒤로 이동'하는 것으로 처리하여, 훈련된 것보다 훨씬 깊은 시퀀스에서도 스택을 완벽하게 추적할 수 있었습니다.

결과: 이것이 중요한 이유

이 논문은 MapFormers 가 거의 완벽한 일반화를 달성했다고 주장합니다.

  • "OOD" 테스트: AI 용어로 '분포 밖 (Out-of-Distribution, OOD)'은 모델이 결코 보지 못한 시나리오에서 테스트하는 것을 의미합니다. 기존 모델은 시퀀스가 길어지거나 환경이 변경되면 처참하게 실패한 반면, MapFormers 는 성공했습니다. 그들은 단순히 암기한 것이 아니라 문제의 기하학을 학습했습니다.
  • 실제 세계 테스트: 연구원들은 또한 인터넷 텍스트의 일부 (OpenWebText) 에서 이를 시도했습니다. 논리 게임만큼의 개선은 아니었지만, MapFormers 는 여전히 기존 모델보다 약간 더 잘 수행하여 이러한 원칙이 실제 세계 언어 작업으로 확장될 수 있음을 시사했습니다.

"비밀 소스": 나침반으로서의 수학

이 논문은 MapFormers 가 '오른쪽으로 이동'과 같은 행동을 회전으로 취급하는 특정 수학적 접근법을 사용한다고 설명합니다.

  • 다이얼을 돌린다고 상상해 보세요. 90 도 돌린 다음 다시 90 도 돌리면 180 도에 도달합니다.
  • MapFormers 는 '오른쪽'이 특정 회전이고 '왼쪽'은 반대 회전임을 학습합니다.
  • 이러한 수학적 프레임워크를 사용하기 때문에, 그들은 매 단계마다 복잡하고 느린 계산을 수행하는 대신 각도를 단순히 더함으로써 긴 여정 (경로 적분) 의 결과를 계산할 수 있습니다. 이를 통해 그들은 시퀀스를 이해하면서도 정보를 병렬로 처리할 수 있습니다 (매우 빠름).

요약

간단히 말해, 이 논문은 AI 를 더 견고하고 적응력 있게 만들기 위해 AI 를 거대한 패턴 매칭 기계처럼 취급하는 것을 멈추고 대신 인지 지도를 부여해야 한다고 제안합니다. AI 에게 보는 것과 이동 규칙을 분리하도록 가르침으로써, MapFormers 는 현재 AI 시스템이 lacking 하는 유연성으로 새롭고 보지 못한 상황을 탐색할 수 있습니다. 그들은 단순히 추측하지 않습니다. 그들은 지도를 이해합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →