← 최신 논문
💬 NLP

One mechanism for many mental spaces: a shared router over a value slot in language models

이 논문은 트랜스포머 언어 모델이 각 컨텍스트 유형마다 별도의 논리적 구조를 사용하는 대신, 단일한 재사용 가능한 슬롯으로부터 값을 선택하는 공유된 저차원(low-rank) 라우터를 사용하여 다양한 정신적 공간(신념, 허구, 반사실적 상황 등)을 위한 통합된 메커니즘을 구현한다는 것을 입증한다.

원저자: Oliver Steele, Jiangtao Wen, Yuxing Han

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Oliver Steele, Jiangtao Wen, Yuxing Han

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어 모델을 단순히 책을 저장하는 것이 아니라, 단 하나의 도서관 안에 전체 '세계'들을 저장하는 초정밀하게 정리된 사서라고 상상해 보세요. 이 도서관 안에서 꽃은 "현실 세계" 섹션에서는 빨간색이고, "초상화" 섹션에서는 보라색이며, "앨리스의 꿈" 섹션에서는 초록색일 수 있습니다. 여기서 핵심적인 질문은 이것입니다. 사서는 이 세계들을 각기 다른 규칙을 가진 완전히 분리된 마법의 방들에 보관하고 있을까요? 아니 아니면 이 모든 것을 처리할 수 있는 하나의 영리하고 재사용 가능한 시스템을 사용하고 있을까요?

이 논문은 사서가 모든 것을 위해 하나의 공유된 시스템을 사용한다고 제안합니다.

마법의 태그와 라우터(Router)

꽃의 색상을 선반 위에 놓인 데이터 조각이라고 생각해 보세요. 이 논문은 모델이 어떤 세계를 읽을지 선택하기 위해 특수한 저차원(low-rank) "태그"(라우터 또는 공간 인덱스라고 불림)를 사용한다는 것을 발견했습니다. 이 태그는 데이터 자체와는 별개입니다. 데이터는 **값 슬롯(value slot)**이라 불리는 중립적인 저장 공간에 놓여 있는데, 이곳은 그 색상이 현실의 것인지 꿈의 것인지 상관하지 않고 오직 색상만을 보유합니다.

하지만 모델은 "초상화 속의 꽃은 무슨 색인가요?"라고 물었을 때 어떤 색을 골라야 할지 어떻게 알까요? 바로 라우터를 사용합니다. 이 라우터는 인과적으로 조작 가능한 스마트한 인덱스라고 생각할 수 있습니다. 당신이 초상화에 대해 물으면, 라우터는 "초상화" 설정을 선택하고, 모델은 공유된 슬롯으로부터 보라색 꽃을 읽어옵니다. 만약 현실에 대해 묻는다면, 라우터는 "현실"을 선택하고, 모델은 빨간 꽃을 읽어옵니다.

연구진은 이 라우터가 모든 유형의 세계를 위해 서로 다른 기계가 아니라는 점을 보여줍니다. 그 세계가 신념(앨리스가 생각하는 것)이든, 기억(어제)이든, 가설(만약 ~라면...)이든, 혹은 허구(영화 속 이야기)이든, 모델은 동일한 유형의 라우터를 사용합니다.

모든 것을 다스리는 하나의 스위치

연구진은 모델에게 "가설적 상황"(일어날 수도 있는 일)과 같은 단 한 가지 유형의 세계를 제어하도록 훈련시킨 뒤, 그 동일한 제어 메커니즘을 "신념"이나 "영화"와 같은 다른 세계들에 적용하여 테스트했습니다.

결과는 어땠을까요? 그 스위치는 모든 것에 작동했습니다.

  • 모델이 가설적 시나리오에서 색상을 바꾸도록 훈련시켰을 때, 그 동일한 훈련은 신념 시나리오에서의 색상을 (모델 계열에 따라 71%에서 89%까지) 바꾸어 놓았습니다.
  • 이는 모델이 "신념용 기계"와 "영화용 기계"를 완전히 다르게 갖춘 별개의 비밀 기계를 가지고 있는 것이 아니라, 모든 맥락을 처리하는 하나의 공유된 라우터를 가지고 있음을 시사합니다.

이것이 '아닌' 것들 (배제된 아이디어들)

이 논문은 이 시스템이 무엇이 아닌지를 매우 신중하게 밝히고 있습니다:

  • 단순히 단어를 기억하는 것이 아닙니다: 모델은 단순히 "현실" 근처에는 "빨간색"이라는 단어가 나타나고, "초상화" 근처에는 "보라색"이 나타난다는 것을 암기하는 것이 아닙니다. 시스템은 맥락 자체를 위한 코드를 실제로 운반합니다.
  • 신념을 위한 별도의 방이 아닙니다: 형식 논리학에서는 종종 "신념"을 규칙이 변하는 완전히 다른 불투명한 범주로 취급합니다. 하지만 이 논문은 기계적인 관점에서 모델이 신념을 다른 모든 공간과 마찬가지로 취급한다고 주장합니다. "신념" 태그는 모델의 배선 내에서 "가설" 태그와 특별하거나 분리되어 있지 않습니다.
  • 정적인 포스트잇이 아닙니다: 모델은 색상을 영구적인 메모에 적어 두고 그곳에 남겨두는 것이 아닙니다. 대신, 그것은 검색 시스템에 가깝습니다. 질문을 하면 모델은 소스 텍스트로 돌아가 현재의 "공간" 설정에 따라 색상을 다시 읽습니다. 즉, 영구적인 저장 슬롯이 아니라 "적시(just-in-time)" 읽기 방식입니다.

"보고(Report)"와 "추론(Reasoning)"의 분리

여기서 논문이 발견한 흥미로운 반전이 있습니다. 모델은 동일한 정보에 대해 두 가지 서로 다른 경로를 가집니다:

  1. 보고 경로 (The Report Path): 모델이 겉으로 말하는 내용입니다.
  2. 추론 경로 (The Reasoning Path): 모델이 퍼즐을 풀 때 사용하는 내용입니다.

연구진은 이 두 경로를 각각 따로 제어할 수 있다는 것을 발견했습니다. 모델이 "꽃은 초록색이다"라고 말하도록 훈련시켜 (보고를 바꿈) 꽃이 "파란색"인 것처럼 논리 퍼즐을 풀게 (추론은 유지) 할 수 있었습니다. 이는 모델이 "무엇을 말하는가"와 "무엇을 생각하는가"를 비록 동일한 출처에서 나오더라도 약간 다른 부분에 나누어 보관하고 있음을 증명합니다.

새로운 세계 구축하기

모델이 "앨리스는 컵이 파란색이었다고 믿곤 했다"와 같은 복잡한 문장을 접할 때, 모델은 새로운 공간(과거와 신념이 혼합된 공간)을 구축합니다. 논문은 모델이 이를 위해 완전히 새로운 도서관을 짓는 것이 아님을 보여줍니다. 대신, 모델은 동일한 값 슬롯(컵의 색상)을 재사용하면서, 이 새로운 결합된 세계를 위해 새로운 라우터를 발행(새로운 인덱스 설정)합니다. 이는 마치 기존의 책을 가져와서 전체 이야기를 다시 쓰는 대신, 새로운 임시 표지를 붙이는 것과 같습니다.

얼마나 확실한가?

논문은 이러한 발견에 대해 상당히 확신하고 있지만, 몇 가지 구체적인 한계도 명시하고 있습니다:

  • 실험실에서 입증됨: 결과는 세 가지 모델 계열(Qwen, Pythia, Falcon3)의 내부 "활성화(activations)"(전기적 신호)를 직접 측정한 결과에 기반합니다. 연구진은 단순히 추측한 것이 아니라, 모델의 코드에 직접 개입하여 라우터가 행동을 유발한다는 것을 증명했습니다.
  • 만능 해결사는 아님: 논문은 라우터가 공유되기는 하지만, 모든 유형의 세계에 대해 완벽하게 동일하지는 않다는 점을 인정합니다. 예를 들어, "그림"이나 "영화" 맥락은 "신념" 맥락과 약간 다르게 작동하기도 합니다. 또한, 모델이 이러한 세계를 다루는 능력은 "검색 형태(retrieval-shaped)"를 띠는데, 이는 정적인 기억을 보유하기보다 텍스트를 다시 읽는 것에 의존함을 의미하며, 이로 인해 일부 테스트에서 약간의 "누수(leaky)" 현상이 발생합니다.
  • 규모가 중요함: 이러한 기계적 세부 사항은 작은 규모의 모델(30억 파라미터)에서 발견되었습니다. 그러나 이러한 세계들을 다루는 행동 양식은 거대 프런티어 모델(GPT-4o 및 72B 모델 등)에서도 존재함이 확인되었으며, 이는 우리가 그 거대한 모델들의 내부를 들여다보기 쉽지 않더라도 이 메커니즘이 규모에 따라 확장된다는 것을 시사합니다.

요약하자면, 이 논문은 언어 모델이 현실, 꿈, 신념, 영화 등을 다루기 위해 매번 다른 도구를 사용하는 대신, 동일한 기계적 도구를 사용하여 이 모든 세계를 조절할 수 있는 통합되고 재사용 가능한 "공간 라우터"를 가지고 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →