Belief-reality separation lives in routing over a shared value slot in language models
이 논문은 언어 모델이 귀속된 정보를 저장하는 공유 가치 슬롯(shared value slot)과 캐릭터의 신념 또는 객관적 현실 중 무엇을 읽을지 결정하는 쿼리-위치 라우터(query-position router)라는 두 가지 뚜렷한 메커니즘을 통해 신념과 현실을 분리한다는 점을 밝혀냈으며, 이러한 능력은 여러 아키텍처에 걸쳐 3B에서 7B 파라미터 사이에서 발현된다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
초거대 언어 모델을 실시간으로 이야기가 쓰이고 읽히는 거대하고 북적이는 도서관이라고 상상해 보세요. 오랫동안 우리는 이 도서관이 어떻게 등장인물의 '믿음'과 '실제 현실'을 구분하여 유지하는지 궁금해했습니다. 만약 이야기가 "안나는 컵이 파란색이라고 생각하지만, 실제로는 빨간색이다"라고 한다면, 모델은 안나의 생각을 물었을 때는 "파란색"이라고 답해야 하고, 실제 사실을 물었을 때는 "빨간색"이라고 답할 줄 알아야 합니다.
이 논문은 모델의 두뇌가 정확히 어떻게 이 작업을 수행하는지 그 커튼을 걷어 보여줍니다. 결론부터 말하자면, 모델은 '진실'과 '거짓'을 위한 두 개의 서로 다른 저장실을 사용하는 것이 아닙니다. 대신, **범용 파일링 슬롯(Universal Filing Slot)**과 **스마트 스위치(Smart Switch)**라는 영리한 2부작 시스템을 사용합니다.
범용 파일링 슬롯
먼저, 모델의 메모리에는 '값 슬롯(value slot)'이라 불리는 특정 지점이 있습니다. 이것은 책상 위에 놓인 일반적인 포스트잇 하나와 같습니다. 이 포스트 l잇은 누가 보고 있는지, 혹은 무엇을 믿고 있는지에 상관없이 그저 '파란색'이라는 정보를 담고 있을 뿐입니다.
논문은 이 슬롯이 두 가지 방식으로 채워진다는 것을 보여줍니다.
- 직접 쓰기: 만약 텍스트에 "안나는 컵이 파란색이라고 믿는다"라고 명시되어 있다면, 모델은 포스트잇에 "파란색"을 직접 적습니다.
- 탐정처럼 되돌아보기: 만약 텍려가 "안나는 벤이 컵을 파란색으로 칠하는 것을 보았다"라고 한다면, 모델은 약간의 탐정 놀이를 해야 합니다. 안나가 실제로 무엇을 볼 수 있었는지 이야기를 되짚어보고, 색상이 파란색이라는 것을 파악한 뒤, 그 동일한 포스트잇에 "파란색"을 적습니다.
여기서 핵심은, 포스트 ít 자체에는 "이것은 안나의 믿음이다"라거나 "이것은 진실이다"라는 라벨이 붙어 있지 않다는 점입니다. 그것은 그저 '파란색'을 담고 있는 중립적인 컨테이너일 뿐입니다. 만약 이 포스트잇의 색상을 바꾼다면, 믿음에 대한 질문과 실제 사실에 대한 질문 모두에 대한 답이 똑같이 변하게 됩니다. 이 포스트잇은 '무엇'인지는 담고 있지만, '누구'인지나 '언제'인지는 담고 있지 않습니다.
스마트 스위치 (라우터)
그렇다면 포스트잇이 중립적이라면, 모델은 어떤 버전을 읽어야 할지 어떻게 알까요? 여기서 두 번째 메커니즘인 **라우터(Router)**가 등장합니다. 이는 질문이 던져지는 바로 그 순간에 작동합니다.
도서관 출구에 서 있는 교통 경찰을 상상해 보세요. 누군가 "안나는 무엇을 생각하나요?"라고 물으면, 경찰은 스위치를 '믿음' 차선으로 돌립니다. "실제로 무엇이 사실인가요?"라고 물으면, 경찰은 스로 '현실' 차선으로 스위치를 돌립니다.
논문은 이 두 차선이 완전히 분리되어 있음을 증명합니다. '믿음' 스위치와 '현실' 스위치는 서로 다른 문을 여는 두 개의 서로 다른 열쇠와 같습니다. 이들은 섞이지 않습니다. '믿음' 열쇠를 '현실' 문에 사용하려고 하면 거의 작동하지 않습니다. 이러한 분리는 색상이 보관되는 저장실이 아니라, 질문이 던져지는 바로 그 순간에 발생합니다.
이 초능력은 언제 나타났는가?
연구진은 모델의 크기에 따라 이 능력이 언제 발현되는지 확인하기 위해 다양한 크기의 모델을 테스트했습니다.
- 작은 모델 (30억 파라미터): 이 모델들은 혼란을 겪습니다. 이들은 누가 무엇을 봤는지 추적하기보다, 마지막에 들은 색상을 그대로 반복하는 경향(이른바 '최신성' 효과)을 보입니다.
- 중간 크기 모델 (70억 파라미터): 갑자기 능력이 확립됩니다. 30억과 70억 사이에서 모델은 믿음과 현실을 깔끔하게 구분하는 법을 배웁니다. 70억 파라미터에 도달하면, 이야기가 어떤 순서로 진행되든 상관없이 이러한 퍼즐을 거의 완벽하게 해결합니다.
이것이 '아닌' 것들
논문은 흔히 하는 추측들을 신중하게 배제합니다.
- '진실' 대 '거짓' 태그가 아님: 모델은 색상에 "믿음"이라는 특별한 도장을 찍어두지 않습니다. 색상 "파란색"은 그것이 믿음이든 사실이든 동일한 방식으로 저장됩니다. 차이점은 전적으로 모델이 그 값을 어떻게 선택해서 읽느냐에 달려 있습니다.
- 단순한 복사가 아님: 테스트는 단순히 언급된 마지막 단어를 복사하는 방식으로는 통하지 않도록 설계되었습니다. 모델은 실제로 누가 무엇을 보았는지 추적해야만 합니다.
- 하나의 커다란 '믿음' 뇌가 아님: 연구는 값을 저장하는 뇌의 부분과 어떤 관점을 사용할지 결정하는 부분이 서로 다르다는 것을 보여줍니다.
요지
요약하자면, 모델은 '믿음 기계'와 '현실 기계'를 따로 가지고 있는 것이 아닙니다. 모델은 값들을 위한 공유 파일 캐비닛과 질문에 따라 어떤 서랍을 열지 결정하는 스마트 스위치를 가지고 있습니다. 이 시스템은 다양한 유형의 모델(Qwen, Mistral, OLMo 등)에서 작동하며, 모델이 충분히 커졌을 때(약 70억 파라미터) 급격히 나타납니다.
연구진은 모델의 내부 코드 조각들을 교체(마치 포스트잇이나 스위치를 바꾸는 것처럼)하고 답변이 어떻게 바뀌는지 관찰함으로써 이 사실을 밝혀냈습니다. 그들은 세 가지 다른 모델 아키텍처에서 동일한 패턴을 발견했기 때문에 이 방식이 작동한다는 점을 확신하고 있습니다. 연구진은 이와 같은 '슬롯과 스위치' 시스템이 다른 까다로운 상황(예: 시간 여행 이야기나 "만약 ~라면" 시나리오)에서도 작동할 것이라고 추측하지만, 이 특정 논문은 오직 '믿음 대 현실'의 분리에만 집중하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.