← 최신 논문
💬 NLP

The Changing Geometry of Grammar: Dimensionality and Neighborhood Reorganization across Transformer Layers

이 논문은 토큰의 문법적 역할이 트랜스포머 표현의 국소적 기하학을 어떻게 형성하는지 조사하며, 이웃 재구성을 통해 폐쇄 부류 및 개방 부류 항목 간에 내재적 차원이 층을 따라 다르게 진화함을 밝히고, 인코더와 디코더 구조 사이에서 구별되는 패턴을 관찰한다.

원저자: Samuele Vallisa, Federico Ravenda, Claudio Palominos, Rui He, Andrea Raballo, Antonietta Mira, Philipp Homan, Wolfram Hinzen

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Samuele Vallisa, Federico Ravenda, Claudio Palominos, Rui He, Andrea Raballo, Antonietta Mira, Philipp Homan, Wolfram Hinzen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 언어 모델의 디지털 정신 내부에서 단어들은 가만히 머물러 있지 않습니다. 컴퓨터가 문장을 읽을 때, 그것은 각 단어를 수백 차원의 거대하고 보이지 않는 공간 속에 떠 있는 점인, 긴 숫자 목록으로 변환합니다. 이 점들은 무작위로 흩어져 있는 것이 아니라, 그 고차원적 공허 속에서 얇고 구부러진 시트(sheet)를 형성하며 함께 군집을 이룹니다. 과학자들은 이 시트를 매니폴드(manifold)라고 부르며, 이 시트의 두께는 단어가 얼마나 많은 정보를 운반하고 있는지에 대한 이야기를 들려줍니다. 만약 단어가 여러 방향으로 자유롭게 변할 수 있다면 시트는 두껍고 복잡해집니다. 만약 단어가 주변 단어들에 의해 엄격하게 제약을 받는다면 시트는 얇고 단순해집니다. 이러한 정보의 압축은 모델이 세상을 이해하는 근본적인 방식이지만, 지금까지 연구자들은 "고양이"와 같은 무거운 명사인지, 아니면 "그(the)"와 같은 가벼운 연결어인지와 같이 단어가 문장에서 수행하는 구체적인 역할이 이 기하학적 구조를 어떻게 형성하는지 파악하는 데 어려움을 겪어왔습니다.

한 연구팀은 이 숨겨진 지형을 지도화하기 위해, 단어의 문법적 역할이 신경망의 층을 통과하는 경로를 결정하는지 묻는 연구를 시작했습니다. 그들은 풍부한 의미를 담고 있는 명사와 동사 같은 개방 어휘(open-class words)와, 전치사나 대명사처럼 구조적 목적을 수행하는 폐쇄 어휘(closed-class words) 사이의 구분에 주목했습니다. 네 가지 유형의 언어 모델에 수천 개의 문장을 입력함으로써, 그들은 데이터의 형태가 층을 거듭할수록 어떻게 변하는지 추적했습니다. 그들은 이 두 유형의 단어가 같은 경로를 따라 이동하지 않는다는 사실을 발견했습니다. 폐쇄 어휘는 과정 초기에 더 넓고 복렴한 공간으로 확장되었다가, 내용이 풍부한 단어들보다 훨씬 더 빨리 다시 작고 단순한 형태로 붕괴됩니다. 이는 모델이 먼저 이 구조적 단어들을 펼쳐서 문장의 다른 부분들과 어떻게 연결되는지 파악한 다음, 연결이 완료되면 필요한 관계적 정보를 모두 추출한 뒤 다시 접어버린다는 것을 시사합니다.

연구진은 이러한 기하학적 접힘이 단순히 무작위적인 변동이 아니라, 각 단어 주변의 이웃을 정밀하게 재조직하는 과정임을 발견했습니다. 단어가 네트워크 깊숙이 이동함에 따라, 수학적 공간 내에서의 가장 가까운 이웃들도 변합니다. 구조적 단어의 경우, 이러한 변화는 빠르고 결정적으로 일어납니다. "the"와 같은 단어는 처음에는 다른 한정사들에 둘러싸여 시작될 수 있지만, 네트워크가 문장을 처리함에 따라 그 집단에서 떨어져 나와 그것이 수식하는 특정 명사에 더 가까워집니다. 이러한 이웃의 변화는 단어의 내부 표현이 더 단순하고 압축되는 순간과 정확히 일치합니다. 반면, "코끼리"나 "달리다"와 같은 내용 어휘는 문장의 진화하는 맥락과 그 특유의 의미를 계속 통합해야 하는 필요성을 반영하여 더 오랫동안 더 복잡하고 열린 기하학적 구조를 유지합니다.

또한 이 연구는 모델의 아키텍처가 매우 중요하다는 것을 밝혀냈습니다. 인코더처럼 문장을 양방향으로 동시에 읽는 모델은 이러한 구조적 연결을 조기에 해결하여, 기하학적 변화가 중간 층에서 발생하게 합니다. 반면 디코더처럼 엄격하게 왼쪽에서 오른쪽으로 읽는 모델은 맥락이 축적됨에 따라 이러한 기하학적 변화가 나중에 발생하는 다른 경로를 택합니다. 이러한 아키텍처의 차이에도 불구하고 핵심적인 발견은 유효했습니다. 즉, 단어가 통과하는 경로는 그 문법적 기능의 직접적인 반영이라는 점입니다. 연구진은 컴퓨터가 데이터 포인트의 형태, 즉 두께와 이웃이 어떻게 변하는지만을 보고도, 단어 자체를 전혀 보지 않고도 그 단어가 기능어인지 내용어인지, 혹은 심지어 구체적인 품사가 무엇인지까지 정확히 맞출 수 있음을 보여줌으로써 이를 증명했습니다.

이 연구는 문장의 문법이 모델이 따르는 단순한 규칙의 집합이 아니라, 그 수학적 구조 내에 존재하는 물리적 실체임을 시사합니다. 모델은 단순히 단어의 의미를 저장하는 것이 아니라, 문장 속에서 어떻게 적합하게 들어맞는지라는 퍼즐을 풀기 위해 그 단어 주변의 공간을 물리적으로 재형성합니다. 구조적 단어가 문장에서 짝을 찾는 순간, 모델은 탐색에 필요했던 여분의 차원을 붕괴시켜 핵심적인 형태만을 남깁니다. 이는 마치 모델이 문장을 지탱하기 위해 임시 가설물을 세우고, 구조가 견고해지면 가설물을 제거하여 본질적인 의미의 형태만을 남기는 것과 같습니다. 이러한 확장과 수축의 기하학적 춤은 인공지능이 의미를 전달하는 단어와 그 의미를 지탱하는 단어 사이의 섬세한 균형을 어떻게 이해하는지에 대한 새로운 창을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →