← 최신 논문
💬 NLP

A Hyperbolicity Atlas of Large Language Model Hidden States

이 논문은 LLM 은닉 상태(hidden states)에서의 그로모프 쌍곡성(Gromov hyperbolicity)이 모델 규모보다는 주로 레이어 깊이에 의해 유도되며—중간 레이어에서 정점에 달하고 최종 레이어에서는 더 트리 구조에 가까워진다는 점을 입증하는 최초의 체계적인 연구를 제시하며, 이를 통해 서로 다른 모델 제품군과 입력 도메인 전반에 걸친 계층적 거리 구조를 이해하기 위한 실용적인 진단 도구를 제공한다.

원저자: Zhichao Yang, Yuanze Hu, Gen Li, Qingchen Yu, Shiying Duan, Xinyu Wang, Ye Qiu, Zeming Liu, Guangxu Chen, Zhaoxin Fan

게시일 2026-09-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhichao Yang, Yuanze Hu, Gen Li, Qingchen Yu, Shiying Duan, Xinyu Wang, Ye Qiu, Zeming Liu, Guangxu Chen, Zhaoxin Fan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능을 구동하는 컴퓨터 내부에는 숫자의 숨겨진 세계가 존재합니다. 이 기계들이 문장을 읽거나 질문을 처리할 때, 단어를 텍스트 그대로 저장하지 않습니다. 대신, 그들은 모든 단어를 거대한 다차원 공간에 존재하는 긴 숫자 목록인 벡터로 변환합니다. 수년 동안 과학자들은 이러한 기계들이 처리하는 대상들—예를 들어 가계도의 구조, 프로그램 코드의 단계, 혹은 이야기의 논리 같은 것들—이 흔히 계층적이라는 사실을 알고 있었습니다. 그것들은 꼭정과 바닥, 그리고 그 사이의 많은 가지들을 가지고 있습니다. 자연스럽게 한 가지 의문이 생겼습니다. 기계가 이러한 것들을 이해하기 위해 만들어내는 내부 숫자 목록 또한 나무와 같은 형태(tree-like shape)로 배열되는가 하는 점입니다. 만약 기계의 내부 지도가 나무 모양을 띠고 있다면, 이는 컴퓨터가 인간의 언어와 논리의 복잡한 구조를 반영하는 방식으로 정보를 조직하고 있음을 의미할 수 있습니다. 이를 확인하기 위해 연구자들은 점들의 집합이 얼마나 '나무와 유사한지'를 측정하는 자 역할을 하는 '쌍곡성(hyperbolicity)'이라는 수학적 개념에 주목했습니다. 점수가 낮으면 점들이 깔끔하고 가지가 뻗어 나가는 계층 구조로 배열되어 있음을 의미하며, 점수가 높으면 점들이 더 무질서하고 평평하게 흩어져 있음을 의미합니다.

베이징과 광저우의 연구진은 오늘날 가장 진보된 언어 모델 전반에 걸쳐 이 숨겨진 기하학적 구조를 지도화하는 작업을 수행했습니다. 그들은 새로운 기계를 만들거나 기존의 기계가 작동하는 방식을 바꾸지 않았습니다. 대신, 그들은 지도 제작자처럼 행동하여 열 가지의 서로 다른 오픈 소스 모델을 가져와 네 가지의 매우 다른 유형의 작업—수학 문제 풀이, 컴퓨터 코드 작성, 상식 관련 질문 답변, 그리고 진술의 진위 여부 판단—을 통과시켰습니다. 입력 프롬프트의 모든 단어에 대해, 그들은 기계가 생성한 숫자 목록 사이의 거리를 측정했습니다. 그들은 다양한 크기를 가진 열 가지 모델과 각 기계 내부의 모든 처리 계층을 아우르며 80만 개 이상의 구체적인 측정을 수행했습니다. 그들의 목표는 이 기계들의 내부 구조가 어디에서 나무 모양을 띠고 어디에서 그렇지 않은지를 보여주는 상세한 지도, 즉 아틀라스를 만드는 것이었습니다.

가장 놀라운 발견은 기계의 크기가 내부 어디를 보느냐보다 훨씬 덜 중요하다는 것이었습니다. 많은 이들이 더 많은 파라미터를 가진 더 큰 모델이 자동으로 더 "똑똑"하거나 더 구조적일 것이라고 가정합니다. 연구진은 이것이 대체로 사실이 아님을 발견했습니다. 단순히 모델을 크게 만든다고 해서 내부 구조가 일관되게 더 나무와 같은 구조가 되는 것은 아니었습니다. 어떤 경우에는 더 큰 모델이 더 작은 모델보다 실제로 덜 조직적이었고, 또 어떤 경우에는 더 조직적이었습니다. 진정한 패턴은 기계의 처리 깊이를 살펴보았을 때 나타났습니다. 정보가 네트워크의 첫 번째 계층에서 중간으로 이동함에 따라, 구조는 무질서하고 평평해지며 나무와 같은 형태를 잃었습니다. 중간 계층의 숫자들은 매우 다양하고 복잡한 정보의 혼합을 반영하며 밀집되어 있었습니다. 그러나 데이터가 마지막 계층, 즉 기계가 답을 내놓기 직전의 단계에 도달하면 구조는 극적으로 변화했습니다. 숫자들이 훨씬 더 명확하고 나무와 같은 배열로 다시 정렬된 것입니다. 이는 기계가 처음에 혼란스러운 가능성의 혼합 상태에서 시작하여, 마지막 순간에 이를 구조화된 형태로 압축한다는 것을 시사합니다.

연구진은 또한 특정 모델의 유형과 훈련된 작업이 지도를 크게 변화시킨다는 사실도 발견했습니다. 크기가 정확히 같은 두 모델이라도 훈련 방식에 따라 완전히 다른 내부 기하학을 가질 수 있습니다. 예를 들어, 코딩 작성에 특화된 모델은 프로그래밍 작업을 처리할 때 매우 강력한 나무 구조를 보여주었지만, 일반적인 수학을 위해 훈련된 모델은 수학 문제를 풀도록 요청받았을 때도 동일한 패턴을 보이지 않았습니다. 사실, 특화된 코드 모델은 일반 모델보다 코드 프롬프트의 구조를 더 나무와 유사하게 만들었지만, 수학 특화 모델은 그 구조를 더 복잡하게 유지했습니다. 이는 기계의 "사고 방식"의 형상이 모델 크기의 고정된 속성이 아니라, 어떻게 훈련되었는지와 현재 무엇을 하고 있는지에 따른 유연한 결과임을 의미합니다.

궁극적으로, 이 연구는 인공지능이 정보를 어떻게 조직하는지에 대한 새로운 이해를 제공합니다. 이는 이 모델들의 내부 세계가 정적이고 균일한 풍경이 아님을 보여줍니다. 대신, 정보가 복잡하고 평평한 상태에서 시작하여, 혼잡한 중간 섹션을 헤매다가, 마지막 단계에서 구조화된 나무 모양으로 안착하는 역동적인 여정입니다. 연구진은 모델의 최종 답변이나 전체 크기만을 보는 것으로는 그 내부 작동 방식을 이해하기에 충분하지 않다고 결론지었습니다. 이 기계들이 어떻게 생각하는지를 진정으로 이해하려면, 정보가 취하는 경로를 관찰해야 하며, 가장 중요한 구조적 변화는 결정이 내려지기 직전의 마지막 순간에 일어난다는 점에 주목해야 합니다. 이 지도는 과학자들이 이 모델들이 어디에서 생각을 정리하고 있으며 어디에서 어려움을 겪고 있는지를 볼 수 있는 실용적인 도구를 제공하며, 지능의 기하학이 단순한 크기 측정보다 훨씬 더 미묘하다는 것을 밝혀냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →