← 최신 논문
🔬 materials science

Pre-registered tests of solid-state-physics-inspired LLM compression: a cluster-level negative result at small-language-model scale

자율 연구 에이전트와 엄격한 3-시그마 결정 게이트를 채택한 이 사전 등록 연구는, 코언 근시성(Kohn-nearsightedness) 및 텐서 트레인 임베딩에 기반한 것을 포함하여 고체 물리학에서 영감을 받은 압축 매핑이 소규모 언어 모델을 압축하는 데 실패했으며, 대신 그들의 어텐션 메커니즘이 예측된 절연체와 같은 특성보다는 임계적 또는 유리질적 거동을 보인다는 것을 발견했다.

원저자: Jun-qiang Lu

게시일 2026-09-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jun-qiang Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 현대 인공지능의 엔진으로서, 놀라울 정도의 유창함으로 글을 쓰고, 추론하며, 번역할 수 있는 능력을 갖추고 있다. 그러나 이 시스템들은 수십억 개의 숫자, 즉 파라미터(매개변수)를 포함하고 있어 그 규모가 매우 거대하다. 이러한 엄청난 크기는 모델을 실행하는 데 많은 비용이 들게 하고 저장하기 어렵게 만들며, 이는 과학자들로 하여금 근본적인 질문을 던지게 한다. 과연 이 복잡성의 상당 부분이 실제로 필요한 것인가? 한 가지 대중적인 이론은 이 모델들이 마치 고체 재료 내의 결정 격자(crystal lattice)처럼, 원자들이 예측 가능하고 질서 정연한 패턴으로 배열된 구조와 같이 숨겨진 중복성을 가지고 있을지도 모른다고 제안한다. 물리학에서 이러한 질서는 상호작용이 거리와 함께 빠르게 사라진다고 가정함으로써 계산을 단순화할 수 있게 하는데, 이를 '면 법칙(area law)'이라고 한다. 만약 언어 모델이 이와 유사하게 작동한다면, 연구자들은 언어를 이해하는 능력을 잃지 않으면서도 먼 거리의 연결을 차단하거나 내부 구조를 단순화함으로써 모델을 획기적으로 압축할 수 있기를 희망했다.

한 연구자는 엄격한 정밀함을 바탕으로 이 구체적인 아이디어를 테스트하기 위해 나섰다. 그는 언어 모델을 블랙박스로 취급하는 대신, 고체 물리학의 절연체(insulator)와 동일한 규칙을 따를 수도 있는 물리적 시스템으로 다루었다. 그의 가설은 모델 내 단어 간의 연결이 지수적으로 감소할 것이라는 것, 즉 단어가 인접한 이웃에게만 강한 영향을 미치고 모델의 내부 가중치는 더 단순하고 희소한(sparse) 형태로 회전될 수 있다는 것이었다. 결과의 신뢰성을 확보하고 특정 결과에 대한 기대 편향으로부터 자유롭기 위해, 그는 자신의 계획 전체를 사전 등록(pre-register)했다. 이는 데이터를 확인하기도 전에 자신의 예측과 테스트할 모델, 그리고 성공 또는 실패의 정확한 기준을 미리 기록해 두는 것을 의미했다. 그런 다음 그는 이 물리 기반의 아이디어들을 바탕으로 한 다섯 가지 서로 다른 테스트를 수행하기 위해 자율 컴퓨터 에이전트를 사용하였으며, 모델이 정말로 예상했던 대로 질서 정연한 절연체처럼 행동하는지 확인했다.

결과는 초기 가설에 대한 명확하고도 예상치 못한 역전이었다. 연구자는 언어 모델이 자신이 예측했던 질서 정연한 절연체처럼 행동하지 않는다는 것을 발견했다. 연결이 빠르고 예측 가능하게 사라지는 대신, 단어 사이의 주의(attention)는 훨씬 더 복잡한 패턴을 따랐다. 한 단어의 영향력이 다른 단어까지의 거리 증가에 따라 어떻게 떨어지는지 측정했을 때, 데이터는 절연체에서 기대되는 단순한 지수 곡선에 부합하지 않았다. 대신, 그 영향력은 질서가 무질서하고 장거리 연결이 지속되는 유리질 물질(glassy materials)이나 임계 시스템(critical systems)에서 흔히 나타나는 패턴인 멱법칙(power law)과 유사한 방식으로 감소했다. 실제로, 공간을 절약하기 위해 먼 거리의 연결을 차단하려고 시도했을 때, 모델의 성능은 단순히 모든 연결을 유지했을 때보다 현저히 저하되며 붕괴되었다. 모델은 먼 곳의 단어를 무시하는 것이 아니라, 단순한 물리적 지름길로는 복제할 수 없는 방식으로 그 단어들에 의존하고 있었다.

또한 이 조사는 모델의 내부 숫자들을 물리 학자가 복잡한 원자 격자를 단순화하는 방식처럼 더 효율적인 형태로 재배열하여 단순화할 수 있는지 여부도 조사했다. 연구자는 모델의 어휘와 가중치 행렬이 1차원 사슬(one-dimensional chains)을 위해 설계된 고급 수학적 구조를 사용하여 압축될 수 있는지 테스트했다. 그는 이 모델들이 활용할 수 있는 그러한 1차원 구조를 가지고 있지 않다는 것을 발견했다. 내부 숫자들은 쉽게 압축할 수 있는 방식으로 배열되어 있지 않았으며, 본질적으로 무작위적이고 정보를 버릴 경우 모델의 기능을 파괴할 수밖에 없는 정보들로 가득 차 있었다. 모델을 이러한 단순화된 형태로 강제하려고 했을 때, 결과는 더 작은 파일이 아니라 오히려 더 큰 파일이 되었는데, 이는 동일한 양의 정보를 저장하기 위해 요구되는 수학적 형식이 더 많은 공간을 필요로 했기 때문이다. 이는 더 큰 모델을 대상으로 테스트했을 때도 유효했으며, 이는 복잡성이 소규모 모델의 특이점이 아니라 이 시스템이 작동하는 방식의 근본적인 특징임을 시사했다.

아마도 가장 중요한 발견은 연구자의 방법론이 이 모델들이 단순한 절연체 같은 시스템이라는 생각을 성공적으로 배제했다는 점일 것이다. 사전 등록된 규칙을 준수함으로써, 그는 데이터를 자신의 이론에 맞추기 위해 재해석하려는 유혹을 피했다. 데이터가 예측대로 작동하지 않았을 때, 그는 그 실패를 정직하게 기록했다. 그는 모델이 단순한 결정보다 훨씬 더 복잡하고, 임계 상태(critical state)와 유사하게 모든 부분이 비선형적인 방식으로 서로 깊게 연결되어 있는 영역에서 작동한다는 것을 발견했다. 이는 먼 거리의 연결을 차단하거나 내부 구조를 재배열하여 이 모델들을 압축하려는 희망이 틀렸을 가능성이 높음을 의미한다. 모델의 복잡성은 크기에 따른 부수적인 현상이 아니라, 지능의 필수적인 특징이다.

연구는 언어 모델을 고체 물리학 원리를 이용해 압축하려는 꿈은 매혹적이지만, 현실적으로 이 모델들은 그 특정 물리 법칙을 따르지 않는다는 결론을 내린다. 연구자는 모델의 힘을 잃지 않으면서 모델을 축소할 방법을 찾지 못했다. 대신, 그는 모델이 무엇이 아닌지에 대한 명확한 지도를 제공했다. 즉, 모델은 단순한 절연체가 아니며, 발견되기를 기다리는 숨겨진 희소 구조를 가지고 있지도 않다. 그의 연구는 이 시스템들을 이해하기 위해서는 그들의 무질서하고 임계적이며 고도로 연결된 본질을 설명할 수 있는 새로운 물리적 유추가 필요함을 보여줌으로써, 해당 분야에 대한 규율 있는 교정을 수행했다. 교훈은, 이 모델들의 지능은 그 복잡성의 직조물 속에 엮여 있으며, 그것을 떼어내어 더 작게 만드는 것은 그것을 작동하게 만드는 핵심을 파괴하지 않고서는 불가능할 수도 있다는 것이다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →