← 최신 논문
🔢 mathematics

Capability from Access Structure, Not Scale: Lower Bounds and Pre-Registered Tests for Hybrid Sequence Models

이 논문은 규모의 확장(scaling)만으로는 능력의 수렴을 보장한다는 관점에 이의를 제기하며, 진정한 능력을 위해서는 압축 상태 채널(compressive state channel)과 축자적 인덱스 채널(verbatim-index channel)이 결합된 특정 하이브리드 아키텍처가 필요하다는 '능력 수렴 가설(Capability Convergence Hypothesis)'을 제안하고, 이론적 하한선과 사전 등록된 실험 결과로 이를 뒷받침한다.

원저자: Wenhui Chen, Jianlin Chen, Ziyao Lin, Chi Man Vong

게시일 2026-07-17
📖 5 분 읽기🧠 심층 분석

원저자: Wenhui Chen, Jianlin Chen, Ziyao Lin, Chi Man Vong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 AI 경주: 왜 더 큰 것이 항상 더 나은 것은 아닌가

우주 전체의 역사를 저장하기 위해 도서관을 짓고 있다고 상상해 보십시오. 오랫동안 과학자들은 도서관을 계속 키우고 사서들을 더 똑똑하게 만든다면, 결국 그들이 모든 책이 정확히 어디에 있어야 하는지에 대해 합의하게 될 것이라고 믿었습니다. **플라톤적 표현 가설(Platonic Representation Hypothesis)**로 알려진 이 아이디어는, AI 모델이 거대해짐에 따라 모델들이 모두 동일한 방식으로 "생각하기" 시작하며, 현실에 대한 완벽하고 공유된 이해로 수렴한다는 것을 시사합니다. 이는 언어와 상관없이 모든 인간이 결국 불은 뜨겁고 물은 축축하다는 사실에 동의하는 것과 같습니다.

하지만 함정이 있습니다. 책이 선반의 어디에 있는지 아는 것(표현)은, 도서관에 불이 나고 아주 작은 손전등 하나만 있는 상황에서 실제로 그 선반으로 달려가 책을 집어 들고 특정 문장을 읽어내는 능력(역량)과는 매우 다릅니다(표현과 역량의 차이). AI의 세계에서 이 "손전등"은 추론 예산(inference budget), 즉 모델이 질문에 답할 때 사용할 수 있는 메모리와 컴퓨팅 파워의 엄격한 제한을 의미합니다. 핵심 질문은 단순히 "모델이 세상을 이해할 수 있는가?"가 아니라, "정보의 바다 속에서 메모리가 바닥나지 않고 실제로 정답을 '찾아낼' 수 있는가?"입니다. 이것이 바로 이 논문이 다루는 퍼즐입니다. 모델을 크게 만드는 것이 더 어려운 문제를 해결할 수 있음을 보장합니까, 아니면 실제로 일을 완수하기 위해 특정한 구조적 기법이 필요합니까?

무한한 흐름 속의 사과

이 논문은 AI 세계를 위한 새로운 규칙인 **역량 수렴 가설(Capability Convergence Hypothesis, CCH)**을 제안합니다. 저자들은 AI 모델이 커짐에 따라 세상을 보는 방식은 같아질지 몰라도, 특정 두 부분으로 구성된 구조를 갖추지 않는 한 무언가를 '수행'하는 능력까지 반드시 좋아지는 것은 아니라고 주장합니다.

이를 이해하기 위해 저자들은 **"뉴턴의 사과가 담긴 무한한 흐름"**이라는 사고 실험을 사용합니다. 끝없이 흐르는 강물이 있고, 그 강물에는 수백만 개의 종이 조각이 떠내려가고 있다고 상상해 보십시오. 강 상류 어딘가에서 누군가 종이 한 장에 "뉴턴, 사과, 1666"이라고 적었습니다. 그 후 강물은 매우 비슷해 보이는 수십억 개의 다른 종이들(예: "뉴턴, 중력, 1666" 또는 "사과, 파이, 1666")로 범람합니다. 당신의 임모는 강물의 맨 끝까지 기다렸다가 정확히 그 원래의 "뉴턴, 사과, 1666" 종이를 건져 올리는 것입니다.

논문은 현재 대부분의 AI 모델이 이 종이를 찾으려는 두 가지 유형의 수영객과 같다고 주장합니다.

  1. 압축형 수영객 (SSMs): 이 모델들은 작고 무거운 배낭을 멘 수영객과 같습니다. 이들은 강의 전반적인 방향(예: "뉴턴에 관한 이야기구나")은 기억할 수 있지만, 배낭이 너무 작기 때문에 새로운 물을 받아들일 공간을 만들기 위해 구체적인 세부 사항을 버려야 합니다. 강 끝에 도달할 때쯤이면 그들은 "사과"나 "1666"이라는 정확한 단어를 잊어버립니다. 이들은 저자들이 **섀넌 벽(Shannon Wall)**이라고 부르는 한계, 즉 필요한 모든 세부 사항을 작은 메모리에 담을 수 없는 물리적 한계에 부딪힙니다.
  2. 축자적(Verbatim) 수영객 (Transformers): 이 모델들은 자신이 본 모든 종이를 담은 거대하고 떠다니는 도서관을 가진 수영객과 같습니다. 이들은 정확한 단어를 완벽하게 기억할 수 있습니다. 하지만 이들에게는 **지평선 벽(Horizon Wall)**이 있습니다. 이들은 아주 짧은 거리만 뒤를 돌아볼 수 있습니다. 만약 강이 너무 길다면, "뉴턴, 사과" 종이는 이미 시야에서 벗어나 버렸을 것입니다. 또한 이들은 **회로 벽(Circuit Wall)**에도 부딪힙니다. 만약 작업이 긴 단계의 복잡한 논리 체계(예: 단계별로 퍼즐을 푸는 과정)를 요구한다면, 고정된 크기의 뇌가 막혀 점들을 연결하지 못하게 됩니다.

승리 전략: 하이브리드 브리지(Hybrid Bridge)

이 논문의 주요 발견은 "뉴턴의 사과" 문제를 해결하기 위해 단순히 더 큰 수영객이 필요한 것이 아니라, **하이브리드(Hybrid)**가 필요하다는 것입니다. 이는 두 종류의 수영객을 하나의 팀으로 결합한 모델입니다.

  • 아이디어 (상태 채널 - State Channel): 한 부분은 강의 방향에 대한 작고 효율적인 요약본(즉, "아이디어")을 유지합니다. 이 부분은 세부 사항에 매몰되지 않고 어디를 봐야 할지 기억합니다.
  • 그림자 (인덱스 채널 - Index Channel): 다른 부분은 자신이 본 모든 구체적인 단어의 거대하고 검색 가능한 목록(즉, "그림자")을 유지합니다. 이 부분은 정확한 세부 사항을 기억합니다.

저자들은 이를 **액세스 완전 하이브리드(Access-Complete Hybrid)**라고 부릅니다. 실험 결과, 이 두 가지를 결 조합했을 때 모델은 순수한 "압축형" 모델이나 순수한 "축자적" 모델이 아무리 규모를 키워도 해결할 수 없는 문제들을 해결할 수 있음을 보여주었습니다.

실험 결과가 보여준 것

연구진은 단순히 추측한 것이 아니라, 자신의 이론이 성립하는지 확인하기 위해 소규모 모델을 대상으로 사전 등록된 테스트(결과를 보기 전에 규칙을 미리 작성하는 방식)를 수행했습니다.

  • 가위 차이(Scissors Gap): 저자들은 "가위 차이"라고 부르는 극적인 차이를 발견했습니다. 순수한 "압축형" 모델을 128개의 숨겨진 사실이 포함된 작업에 테스트했을 때, 모델은 거의 완전히 실패했습니다(오차율 99.4%). 그러나 동일한 모델에 "축자적" 인덱스 레이어를 단 하나만 추가했을 때, 오차율은 거의 0.000%로 떨어졌습니다. 이는 문제를 해결하는 능력이 모델이 더 "똑똑해지거나" "커지는" 것에 관한 것이 아니라, 올바른 **접근 구조(access structure)**를 갖추고 있는지에 관한 것임을 입증했습니다.
  • 훈련 신뢰성: 또한 순수한 모델이 훈련 중에 운이 아주 좋다면 이론적으로는 어려운 퍼즐을 풀 수도 있겠지만, 하이브리드 모델은 매번 확실하게 문제를 해결한다는 것을 발견했습니다. 이는 정답을 맞힐 때까지 찍어서 통과하는 학생과, 실제로 내용을 알고 있는 학생의 차이와 같습니다.
  • 산업계의 추세: 논문은 2023년에서 2026년 사이에 출시된 실제 AI 모델들도 살펴보았습니다. 연구진은 산업계가 자연스럽게 이 하이브리드 설계로 향하고 있음을 발견했습니다. 대부분의 최상위 모델은 이제 효율성을 위한 작은 "상태(state)"와 정확성을 위한 더 큰 "인덱스(index)"를 혼합하여 사용하는 두 가지 접근 방식을 모두 사용하고 있습니다.

이것이 의미하는 바 (그리고 의미하지 않는 것)

이 논문은 자신들의 주장에 대해 매우 신중합니다. 이 논문은 하이브리드 모델이 완벽하다거나 모든 문제를 해결할 수 있다고 말하는 것이 아닙니다. 저자들은 "더 큰 것이 더 낫다"라는 아이디어 자체를 명시적으로 부정합니다. 즉, 적절한 접근 구조가 없다면 순수한 모델은 아무리 거대하더라도 여전히 벽에 부딪힐 것입니다.

또한 저자들은 "뉴턴의 사과" 테스트가 최악의 시나리오임을 인정합니다. 실제 자연어는 그들이 시뮬레이션한 무한한 강물만큼 무질서하지 않을 수 있습니다. 그러나 핵심적인 발견은 견고합니다: 역량은 공짜가 아닙니다. 단순히 더 많은 컴퓨팅 파워를 단일 유형의 모델에 쏟아붓는다고 해서 더 나은 문제 해결 능력을 살 수는 없습니다. 대신, 압축된 메모리(방향을 위한)와 상세한 인덱스(검색을 위한)를 모두 갖춘 시스템을 구축함으로써 복잡하고 장기적인 문제를 해결할 수 있는 능력을 "구매"해야 합니다.

요약하자면, 이 논문은 AI의 미래가 단순히 모델을 더 크게 만드는 것이 아니라, 올로바른 **이중 채널 구조(two-channel architecture)**를 갖추도록 만드는 것에 있다고 제안합니다. "아이디어"는 모델이 앞으로 나아가게 하고, "그림자"는 모델이 성공에 필요한 구체적인 사실들을 결코 놓치지 않도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →