← 최신 논문
🤖 machine learning

Three Tokens Force Exponential Feature Rank in Nonnegative Kernel Attention

이 논문은 비음수 커널 어텐션(nonnegative kernel attention)이 풀 어텐션(full attention)이나 밀집 소프트맥스(dense softmax)는 효율적으로 처리할 수 있는 특정 3-토큰 불리언 태스크를 해결하기 위해 지수적인 수의 특징량을 필요로 한다는 점을 입증함으로써, 커널 기반 메커니즘과 풀 어텐션 메커니즘 사이의 근본적인 표현력 격차를 확립한다.

원저자: Vicente Opazo

게시일 2026-08-13
📖 5 분 읽기🧠 심층 분석

원저자: Vicente Opazo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 토큰의 대결: 왜 "짧고 간결함"만으로는 항상 충분하지 않은가

당신이 붐비는 방 안에서 완벽한 짝을 찾으려 노력하고 있다고 상상해 보세요. 인공지능의 세계, 특히 머신러닝이라는 분야에서 컴퓨터는 항상 이 작업을 수행합니다. 컴퓨터는 문장 속의 단어나 이미지 속의 픽셀과 같은 아이템 목록을 보고, 어떤 것들이 서로 가장 잘 어울리는지 파악하려고 노력합니다. 이 과정을 흔히 "어텐션(attention, 주의 집중)"이라고 부릅니다.

컴퓨터가 이를 수행하는 두 가지 주요 방법이 있습니다. 첫 번째 방법은 매우 사교적인 호스트가 방 안의 모든 사람에게 다가가 한 명 한 명과 악수를 하며 비교하는 것과 같습니다. 이를 "풀 어텐션(full attention)"이라고 합니다. 철저하지만, 방이 거대해지면 매우 느려지고 비용이 많이 듭니다. 두 번째 방법은 호스트가 방 전체의 빠르고 압축된 요약본, 즉 "스케치(sketch)"를 만든 다음, 그 요약본을 사용하여 누가 서로 매치되는지 추측하는 방식입니다. 이를 "커널 어텐션(kernel attention)" 또는 "리니어 어텐션(linear attention)"이라고 합니다. 이는 훨씬 빠르며 책 한 권이나 긴 비디오와 같은 방대한 양의 데이터를 처리하도록 설계되었습니다.

오랫동안 과학자들은 이 "스케치" 방식이 "풀(full)" 방식보다 약간 덜 정확할 뿐이며, 스케치를 충분히 크게 만들기만 하면 잘 작동할 것이라고 가정해 왔습니다. 큰 의문은 이것이었습니다: 만약 스케치가 아무리 똑똑하게 만들어지더라도, 도저히 해낼 수 없는 지점이 존재할 것인가? 이 논문은 거대하고 무질서한 실제 데이터를 보는 대신, 아주 작고 구체적인 퍼즐을 설정하여 스케치가 정확히 어디에서 무너지는지를 탐구함으로써 이 질문에 파고듭니다.


세 개의 토큰 함정

이 논문의 저자인 비센테 오파조(Vicente Opazo)는 Min-IP(최소 내적, Minimum Inner Product)라는 게임을 사용하여 이러한 "스케치" 모델의 한계를 테스트하기로 했습니다. 당신이 0과 1로 이루어진 비밀 코드 목록을 가지고 있다고 상상해 보세요. 리스트에 있는 모든 코드에 대해, 당신은 해당 코드와 겹치는 부분이 가장 적은(최소인) 다른 코드를 찾아내야 합니다. 이는 방 안에서 공통점이 가장 적은 두 사람을 찾는 것과 같습니다.

연구진은 두 종류의 AI 모델 간의 경주를 설정했습니다:

  1. 풀 어텐션 모델 (The Full Attention Model): 이 모델은 모든 코드 쌍을 직접 살펴봅니다. 이는 모든 비교에 대해 돋보기를 사용하는 것과 같습니다.
  2. 커널 어텐션 모델 (The Kernel Attention Model): 이 모델은 모든 코드를 고정된 크기의 "스케치"(요약본)로 압축한 다음, 그 요약본을 바탕으로 수학적 계산을 수행하여 퍼즐을 풀려고 시 합니다.

논문은 다음과 같은 간단한 질문을 던집니다: 리스트에 코드가 몇 개 있을 때 스케치 모델이 실패하는가?

마법의 숫자는 3이다

이 논문에서 발견한 가장 놀라운 사실은 스케치 모델이 리스트가 거대해질 때 실패하는 것이 아니라, 거의 즉시 실패한다는 것입니다.

  • 길이 1과 2: 리스트에 하나 또는 두 개의 코드만 있다면 스케치 모델은 완벽합니다. 아주 작은 요약(단 하나의 "특징")만으로도 퍼즐을 정확하게 풀 수 있습니다. 이는 단 두 명만 있는 방에서 최고의 짝을 찾는 것과 같으며, 매우 쉽습니다.
  • 길이 3: 리스트에 세 번째 코드가 추가되는 순간, 스케치 모델은 벽에 부딪힙니다. 논문은 단 세 개의 코드로 구성된 리스트에 대해 퍼즐을 올바르게 풀기 위해서, 스케치 모델이 코드의 크기에 따라 기하급수적으로 증가하는 수의 특징(features)을 필요로 한다는 것을 증명합니다.

이를 체감할 수 있도록 설명하자면: 만약 당신의 코드가 100비트 길이라면, 스케치 모델은 이를 제대로 맞추기 위해 수십억 개의 특징이 필요할 수도 있습니다. 만약 200비트라면, 그것은 실질적으로 불가능할 정도로 거대한 숫자가 필요합니다. 반면, "풀 어텐션" 모델(개별적으로 확인하는 모델)은 동일한 세 개의 코드 퍼즐을 아주 적은 양의 일정한 노력만으로 쉽게 해결합니다.

왜 이런 일이 발생하는가?

저자는 이를 "도미노 효과" 또는 "증폭"의 비유를 들어 설명합니다.

스케치 모델이 후보 A와 후보 B 사이에서 결정하려고 한다고 가정해 봅시다.

  • 리스트에 두 사람만 있다면, 모델은 단순히 A와 B를 비교합니다. 쉽습니다.
  • 리스트에 세 사람(A, B, C)이 있다면, 모델은 A를 B와 비교해야 하고, 동시에 A를 C와도 비교해야 합니다.

논문은 모델이 모든 것을 하나의 요약본으로 압축하도록 강제되기 때문에, "매우 다른 것"과 "약간 다른 것" 사이의 날카로운 구별 능력을 상실한다는 것을 보여줍니다. 두 명의 경쟁 후보가 있으면 모델의 요약본은 혼란에 빠집니다. 이 혼란을 해결하기 위해 모델은 요약본을 믿을 수 없을 정도로 상세하게 만들어야 하며, 이는 결국 요약본이 아니라 모든 가능성을 나열한 리스트가 되어버리는 결과를 초래합니다.

저자는 수학적으로 세 개의 항목이 있는 리스트에 대해 필요한 특징의 수가 대략 2m2^m (여기서 mm은 코드의 길이)임을 증명했습니다. 이는 기하급급적인 폭발입니다. 이는 문을 여는 데 단 하나의 열쇠가 필요한 것과, 우주의 모든 원자의 조합에 대응하는 열쇠가 필요한 것의 차이와 같습니다.

"부호가 있는" 커널이나 "멀티 헤드"는 어떤가?

이 논문은 자신이 무엇을 증명하지 않았는지 매우 신중하게 밝힙고 있습니다. 이 논문은 "비음수(nonnegative)" 커널(수학적으로 더하기만 수행하고 빼기는 하지 않는 방식)과 단일 "헤드"(하나의 추론 경로)에 초점을 맞춥니다.

  • "부호가 있는(Signed)" 루프홀: 만로 모델이 숫자를 뺄 수 있다면(음수 특징을 사용한다면), 이 시스템을 우회할 수 있을지도 모릅니다. 논문은 "이 접근 방식이 뺄셈 기반 모델에서도 작동하는지는 알 수 없으나, 덧셈 전용 모델의 경우 벽은 실재한다"라고 말합니다.
  • "멀티 헤드(Multiple Heads)" 루프홀: 만약 모델에게 여러 개의 "헤드"(데이터를 바라보는 다양한 관점)를 부여한다면, 그것들이 협력하여 퍼즐을 풀 수도 있습니다. 논문은 이를 인정하면서도, 그들이 전달해야 하는 정보의 총량이 엄청나게 증가한다는 점을 보여줍니다.

증명과 실험

저자는 단순히 추측한 것이 아니라, 이를 수학적으로 증명했습니다. 어떤 모델이 이 특정 세 토큰 퍼즐을 50% 미만의 오차율로 해결하려고 할 때, 특징의 수는 반드시 기하급수적이어야 함을 보여주었습니다.

또한, 이를 뒷받침하기 위해 컴퓨터 시뮬레이션을 실행했습니다. 연구진은 세 개의 코드가 담긴 리스트로 AI 모델을 훈련시키고, "특징 랭크(feature rank)"(요약의 크기)를 높임에 따라 어떤 일이 발생하는지 관찰했습니다.

  • 랭크 1에서 15까지: 모델들은 처참하게 실패하며 큰 실수를 저질렀습니다.
  • 랭크 32: 갑자기 모델들이 정답을 맞히기 시작했습니다.
    이 실험은 이론을 확인시켜 주었습니다: 모델이 기하급수적 임계값을 넘을 수 있는 충분한 특징을 갖게 되는 순간, 급격한 "상전이(phase transition)"가 일어납니다.

시사점

여기서 얻는 주요 교훈은 속도에는 대가가 따르며, 그 대가는 우리가 생각했던 것보다 훨씬 빨리 나타난다는 것입니다.

우리는 종-종 선형 어텐션(빠른 스케치 기반 방식)이 처리해야 할 토큰의 이 너무 많을 때만 문제가 될 것이라고 생각합니다. 하지만 이 논문은 문제가 데이터의 이 아니라, 선택의 복잡성에 있다는 것을 보여줍니다. AI가 몇 가지 특정 항목 사이에서 정밀하고 날카로운 비교를 수행해야 하는 상황(세 개의 항목이 있는 리스트)에 놓이는 즉시, "스케치" 방식은 무너집니다. 이때 엄청난 양의 메모리를 제공하지 않는 한 말입니다.

현실 세계에서 이는 빠른 어텐션 모델이 긴 문서를 요약하는 데는 훌륭할 수 있지만, 몇 가지 특정 항목 간의 정밀하고 날카로운 비교를 요구하는 작업에서는 어려움을 겪을 수 있음을 시사합니다. 느리긴 하지만 "풀 어텐션" 모델은 불가능한 수준의 컴퓨팅 파워를 요구하지 않고도 이러한 날카로운 선택을 처리할 수 있는 유일한 방법입니다. 논문은 빠른 모델과 정확한 모델 사이의 "기하급급적 격차"가 단순히 쉽게 고칠 수 있는 버그가 아니라, 이러한 특정 유형의 AI가 작동하는 근본적인 법칙이라고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →