← 최신 논문
🤖 machine learning

The Entropic Bound for Transformers: Why Static Rank Fails and Attention-Native Rank Recovers

본 논문은 정적 랭크 제약이 어텐션의 입력 조건부 특성으로 인해 트랜스포머의 본질적 용량을 포착하는 데 실패하는 반면, 쿼리-키 커널에 기반한 어텐션 네이티브 본질적 랭크는 선형 및 소프트맥스 어텐션 메커니즘 모두에 대해 엔트로피 경계(Entropic Bound)의 결핍성, 달성 가능성 및 경사 하강법 회복 원칙을 성공적으로 복구한다는 점을 입증한다.

원저자: Byeong Hoon Yoon

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Byeong Hoon Yoon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 스도쿠나 수수께끼 같은 특정 퍼즐을 풀 수 있는 로봇을 만들려고 한다고 상상해 보십시오. 수십 년 동안 과학자들은 간단한 규칙을 알고 있었습니다. 로봇을 더 크게 만들고, 더 많은 데이터를 주고, 더 오래 생각하게 하면 로봇이 퍼즐을 더 잘 풀게 된다는 것입니다. 이것이 바로 '스케일링 법칙(scaling law)'입니다. 하지만 퍼즐 자체에 빠진 조각이 하나 있습니다. 우리는 로봇을 어떻게 더 좋게 만들지는 알지만, 퍼즐을 풀기 위해 필요한 '최소한의 크기'가 얼마인지는 모릅니다. 이는 마치 더 큰 양동이가 더 많은 물을 담을 수 있다는 것은 알지만, 물 한 컵을 새지 않고 담을 수 있는 가장 작은 양동이의 크기가 얼마인지는 모르는 것과 같습니다. 이 질문은 매우 중요한데, 왜냐하면 이는 어떤 주어진 과업에 대한 지능의 근본적인 '비용'을 알려주기 때문입니다. 이 질문에 답하기 위해 연구자들은 모델의 '랭크(rank)'를 살펴봅니다. 랭크는 모델이 정보를 처리하거나 혼합할 수 있는 독립적인 방식의 수를 측정하는 세련된 방법입니다. 랭크를 모델이 가진 고유한 '도구'나 '차선(lane)'의 수라고 생각해 보십시오. 만약 어떤 과업이 다섯 개의 구별된 사고 차선을 필요로 한다면, 단 세 개의 차선만 가진 로봇은 아무리 노력해도 필연적으로 실패할 것입니다.

이 논문은 현대의 챗봇과 이미지 생성기를 구동하는 AI 유형인 트랜스포머(Transformer)의 두뇌를 깊이 파고듭니다. 저자들은 이 모델들의 '최소 양동이 크기'를 찾고자 했습니다. 그들은 먼저 단순화되고 수학적으로 깔끔한 버전의 트랜스포머(이를 '선형 대리 모델'이라 부릅니다)로 시작하여, 아름답고 정교한 규칙을 증명했습니다. 즉, 과업을 해결하기 위해 필요한 최소한의 사고 차선(이를 '내재적 랭크'라 부릅니다)의 수가 정해져 있다는 것입니다. 만약 차선이 그보다 적다면 높은 오류율에 직면하게 됩니다. 만약 정확히 그만큼의 차선을 가지고 있다면 완벽한 한계치에 도달합니다. 그리고 모델에게 필요한 것보다 더 많은 차선을 주면, 모델은 자연스럽게 딱 적절한 양만큼만 사용하고 나머지는 무시합니다. 이것은 완벽하고 예측 가능한 세계였습니다.

하지만 연구자들은 이 완벽한 규칙을 실제 세상에서 작동하는 '진짜' 트랜스포머에 적용해 보았습니다. 그들은 규칙이 유지되기를 기대했지만, 규칙은 깨졌습니다. 모델은 충분한 '차선'을 가지고 있음에도 불구하고 과업을 해결하지 못했습니다. 큰 의문은 이것이었습니다. 왜일까요? '소프트맥스(softmax)' 함수(원시 점수를 확률로 변환하는 수학적 단계, 즉 누가 이길지 결정하는 심판과 같은 역할)가 범인이라는 자연스러운 추측이 가능했습니다. 그러나 저자들은 마치 한 번에 하나의 단서를 테스트하는 탐정처럼 영리한 일련의 실험을 수행했습니다. 그들은 진짜 범인이 심판(소프트맥스)이 아니라, 모델의 '사고 차선'이 보고 있는 특정 퍼즐에 따라 변한다는 사실임을 발견했습니다. 단순화된 버전에서는 차선이 고정되어 있었지만, 실제 버전에서는 입력값에 따라 차선이 움직이고 뒤틀립니다. 차선이 움직이는 표적이기 때문에, 단순히 도구 상자에 있는 정적인 도구의 개수만 세어서는 로봇이 일을 해낼 수 있을지 알 수 없습니다.

이를 해결하기 위해 저자들은 로봇의 용량을 측정하는 새로운 방법인 '어텐션 네이티브 내재적 랭크(attention-native intrinsic rank)'를 발명했습니다. 정적인 도구의 수를 세는 대신, 그들은 로봇이 '실제로 작업을 수행하는 동안' 필요한 최소한의 차선을 측정했습니다. 이 새로운 동적인 측정법을 사용하자, 완벽한 규칙이 다시 돌아왔습니다! 모델은 다시 예측 가능해졌습니다. 차선이 너무 적으면 실패했고, 적절한 수의 차선이 있으면 완 perfection(완벽)에 도달했으며, 여분의 차선은 자연스럽게 무시되었습니다. 또한, 단순화된 모델의 경우 로봇이 훈련을 시작하기도 전에 퍼즐 데이터를 보는 것만으로도 필요한 차선의 수를 정확히 예측할 수 있다는 것을 발견했습니다. 복잡한 실제 모델의 경우, 움직이는 차선들 때문에 수학적으로 복잡해져서 이 예측이 부분적으로만 가능하지만, 핵심 아이디어는 유효합니다.

요약하자면, 이 논문은 AI의 용량을 측정하는 기존 방식이 카멜레온이 잠들어 있을 때의 색깔을 측정하려는 것과 같다고 보여줍니다. 카멜레온이 깨어 있고 변화하고 있을 때 측정해야 합니다. 이처럼 변화하는 성질을 고려하여 '사고 차선'을 세는 방식을 재정의함으로써, 저자들은 트랜스포머가 특정 문제를 해결하기 위해 얼마나 많은 뇌력이 필요한지를 알려주는 정밀한 수학적 법칙을 회복했습니다. 이는 단순히 일부 모델이 왜 실패하는지를 설명하는 데 그치지 않고, 우리가 모델을 만들기 전부터 AI의 근본적인 한계를 측정할 수 있는 새로운 자를 제공하며, 지능의 진정한 비용이 무엇인지 이해하도록 돕습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →