← 최신 논문
💬 NLP

You Need Better Attention Priors

이 논문은 표준 어텐션의 암묵적인 균등 사전 확률(uniform prior)을 엔트로피 최적 운송(Entropic Optimal Transport)을 통한 학습 가능한 연속 사전 확률로 대체함으로써, 어텐션 싱크(attention sinks) 문제를 해결하고 FlashAttention과 같은 최적화된 커널과의 호환성을 유지하면서도 길이 일반화가 가능한 공간 인코딩을 가능하게 하는 새로운 어텐션 메커니즘인 GOAT를 소개한다.

원저자: Elon Litman, Gabe Guo

게시일 2026-08-25
📖 6 분 읽기🧠 심층 분석

원저자: Elon Litman, Gabe Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 광활한 풍경 속에서, 트랜스포머(Transformer)라고 알려진 특정 유형의 컴퓨터 프로그램은 현존하는 가장 유능한 언어 및 이미지 시스템들의 엔진이 되었습니다. 이러한 시스템의 핵심에는 셀프 어텐션(self-attention)이라 불리는 메커니즘이 자리 잡고 있는데, 이는 소프트웨어가 주어진 순간에 문장이나 이미지의 어느 부분에 가장 집중해야 할지를 결정할 수 있게 해줍니다. 독자가 긴 문서를 훑어보는 모습을 상상해 보십시오. 셀프 어텐션은 그들이 아무리 많은 단어가 사이에 끼어 있더라도, "그것(it)"과 같은 대명사를 그것이 가리키는 특정 명사로 즉각 연결하거나, 동사를 그 주어와 연결할 수 있게 해주는 정신적 과정입니다. 수년 동안 엔지니어들은 이 집중 과정을 안내하기 위해 다소 경직된 표준 규칙 세트에 의존해 왔습니다. 이 규칙들은 많은 상황에서 잘 작동하지만, 텍스트가 매우 길어지거나 시스템이 한 번도 본 적 없는 패턴을 마주할 때 어려움을 겪으며, 종종 혼란을 야기하거나 가장 중요한 정보에 대한 집중력을 잃게 만듭니다.

스탠퍼드 대학교의 연구진은 이 집중 메커니즘이 작동하는 방식에 근본적인 변화를 제안했습니다. 그들은 표준 규칙들이, 컴퓨터가 내용을 보기 전까지 모든 가능한 단어나 이미지 패치를 중요할 가능성이 동일하다고 간주해야 한다는 숨겨진 가정을 바탕으로 하고 있다고 지적합니다. 연구진은 이것이 지나치게 단순한 출발점이라고 주장합니다. 대신, 그들은 GOAT라고 불리는 새로운 방법을 개발하여, 시스템이 어디를 바라볼지에 대한 자신만의 기대치를 학습할 수 있도록 했습니다. 컴퓨터에게 백지 상태에서 시작하도록 강요하는 대신, GOAT는 시스템이 실제 단어의 의미와 상관없이 문장의 맨 앞부분에 주의를 기울이거나 최근의 단어들에 주목하는 것과 같은 특정한 구조적 습관을 발견하고 채택할 수 있게 합니다.

이 발견의 핵심은 어텐션을 단순히 유사성을 계산하는 것이 아니라, 일련의 항목들에 걸쳐 집중을 분배하는 과정으로 재구상하는 데 있습니다. 표준적인 접근 방식에서는 시스템이 내용이 강력하게 암시하지 않는 한, 주의력을 최대한 고르게 분산시키려고 노력합니다. 연구진은 이 "고른 분산" 가정이 내용이 모호하거나 시퀀스가 극도로 길어질 때 시스템을 실패하게 만드는 원인임을 발견했습니다. 이 균일한 가정을 유연하고 학습 가능한 가이드로 대체함으로써, 새로운 방법은 정보가 희소한 상황에서도 시스템이 안정적인 집중력을 유지할 수 있게 합니다. 이는 특히 "어텐션 싱크(attention sinks)"라고 알려진 현상, 즉 모델이 긴 대화 중에 특정 토큰(종종 첫 번째 토큰)에 과도하게 많은 주의를 쏟아붓는 현상과 관련이 깊습니다. 이는 시스템이 집중할 곳을 찾지 못할 때 발생하는 현상입니다. 새로운 접근 방식은 이러한 동작을 단순한 결함이 아니라, 시스템이 명확한 신호가 없을 때 주의력을 어떻게 분배하는지에 대한 논리적 결과로 설명하며, 이를 의도적으로 제어할 수 있는 방법을 제공합니다.

아이디어를 테스트하기 위해 연구진은 어텐션의 구조적 규칙을 실제 단어의 의미와 분리하는 시스템을 구축했습니다. 기존 방식에서는 어디를 바라봐야 하는지에 대한 규칙이 단어의 의미와 뒤섞여 있어, 시스템이 새로운 길이 혹은 맥락으로 일반화하는 데 어려움이 있었습니다. 새로운 방법은 이 두 가지를 별개로 유지합니다. 이는 학습 과정에서 조정될 수 있는 연속적인 기대치 지도를 학습합니다. 이 지도는 현재 단어 바로 앞에 있는 단어를 선호하거나 시퀀스의 시작 부분에 편향을 갖는 것과 같은 복잡한 패턴을 포착할 수 있으면서도, 단어 자체의 의미를 왜곡하지 않습니다. 연구진은 이 시스템이 현재의 대규모 언어 모델을 구동하는 것과 동일한 고속 컴퓨터 칩을 사용하여 효율적으로 구현될 수 있으며, 추가적인 메모리나 처리 능력을 요구하지 않는다는 것을 입증했습니다.

실험 결과는 놀라웠습니다. 연구진이 방대한 양의 텍-스트로 모델을 학습시켰을 때, 새로운 방법은 긴 시퀀스를 이해하는 데 있어 기존 기술보다 더 나은 성능을 보였습니다. 모델이 긴 맥락 속에 숨겨진 특정 정보를 찾아내도록 요청받는 테스트(흔히 "건더미 속의 바늘 찾기"라고 불리는 작업)에서, 새 시스템은 학습 시 보았던 것보다 몇 배나 긴 맥락에서도 거의 완벽한 정확도를 유지했습니다. 반면, 위치를 처리하기 위해 고정된 규칙에 의존하는 다른 인기 있는 방법들은 텍스트가 길어짐에 따라 성능이 급격히 저하되었습니다. 새 시스템은 또한 DNA와 같은 생물학적 시퀀스를 모델링하고, 이미지를 처리하는 데 있어서도 우수한 성능을 보여주었으며, 명시적으로 배우지 않고도 2차원 공간 관계를 처리하는 법을 학습했습니다.

가장 중요한 발견 중 하나는 시스템이 "어텐션 싱크" 문제를 어떻게 처리했는가 하는 점이었습니다. 표준 모델에서 첫 번째 토큰에 과도하게 집중하는 경향은 모델이 데이터를 이해하려고 노력하는 과정에서 발생하는 부작 l이며, 이는 때때로 새로운 정보를 처리하는 능력을 방해할 수 있습니다. 연구진은 첫 번째 토큰에 대한 기본 집중을 하나의 구조적 규칙으로서 명시적으로 가르침으로써, 오히려 안정성을 높일 수 있다는 것을 보여주었습니다. 이를 통해 모델은 나머지 텍스트가 불분명할 때 첫 번째 토큰을 신뢰할 수 있는 닻(anchor)으로 사용할 수 있게 되었으며, 다른 단어들의 표현을 손상시키지 않고도 이를 활용할 수 있었습니다. 이러한 구조와 의미의 분리는 시스템이 이전보다 훨씬 더 유연하게 새로운 길이와 맥락에 적응할 수 있게 했습니다.

연구진은 또한 입력 데이터가 예상치 못한 방식으로 변할 때 이 새로운 방법이 어떻게 작동하는지 탐구했습니다. 한 실험에서 연구진은 짧은 시퀀스로 모델을 학습시킨 후, 그보다 16배 더 긴 시퀀스로 테스트했습니다. 다른 방법들이 성능 저하를 크게 겪은 반면, 새 시스템은 높은 정확도를 유지하며 계속 작동했습니다. 이는 시스템이 학습 데이터의 범위를 훨씬 넘어서는 상황에도 적용될 수 있는 견고한 정보 조직 규칙을 학습했음을 시사합니다. 이처럼 효과적으로 일반화할 수 있는 능력은, 현실 세계의 가변적인 길이의 의사소통을 처리할 수 있는 인공지능을 구축하는 데 있어 중요한 단계입니다.

컴퓨터 비전 영역에서도 이 방법은 똑같이 다재다능함을 입증했습니다. 이미지 인식 작업에 적용되었을 때, 시스템은 이미지의 서로 다른 부분들 사이의 공간적 관계를 이해하는 법을 배웠습니다. 시스템은 인간이 자연스럽게 시각적 장면을 스캔하는 방식과 유사하게, 주변의 이미지 패치들을 바라보는 선호도를 발달시켰습니다. 이를 통해 시스템은 학습 시 보지 못했던 해상도의 이미지가 제시되더라도 사물과 장면을 인식할 수 있었는데, 이는 광범위한 재학습 없이 달성하기 어려운 능력입니다. 연구진은 시스템이 이러한 공간적 편향을 자발적으로 발견했다는 것을 확인했으며, 이는 이 접근 방식이 텍스트에 국한되지 않고 순차적이거나 공간적인 구조를 가진 모든 데이터에 적용될 수 있음을 확증합니다.

이 연구는 또한 대규모 언어 모델에서 왜 특정 행동들이 나타나는지에 대한 더 명확한 이론적 이해를 제공했습니다. 어텐션을 내용과 학습된 기대치의 균형을 맞추는 과정으로 정의함으로써, 연구진은 모델이 왜 때때로 긴 맥락을 다루는 데 어려움을 겪는지, 그리고 이를 어떻게 해결할 수 있는지를 설명할 수 있었습니다. 그들은 이러한 시스템에서 나타나는 불안정성이 아키텍처 자체의 결함이 아니라, 고정되고 정보가 없는 시작점을 사용하기 때문에 발생하는 결과임을 보여주었습니다. 시스템이 스스로의 시작점을 학습할 수 있게 함으로써, 연구진은 더 안정적이고 신뢰할 수 있는 기반을 만들었습니다.

이 연구는 인공지능의 모든 문제를 해결했다고 주장하는 것은 아니지만, 더 견고한 시스템을 구축하기 위한 강력한 새로운 도구를 제공합니다. 이 방법은 현재 최첨단 모델들에 사용되는 어텐션 메커니즘을 직접 대체할 수 있도록 설계되어, 최소한의 변경만으로 기존 소프트웨어에 통합될 수 있습니다. 저자들은 자신의 코드를 공개하여 다른 연구자들이 그들의 발견을 테스트하고 발전시킬 수 있도록 했습니다. 모델이 더 긴 맥락과 더 복잡한 작업을 처리할 수 있는 방향으로 발전함에 따라, 어텐션이 어떻게 분배되는지를 제어하고 이해하는 능력은 필수적인 요건이 될 것입니다. 새로운 접근 방식은 이전보다 더 큰 유연성과 정밀도로 이를 수행할 수 있는 방법을 제공하며, 더 똑똑할 뿐만 아니라 더 안정적이고 신뢰할 수 있는 추론을 하는 시스템을 향한 길을 열어주고 있습니다.

이 작업의 함의는 단순히 모델의 읽기나 보기 능력을 개선하는 데 그치지 않습니다. 이는 기계가 정보를 조직하는 법을 배우는 방식에 대한 새로운 관점을 제시합니다. 어텐션의 규칙을 엔지니어가 하드코딩해야 하는 것이 아니라 학습하고 정교화할 수 있는 것으로 취급함으로써, 연구진은 특정 작업의 요구 사항에 맞춰 자신의 내부 구조를 적응시킬 수 있는 시스템의 문을 열었습니다. 경직된 규칙에서 유연한 학습으로의 이러한 전환은 인공지능 발전의 중요한 진전이며, 우리가 현실 세계의 복잡성을 인간과 같은 쉬움으로 헤쳐 나갈 수 있는 시스템에 더 가까워지게 합니다. 이 발견은 더 유능한 기계를 만드는 열쇠가 모델을 더 크게 만드는 것이 아니라, 그들에게 더 나은 집중 방법을 부여하는 데 있을지도 모른다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →