← 최신 논문
💬 NLP

Bayesian Attention Mechanism: A Probabilistic Framework for Positional Encoding and Context Length Extrapolation

본 논문은 기존 위치 인코딩 방법을 통합하고 최첨단 장문맥 일반화를 달성하기 위해 일반화된 가우시안 사전 분포를 제안하는 확률적 프레임워크인 베이지안 어텐션 메커니즘 (BAM) 을 소개하며, 이를 통해 최소한의 파라미터 오버헤드로 훈련 컨텍스트 길이의 500 배에 달하는 거리에서도 정확한 정보 검색이 가능해집니다.

원저자: Arthur S. Bianchessi, Yasmin C. Aguirre, Rodrigo C. Barros, Lucas S. Kupssinskü

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arthur S. Bianchessi, Yasmin C. Aguirre, Rodrigo C. Barros, Lucas S. Kupssinskü

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 AI 챗봇의 두뇌인 트랜스포머 언어 모델을 거대한 책을 읽으려 노력하는 초지능 사서로 상상해 보세요. 이 사서는 단어의 의미를 이해하는 데 탁월하지만, 이상한 문제가 하나 있습니다: 순서에 대한 감각이 전혀 없습니다. "The cat sat on the mat(고양이가 매트 위에 앉았다)"라는 문장을 건네면, 단어들이 어디에 있든 동일하게 보이기 때문에 'cat'이 'sat'보다 앞서 왔는지 아니면 뒤에 왔는지 구분할 수 없습니다.

이를 해결하기 위해 우리는 보통 이 사서에게 **위치 인코딩 (Positional Encoding, PE)**을 제공합니다. 이는 마치 "나는 1 번째 단어입니다", "나는 2 번째 단어입니다"라고 적힌 작고 보이지 않는 이름표나 각 단어에 붙은 컬러 스티커와 같습니다. 이를 통해 사서는 이야기의 흐름을 이해할 수 있게 됩니다.

그러나 이러한 "스티커 시스템" 대부분은 결함이 있습니다: 짧은 이야기에는 훌륭하게 작동하지만, 책이 매우 길어지면 (예: 10 만 페이지 분량의 소설) 무너져 버립니다. 사서는 스티커가 너무 혼란스러워지거나 사라져 버리기 때문에 책의 앞부분을 무시하기 시작합니다.

새로운 아이디어: "베이지안 어텐션 메커니즘 (BAM)"

이 논문의 저자들은 이러한 스티커를 바라보는 새로운 방식을 제안하며, 이를 BAM이라고 부릅니다. BAM 은 단순히 단어에 고정된 스티커를 붙이는 대신, 단어의 위치를 확률적 추측으로 다룹니다.

다음은 비유입니다:
사서가 긴 문서 어딘가에 숨겨진 특정 정보 (비밀번호) 를 찾으려 한다고 상상해 보세요.

  • 기존 방법 (ALiBi 등): 사서는 답이 현재 단어의 가장 가까운 곳에 있을 가능성이 높다고 가정하며, 멀어질수록 답이 있을 확률은 낮아진다고 봅니다. 마치 집에서 분실된 열쇠를 찾는 것과 같습니다; 먼저 주머니를 확인하고, 다음으로 탁자를 확인한 뒤, 너무 멀다는 이유로 차고에서는 찾기를 멈춥니다.
  • BAM 방법: 사서는 답이 어디에 있을지에 대한 "사전 믿음 (확률 지도)"을 사용합니다. 이 지도는 고정된 것이 아니라 조정 가능한 유연한 규칙입니다.

비밀 재료: "일반화된 가우시안 (Generalized Gaussian)" 지도

이 논문은 **일반화된 가우시안 사전 (Generalized Gaussian Prior)**이라고 불리는 특정 유형의 확률 지도를 소개합니다. 이 지도는 사서가 특정 단어를 볼 확률을 나타내는 언덕과 계곡으로 이루어진 지형과 같습니다.

  1. "지역" 언덕: 이 지도는 현재 단어 바로 옆에 가파른 언덕을 가질 수 있습니다. 이는 문법과 문장 구조와 같은 즉각적인 문맥을 이해하는 데 도움을 줍니다.
  2. "장거리" 꼬리: 여기가 마법과 같은 부분입니다. 저자들은 특정 조절 장치 ( β\beta라고 함) 를 조정함으로써 지도의 모양을 바꿀 수 있음을 발견했습니다.
    • 조절 장치를 한쪽으로 돌리면, 사서는 책의 먼 부분을 무시합니다 (기존 방법과 동일).
    • 조절 장치를 다른 쪽으로 돌리면 (특히 음수로 설정), 사서는 즉각적인 이웃을 무시하고 매우 먼 거리에 있는 단어에 집중하기 시작합니다.

실제로 무엇을 달성했나요?

이 논문은 이것이 질병을 치료하거나 당신을 위해 소설을 써 줄 것이라고 주장하지는 않습니다. 그들은 매우 구체적이고 통제된 작업에서 이를 테스트했습니다:

  • "건초더미 속의 바늘" 테스트: 그들은 수천 단어로 이루어진 텍스트 깊숙한 곳에 특정 5 자리 숫자 (비밀번호) 를 숨겼습니다.
    • 결과: 텍스트가 너무 길어지면 다른 방법들 (RoPE 나 ALiBi 등) 은 포기하고 무작위로 추측하는 반면, BAM 모델은 모델이 훈련된 길이보다 500 배 더 긴 텍스트에서도 숫자를 완벽하게 찾아낼 수 있었습니다.
  • "Perplexity(혼란도)" 테스트: 이는 모델이 문장에서 다음 단어를 얼마나 잘 예측하는지 측정합니다.
    • 결과: BAM 은 기존 최상의 방법만큼 단어 예측 능력이 뛰어났으며, 이는 장거리 초능력을 얻기 위해 일반적인 언어 능력을 희생하지 않았음을 의미합니다.

"보이지 않는" 비용

이 발견의 가장 멋진 점 중 하나는 추가 비용이 얼마나 저렴한지입니다.

  • 그들은 이미 1 억 2 천만 개의 매개변수를 가진 모델에 **1,000 개 미만의 새로운 매개변수 (작은 메모리 조각)**만 추가했습니다.
  • 이는 해변에 모래알 하나를 추가하는 것과 같지만, 갑자기 그 해변 전체가 지평선을 볼 수 있게 됩니다.
  • 모델의 속도가 느려지거나 더 많은 컴퓨터 전력을 사용하지도 않았습니다.

쉬운 영어로 요약

저자들은 AI 를 위한 새로운 "위치 스티커" 시스템을 구축했습니다. 답이 항상 근처에 있다고 가정하는 대신, 그들은 AI 에게 즉각적인 주변 환경을 무시하고 과거에 깊이 묻힌 정보에 집중할 수 있는 유연한 규칙책을 제공했습니다.

그들은 수학적으로 이것이 작동함을 증명했으며, 실험을 통해 그들의 AI 가 50 만 단어 분량의 건초더미 속 바늘을 찾을 수 있음을 보여주었습니다. 반면 다른 AI 들은 수천 단어만 지나도 길을 잃습니다. 그들은 실제 의료 또는 법률 문서에서 이를 테스트하지는 않았지만, 장거리 정보를 찾는 메커니즘이 이제 훨씬 더 강력하고 신뢰할 수 있음을 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →