← 최신 논문
🤖 machine learning

Positional LSH: Binary Block Matrix Approximation for Attention with Linear Biases

본 논문은 ALiBi 어텐션 메커니즘이 확률적으로 높은 확률로 무작위 블록-대각 이진 마스크로 근사될 수 있음을 증명함으로써 위치 편향과 로컬리티-민감 해싱 간의 형식적 연결을 수립하여, 긴 문맥 어텐션에 대한 효율적인 거의 선형 시간 계산을 가능하게 하면서 동시에 위치 편향, 마스크, 임베딩을 단일 이론적 프레임워크로 통합합니다.

원저자: Daniel Wolfson, Tal Wagner

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daniel Wolfson, Tal Wagner

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 AI 의 두뇌인 트랜스포머 모델을 상상해 보세요. 이 모델은 모든 책 (토큰) 이 이야기를 이해하기 위해 책장에서의 자신의 위치를 알아야 하는 거대한 도서관과 같습니다. 책들이 서로 "대화"할 수 있도록 돕기 위해, 이 도서관은 **어텐션 (Attention)**이라는 시스템을 사용합니다.

그러나 문제가 있습니다: 도서관이 거대해지면 (긴 컨텍스트), 모든 책이 다른 모든 책을 읽는 것은 엄청나게 느리고 비용이 많이 듭니다. 이를 해결하기 위해 연구자들은 ALiBi(선형 편향을 가진 어텐션)를 발명했습니다. ALiBi 는 "책장 옆에 앉아 있는 책들은 멀리 떨어진 책들보다 더 크게 대화해야 한다"는 규칙과 같습니다. 복잡한 위치 마커 없이 AI 가 가까운 단어들에 집중할 수 있게 해주는 영리한 방법입니다.

하지만 함정이 있습니다: ALiBi 는 여전히 수학적으로 무겁습니다. 모든 상호작용마다 거대하고 복잡한 "편향 지도"를 계산해야 하므로 속도가 느려집니다.

핵심 아이디어: "위치 기반 LSH"

이 논문의 저자들은 간단한 질문을 던졌습니다: 이 복잡한 ALiBi 규칙을 이진 스위치 (켜기/끄기) 같은 훨씬 더 간단한 것으로 근사할 수 있을까요?

그들은 **국소 민감 해싱 (Locality-Sensitive Hashing, LSH)**이라는 개념을 사용하여 이를 수행하는 방법을 발견했습니다.

비유: "그룹화 게임"

복도에 기다리고 있는 긴 줄의 사람들 (토큰들) 이 있다고 상상해 보세요.

  1. 옛 방법 (ALiBi): 모든 사람 쌍 사이의 정확한 거리를 계산하여 그들이 얼마나 대화해야 할지 결정합니다. 이는 정밀하지만 시간이 매우 오래 걸립니다.
  2. 새 방법 (위치 기반 LSH): 정확한 거리를 측정하는 대신 게임을 합니다. 복도 위로 거대한 무작위 "그물"을 던지는 것입니다.
    • 그물에는 무작위 크기의 구멍들이 있습니다.
    • 같은 구멍에 잡힌 사람은 "1"을 받습니다 (그들이 그룹화됨).
    • 다른 구멍에 있는 사람은 "0"을 받습니다 (이 라운드에서는 무시됨).
    • 그물이 무작위이기 때문에, 때로는 가까이 있는 사람들이 그룹화되기도 하고 때로는 그렇지 않기도 합니다.

마법: 이 "그물 던지기" 게임을 여러 번 반복하고 결과를 평균내면, 누가 누구와 그룹화되었는지에 대한 패턴이 복잡한 ALiBi 규칙을 완벽하게 모방합니다.

논문이 실제로 증명한 것

저자들은 이것이 작동할 것이라고 단순히 추측한 것이 아니라, 수학적으로 증명했습니다:

  1. 구조적 연결: 그들은 복잡한 ALiBi 편향 행렬이 사실은 많은 단순하고 블록 형태의 이진 마스크들의 "평균"임을 보여주었습니다. 이는 많은 저해상도, 흑백 픽셀화된 레이어 (이진 마스크) 를 쌓아 고해상도 사진 (ALiBi) 을 완벽하게 재구성할 수 있는 것과 같습니다.
  2. 속도 향상: 이러한 이진 마스크는 단순히 "켜기"와 "끄기" 블록이기 때문에, 컴퓨터는 무거운 수학 계산을 할 필요가 없습니다. 거대한 도서관을 작고 관리 가능한 방 (블록) 으로 나누어 별도로 처리할 수 있습니다. 이는 느리고 무거운 계산을 빠르고 거의 선형적인 계정으로 변환합니다.
  3. 정확도: 그들은 각 개별 "그물 던지기"가 거친 근사치일지라도, 여러 번 던진 것의 평균은 놀라울 정도로 정확함을 증명했습니다. 그물을 던지는 횟수가 많을수록 (샘플링을 더 많이 할수록) 정확한 ALiBi 결과에 더 가까워집니다.

실험

이를 테스트하기 위해 연구자들은 실제 대규모 AI 모델 (Llama 와 Mistral 등) 에 적용해 보았습니다.

  • 결과: "그물 던지기" (샘플) 의 수를 늘림에 따라, 근사치는 원래의 정확한 ALiBi 방법과 거의 동일해졌습니다.
  • 성능: 그들의 테스트에서, 소수의 샘플로 이 방법을 사용하면 원래 편향이 없는 모델에 비해 긴 텍스트 처리 능력이 실제로 향상되었으며, 정확한 ALiBi 방법과 매우 유사하게 작동했습니다.

한계점 (논문이 말하지 않는 것)

저자들은 이것이 아직 무엇을 하지는 않는지에 대해 매우 솔직합니다:

  • 현재 하드웨어에서의 즉각적인 속도 향상 부재: 수학적으로는 이것이 더 빨라야 함 (거의 선형 시간) 을 말하지만, 그들의 현재 소프트웨어 프로토타입은 오늘날의 GPU 에서 초고도로 최적화된 기존 ALiBi 코드를 이기지 못했습니다. 이는 현재 컴퓨터 칩이 거대하고 밀집된 계산을 매우 효율적으로 처리하도록 설계되어 있기 때문입니다. 이 방법이 수행하는 것처럼 작업을 많은 작은 조각으로 나누는 것은 수학적으로 총 연산 수가 적더라도 현재 하드웨어에서는 항상 더 빠른 것은 아닙니다.
  • 우선 이론: 이 논문은 문을 여는 이론적 돌파구입니다. 문이 존재함을 증명하고 열쇠를 만드는 방법을 보여주지만, 아직 그 문을 통과할 가장 빠른 차를 만들지는 않았습니다.

요약

간단히 말해, 이 논문은 AI 가 사용하는 복잡한 "거리 규칙" (ALiBi) 이 단순하고 무작위적인 "그룹화 게임"으로 대체될 수 있음을 밝힙니다. 이 게임을 몇 번 반복하고 결과를 평균내면 복잡한 방법과 동일한 지능적인 행동을 얻을 수 있지만, 미래에 훨씬 더 빨라질 수 있는 구조를 갖게 됩니다. 이는 편향, 마스크, 임베딩이라는 세 가지 서로 다른 위치 처리 방식을 하나의 통합되고 우아한 프레임워크로 연결합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →