← 최신 논문
💬 NLP

Long Context Pre-Training with Lighthouse Attention

본 논문은 극단적인 시퀀스 길이에서 인과적 트랜스포머의 효율적인 2 차 미만의 복잡도로 사전 학습을 가능하게 하기 위해 표준 스케일된 점곱 어텐션을 감싸는 학습 전용, 기울기 없는 계층적 선택 알고리즘인 라이트하우스 어텐션을 소개하며, 이는 짧은 복구 단계를 통해 완전히 제거되어 더 빠른 학습과 더 낮은 최종 손실을 갖는 전체 어텐션 모델을 생성할 수 있습니다.

원저자: Bowen Peng, Subho Ghosh, Jeffrey Quesnelle

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bowen Peng, Subho Ghosh, Jeffrey Quesnelle

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 번에 거대한 도서관의 책들(매우 긴 텍스트) 전체를 읽어서 이야기를 이해하려고 상상해 보세요. AI 세계에서는 이를 '긴 문맥 학습(long-context training)'이라고 부릅니다.

문제는 표준 AI 모델(트랜스포머)이 연결고리를 찾기 위해 모든 단어를 다른 모든 단어와 비교하려 한다는 점입니다. 10 만 단어가 있다면 모델은 100 억 번의 비교를 수행해야 합니다. 이는 도서관에서 특정 문장을 찾기 위해 모든 단어를 다른 모든 단어에게 동시에 외치는 것과 같습니다. 이는 영원히 걸리며, 막대한 전기 비용을 소모하고 컴퓨터의 메모리가 부족해집니다.

이 논문은 이를 해결하기 위해 '등대 어텐션(Lighthouse Attention)'이라는 새로운 방법을 소개합니다. 간단한 비유를 통해 작동 원리를 설명하겠습니다.

1. 문제: '만능 시선'은 너무 무겁습니다

표준 AI 어텐션은 스타디움의 모든 사람을 동시에 바라보며 누가 누구와 대화하는지 확인하려는 집착을 가진 경비원처럼 작동합니다. 스타디움이 커질수록 경비원은 압도당합니다.

2. 해결책: '등대' 전략

등대 어텐션은 어둠의 바다를 비추는 등대처럼 모든 것을 고해상도로 보는 대신, 바다를 무시하지 않고 가장 중요한 부분을 빠르게 찾기 위해 계층적으로 스캔합니다.

논문에 설명된 3 단계 과정은 다음과 같습니다.

단계 A: '피라미드'(군중 요약)

거대한 군중(텍스트)이 있다고 상상해 보세요. 개별 얼굴 하나하나를 보는 대신, 그들을 작은 클러스터(가족이나 팀과 같은) 로 그룹화합니다.

  • 기법: 이 논문은 여기서 독특한 작업을 수행합니다. 대부분의 다른 방법들은 '대화의 대상'(키와 값) 만 요약하고 '대화를 주도하는 사람'(쿼리) 은 고해상도로 남깁니다.
  • 등대의 움직임: 등대는 모두를 동등하게 요약합니다. 요약의 피라미드를 생성합니다.
    • 레벨 0: 모든 단일 단어.
    • 레벨 1: 4 개의 단어가 하나의 그룹으로 요약됨.
    • 레벨 2: 16 개의 단어가 하나의 그룹으로 요약됨.
    • 이어서 계속됩니다.
      이것은 '초세부'에서 '큰 그림'까지 텍스트의 다중 레벨 지도를 생성합니다.

단계 B: '스포트라이트'(가장 좋은 부분 선택)

이제 모델은 이 피라미드의 어떤 부분이 전체 세부 사항으로 읽기에 중요한지 결정해야 합니다.

  • 선택: 추가 학습이 필요 없는 간단한 무료 규칙을 사용하여 모든 그룹에 점수를 매깁니다. "어떤 그룹이 가장 많은 '에너지'나 중요성을 가지고 있는가?"라고 묻습니다.
  • 컷: 피라미드의 모든 레벨에서 가장 중요한 상위 KK개의 그룹을 선택합니다.
  • 결과: 10 만 단어를 읽는 대신, 모델은 이제 가장 중요한 '조각들'(약 5,000 단어일 수 있음) 의 작고 밀집된 목록만 읽으면 됩니다.

단계 C: '플래시'(선택된 부분 읽기)

모델이 상위 5,000 단어를 선택하면, 이를 표준의 초고속 '플래시 어텐션(FlashAttention)' 엔진에 통과시킵니다. 목록이 이제 짧기 때문에 이 단계는 놀라울 정도로 빠르고 컴퓨터 메모리에 쉽게 들어갑니다.

3. '마법' 회복 (2 단계 학습)

이것이 이 논문에서 가장 중요한 부분입니다. 저자들은 다음과 같이 우려했습니다: "만약 AI 를 요약만 보도록 훈련한다면, 나중에 완전한 문장을 읽는 방법을 잊어버리지 않을까?"

이를 해결하기 위해 2 단계 학습 레시피를 사용합니다.

  1. 1 단계 (등대 단계): 대부분의 시간 동안 등대 방법을 사용하여 모델을 훈련시킵니다. 모델은 효율성을 배우고 올바른 하이라이트를 선택하는 법을 배웁니다.
  2. 2 단계 (회복 단계): 훈련의 마지막 짧은 기간 동안 '요약'과 '선택' 부분을 끕니다. 표준 방법을 사용하여 모델이 다시 전체 텍스트를 읽도록 강요합니다.

결과: 모델은 효율적인 훈련에서 '깨어나' 완전한 어텐션을 사용하는 방법을 완벽하게 기억합니다. 논문은 이 짧은 회복 기간 후, 모델이 전체 텍스트를 전체 시간 동안 훈련받은 모델만큼 (또는 더) 잘 수행하지만, 훨씬 더 빠르고 저렴하게 그 지점에 도달했다고 주장합니다.

이것이 왜 중요한가요?

  • 속도: 이 논문은 매우 긴 텍스트 (10 만 단어 이상) 의 경우 이 방법이 표준 방법보다 17 배에서 21 배 더 빠르다고 보여줍니다.
  • 불필요한 '쓰레기' 코드: '선택' 과정을 처리하기 위해 맞춤형 복잡한 컴퓨터 칩(커널) 을 구축해야 하는 다른 방법들과 달리, 등대는 실제 읽기를 위해 표준의 상용 컴퓨터 부품을 사용합니다. 데이터만 전달하기 전에 재배열할 뿐입니다.
  • 대칭성: 문장의 '질문' 부분과 '답변' 부분을 동등하게 취급하여 수학을 더 깔끔하고 안정적으로 만듭니다.

결론

등대 어텐션은 똑똑한 연구 조교를 고용하는 것과 같습니다. 조교는 보고서 1,000 페이지를 단어별로 읽는 대신, 문서 전체를 빠르게 스캔하여 가장 중요한 50 개 단락을 하이라이트한 후, 오직 그 50 개 단락만 깊이 있게 읽습니다.

이 논문은 이렇게 AI 를 훈련시킨 후, 마지막에 전체를 읽는 것에 대한 빠른 '보충 과정'을 제공하면, 지능을 잃지 않는 초고속 독서가 된다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →