← 최신 논문
📊 statistics

Express Language Modeling

이 논문은 비인과적 어텐션 근사치를 개선된 이론적 보장과 효율적인 Triton 구현을 갖춘 인과적 어텐션으로 변환하는 도구인 Express를 소개하며, 이는 FlashAttention 2보다 상당한 속도 향상을 가능하게 하고 긴 문맥 언어 모델링에서의 핵심적인 자원 병목 현상을 극복한다.

원저자: Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi, Lester Mackey

게시일 2026-06-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi, Lester Mackey

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 질문에 답하기 위해 매우 긴 책을 읽으려고 노력하고 있다고 상상해 보세요. 책을 읽는 동안, 당신은 현재 문장을 이해하기 위해 지금까지 마주친 모든 중요한 세부 사항을 기억해야 합니다. AI 언어 모델의 세계에서 이 '기억하는' 과정은 **어텐션(Attention)**이라고 불립니다.

문제는 책이 길어질수록 모든 것을 기억하는 데 필요한 노력이 폭발적으로 증가한다는 점입니다. 이는 마치 방 안의 모든 사람에게 자신을 다시 소개하고 지금까지의 대화 내용을 매번 다시 읽어야 하는 상황에서 대화를 나누는 것과 같습니다. 이 방식은 너무 느리고 메모리를 많이 차지하여, 매우 긴 이야기나 복잡한 추론 작업을 처리하는 것을 불가능하게 만듭니다.

이 논문은 이러한 AI 모델을 위한 매우 효율적인 사서 역할을 하는 새로운 도구인 Express(그리고 특정 버전인 Thinnerformer Express)를 소개합니다. 이 도구가 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. 문제점: "이차적(Quadratic)" 병목 현상

보통 새로운 문장을 이해하기 위해 AI는 이전의 모든 단어를 살펴봅니다. 단어가 1,000개라면 1,000번의 확인을 수행합니다. 만약 단어가 100만 개라면, 1조 번의 확인을 해야 합니다. 이것이 논문에서 언급된 "이차적" 비용입니다. 이는 마치 건초더미 속에서 특정 바늘을 찾기 위해 매번 건초 한 조각 한 조각을 하나씩 계속해서 확인하는 것과 같습니다.

2. 해결책: "스마트 요약기" (Thinning)

저자들은 당신이 실제로 모든 단어를 완벽하게 기억할 필요는 없다는 사실을 깨달았습니다. 당신은 그저 전체 이야기를 대표할 수 있는 작고 고품질인 "요약본" 또는 "핵심 세트"만 있으면 됩니다.

그들은 Express라는 도구를 만들었는데, 이는 "비인과적(non-causal)" 요약기(책 전체를 보고 가장 좋은 100페이지를 골라낼 수 있는 도구)를 "인과적(causal)" 요약기로 바꾸어 줍니다.

  • 비인과적 방식은 책 전체를 먼저 읽은 다음 하이라이트를 뽑아내는 것과 같습니다.
  • 인과적 방식은 책을 실시간으로 페이지 단위로 읽으며, 앞을 내다보지 않고도 어떤 하이라이트를 주머니에 넣을지 즉시 결정하는 것과 같습니다.

Express는 AI가 정확도를 잃지 않으면서도 이러한 실시간 요약을 수행할 수 있게 해주는 마법 같은 기술입니다. 이는 AI가 과거의 아주 작은 부분( "희박하게 만든(thinned)" 버전)만을 보고 있음에도 불구하고 여전히 정답을 얻을 수 있도록 보장합니다.

3. "팽창(Inflation)" 기술

논문은 AI의 메모리가 풍선처럼 "팽창"하고 "수축"하는 영리한 메커니즘을 설명합니다.

  • 정확 단계(Exact Phase): 맨 처음에는 AI가 모든 것을 완벽하게 기억합니다.
  • 희박 단계(Thin Phase): 더 많은 단어가 들어옴에 따라, AI는 단어들을 배치(batch) 단위로 그룹화합니다. 모든 단어를 유지하는 대신, 특수한 알고리 liệu를 사용하여 해당 배치를 더 작은 가중치 요약본으로 "압축"합니다.
  • HALVE 단계: 요약본이 너무 커지면, AI는 가장 중요한 정보를 신중하게 보존하면서 크기를 절반으로 줄이는 "절반 나누기(halving)" 작업을 수행합니다.

이 과정은 이야기가 아무리 길어져도 메모리 크기를 작고 일정하게 유지해 줍니다. 이는 마치 내용물을 자동으로 줄여서 딱 맞게 만드는 배낭을 가진 것과 같습니다. 필수적인 아이템만 남겨두어 공간이 부족해지는 일이 없도록 합니다.

4. 실제 결과: AI의 속도 향상

저자들은 단순히 수학적 계산만 한 것이 아니라, Triton(컴퓨터 칩을 위한 고속 엔진과 같은 프로그래밍 언어)을 사용하여 이 도구의 빠른 버전을 구축했습니다. 그들은 네 가지 특정 시나리오에서 테스트를 진행했습니다.

  • 긴 컨텍스트 프리필(Long-Context Prefill, 책 읽기): AI에게 답변을 하기 전 방대한 문서를 읽게 할 때, Express는 매우 긴 텍xt(512,000 단어)에 대해 현재 최고의 방법인 FlashAttention 2보다 82배 더 빨랐습니다.
  • 메모리 압축(KV 캐시): AI 모델은 과거의 단어들을 "캐시"에 저장합니다. Express는 다른 인기 있는 방법들을 사용하여 이 캐시를 압축하는 데 도움을 주었으며, 정확도를 잃지 않으면서 전체 과정을 더 빠르게 만들었습니다.
  • 메모리 효율적 디코딩(Memory-Efficient Decoding, 단계별 사고): 긴 추론 체계가 필요한 어려운 수학 문제를 풀 때, Express는 표준 방식이 요구하는 메모리의 61%만 사용하면서도 동일하게 정답을 얻어냈습니다.
  • 연산 효율적 디코딩(Compute-Efficient Decoding, 사고 속도 향상): 동일한 수학 문제를 풀 때, Express는 정답을 유지하면서도 보통 걸리는 시간의 56%만 사용하여 작업을 완료했습니다.

요약

요약하자면, Express는 AI가 긴 대화와 복잡한 작업을 처리하기 위한 새로운 방법입니다. 이는 과거를 지속적으로 요약하여 AI가 중요한 세부 사항을 "잊어버리지" 않으면서도, AI의 메모리를 작게 유지하고 사고 속도를 빠르게 만드는 스마트한 필터 역할을 합니다. 이는 긴 텍스트나 복잡한 추론을 다룰 때 AI가 너무 느려지거나 메모리가 부족해지는 문제를 해결합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →