← 최신 논문
🤖 AI

FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs

이 논문은 WGMMA 연산을 최적화하여 기존 방식 대비 상당한 속도 향상을 달성하는 동시에 높은 수치적 안정성을 유지하면서, NVIDIA H20 GPU에서 Multi-Head Latent Attention 추론을 크게 가속화하기 위해 효율적인 전치 어텐션 파이프라인(Efficient Transpose Attention Pipeline)을 활용하는 새로운 프레임워크인 FlashMLA-ETAP을 소개한다.

원저자: Pengcuo Dege, Qiuming Luo, Rui Mao, Chang Kong

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pengcuo Dege, Qiuming Luo, Rui Mao, Chang Kong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 긴 책(컨텍스트)을 읽고 단 하나의 짧은 질문(쿼리)에 답하려고 노력하고 있다고 상상해 보세요. 이것은 본질적으로 DeepSeek-R1과 같은 거대 AI 모델이 텍스트를 생성할 때 하는 일과 같습니다. 즉, 다음에 어떤 단어를 말할지 결정하기 위해 지금까지 읽은 모든 내용을 되돌아보는 것입니다.

이 논문은 특정 컴퓨터 칩인 NVIDIA H20을 위해, AI에게 그 책의 페이지를 더 똑똑하게 넘기는 방법을 가르치는 것과 같은 새로운 방법인 FlashMLA-ETAP를 소개합니다.

다음은 일상적인 비유를 사용한 문제와 해결책의 분석입니다:

문제점: "어색한 선반" 이슈

NVIDIA H20 GPU를 다음과 같은 규칙이 있는 도서관에서 일하는 사서라고 생각해 보세요: 선반은 안정성을 위해 최소 64권의 책 너비여야 합니다. 만약 선반에 16권의 책만 놓으려고 한다면, 사서는 선반이 무너지지 않도록 빈 공간을 가짜 책(패딩)으로 채워야 합니다. 이는 시간과 에너지를 낭비합니다.

AI 세계에서 "책"은 어텐션 헤드(서로 다른 것에 집중하는 뇌의 부분들)를 의미합니다. 8개의 H20 GPU가 있는 단일 서버에서 거대한 DeepSeek-R1 모델을 실행할 때, 작업은 분할됩니다. 각 GPU는 결국 16개의 헤드만을 처리하게 됩니다.

16은 요구되는 64보다 작기 때문에, H20 GPU는 하드웨어 규칙을 충족하기 위해 많은 "가짜 작업"(패딩)을 수행해야 합니다. 이는 마치 사서에게 16개의 진짜 상자를 운반하기 위해 64개의 빈 상자를 들고 다니라고 강요하는 것과 같습니다. 이로 인해 AI는 매우 긴 "책"(롱 컨텍스트)을 읽고 있지만 질문은 매우 짧은(한 번에 한 단어씩) 경우, 속도가 느려지고 비효율적이 됩니다.

해결책: 책을 옆으로 돌리기 (ETAP)

저자들은 ETAP(Efficient Transpose Attention Pipeline)이라고 불리는 기술을 만들었습니다. 16개의 헤드를 64 너비의 선반 규칙에 억지로 맞추려고 노력하는 대신, 그들은 문제를 옆으로 돌렸습니다.

짧은 행에 16개의 헤드를 배치하는 대신, 책의 길이(수천 페이지가 될 수 있는)를 주요 차원으로 보는 것입니다. 책이 매우 길기 때문에, 가짜 책 없이도 "64 너비의 선반" 요구 사항을 쉽게 채울 수 있습니다.

차원을 바꿈으로써—대화의 긴 기록을 주요 "너비"로 취급하고 짧은 질문을 "높이"로 취급함으로써—H20 GPU는 가짜 패딩으로 시간을 낭비하지 않고 풀 스피드로 작동할 수 있습니다. 이는 16개의 작은 아이템을 큰 상자에 넣으려고 하는 대신, 여유 공간이 많은 곳에 수직으로 쌓는 법을 깨닫는 것과 같습니다.

결과: 더 빠르고 더 정확하게

논문은 이 "옆으로 돌리는" 접근 방식이 H20 GPU에서 엄청난 차이를 만든다고 주장합니다:

  1. 훨씬 빠름: 긴 대화 길이(64,000 단어)에서 FlashMLA-ETAP는 이 특정 모델에 대한 이전의 최고 방법(FlashMLA)보다 2.78배 더 빠릅니다. 또한 FlashAttention-3 및 FlashInfer와 같은 다른 인기 있는 방법들보다 현저히 빠릅니다.
  2. 더 정확함: 보통 AI 계산 속도를 높이려고 하면 정밀도(숫자를 너무 공격적으로 반올림하는 것과 같은)를 약간 잃을 수 있습니다. 하지만 이 새로운 방법은 실제로 FlashAttention-3보다 더 정확하며, 훨씬 낮은 오차율(RMSE)을 보입니다. 이는 책을 더 빨리 읽으면서도 동시에 더 잘 이해하는 것과 같습니다.

이것이 중요한 이유

대부분의 AI 최적화는 초고가형 하이엔드 칩(H100과 같은)을 위해 설계되었습니다. H20은 "중급형" 칩으로, 성능은 좋지만 가장 강력하지는 않습니다. 이 논문은 적절한 소프트웨어 기술(ETAP)을 사용하면 특정 작업에 대해 중급형 칩의 성능을 훨씬 더 좋게 만들 수 있음을 보여줍니다. 이는 마치 기어를 바꾸는 방식을 변경함으로써 일반 세단이 특정 종류의 도로에서 스포츠카처럼 효율적으로 달리게 만드는 것과 같습니다.

요약하자면, FlashMLA-ETAP는 NVIDIA H20 GPU가 긴 AI 대화를 읽는 방식을 재구성하도록 알려주는 소프트웨어 업데이트이며, 이를 통해 낭비되는 노력을 제거하고 AI가 더 빠르고 정확하게 응답하도록 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →