← 최신 논문
🤖 machine learning

GQLA: Group-Query Latent Attention for Hardware-Adaptive Large Language Model Decoding

이 논문은 H100 급 GPU 를 위한 MQA-흡수 경로와 H20 과 같은 상용 GPU 를 위한 GQA 경로 사이에서 단일 가중치 세트를 동적으로 전환할 수 있도록 DeepSeek 의 멀티헤드 잠재 어텐션에 하드웨어 적응형 수정을 가한 그룹 쿼리 잠재 어텐션 (GQLA) 을 제안하여, 재학습이나 커스텀 커널 없이 추론 효율을 최적화하고 멀티 토큰 예측을 지원한다.

원저자: Fanxu Meng

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fanxu Meng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 도서관 (대규모 언어 모델) 을 운영한다고 상상해 보세요. 사서가 새로운 문장을 작성할 때마다, 그 문장이 논리적으로 타당한지 확인하기 위해 과거에 읽은 모든 책을 다시 뒤져봐야 한다면 어떨까요? 이 "뒤져보기" 과정이 전체 프로세스에서 가장 비용이 많이 드는 부분이며, 많은 메모리 트래픽을 필요로 합니다.

오래전부터 이 문제를 해결하는 최선의 방법은 MLA(Multi-head Latent Attention, 멀티헤드 잠재 어텐션)라는 방법이었습니다. MLA 는 초효율적인 "요약 노트" 시스템과 같습니다. 사서는 모든 책의 세부 사항을 모두 보관하는 대신, 모든 중요한 정보를 작고 저랭크 (low-rank) 의 "요약 치트 시트"(잠재 벡터) 로 압축합니다.

구식 시스템 (MLA) 의 문제점:
이 논문은 치트 시트 시스템이 훌륭하지만, 특정 고가의 고성능 컴퓨터 (NVIDIA H100) 에 맞춰 설계되었다고 주장합니다.

  • H100 적합성: 이 고가의 컴퓨터에서는 시스템이 완벽하게 작동합니다. 수학 연산 속도는 빠르지만 메모리 속도는 제한적이기 때문입니다. 치트 시트는 메모리 사용량을 낮게 유지하여 컴퓨터의 강점과 부합합니다.
  • H20 불일치: 그러나 수출 규제를 받은 더 저렴한 컴퓨터 (H20) 는 메모리 속도는 충분하지만 수학 연산 속도가 훨씬 느립니다. 이 기계에게 구식 치트 시트 시스템은 재앙입니다. 이동하는 데이터 양에 비해 컴퓨터가 수행해야 할 수학 연산이 너무 많아져 시스템이 멈추게 됩니다.
  • 경직성: 구식 시스템은 특정 한 사람을 위해 맞춤 제작된 정장과 같습니다. 몸매가 변하면 입을 수 없습니다. 또한 이 시스템은 도서관이 여러 명의 작업자 (텐서 병렬화) 를 효율적으로 활용하는 것을 막고, 속도를 늦추지 않고 여러 단어를 한 번에 추측하는 것 (멀티 토큰 예측) 을 방해합니다.

새로운 해결책: GQLA(Group-Query Latent Attention, 그룹 쿼리 잠재 어텐션)
저자들은 GQLA라는 새로운 시스템을 제안합니다. 이는 새로운 정장이 아니라, 정확히 같은 원단 (동일한 학습된 가중치) 을 사용하여 두 가지 다른 체형에 완벽하게 맞는 변형 가능한 정장으로 생각하세요.

유사를 통해 작동 방식을 설명하면 다음과 같습니다:

  1. 두 가지 경로:

    • 경로 A(초소형 모드): 원래 MLA 스타일입니다. 작은 치트 시트를 유지합니다. 이는 수학 연산이 많은 고가의 H100 컴퓨터에 완벽합니다. 메모리 트래픽을 최소화합니다.
    • 경로 B(그룹화 모드): 새로운 트릭입니다. 모든 것을 하나의 작은 노트로 압축하는 대신, 노트를 8 개의 별도 "폴더"로 그룹화합니다. 이는 약간 더 큰 캐시를 생성하지만, 단계당 수행해야 할 수학 연산을 줄여줍니다. 이는 수학 연산은 느리지만 데이터 이동은 빠른 저렴한 H20 컴퓨터에 완벽합니다.
  2. 마법 같은 스위치:
    가장 좋은 점은 도서관을 다시 구축할 필요가 없다는 것입니다. "정장"(모델 가중치) 은 동일합니다. 모델을 배포할 때:

    • H100에 있다면, 경로 A를 사용하도록 스위치를 전환합니다.
    • H20에 있다면, 경로 B를 사용하도록 스위치를 전환합니다.
    • 재학습 불필요: 사서에게 새로운 것을 가르칠 필요가 없습니다. 단순히 노트를 읽는 방식을 변경할 뿐입니다.
    • 커스텀 도구 불필요: 컴퓨터 도구함에 이미 존재하는 표준 도구를 사용합니다.
  3. 더 나은 이유:

    • 하드웨어 적응형: 고가와 저렴한 컴퓨터 모두에 대한 "최적점"을 찾아 두 기기 모두에서 속도를 극대화합니다.
    • 팀워크: 구식 시스템과 달리, 새로운 "그룹화" 경로는 여러 작업자가 효율적으로 협업 (텐서 병렬화) 할 수 있게 하여, 이전에 차단되었던 기능을 가능하게 합니다.
    • 미래 대비: 구식 시스템이 충돌 없이 수행하지 못했던 "여러 단어를 한 번에 추측하기"(멀티 토큰 예측) 기능을 저렴한 컴퓨터에서도 지원합니다.

"TransGQLA" 트릭:
이 논문은 기존에 구식 그룹화 시스템으로 이미 학습된 도서관 (모델) 을 처음부터 다시 시작하지 않고 즉시 이 새로운 "변형 가능한 정장"으로 변환하는 방법도 보여줍니다. 마치 표준 재킷에 숨겨진 지퍼를 추가하여 즉시 초소형 버전으로 변형할 수 있게 하는 것과 같습니다.

결과:

  • H100에서는 원래 시스템과 동일한 성능을 발휘합니다.
  • H20에서는 불필요한 수학 연산으로 인해 컴퓨터가 시간을 낭비하지 않게 함으로써 원래 시스템보다 3.4 배 더 빠릅니다.
  • 그들은 표준 모델 (LLaMA-3-8B) 로 이를 테스트하여, 이를 새로운 형식으로 변환해도 지능이 거의 변하지 않고 저렴한 하드웨어에서 막대한 속도 향상을 얻으면서도 능력을 거의 잃지 않았음을 발견했습니다.

요약:
이 논문은 "범용 어댑터"처럼 작동하는 유연한 어텐션 메커니즘을 소개합니다. 이 메커니즘은 모델을 재학습하거나 새로운 소프트웨어를 구축할 필요 없이 메모리 조직 방식을 변경하기만 하면, 단일 AI 모델이 고가의 고성능 칩과 저렴한 규제가 있는 칩 모두에서 최대 효율로 실행되도록 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →