← 최신 논문
🤖 machine learning

Tile-Level Activation Overlap for Efficient LLM Inference

이 논문은 중간 텐서 구체화 오버헤드를 제거하기 위해 타일 레벨에서 SwiGLU 활성화 함수를 행렬 곱셈과 융합하는 두 가지 특화된 CUTLASS 기반 SM90 커널을 소개하며, 이를 통해 NVIDIA H100 GPU에서 최대 2.47배의 속도 향상과 79.5%의 피크 활용도를 달려 달성함과 동시에 효율성과 수치적 정확도 측면에서 PyTorch와 cuBLAS를 모두 능가한다.

원저자: Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt, Jianlan YE, Chaoyin Li, Atul Gupta

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt, Jianlan YE, Chaoyin Li, Atul Gupta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 로봇(챗봇을 구동하는 것과 같은 대규모 언어 모델)을 제작하는 고속 공장을 운영하고 있다고 상상해 보십시오. 각 로봇을 제작하기 위해 당신의 공장에는 특정 조립 라인인 MLP(로봇 두뇌의 핵심 부분)가 있습니다.

오랫동안 이 조립 라인에는 주요한 비효리성이 존재해 왔습니다. 여기 그 문제와 논문에서 제시된 해결책을 쉽게 설명한 내용이 있습니다.

문제점: "중간 관리자" 병목 현상

현대적인 로봇 공장에서는 로봇을 더 똑똑하게 만들기 위해 SwiGLU라고 불리는 특정 단계가 사용됩니다. SwiGLU를 두 가지 별도의 계산이 필요한 품질 검사라고 생각하십시오:

  1. 계산 A: 로봇의 현재 상태 측정.
  2. 계산 B: 로봇의 잠재력 측정.
  3. 결합(The Glue): 이 두 가지 측정값을 결합하여 최종 결과 도출.

기존 방식 (병목 현상):
표준적인 공장 설정(PyTorch에서 사용하는 방식)에서는, 계산 A를 수행한 후 작업자들이 그 결과를 복도에 있는 거대한 화이트보드(고대역폭 메모리, HBM)에 적어야 합니다. 그러고 나서 그들은 다시 걸어가서 그 화이트보드를 읽고, 계산 B를 수행한 뒤, 그 결과를 두 번째 화이트보드에 적고, 다시 돌아와서 두 화이트보드를 모두 읽은 다음 "결합" 단계를 수행해야 합니다.

이 논문은 더 작은 로봇(작은 AI 모델)의 경우, 이 "화이트보드로 걸어가는 시간"이 전체 시간의 **30%에서 37%**를 차지한다는 것을 발견했습니다. 이는 마치 요리사가 요리를 하는 시간보다 식재료를 가지러 팬트리까지 왔다 갔다 하는 데 절반의 시간을 쓰는 것과 같습니다.

해결책: 두 개의 새로운 "슈퍼 키친"

저자들은 화이트보드를 완전히 없애버린 두 가지 새로운 맞춤형 키친(커널, Kernels)을 구축했습니다. 결과를 적어두고 다시 걸어가는 대신, 작업자들은 재료를 손에 쥐고(레지스터, Registers) 모든 과정을 하나의 연속적인 동작으로 처리합니다.

그들은 서로 다른 공장 규모에 맞춘 두 가지 전략을 만들었습니다:

1. "핑퐁" 키친 (Kernel-1)

  • 작동 방식: 이어달리기 경주를 상상해 보십시오. 한 명의 작업자가 다음 배치의 재료를 가져오는 동안, 다른 작업자는 이미 현재 배치를 섞고 있습니다.
  • 비결: 이들은 "핑퐁" 스케줄을 사용합니다. 기계가 두 번째 재료 세트를 가져오는 데 바쁜 동안, 작업자들은 그 시간을 활용해 첫 번째 세트에 대한 "결합" 수학 연산을 수행합니다.
  • 적합한 경우: 거대한 로봇(대규모 모델)을 만들거나 동시에 많은 로봇을 실행(대규모 배치)하는 공장에 적합합니다. 이는 대형 기계들을 쉬지 않고 가동할 수 있을 만큼 충분한 인력이 확보된 거대한 조립 라인과 같습니다.

2. "인터리브드(Interleaved)" 키친 (Kernel-2)

  • 작동 방식: 상자를 포장하는 상황을 상상해 보십시오. 빨간색 물건을 모두 포장한 다음 파란색 물건을 포장하는 것이 아니라, 빨간색 하나, 파란색 하나를 번갈아 가며 완벽하게 섞어서 포장합니다.
  • 비결: 계산을 위한 두 가지 가중치 행렬(즉, "레시피")을 시작하기 전에 미리 섞어 놓습니다. 이를 통해 작업자들은 "빨간색" 재료와 "파란색" 재료를 동시에 잡고 즉시 함께 처리할 수 있습니다.
  • 적합한 경우: 더 작은 로봇을 만들거나 한 번에 적은 수의 로봇을 실행(작은 배치)하는 공장에 적합합니다. 이 방법은 매우 효율적이어서 공장 바닥이 작업자들로 꽉 차게 유지하며, 아무도 기다리느라 서 있지 않게 만듭니다.

결과: 속도와 정확도

저자들은 다양한 로봇 크기(0.5B 모델부터 거대한 72B 모델까지)에 대해 NVIDIA H100 칩(가장 강력한 AI 프로세서)에서 이 새로운 키친들을 테스트했습니다.

  • 엄청난 속도 향상: 작은 로봇의 경우, 새로운 키친은 기존 표준 방식보다 2.47배 더 빨랐습니다. 이는 10분 걸리던 작업을 4분으로 단축하는 것과 같습니다.
  • 병목 현상의 이동: 기존 시스템은 "메모리 제한적(Memory-Bound)"이었습니다(화이트보드로 걸어다니는 데 너무 많은 시간을 소비함). 새로운 시스템은 "연산 제한적(Compute-Bound)"입니다(수학 연산을 실제로 수행하는 데 모든 시간을 쏟음). 이들은 칩의 최대 이론적 속도의 **79.5%**에 도달했습니다.
  • 컴파일러가 할 수 없는 일: 저자들은 표준 "자동 항법" 소프트웨어(PyTorch의 torch.compile)를 사용하여 이를 자동으로 해결하려고 시도했습니다. 하지만 실패했습니다. 자동 항법 소프트웨어는 그들의 커스텀 키친보다 3배에서 7배 더 느렸습니다. 이는 이 특정 문제에 있어서는 인간 전문가가 직접 설계한 해결책이 필요하다는 것을 증명합니다. 컴퓨터는 아직 스스로 이 방법을 찾아낼 수 없습니다.
  • 더 나은 정확도: 놀랍게도, 새로운 커스텀 키친은 표준 방식보다도 더 정확했습니다. 표준 방식은 결과의 4.5%에서 11% 사이에서 미세한 수학적 오류를 보였으나, 새로운 키친은 오류가 전혀 없었습니다.

요약

이 논문은 공장 바닥의 운영 방식을 재편함으로써(특히 작업자들이 중간 노트를 적거나 읽기 위해 화이트보드로 계속 왔다 갔다 하는 것을 막음으로써), AI 모델을 특히 엣지 디바이스(폰이나 노트북 등)에서 사용하는 작은 모델의 경우 훨씬 더 빠르게 실행할 수 있음을 보여줍니다. 그들은 표준 소프트웨어 도구가 이러한 효율성을 재현할 수 없으며, 이러한 결과를 달기 위해서는 전문적으로 작성된 코드가 필요하다는 것을 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →