← 최신 논문
🤖 AI

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

TileMix는 융합된 밀집 어텐션 연산 내에서 하드웨어에 정렬된 어텐션 스코어 타일을 FP16과 INT8 경로 사이로 동적으로 라우팅함으로써, 균일한 저정밀도 방식에 의해 손실된 정확도를 회복하는 동시에 처리량을 개선하여 롱 컨텍스트 LLM 추론을 가속화하는 학습이 필요 없는 타일 중심의 혼합 정밀도 커널입니다.

원저자: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 책 한 권 전체를 요약하고, 긴 문서에서 복잡한 질문에 답하며, 수천 단어에 달하는 대화를 이어갈 수 있는 새로운 세대의 인공지능을 뒷받침하는 엔진이 되었습니다. 이를 위해 이 모델들은 '어텐션(attention)'이라 불리는 메커니즘에 의존하는데, 이는 문장 내 모든 단어가 다른 모든 단어에 대해 갖는 중요도를 가중치로 계산할 수 있게 해줍니다. 텍스트가 짧을 때는 이 과정이 빠릅니다. 하지만 문맥이 전체 챕터나 법률 계약서 수준으로 길어지면 계산 비용이 폭발적으로 증가합니다. 모델은 가능한 모든 단어 쌍에 대해 점수를 계산해야 하며, 이는 엄청난 양의 메모리와 처리 능력을 요구하는 거대한 데이터 격자를 생성합니다. 이러한 병목 현상은 법률 분석이나 의료 기록 검토와 같이 실제 세계의 작업에 필요한 긴 시퀀스를 다룰 때, 표준 하드웨어에서 이러한 강력한 도구들을 효율적으로 실행하는 것을 어렵게 만들었습니다.

연구자들은 수학적 계산을 단순화함으로써 이 문제를 해결하려고 노력해 왔습니다. 한 가지 흔한 접근 방식은 컴퓨터가 사용하는 숫자의 정밀도를 낮추는 것으로, 고정밀 계산에서 더 빠르고 낮은 정밀도의 계산으로 전환하는 것입니다. 이는 마치 식재료를 측정할 때 실험실용 저울 대신 주방용 숟가락을 사용하는 것과 같습니다. 훨씬 빠르지만, 복잡한 레시피의 모든 단계에서 이 방식을 사용한다면 최종 요리의 맛이 변할 수 있습니다. 또 다른 접근 방식은 계산 자체를 건너뛰어 중요해 보이지 않는 단어들을 무시하는 것입니다. 이는 시간을 절약해주지만, 모델이 이야기를 이해하는 데 필요한 핵심적인 연결 고리를 끊어버릴 위험이 있습니다. 과제는 고정밀 방식의 정확성을 희생하지 않으면서도 저정밀 수학의 속도를 활용하는 방법을 찾는 것이었으며, 이 과정에서 모델의 전체적인 맥락 파악 능력을 유지해야 했습니다.

한 연구팀은 어텐션 과정을 단일하고 균일한 작업 블록이 아니라, 작고 관리 가능한 '타일(tile)'들의 집합으로 취급하여 이 문제를 해결하는 '타일믹스(TileMix)'라는 새로운 방법을 도입했습니다. 거대한 단어 쌍 점수 격자를 커다란 모자이크라고 상상해 보십시오. 모자이크 전체를 한 종류의 물감으로 칠하는 대신, 타일믹스는 이를 하드웨어와 정렬된 작은 정사각형 구역들로 나눕니다. 각 구역에 대해 시스템은 찰나의 결정을 내립니다. 즉, 이 특정 단어 쌍 그룹이 고정밀의 느린 계산이 필요한지, 아니면 빠른 저정밀 계산으로도 충분한지를 결정합니다. 이 결정은 이 타일들을 함께 그룹화하는 사전 계획된 지도에 기반하여 이루어지며, 이를 통해 컴퓨터는 데이터를 재구성하기 위해 멈추지 않고도 동일한 연산 내에서 고정밀과 저정밀 사이를 전환할 수 있습니다.

이 혁신의 핵심은 컴퓨터의 프로세서를 위한 교통 관제사 역할을 하는 라우팅 시스템입니다. 이 시스템은 이러한 결정들을 압축된 코드, 즉 각 타일에 대해 어떤 경로를 택할지 알려주는 비트 문자열 형태로 패킹합니다. 타일이 고정밀로 표시되면 프로세서는 가장 정확한 수학 유닛을 사용합니다. 만약 저정밀로 표시되면 가장 빠르고 에너지 효율적인 유닛으로 전환합니다. 결정적으로, 두 경로 모두 전체 결과를 추적하는 공유 메모리 상태를 업데이트하여 최종 출력이 일관되게 유지되도록 합니다. 이를 통해 시스템은 모델의 완전한 연결성(즉, 어떤 단어 간의 상호작용도 무시되지 않음)을 보존하면서도, 저정밀 수학이 허용되는 부분에서는 그 속도의 이점을 누릴 수 있습니다.

연구진은 LLaMA, Qwen, Vicuna를 포함한 여러 인기 있는 대규모 언어 모델을 대상으로 16,000단어에서 64,000단어에 이르는 시퀀스를 사용하여 이 방법을 실험했습니다. 그들은 이 방식을 표준 고정밀 방식 및 모든 것에 저정밀 수학을 사용하는 방식과 비교했습니다. 실험 결과, 전체 계산에 저정밀 수학을 사용하는 것은 종종 정확도를 크게 떨어뜨려 모델이 세부 사항을 놓치거나 검색 작업에 실패하게 만드는 것으로 나타났습니다. 그러나 타일믹스는 손실된 품질의 대부분을 회복할 수 있었습니다. 특정 타일 그룹만을 고정밀 경로로 정교하게 라우팅함으로써, 시스템은 전체 고정밀 기준치에 매우 근접한 정확도를 유지하는 동시에 훨씬 빠른 처리 속도를 달달성했습니다.

또한 연구는 어떤 타일이 고정밀 처리를 받아야 하는지 결정하는 다양한 패턴을 탐구했습니다. 그들은 배치 방식이 중요하다는 것을 발견했습니다. 즉, 고정밀 계산을 단어 격자의 특정 공간 영역에 유지하는 특정 레이아웃이 작업에 따라 더 효과적이라는 점입니다. 예를 들어, 로컬 단어 상호작용에 대해 고정밀도를 유지하는 특정 레이아웃은 사실적 회상 작업에서 더 우수한 성능을 보였고, 다른 레이아웃은 일반적인 질의응답에서 더 견고했습니다. 연구진은 이 방법이 모델을 재학습시키지 않고도 적용 가능하다는 것을 입증했으며, 이는 기존 시스템에 즉시 배포될 수 있음을 의미합니다. 또한 이 방식이 가변 길이 배치 및 다양한 모델 아키텍처와도 잘 작동함을 보여주어, 효율성을 개선하기 위한 유연한 도구임을 시사했습니다.

궁극적으로 타일믹스는 속도와 정확도 사이의 조절 가능한 균형을 제공합니다. 이는 효율적인 롱 컨텍스트(long-context) 처치의 미래가 단순히 '빠른 것'과 '똑똑한 것' 중 하나를 선택하는 것이 아님을 시사합니다. 대신, 두 가지를 지능적으로 혼합함으로써 시스템은 저정밀 수학을 무분별하게 사용하여 발생하는 심각한 정확도 저하 없이, 하드웨어의 이론적 한계에 근접한 속도로 긴 문서를 처리할 수 있습니다. 이 접근 방식은 실시간 대규모 데이터셋 분석이나 긴 복잡한 문맥을 즉각적으로 이해해야 하는 대화형 도구와 같이 속도와 정밀도가 모두 중요한 시나리오에서 대규모 언어 모델을 배포하기 위한 실질적인 경로를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →