← 최신 논문
🤖 machine learning

CubicQuant: Parametric Non-Uniform Codebooks for High-Throughput LLM Inference with 1-8-Bit Weights

CubicQuant는 균일하게 간격이 떨어진 크기 코드들을 단조적인 3차 곡선을 통해 적응형 재구성 레벨로 매핑하는 파라미터화된 비균일 스칼라 형식을 도입하여, 직접적인 GPU 실행 가능성을 유지하면서도 균일 정수 및 유한 부동 소수점 양자화에 비해 재구성 오차를 줄인 효율적인 1-8비트 LLM 추론을 가능하게 한다.

원저자: Xuetian Gao

게시일 2026-08-10
📖 6 분 읽기🧠 심층 분석

원저자: Xuetian Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 도서관의 책들을 아주 작은 배낭 속에 집어넣으려고 한다고 상상해 보세요. 인공지면 세계에서 이 "책들"은 이야기를 쓰고, 질문에 답하고, 당신과 대화하는 LLM(대규모 언어 모델)을 구성하는 수십억 개의 숫자(가중치라고 불림)를 의미합니다. 이러한 AI 모델을 컴퓨터에서 빠르게 실행하기 위해, 과학자들은 이 숫자들을 줄이려고 노력하는데, 이를 **양자화(quantization)**라고 합니다. 이것은 마치 고화기 사진을 휴대폰에서 빠르게 로드될 수 있도록 더 작은 파일 크기로 압축하는 것과 같습니다.

하지만 여기에는 까다로운 균형 잡기가 필요합니다. 숫자를 너무 많이 혹은 너무 경직되게 줄이면 중요한 세부 정보를 잃게 되어 AI가 바보 같은 실수를 하기 시작합니다. 반대로 숫자를 너무 크게 유지하면 컴퓨터가 과부하되어 실행 속도가 느려집니다. 전통적으로 과학자들은 두 가지 주요 방식을 사용해 왔습니다. **균등 양자화(Uniform Quantization)**는 완벽하게 동일한 간격을 가진 자를 사용하는 것과 같으며(단순하지만 경직됨), 부동 소수점(Floating-Point) 방식은 어떤 곳에서는 늘어나고 어떤 곳에서는 줄어드는 유연한 자를 사용하는 것과 같습니다(더 유연하지만 사용하기 어려움). 핵심적인 질문은 이것이었습니다. "우리는 유연한 자만큼 유연하면서도 단순한 자만큼 사용하기 쉬운 형식을 가질 수 있을까?"

여기서 CubicQuant라는 새로운 방법이 등장합니다. 이것은 마치 데이터를 측정하는 정확한 모양에 맞춰 변형될 수 있으면서도, 컴퓨터가 즉시 읽을 수 있을 만큼 단순한 "마법의 형상 변형 자"를 발명한 것과 같습니다. 이 논문의 저자인 Xuetian "Elliot" Gao는 데이터가 배치되는 방식을 결정하기 위해 특수한 수학적 곡선(3차 곡선)을 사용하는 시스템을 제안합니다. 모든 숫자를 하나의 직선적이고 경직된 선 안에 강제로 밀어 넣는 대신, CubicQuant는 데이터가 밀집된 곳에서는 눈금을 촘촘하게 만들고, 데이터가 희소한 곳에서는 눈금을 넓게 벌릴 수 있게 하여 데이터를 조밀하게 유지합니다.

이 접근 방식은 놀라울 정도로 잘 작동한다는 것이 논문의 결과입니다. 다양한 데이터 분포(정규 분포의 종 모양 곡선이나 라플라스 분포의 날카로운 스파이크 등)에 대해 테스트했을 때, CubicQuant는 특정 데이터 유형에 대해 표준 방식보다 재구성 오차를 최대 **28.14%**까지 줄였습니다. 또한 이 형식은 데이터를 먼저 풀어낼(unpack) 필요 없이 현대적인 그래픽 카드(GPU)에서 직접 실행될 수 있어 속도 면에서도 큰 이점을 보였습니다. 다만, 저자는 시뮬레이션과 격리된 테스트에서는 수치가 훌륭해 보이지만, 이것이 실제 사용자와의 채팅과 같은 실제 환경에서 AI를 더 "똑똑하게" 만들거나 더 빠르게 만드는지는 아직 증명하지 못했다고 주의를 기울였습니다. 결과는 유망하고 수학적으로 타당하지만, 이것이 AI의 세계를 바꿀 것인지에 대한 최종 테스트는 여전히 남아 있습니다.

"형상 변형 자"의 마법

CubicQuant가 왜 중요한지 이해하려면, AI의 "배낭 문제"를 어떻게 해결하는지 살펴봅시다.

기존 방식: 경직됨 vs 무질서함
다양한 크기의 구슬 한 봉지를 상자에 담는다고 상상해 보세요.

  • **균등 양자화(Uniform Quantization)**는 고정된 간격의 선반이 있는 상자를 사용하는 것과 같습니다. 구슬들이 모두 같은 크기라면 완벽하겠지만, 작은 자갈과 거대한 바위가 섞여 있다면 바위에는 공간이 낭비되거나 자갈이 으깨지게 됩니다. 단순하고 빠르지만, 물건의 모양에 적응하지 못합니다.
  • **학습된 코드북(Learned Codebooks)**은 모든 구슬을 하나하나 살펴보고 그에 맞는 맞춤형 선반을 만드는 전문 포장업자를 고용하는 것과 같습니다. 이는 매우 효율적이지만, 느리고 복잡하며, 물건이 어디에 있는지 기억하기 위한 많은 추가 정보(메타데이터)가 필요합니다. 컴퓨터가 빠르게 읽기 어렵습니다.

CubicQuant의 솔루션
CubicQuant는 이 두 세계의 장점을 결합했습니다. 그것은 **매개변수적 비균등 코드북(parametric non-uniform codebook)**을 사용합니다. 이는 "형상 변형 자"를 사용한다는 뜻의 멋진 표현입니다.

  • 고정된 선반 대신, 부드러운 곡선(3차 곡선)을 사용하여 선반의 위치를 결정합니다.
  • 이 곡선은 모든 작은 가중치 그룹(하나의 "그룹")에 대해 단 두 개의 형상 매개변수하나의 스케일 계수에 의해 제어됩니다.
  • 이것은 마치 휘어질 수 있는 유연한 자와 같습니다. 데이터가 0 근처에 몰려 있다면(많은 작은 숫자들처럼), 자는 그곳에 더 많은 "눈금"(재구성 레벨)을 놓도록 휘어집니다. 데이터가 꼬리 부분에 퍼져 있다면, 자는 늘어납니다.
  • 결정적으로, 이 휘어짐은 단순한 공식에 의해 제어됩니다. 컴퓨터는 거대한 룩업 테이블(lookup table)을 가질 필요 없이, 그 자리에서 바로 곡선을 계산합니다. 이를 통해 데이터를 정규 정수 스트림처럼 조밀하게 유지하면서도, AI 모델의 국소적인 통계에 적응할 수 있게 합니다.

작동 원리: "그룹" 전략

논문은 AI 모델의 가중치가 작은 그룹(예: 128 또는 256개의 숫자 그룹)으로 나뉜다고 설명합니다. 각 그룹에 대해 CubicQuant는 다음을 계산합니다:

  1. 스케일(Scale): 이 그룹 내의 숫자들의 전체적인 크기.
  2. 두 개의 형상 계수 (a와 b): 이 계수들은 곡선이 어떻게 휘어질지를 알려줍니다. 하나는 초기 기울기를 제어하고, 다른 하나는 곡률을 제어합니다.

이는 모델 전체에 수십억 개의 숫자가 있더라도, 컴퓨터가 특정 덩어리에 대한 자를 어떻게 "휘게" 할지 알기 위해 각 그룹마다 아주 적은 양의 추가 정보(메타데이터)만 저장하면 된다는 것을 의미합니다. 논문은 그룹 크기가 128일 때, 이것이 4비트 페이로드 외에 가중치당 단 0.5비트의 오버헤드만 추가된다고 언급하며, 매우 효율적임을 강조했습니다.

결과: 더 작은 오차, 동일한 속도

연구자는 이 새로운 자가 기존 방식들과 비교하여 얼마나 잘 작동하는지 실험을 진행했습니다. 세 가지 유형의 데이터 분포를 테스트했습니다:

  • 균등(Uniform): 데이터가 고르게 퍼져 있음.
  • 가우시안(Gaussian): 전형적인 "종 모양 곡선" (대부분 평균적이며 극단적인 값은 적음).
  • 라플라스(Laplace): 날카로운 정점과 두꺼운 꼬리를 가진 분포 (작은 숫자는 많지만, 매우 큰 이상치가 존재함).

결과:

  • 균등 데이터의 경우: 데이터가 이미 고르게 퍼져 있기 때문에, 유연한 자가 큰 도움이 되지 않습니다. 기존의 경직된 자와 동일한 성능을 보입니다.
  • 가우시안 및 라플라스 데이터의 경우: 여기서 CubicQuant가 빛을 발합니다. 이러한 분포는 0 근처에 많은 숫자가 모여 있고 꼬리 부분에는 숫자가 적기 때문에, 유연한 자가 0 근처에 "눈금"을 집중시켜 세부 사항을 더 잘 포착할 수 있습니다.
    • 가우시안 데이터의 경우, 표준 방식에 비해 오차를 13.49% 줄였습니다.
    • 라플라스 데이터의 경우, 개선 폭이 더 커서 **28.14%**에 달했습니다.
    • 또한, 이미 상당히 유연한 "부동 소수점" 형식보다 비트 너비에 따라 **6.27%에서 9.44%**까지 더 우수한 성능을 보였습니다.

논문은 이 결과들이 숫자를 얼마나 잘 재구성할 수 있는지에 대한 시뮬레이션수학적 증명임을 강조합니다. 이것이 AI의 답변 품질(혼란도, 추론 능력 등)을 높인다는 것을 아직 주장하는 것은 아닙니다.

AI를 실행하는 "두 가지 경로"

CubicQuant의 가장 멋진 특징 중 하나는 AI를 실행하는 두 가지 서로 다른 방식을 지원하며, 두 방식 모두에 완벽히 부합한다는 점입니다.

  1. Model-Dtype 경로: 컴퓨터가 숫자를 원래 모습 그대로(부동 소수점 연산을 사용하여) 재구성합니다. 이는 정확도에 좋습니다.
  2. Dynamic-A8 경로: 컴퓨터가 숫자를 실행 중에 표준 8비트 정수 형식(INT8)으로 매핑합니다. 이는 현대 컴퓨터의 텐서 코어(Tensor Cores)가 8비트 정수 연산에 매우 빠르기 때문에 속도 측면에서 유리합니다.

논문은 CubicQuant가 두 경로 모두에서 잘 작동하도록 "맞춤 설계"될 수 있음을 보여줍니다. 이는 마치 두 개의 다른 자물쇠에 맞는 열쇠를 설계하는 것과 같습니다. 연구자는 작은 작업에서는 표준 방식이 더 빠르지만, 작업 규모가 커질수록(데이터 행이 많아질수록) Dynamic-A8 경로가 훨씬 더 빨라진다는 것을 발견했습니다 (NVIDIA H200 GPU에서 일부 테스트 시 최대 4.46배 더 빠름).

하지 못하는 것 (제한 사항)

논문에 따르면 CubicQuant가 하지 못하는 것을 아는 것도 중요합니다:

  • AI 지능을 위한 마법의 해결책이 아닙니다. 논문은 이 방식이 AI를 더 똑똑하게 만들거나 지시 이행 능력을 높이는지에 대해 측정하지 않았음을 명시하고 있습니다. 이는 향후의 과제입니다.
  • 보편적인 속도 향상을 보장하지 않습니다. 속도 이득은 데이터의 형태와 컴퓨터 칩의 종류에 크게 의존합니다. 매우 작은 작업에서는 여가 표준 방식이 여전히 더 빠를 수 있습니다.
  • "지속적 활성화(Persistent Activation)" 문제를 해결하지 못합니다. 연구자는 공간을 절약하기 위해 압축된 숫자를 단계 사이에 메모리에 유지하려고 시도했으나, 컴퓨터가 데이터를 관리하는 데 너무 많은 시간을 소비하여 오히려 속도가 느려졌습니다. 따라서 현재로서는 이 방식을 제외했습니다.

요 요점

CubicQuant는 데이터의 모양에 맞춰 수학적 곡선을 사용하는, AI 가중치를 패킹하는 영리하고 새로운 방법입니다. 이것은 최적의 접점을 제공합니다. 경직된 방식보다 세부 사항을 더 잘 포착할 수 있을 만큼 유연하면서도, 현대적인 컴퓨터에서 빠르게 실행될 수 있을 만큼 단순합니다. 수학적 근거가 확실하고, 시뮬레이션은 큰 정확도 향상을 보여주며, 강력한 GPU에서의 초기 속도 테스트도 유망합니다. 하지만 모든 새로운 도구가 그러하듯, 이것이 정말로 AI를 구축하고 사용하는 방식을 바꿀 수 있을지는 실제 세상에서의 더 많은 테스트가 필요합니다. 현재로서는 차세대 효율적인 AI 모델을 위한 매우 강력한 후보입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →