← 최신 논문
🤖 machine learning

OffQ: Taming Structured Outliers in LLM Quantization by Offsetting

OffQ는 top-1 PCA를 통해 저차원 아웃라이어 부공간을 식별하고, 고진폭 활성화 값을 단일 채널로 회전시킨 뒤, 그 크기를 공유 오프셋으로 변환하여 효율적이고 정확한 W4A4KV4 양자화를 가능하게 함으로써 대규모 언어 모델의 활성화 아웃라이어를 완화하는 새로운 저비트 양자화 방법이다.

원저자: Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang, Mathieu Salzmann, Lukas Cavigelli

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang, Mathieu Salzmann, Lukas Cavigelli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 엄청나게 방대하고 정교한 지식의 도서관(거대 언어 모델, LLM)을 가지고 있다고 상상해 보세요. 이 도서관을 휴대폰이나 노트북에 담기 위해 작은 배낭 크기로 줄이려면, 책의 부피를 줄여야 합니다. 이 과정을 **양자화(quantization)**라고 부릅니다.

보통, 우리는 복잡한 숫자를 단순한 정수(예: 4.99를 5로 만드는 것)로 바꾸는 방식으로 세부 사항을 반올림하여 책을 줄입니다. 이렇게 하면 엄청난 공간을 절약할 수 있습니다.

문제점: "스크리머(Screamer, 비명 지르는 자들)"
하지만 여기에는 함정이 있습니다. 이 도서관의 대부분의 페이지는 차분하고 조용하지만, 몇몇 페이지에는 다른 모든 것보다 훨씬 더 크고 혼란스러운 "스크리머"(매우 큰 숫자들)가 들어 있습니다.

  • 만약 이 도서관 전체를 작은 상자에 넣으려고 시도한다면, 이 "스크리머"들 때문에 매우 거친 격자(grid)를 사용해야만 합니다.
  • 이는 마치 거대한 코끼리와 아주 작은 생쥐를 같은 작은 상자에 넣으려는 것과 같습니다. 코끼리를 맞추기 위해 생쥐를 형체를 알아볼 수 없을 정도로 짓눌러 버려야 하기 때문입니다.
  • 기술적인 용어로, 이러한 "스크리머"(활성화 이상치, activation outliers)는 데이터의 조용한 부분에서 반올림 오차를 너무 크게 만들어 모델의 정확도를 망가뜨립니다.

기존의 해결책들
이 코끼리와 생쥐 문제를 해결하기 위한 이전의 시도들은 다음과 같았습니다:

  1. 새로운 축소 방식 학습: 모델이 더 잘 줄일 수 있도록 다시 학습시키는 것 (비싸고 느림).
  2. 서로 다른 크기의 상자 사용: 코끼리는 큰 상자에, 생쥐는 작은 상자에 넣는 것 (혼합 정밀도). 이것은 작동하지만, 패킹 과정을 복잡하고 느리게 만듭니다.
  3. 이상하고 특수한 상자 사용: 표준 선반에 맞지 않는 특수한 상자를 만드는 것 (비균등 양자화). 하지만 대부분의 컴퓨터는 이를 쉽게 처리하지 못합니다.

새로운 해결책: OffQ
이 논문은 OffQ라는 새로운 방법을 소개합니다. 스크리머와 싸우거나 서로 다른 상자를 사용하는 대신, OffQ는 스크리머를 "상쇄"하는 영리한 트릭을 사용합니다.

OffQ가 작동하는 방식은 다음과 같습니다 (단순한 비유를 사용한 단계별 설명):

1. "스크리머" 찾기 (Top-1 PCA)

먼저, OffQ는 데이터에서 "스크리머"들이 정확히 어디에 숨어 있는지 찾아냅니다.

  • 비유: 많은 사람이 속삭이고 있지만, 한 사람이 구석에서 비명을 지르고 있는 붐비는 방을 상상해 보세요. 표준 방식은 속삭임 때문에 혼란을 겪을 수 있습니다. OffQ는 속삭임을 무시하고 오직 가장 큰 비명 소리에만 집중하는 특별한 "Top-1" 레이더를 사용합니다.
  • 결과: 이를 통해 이 스크리머들이 특정 패턴을 따르며, 하나의 "시끄러운 채널"로 묶일 수 있음을 식별합니다.

2. "스크리머"를 한곳으로 모으기 (회전)

찾아낸 후, OffQ는 데이터를 회전시켜 모든 비명 소리의 에너지를 단 하나의 채널에 집중시킵니다 (마치 극장의 모든 비명 지르는 사람들을 하나의 특정 좌석으로 옮기는 것과 같습니다).

  • 비유: 여러 줄에서 사람들이 비명을 지르는 대신, 그들을 모두 앞줄 1번 좌석으로 옮깁니다. 이제 극장의 나머지 부분은 완벽하게 조용해집니다.

3. 마법의 "오프셋(Offset)" 트릭 (Hadamard 회전)

이것이 핵심 혁신입니다. OffQ는 그 하나의 "시끄러운 좌석"을 가져와 수학적 회전(Hadamard 회전)을 사용하여 그 시끄러운 소음을 모든 좌석에 고르게 퍼뜨립니다.

  • 비유: 1번 좌석에서 나는 큰 소음이 사실 거대하고 무거운 담요라고 상상해 보세요. 그 담요를 1번 좌석에 그대로 두는 대신(그렇게 하면 시야를 가리니까), OffQ는 담요를 아주 작은 동일한 조각들로 자른 뒤 방 안의 모든 좌석에 한 조각씩 덮어씌웁니다.
  • 결과: 더 이상 어떤 좌석도 압도당하지 않습니다. "소음"은 이제 모든 사람에게 동일하게 들리는 아주 작은 배경 소음이 되었습니다.

4. 소음 흡수하기 (양자화)

소음이 이제 방 전체에 걸쳐 일정하고 균일한 웅성거림이 되었기 때문에, 양자화 과정(축소)은 단순히 이렇게 말할 수 있습니다. "좋아, 방 안에 미세한 웅성거림이 있다는 것을 알고 있어. 그 소음을 무시하도록 우리의 제로 포인트(zero-point)를 조정하자."

  • 비유: 사서에게 이렇게 말하는 것과 같습니다. "방 안에 약간의 먼지가 있다는 것을 알고 있습니다. 모든 책의 무게에서 아주 적은 양의 먼지를 빼주세요. 그러면 이제 책들이 작은 배낭에 완벽하게 들어갈 것입니다."
  • 결과: "스크리머"들이 효과적으로 중화되었습니다. 이제 모델은 언어를 이해하는 능력을 잃지 않고도 매우 작은 크기(4-bit)로 줄어들 수 있습니다.

이것이 왜 중요한가

  • 특수 하드웨어가 필요 없음: 커스텀 제작된 복잡한 컴퓨터 칩을 요구하는 다른 방법들과 달리, OffQ는 표준적이고 균일한 상자를 사용합니다. 이는 커스텀 제작된 상자 대신 표준 컨테이너를 사용하는 것과 같습니다.
  • 더 나은 정확도: 논문은 OffQ가 가장 작은 크기로 줄일 때(가중치, 활성화 및 메모리에 대해 4-bit)도 이전 방법들보다 모델의 지식을 훨씬 더 정확하게 유지함을 보여줍니다.
  • 효율성: 모델을 다시 학습시키거나 다른 종류의 상자를 위해 추가 메모리를 사용할 필요가 없습니다. 단지 데이터를 재배치하고 "제로 포인트"를 조정할 뿐입니다.

요약하자면
OffQ는 영리한 포장 기술입니다. 몇몇 "시끄러운" 숫자들이 전체 배송을 망치도록 두는 대신, 그것들을 격리하고, 그 효과를 전체 패키지에 고르게 퍼뜨린 다음, 내용물을 망가뜨리지 않고 아주 작고 효율적인 상자에 완벽하게 들어맞도록 규모를 조정합니다. 이는 강력한 AI 모델을 일상적인 기기에서 실행하는 것을 훨씬 더 실현 가능하게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →