← 최신 논문
🤖 machine learning

XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference

XFP 는 사용자 지정 품질 임계값에 기반하여 코드북 매개변수를 자동으로 결정하고 희소성 있는 이상치를 효과적으로 분리하여 높은 처리량과 정확도를 달성함과 동시에 품질 중심의"H-Process"반복을 통해 대규모 모델이 제한된 메모리 내에 수용되도록 하는 LLM 추론을 위한 동적이며 보정 불필요한 가중치 양자화 방법입니다.

원저자: Thomas Witt

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Thomas Witt

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 3,970 억 개의 레고 조각으로 이루어진 성 (거대 AI 모델) 을 작은 배낭 (일반 워크스테이션 컴퓨터) 에 넣으려 한다고 상상해 보세요.

보통은 그 성을 넣기 위해 벽돌을 작은 균일한 먼지로 부수려 합니다 (표준 압축). 하지만 이렇게 하면 성이 망가집니다. 세부 사항이 흐려지고 AI 는 실수를 하기 시작합니다.

XFP는 그 성을 담는 더 똑똑한 새로운 방법입니다. 모든 것을 부수는 대신 '품질 우선' 접근법을 사용합니다. 간단한 비유를 통해 작동 원리를 설명해 드리겠습니다.

1. '비트 너비' 대신 '품질 바닥선'

옛날 방식에서는 컴퓨터에게 이렇게 지시합니다. "이 벽돌 하나당 4 비트로 포장해." 컴퓨터는 최선을 다하지만, 벽돌 모양이 기이하면 결과가 나빠집니다.

XFP 는 이를 뒤집습니다. 컴퓨터에게 이렇게 말합니다. "이 성이 원본과 최소 96% 는 비슷하게 보이게 해."
그러면 컴퓨터가 나머지를 스스로 판단합니다. "알겠어, 96% 품질을 유지하려면 이 특정 부분에 실제로 몇 비트가 필요하지?"

  • 어떤 부분에서는 2 비트만 필요할 수도 있습니다.
  • 다른 부분에서는 4 비트가 필요할 수도 있습니다.
  • 모든 것에 적용되는 일률적인 규칙을 강요하지 않습니다.

2. '이상치' 문제 (거대 벽돌)

레고 성에서 99% 의 벽돌은 작고 평범하지만, 1% 는 거대하고 무겁고 모양이 기이한 벽돌이라고 상상해 보세요.

  • 옛날 방법: 작은 상자에 맞추기 위해 거대 벽돌을 억지로 으깹니다. 이로 인해 상자 전체가 왜곡되어 작은 벽돌도 나빠 보입니다.
  • XFP 방법: *"저 거대하고 기이한 벽돌들은 꺼내서 별도의 특수 주머니에 넣어보자."*라고 말합니다.
    • 특수 주머니는 거대 벽돌들을 원래의 고품질 형태로 보관합니다 (약간의 공간을 더 쓰지만, 필요한 소수에게만 해당됩니다).
    • 메인 상자는 이제 압축하기 쉬운 99% 의 평범한 벽돌만 담습니다.

3. '맞춤형 사전' (코드북)

모든 단어가 같은 길이를 갖는 표준 사전을 사용하는 대신, XFP 는 AI 의 각 레이어마다 맞춤형 사전을 학습합니다.

  • 성의 특정 방에 있는 벽돌들을 살펴보고 어떤 모양이 가장 자주 나타나는지 정확히 학습합니다.
  • 그 모양들만 담은 작은 목록 (코드북) 을 만듭니다.
  • 그런 다음 벽돌 전체를 저장하는 대신, 그 목록에서 해당 모양을 가리키는 작은 숫자 (인덱스) 만 저장합니다.
  • 그 목록이 그 특정 방을 위해 맞춤 제작되었기 때문에 효율성이 매우 뛰어납니다.

4. 두 가지 규칙 (엄격 vs 관대)

AI 에는 서로 다른 유형의 방들이 있습니다.

  • '엄격한' 방들: (세부 사항에 주의를 기울이는 어텐션 메커니즘과 같은 곳). XFP 는 여기서 매우 신중합니다. 고품질 사전을 사용하고 특수 주머니에 더 많은 거대 벽돌을 보관합니다.
  • '관대한' 방들: (전문가 역할을 하는 '라우팅된 전문가'들과 같은 곳). 이 방들은 더 유연합니다. XFP 는 이 부분에서는 더 작고 거친 사전을 사용합니다. 왜냐하면 AI 의 이 부분들은 깨지지 않고도 더 많이 으깨질 수 있기 때문입니다.

이를 통해 XFP 는 AI 의 두뇌를 망가뜨리지 않고 막대한 공간을 절약할 수 있습니다.

5. 'H-프로세스' (꽉 끼는 압박)

이 논문은 보통 담을 수 없는 3,970 억 파라미터 모델을 두 개의 표준 그래픽 카드에 넣는 특정 과제를 설명합니다.

  • 그들은 H-프로세스라는 과정을 사용했습니다.
  • 이를 '골리디락스' 게임처럼 생각하세요. 그들은 '엄격한' 규칙과 '관대한' 규칙을 계속 조정했습니다.
    • 규칙을 너무 엄격하게 하면 모델이 배낭에 들어가지 않습니다 (메모리 부족).
    • 규칙을 너무 관대하게 하면 AI 가 망가진 말을 하기 시작합니다 (불합리한 출력).
  • 그들은 모델이 완벽하게 들어가고, 빠르게 실행되며, 여전히 좋은 답변을 주는 '딱 알맞은' 설정 (H1.5) 을 찾았습니다.

결과

  • 속도: 고성능 워크스테이션 컴퓨터에서 XFP 는 1,220 억 모델의 경우 현재 가장 우수한 표준 방법 (Marlin INT4) 보다 49% 더 빠릅니다.
  • 품질: AI 의 지능을 원본 압축 해제 버전과 거의 동일하게 유지합니다.
  • 접근성: 고가의 데이터 센터 슈퍼컴퓨터 없이도 연구자들이 표준 고성능 데스크톱 컴퓨터에서 거대 AI 모델을 실행할 수 있게 합니다.

간단히 말해: XFP 는 모든 것을 균일한 상자에 강제로 넣지 않는 똑똑한 포장 시스템입니다. 기이하고 무거운 물건들은 분리하고, 나머지를 위해 맞춤형 사전을 학습하며, 유지하려는 품질의 양을 사용자가 결정하면 자동으로 가장 효율적으로 모두 담는 방법을 찾아냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →