← 최신 논문
💬 NLP

Multi-Bitwidth Quantization for LLMs Using Additive Codebooks

이 논문은 가산 코드북(additive codebooks)과 마트료시카 스타일의 감독(Matryoshka-style supervision)을 활용하여, 단일 LLM 체크포인트가 다양한 모델 아키텍처 전반에서 경쟁력 있는 정확도를 유지하면서도 최소한의 저장 공간 오버헤드로 적응형 다중 비트 폭 추론을 지원할 수 있도록 하는 새로운 사후 학습 양자화 프레임워크인 Drop-by-Drop을 소개한다.

원저자: Liza Babaoglu, Shuangyi Chen, Ashish Khisti

게시일 2026-06-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Liza Babaoglu, Shuangyi Chen, Ashish Khisti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

논문 "Multi-Bitwidth Quantization for LLMs Using Additive Codebooks" (Drop-by-Drop 소개)에 대한 설명: 쉬운 언어와 창의적인 비유를 사용함

거대한 문제: 모든 이에게 맞는 하나의 크기란 없다

당신이 아주 정교하고 상세한 지식의 거대한 도서관(대규모 언어 모델 또는 LLM)을 가지고 있다고 상상해 보세요. 이 도서관은 너무 방대해서 이를 보관하기 위해 거대한 창고가 필요합니다.

  • 클라우드: 만약 이 도서관을 클라우드의 거대한 슈퍼컴퓨터에서 실행한다면, 공간은 충분합니다. 모든 책을 펼쳐 놓고 아주 세밀한 부분까지 읽을 수 있습니다.
  • 스마트폰: 하지만 이와 똑같은 도서관을 스마트폰이나 작은 엣지 디바이스에서 실행하려고 한다면, 창고가 너무 큽니다. 스마트폰의 메모리(RAM)와 배터리가 그 전체 크기를 감당할 수 없기 때문입니다.

현재의 해결책 ("정적" 방식):
현재는 이 도서관을 다양한 기기에서 사용하고 싶을 때, 도서관의 별도 복사본들을 만들어야 합니다.

  1. 슈퍼컴퓨터를 위한 "디럭스 에디션" (고품질, 거대한 크기).
  2. 스마트폰을 위한 "포켓 에디션" (압축됨, 낮은 품질).
  3. 태블릿을 위한 "트래블 에디션" (중간 크기).

이것은 비효율적입니다. 당신은 동일한 도서관의 세 가지 서로 다른 버전을 학습시키고, 저장하고, 유지 관리해야 합니다. 만약 스마트폰에서 태블릿으로 전환하고 싶다면, 파일 전체를 교체해야 합니다.

새로운 해결책: "Drop-by-Drop"

저자들은 Drop-by-Drop이라는 새로운 방법을 제안합니다. 여러 개의 서로 다른 도서관을 만드는 대신, 재학습하거나 교체할 필요 없이 기기에 따라 마법처럼 줄어들거나 커질 수 있는 단 하나의 도서관을 만듭니다.

도서관을 책의 더미가 아니라 **러시아 인형(마트료시카 인형)**이라고 생각해 보세요.

  • 바깥쪽 껍데기: 가장 작고 기본적인 버전입니다. 주머니에 들어갈 정도로 작지만, 가장 중요한 사실들은 알고 있습니다.
  • 중간 층: 껍데기를 열면, 약간 더 많은 세부 정보가 담긴 조금 더 큰 인형이 나옵니다.
  • 내부 핵심: 모든 세부 사항이 담긴 전체 크기의 인형입니다.

Drop-by-Drop을 사용하면, 당신은 세 개의 서로 다른 인형을 들고 다닐 필요가 없습니다. 단 하나만 있으면 됩니다.

  • 스마트폰에서는 바깥쪽 껍데기만 사용합니다.
  • 태블릿에서는 껍데기를 열어 중간 층을 사용합니다.
  • 슈퍼컴퓨터에서는 모두 열어서 전체 핵심을 사용합니다.

작동 원리: "가산 코드북(Additive Codebook)" 레시 recipe

이 마트료시카 인형이 작동하게 만들기 위해, 저자들은 가산 양자화(Additive Quantization) 기술을 사용합니다.

당신이 누군가에게 전화로 복잡한 그림을 설명하려고 한다고 상상해 보세요.

  1. 표준 방식: 스마트폰을 위해 저해상도 사진(흐릿함)을 보내고, 컴퓨터를 위해 고해상도 사진을 보냅니다. 이것은 두 개의 서로 다른 파일입니다.
  2. Drop-by-Drop 방식: 먼저 기초 스케치를 보냅니다.
    • 듣는 사람이 작은 화면을 가지고 있다면, 거기서 멈춥니다. 그들은 그림의 대략적인 윤곽을 파악하게 됩니다.
    • 듣는 사람이 더 큰 화면을 가지고 있다면, 형태를 정의하는 몇 개의 선이 더 담긴 레이어 2를 보냅니다.
    • 듣는 사람이 아주 큰 화면을 가지고 있다면, 최종적인 색상과 세부 묘사가 담긴 레이어 3를 보냅니다.

여기서 마법은 레이어 2와 레이어 3는 레이어 1 없이는 쓸모가 없지만, 레이어 1 자체만으로도 완벽하다는 점입니다. 이 레이어들은 "가산적(additive)"입니다. 즉, 더 명확한 그림을 만들기 위해 서로 위에 쌓이는 구조입니다.

핵심 비결: "마트료시카(Matryoshka)" 학습

보통 AI가 데이터를 압축하도록 학습할 때는, 가장 완벽한 최종 결과물을 만드는 데 집중합니다. 초기 단계의 레이어들이 형편없더라도 신경 쓰지 않습니다. 중간에 멈추면 그림은 엉망이 됩니다.

저자들은 **마트료시카 감독(Matryoshka Supervision)**이라는 특별한 학습 규칙을 도입했습니다.

  • 비유: 선생님이 학생의 에세이를 채점하는 상황을 상상해 보세요.
    • 기존 방식: 선생님은 오직 최종 10페이지짜리 에세이만 채점합니다. 만약 학생이 1페이지만 쓰고 멈춘다면, 선생님은 "이건 쓰레기야, 채점할 수 없어"라고 말합니다.
    • Drop-by-Drop 방식: 선생님은 모든 단계에서 학생을 채점합니다. "좋아, 1페이지는 훌륭한 요약이야. 3페이지는 좋은 세부 사항들을 추가했구나. 10페이지는 완벽해."
  • 결과: AI가 모든 부분적인 버전(1개 레이어, 2개 레이어, 3개 레이어)이 모두 정확하도록 학습되었기 때문에, 작은 기기를 사용할 때 추가 레이어를 "드롭(drop)"하더라도 남은 레이어들이 여전히 완벽하게 작동할 수 있습니다.

이 기술이 왜 중요한가 (논문에 따르면)

  1. 하나의 모델, 다양한 기기: 단 하나의 파일만 저장하고 다운로드하면 됩니다. 기기는 자신의 메모리에 따라 파일의 어느 정도까지 "풀어낼지(unpack)" 결정합니다.
  2. 재학습 불필요: 스마트폰이나 태블릿마다 새로운 모델을 학습시킬 필요가 없습니다. 단일 모델이 자동으로 적응합니다.
  3. 매끄러운 전환: 저전력 기기에서 고성력 기기로 이동할 때, 호환되지 않는 모델 사이를 건너뛰는 것이 아니라 품질이 매끄럽게 향상됩니다.
  4. 검증된 이론: 이 논문은 이 "중첩(nesting)" 방식이 LLM이 사용하는 데이터 유형에 대해 이론적으로 가능하다는 것을 정보 이론(Information Theory)을 통해 증명하며, 레이어를 추가함으로써 효율성을 잃지 않음을 보장합니다.

요약

Drop-by-Drop은 경직된 "일률적인" AI 모델을 유연하고 "스Intelligent"한 모델로 바꿉니다. 이 모델은 단 하나의 파일로부터 주머니 속으로 줄어들어 들어가거나 슈퍼컴퓨터를 가득 채울 만큼 확장될 수 있습니다. 이는 AI가 최종적인 가장 상세한 버전뿐만 아니라, 모든 수준의 디테일에 대해서도 능숙해지도록 학습함으로써 가능해집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →