← 최신 논문
🤖 machine learning

TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling

TileQ 는 입력 및 출력 차원 간에 공유되는 2 차원 타일링 구조의 저랭크 인자를 활용하고 단일 패스 추론 기법과 결합하여 정확도를 유지하면서 전문가 혼합 모델의 메모리 사용량과 지연 시간을 크게 줄이는 미세 조정 없는 사후 학습 양자화 방법입니다.

원저자: Hongyaoxing Gu, Xinzhe Chen, Lijuan Hu, Fangfang Liu

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hongyaoxing Gu, Xinzhe Chen, Lijuan Hu, Fangfang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 AI 회사가 일하는 방대한 전문가 (전문가) 도서관을 상상해 보세요. 이 회사는 "믹스처 오브 전문가 (MoE)" 시스템을 사용합니다. 작동 방식은 다음과 같습니다: 질문을 하면 AI 는 모든 전문가를 깨우지 않습니다. 대신 그 특정 질문에 가장 적합한 전문가 몇 명 (100 명 중 2 명 또는 4 명 정도) 만 선택합니다. 이로 인해 AI 는 매우 똑똑하면서도 매우 효율적이 됩니다.

문제점:
AI 가 한 번에 몇 명의 전문가만 사용하더라도, 모든 전문가가 호출을 기다리며 컴퓨터의 메모리 (RAM) 에 앉아 있어야 합니다. 마치 한 번에 한 권의 책 한 페이지만 읽더라도 도서관의 모든 책이 책상에 놓여 있어야 하는 것과 같습니다. 이는 엄청난 공간을 차지하며, 필요한 몇 권의 책을 찾기 위해 방대한 책 더미를 뒤져야 하므로 컴퓨터를 느리게 만듭니다.

기존 해결책 (그리고 실패한 이유):
과학자들은 이러한 책들을 요약 (양자화) 하거나 작은 부분으로 분할 (저랭크) 하여 압축하려고 시도했습니다.

  • 문제점: 각 전문가를 개별적으로 요약하면 여전히 너무 많은 요약본이 생깁니다. 전문가들 사이에 요약본을 공유하려 하면, 기존 방법들은 책을 단일 긴 줄 (1 차원) 에 쌓으려 하는 것과 같았습니다. 공간을 조금 절약했지만, 컴퓨터는 여전히 올바른 페이지를 찾기 위해 많이 뛰어다녀야 했으므로 속도가 느려졌습니다. 또한, "요약 노트" 자체가 너무 많은 추가 공간을 차지하여 절약 효과가 상쇄되었습니다.

새로운 해결책: TILEQ
이 논문의 저자들은 TILEQ를 제안합니다. 이를 단일 긴 줄 대신 **2 차원 격자 모양의 선반 (체스판과 유사)**으로 도서관을 재편성하는 것으로 생각하세요.

TILEQ 가 작동하는 방식에 대한 간단한 설명은 다음과 같습니다:

1. "2 차원 타일링" 트릭 (지능형 선반)

64 명의 전문가가 있다고 가정해 보세요. TILEQ 는 이들을 64 명의 별개 사람으로 취급하는 대신, "이봐요, 1 번 전문가와 5 번 전문가가 매우 비슷하게 생각하고, 2 번 전문가와 6 번 전문가도 쌍둥이네요"라고 깨닫습니다.

  • 기존 방식: 1 번 전문가를 요약한 다음 2 번, 3 번... 하여 64 개의 별도 요약본을 만듭니다.
  • TILEQ 방식: 이 64 명의 전문가를 8x8 격자 (더 큰 틱택토 보드와 유사) 로 배열합니다.
    • 같은 에 있는 전문가들은 "왼쪽 노트 (입력에 대한 공통 요약)"를 공유합니다.
    • 같은 에 있는 전문가들은 "오른쪽 노트 (출력에 대한 공통 요약)"를 공유합니다.
    • 결과: 64 개의 고유한 요약본이 필요했던 대신, 8 개의 행 노트와 8 개의 열 노트만 있으면 됩니다. 이로써 "노트"를 저장하는 데 필요한 메모리가 극적으로 줄어듭니다.

2. "한 번 통과" 추론 (급행 엘리베이터)

AI 가 질문에 답하려면 보통 선택한 각 전문가마다 별도의 계산을 수행해야 합니다. 이는 한 명씩 엘리베이터를 호출하는 것과 같습니다. 느리고 비효율적입니다.

  • TILEQ 의 해결책: 전문가들이 이제 깔끔한 2 차원 격자로 배열되고 노트를 공유하므로, 컴퓨터는 "활성" 전문가들을 한 번의 매끄러운 동작으로 모두 처리할 수 있습니다. 이는 책을 하나씩 가져오는 대신, 컨베이어 벨트를 켜서 선택된 모든 책을 한 번에 독자에게 이동시키는 것과 같습니다.
  • 장점: 컴퓨터 하드웨어 (GPU) 가 작고 흩어진 조각 대신 크고 단단한 데이터 블록으로 작업할 수 있으므로 AI 가 훨씬 빠르게 실행됩니다 (지연 시간 감소).

3. "재학습" 불필요

일반적으로 AI 를 압축하면 잊지 않도록 다시 가르쳐야 합니다 (파인튜닝). TILEQ 는 "학습 후 양자화 (PTQ)" 방법입니다.

  • 비유: 마치 완성된 고해상도 사진을 다시 찍지 않고 더 작은 파일 크기로 압축하는 것과 같습니다. 기존 이미지를 처리할 뿐입니다. 이는 막대한 시간과 컴퓨팅 파워를 절약합니다.

결과

이 논문은 이 2 차원 격자와 "한 번 통과" 방식을 사용하면 다음과 같은 결과가 있다고 주장합니다:

  • 메모리: 기존 방법 대비 이러한 "노트"에 필요한 추가 메모리를 최대 10 배까지 줄입니다.
  • 속도: 모델의 이러한 특정 부분에 대한 질문 응답 시간 (지연 시간) 을 기존 시간의 약 **5%**까지 단축합니다.
  • 정확도: 이렇게 작고 빠르더라도 AI 는 크고 압축되지 않은 버전과 마찬가지로 질문에 정확히 답합니다.

요약:
TILEQ 는 똑똑한 AI 의 "메모리 노트"를 조직화하는 교묘한 방법입니다. 모든 전문가에게 무거운 배낭을 주는 대신, 가벼운 배낭을 공유하는 팀으로 그룹화합니다. 이로 인해 전체 시스템이 더 작은 컴퓨터에 적합해지고 지능을 잃지 않으면서 훨씬 빠르게 실행됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →