← 최신 논문
🤖 machine learning

OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization

OSCAR 는 오프라인 스펙트럴 공분산 추정을 활용하여 어텐션 정렬 회전 및 클리핑 임계값을 도출하는 배포 가능한 2 비트 KV 캐시 양자화 방법으로, 현대 LLM 서비스 프레임워크에서 메모리 사용량을 크게 줄이고 추론 처리량을 향상시키면서도 장문맥 추론 작업에서 거의 손실 없는 정확도를 가능하게 합니다.

원저자: Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 OSCAR 논문에 대한 설명을 일상적인 언어와 창의적인 비유로 번역한 것입니다.

큰 문제: "기억 수집가"

거대 언어 모델 (LLM) 을 지능적이지만 건망증이 있는 사서라고 상상해 보세요. 여러분이 긴 질문을 하면, 사서는 문맥을 이해하기 위해 지금까지 여러분이 말한 모든 것의 실행 목록 (KV 캐시) 을 유지해야 합니다.

대화가 길어질수록 (32,000 단어 이상까지) 이 목록은 거대해집니다. 이를 저장하기 위해 사서는 막대한 양의 비싼 메모리 (거대하고 고속인 창고와 같은) 가 필요합니다. 창고가 가득 차면 사서는 작업을 멈추거나 속도가 극도로 느려져야 합니다.

이 논문의 목표는 사서가 중요한 것을 잊지 않으면서 그 창고를 8 배 줄이는 것입니다. 그들은 메모를 "고화질"(BF16) 에서 "작은 스케치"(2 비트) 크기로 압축하고자 합니다.

구식 방법: "하드마드 셔플"

이전에는 연구자들이 단순히 단어들을 섞어서 이러한 메모를 줄이려 했습니다. 그들은 하드마드 회전이라는 수학적 트릭을 사용했습니다.

  • 비유: 몇 개의 거대하고 어색한 소파 (이상치) 와 많은 작은 의자가 있는 messy 한 방이 있다고 상상해 보세요. 모든 것을 작은 상자에 넣을 수 없습니다. 구식 방법은 거대한 믹서를 가져와 방 전체를 회전시키는 것이었습니다. 이렇게 하면 거대한 소파들이 퍼져서 약간 더 큰 의자 몇 개처럼 보이게 되어 포장하기 쉬워집니다.
  • 결함: 이 혼합은 "맹목적"입니다. 사서의 작업에 실제로 중요한 방의 어떤 부분이 있는지 알지 못합니다. 모든 것을 작은 2 비트 스케치로 압축할 때, 이 맹목적인 혼합은 가장 중요한 세부 사항을 실수로 흐리게 만들어 사서가 환각을 보거나 잘못된 답변을 하게 만듭니다. 마치 섬세한 화병과 돌을 함께 포장하려는 것과 같습니다. 상자를 그냥 흔들면 화병이 깨집니다.

새로운 해결책: OSCAR ("지능형 건축가")

저자들은 OSCAR(Offline Spectral Covariance-Aware Rotation) 을 제안합니다. 방을 맹목적으로 흔드는 대신, OSCAR 은 포장 시작 전에 사서가 정확히 어떻게 작동하는지 연구하는 지능형 건축가처럼 행동합니다.

1. "오프라인 보정" (연구 단계)

사서가 고객 서비스를 시작하기 전에, OSCAR 은 대화의 작은 샘플을 가져와 이렇게 묻습니다: "사서가 결정을 내리기 위해 실제로 사용하는 메모리의 어떤 부분인가?"

  • 비유: 사서가 특정 질문에 기반해 책을 고르라고 가정해 보세요. OSCAR 은 사서가 책 표지의 색상( "Query") 에는 깊이 관심을 갖지만 페이지의 두께( "Value") 에는 크게 관심이 없다는 것을 깨닫습니다.
  • 결과: OSCAR 은 이러한 특정 요구 사항과 메모리 저장을 정렬하는 맞춤형 지도 (회전 행렬) 를 생성합니다. 사서가 가장 중요하게 생각하는 부분은 고정밀도로 보존되도록 하고, 덜 중요한 부분은 더 공격적으로 압축되도록 합니다.

2. "지능형 포장" (회전)

OSCAR 은 이 지도를 사용하여 데이터를 압축에 완벽한 형태로 회전시킵니다.

  • 비유: 방을 무작위로 회전시키는 대신, OSCAR 은 모든 깨지기 쉬운 물건이 작은 상자에 완벽하게 들어맞도록 정렬되도록 가구를 재배치합니다. 이는 "중요한 방향"을 "노이즈"와 분리합니다.
  • 마법: 이렇게 함으로써 데이터를 2 비트(매우 작음) 로 압축하면서도 사서의 정확도를 원래 고화질 버전과 거의 동일하게 유지할 수 있습니다.

3. "하이브리드 창고" (시스템)

OSCAR 은 모든 것을 한 번에 압축하지 않습니다. 그것은 교묘한 하이브리드 시스템을 사용합니다:

  • "싱크" 및 "최근" 토큰: 처음 몇 단어들 (이야기의 시작) 과 마지막 몇 단어들 (방금 말한 것) 은 고화질로 유지됩니다. 이것이 가장 중요한 앵커입니다.
  • "역사" 토큰: 대화의 중간 부분 (긴 역사) 은 지능형 OSCAR 회전을 사용하여 작은 2 비트 스케치로 압축되는 부분입니다.

이것이 중요한 이유 (결과)

이 논문은 매우 긴 문맥을 가진 Qwen 과 GLM 과 같은 가장 똑똑한 이용 가능한 AI 모델들에서 이를 테스트했습니다.

  • 정확도: 다른 방법들이 2 비트로 압축하려 했을 때, 모델들은 기본적으로 생각하는 법을 잊어버렸습니다 (정확도가 거의 0 으로 떨어졌습니다). OSCAR 은 모델들이 원래 고화질 버전과 거의 똑똑하게 유지되도록 했습니다.
  • 속도 및 메모리: 데이터가 8 배 작아졌기 때문에, 창고는 8 배 더 많은 대화를 수용할 수 있습니다. 이는 시스템이 메모리가 부족해지지 않으면서 동시에 7 배 더 많은 사용자를 처리할 수 있음을 의미합니다.
  • 실제 사용 준비 완료: 저자들은 단순히 이론만 쓴 것이 아니라, 현대 AI 서버 (SGLang 및 vLLM) 에 들어가는 작동 시스템을 구축했습니다. 이는 단순히 더 나은 상자를 설계한 것이 아니라, 그 상자를 사용하고 더 빠르게 주행하는 새로운 트럭을 만든 것과 같습니다.

요약

OSCAR은 AI 모델이 메모리를 절약하려 할 때 "잊어버리는" 것을 막는 방법입니다. 데이터를 맹목적으로 으깨는 대신, 먼저 AI 가 실제로 무엇을 중요하게 생각하는지 연구하고, 그 요구 사항에 맞게 데이터를 재배열한 다음 압축합니다. 이를 통해 AI 는 지능을 잃지 않고도 막대한 양의 정보 (책 한 권 전체와 같은) 를 메모리의 아주 작은 부분만 사용하여 기억할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →