← 최신 논문
🤖 machine learning

Output-Aware Rotation for INT2 KV-Cache Quantization

이 논문은 헤드별 직교 보정(per-head orthogonal corrections)과 키 재매개변수화(key reparameterization)를 통해 투영 후 어텐션 출력 오차를 최소화함으로써, 대규모 언어 모델을 위한 INT2 KV-캐시 양자화 성능을 무시할 수 있는 수준의 추론 오버헤드로 유지하면서도 크게 향상시키는 출력 인지 회전 방식인 OptR을 제안한다.

원저자: Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong, Sunwoo Lee, Murali Annavaram, Sai Praneeth Karimireddy, Sungjoo Yoo

게시일 2026-08-05
📖 5 분 읽기🧠 심층 분석

원저자: Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong, Sunwoo Lee, Murali Annavaram, Sai Praneeth Karimireddy, Sungjoo Yoo

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구에게 들은 거대한 이야기를 기억하려고 노력하고 있다고 상상해 보세요. 당신은 지금까지 들은 모든 중요한 세부 사항을 적어두는 공책을 가지고 있습니다. 이야기가 커질수록 더 많은 페이지가 필요합니다. 이제 당신의 공책에 공간이 부족해졌고, 더 큰 공책을 살 형편도 되지 않는다고 상상해 보세요. 이 문제를 해결하기 위해, 당신은 글씨를 작게 쓰기로 결ุ정합니다. 완전하고 명확한 글자 대신, 점, 대시, 원, 십자가라는 네 개의 아주 작은 기호만을 사용하여 휘갈겨 쓰는 것입니다. 이것은 방대한 양의 정보를 매우 작은 공간에 압축하는 것과 같습니다.

인공지능의 세계, 특히 대규모 언어 모델(LLM)에서 이러한 공책은 "KV 캐시(Key-Value caches)"라고 불립니다. 이것은 대화의 맥락을 저장하여 AI가 이전에 나눈 대화를 기억할 수 있게 해줍니다. 대화가 길어짐에 따라 이 캐시는 엄청나게 커져서 메모리를 잡아먹고 속도를 늦춥니다. 이를 해결하기 위해, 과학자들은 데이터를 단 2비트(우리의 네 가지 기호처럼 단 네 단계만 사용하는 방식)로 줄여 압축하려고 노력합니다. 하지만 여기에는 함정이 있습니다. 데이터를 너무 꽉 눌러 짜면, 정말 중요하고 특이한 세부 사항인 "아웃라이어(outliers)"들이 잘못된 모양으로 찌그러져 버려서 AI가 실수를 하기 시작한다는 것입니다. 이것은 마치 거대하고 울퉁불퉁한 감자를 아주 작은 상자에 억지로 넣으려는 것과 같습니다. 감자는 멍이 들 것이고, 상자에서 꺼냈을 때 원래의 감자 모양을 유지하지 못할 것입니다.

한동안 연구자들은 이 감자를 찌그러뜨리기 전에 미리 회전시켜서, 덩어리들을 고르게 퍼뜨리는 방식으로 문제를 해결하려 했습니다. 하지만 그들은 성공 여부를 측정할 때, 상자 '안'에서 감자가 얼마나 잘 보이는지를 기준으로 삼았습니다. 즉, AI가 나중에 그 데이터를 사용해 이야기를 어떻게 전달할 수 있는지를 본 것이 아니라 말이죠. 이 논문은 OptR(Output-Aware Rotation, 출력 인지 회전)이라는 새로운 방법을 도입하여 판도를 바꿉니다. 단순히 데이터를 보기 좋게 만드는 대신, OptR은 데이터를 압축하고 다시 펼친 '후'에 AI가 여전히 이야기를 이해할 수 있는지 확인합니다. 결과적으로, 이 방식은 데이터를 아주 좁은 네 가지 기호의 공책에 담더라도 AI가 훨씬 더 정확하게 기억할 수 있게 해준다는 사실이 밝혀졌습니다.

문제점: "찌그러진 감자" 효과

AI가 긴 텍스트를 읽을 때, AI는 자신이 본 단어들의 정신적 지도를 구축합니다. 이 지도는 KV 캐시에 저장됩니다. 공간을 절약하기 위해 연구자들은 이 지도를 줄이는 양자화(quantization) 기술을 사용합니다. 가장 극단적인 버전은 INT2 양자화로, 데이터를 단 네 가지 값으로 줄입니다. 이는 매우 효율적입니다. 표준 형식의 1/8 수준의 메모리만 사용하기 때문입니다. 하지만 이는 위험합니다.

캐시의 데이터를 줄에 서 있는 학생들로 생각해 보세요. 대부분의 학생은 평균적인 키를 가졌지만, 몇몇은 거인입니다. 만약 이들을 작은 방(INT2 범위)에 넣으려고 한다면, 거인들은 찌그러질 것이고, 방이 너무 작기 때문에 평균적인 학생들도 함께 찌그러질 것입니다. 이는 "양자화 오차(quantization error)"를 유발하며, AI가 거인뿐만 아니라 평균적인 학생들까지도 잘못 기억하게 만듭니다.

이를 해결하기 위해 이전 방법들은 **회전(rotation)**을 사용했습니다. 줄에 서 있는 학생들을 회전시켜서, 거인들이 똑바로 서 있는 대신 옆으로 기울어져 있게 만든다고 상상해 보세요. 이렇게 하면 그들의 키가 방 전체에 골고루 퍼지게 되어, 누구나 찌그러지지 않고 방에 들어갈 수 있게 됩니다. 그러나 이 논문은 기존 방법들이 실수를 저질렀다고 주장합니다. 그들은 단순히 데이터를 상자 안에 예쁘게 넣기 위해(저장된 데이터의 오차를 최소화하기 위해) 학생들을 돌렸지만, 학생들이 방을 나간 후에도 제대로 달릴 수 있는지(데이터를 사용할 수 있는지)는 확인하지 않았습니다.

저자들은 불일치를 지적합니다. 데이터를 상자 안에서 가장 보기 좋게 만드는 회전이, 반드시 데이터를 사용한 후 AI가 가장 잘 수행하게 만드는 회전은 아니라는 것입니다. AI는 데이터가 캐시 안에서 완벽하게 보이는 것에는 관심이 없습니다. AI는 최종 답변이 올바른지에 관심이 있습니다.

해결책: OptR (출력 인-지 회전)

이 논문은 저장 공간이 아닌 최종 출력을 기준으로 회전을 최적화하는 방법인 OptR을 제안합니다.

OptR의 작동 단계는 다음과 같습니다:

  1. 데이터 중심 맞추기 ("수평 맞추기" 기술): 데이터를 찌그러뜨리기 전에, OptR은 키(key)에서 평균값을 뺍니다 (Key Reparameterization). 만약 우리 줄의 거인들이 사실 높은 플랫폼 위에 서 있었다고 가정해 봅시다. OptR은 플랫폼을 낮추어 모두가 같은 지면 위에 서 있게 만듭니다. 이것은 서로 간의 키 차이를 바꾸지는 않지만, 거인들이 작은 방의 천장에 부딪히는 것을 막아줍니다. 결정적으로, 이 단계는 "어텐션 등가(attention-equivalent)"입니다. 즉, 숫자는 바꾸지만 AI의 어텐션 집중도는 정확히 동일하게 유지합니다. 이는 숫자의 범위를 좁혀서 INT2 압축의 고통을 훨씬 덜하게 만듭니다.

  2. 완벽한 회전 학습하기 ("출력 인지" 단계): 고정된 회전(표준 수학적 회전)을 사용하는 대신, OptR은 모델의 모든 "헤드(head, AI의 뇌 중 특정 부분)"를 위한 맞춤형 회전을 학습합니다. 이를 위해 전체 과정을 시뮬레이션합니다: 데이터를 압축하고, 다시 펼치고, AI의 어텐션 메커니즘을 통과시킨 다음, 최종 답변으로 투영합니다.

    • 이 과정에서 최종 답변의 오차(post-WO attention-output error)를 살펴봅니다.
    • 이 오차를 두 부분으로 나눕니다: **키(key)**에 의해 발생하는 오차(AI가 무엇에 주목할지 결정함)와 **값(value)**에 의해 발생하는 오차(실제로 어떤 정보가 추출될지 결정함)입니다.
    • 그다음, 단순히 저장 공간의 오차를 줄이는 것이 아니라, 최종 답변의 오차를 최소화하도록 회전 각도를 미세하게 조정합니다.

라디오 튜닝을 생각해보세요. 기존 방법들은 스피커 박스 내부의 정전기 소리가 최대한 조용하게 들리도록 만들려고 했습니다. 반면 OptR은 스피커에서 나오는 음악을 직접 듣고, 내부의 정전기가 완벽하게 무음이 되지 않더라도 노래가 완벽하게 들릴 때까지 노브를 조절합니다.

연구 결과

연구진은 세 가지 AI 모델(Qwen3-4B, Qwen3-8B, Phi4-14B)과 수학 문제(AIME25), 코딩 작업(LiveCodeBench), 그리고 긴 문맥 검색(64,000 단어 속에서 바늘 찾기)을 포함한 다섯 가지 도전적인 벤치마크에서 OptR을 테스트했습니다.

결과는 놀라웠습니다:

  • 엄청난 정확도 향상: Qwen3-8B 모델에서, 기존의 최고 방법인 QuaRot을 사용한 표준 INT2 양자화는 어려운 수학 테스트에서 **17.33%**의 정확도만을 기록했습니다. 하지만 OptR을 추가하자 정확도가 **66.67%**로 치솟았습니다. 이는 거의 4배에 달하는 개선입니다.
  • 베이스라인 돌파: 이미 꽤 우수했던 최첨단 방법인 OSCAR와 비교해도, OptR은 정확도를 **54.67%**에서 **66.00%**로 끌어올렸습니다.
  • 긴 문맥에서의 초능력: 가장 인상적인 발견은 긴 문맥 작업에서 나타났습니다. 이야기가 길어질수록(최대 64,000 토큰), 표준 INT2 방식은 처참하게 실패하여 정확도가 거의 0에 수렴했습니다. 반면 OptR은 검색 정확도를 높게 유지했습니다. 4k 토큰일 때 **99.83%**였던 정확도가 64k 토근에서 **70.02%**로 약간 감소했을 뿐, 표준 방식이 **0.04%**로 추락한 것과 대조적입니다.
  • 속도 저하 없음: 저자들은 이 마법에 큰 비용이 따르지 않는다는 것을 확인했습니다. OptR을 시스템에 통합한 결과, AI의 속도(지연 시간)와 처리량(throughput)은 표준 방식과 거의 동일하게 유지되었습니다. 이는 마치 자동차에 추가적인 무게를 더하지 않고도 슈퍼차저 엔진을 장착한 것과 같습니다.

이것이 왜 중요한가

이 논문은 초저비트 양자화(INT2와 같은)가 제대로 작동하려면, 데이터를 독립적으로 보는 것이 아니라 그 데이터가 전체 시스템을 통해 최종 답변으로 어떻게 흐르는지를 보아야 한다고 제안합니다. 저장이 아닌 출력을 최적화함으로써, OptR은 극한의 압축과 높은 성능 사이의 간극을 메웁니다.

저자들은 이것이 단순한 이론적 승리가 아니라 실용적인 승리임을 강조합니다. 이를 통해 AI 모델은 메모리 부족 없이 훨씬 더 긴 대화를 처리하고 더 많은 사용자를 수용할 수 있으며, 동시에 어려운 수학 문제를 풀거나 코드를 작성할 만큼 똑똑함을 유지할 수 있습니다. 그들은 단순히 이것이 가능할 것이라고 제안한 것이 아니라, 여러 모델에 걸쳐 일관되고 유의미한 개선을 측정함으로써 "출력 인지(output-aware)" 최적화가 2비트 AI의 잠재력을 끌어올리는 핵심임을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →