← 최신 논문
🤖 machine learning

When Local Variance Optimality Is Not Enough: RoPE-Aligned Q/K Rotations for Dynamic 4-Bit Quantisation

이 논문은 RoPE 정렬된 쌍별 회전(pairwise rotations)이 엄격한 가환성 제약 조건 하에서 특정 풀링된 분산 대리 함수를 최소화하는 데 분석적으로 최적이지만, 대리 함수의 가정과 양자화기가 사용하는 토큰별 통계 사이의 근본적인 불일치로 인해 전체 헤드 하다마르 변환(full-head Hadamard transforms)과 비교하여 동적 4비트 양자화 정확도를 개선하는 데 실패한다는 것을 입증한다.

원저자: Shuhan Wang, Yilin Luo, Nan Xu, Chi Wang Cheung

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shuhan Wang, Yilin Luo, Nan Xu, Chi Wang Cheung

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 푹신한 데이터 구름을 작고 딱딱한 상자에 집어넣으려고 애쓰는 모습을 상상해 보세요. 이것이 거대한 인공지면(AI) 모델을 일반 컴퓨터나 휴대폰에서 실행할 수 있도록 더 작고 빠르게 만드는 과정에서 겪는 일상의 사투입니다. 이를 위해 과학자들은 '양자화(quantization)'라는 기술을 사용하는데, 이는 마치 구름을 더 낮은 해상도로 꾹 눌러 압축하는 것과 같습니다. 하지만 여기에는 함정이 있습니다. 구름 속에는 '아웃라이어(outliers)'라고 불리는 매우 밝고 무거운 지점들이 존재합니다. 주의를 기울이지 않고 구름 전체를 꾹 누르면 이 무거운 지점들이 뭉개져 버리고, 결국 AI는 어처구니없는 실수를 하기 시작합니다.

이 문제를 해결하기 위해 연구자들은 '회전(rotation)'이라는 방법을 사용해 왔습니다. 구름이 스파게티 가닥들로 만들어졌다고 상상해 보세요. 만약 가닥 전체를 그냥 꾹 누르면 두꺼운 가닥들이 끊어지고 맙니다. 하지만 가닥들을 먼저 비틀어준다면, 두께를 고르게 분산시켜서 아무것도 부서지지 않게 더 쉽게 누를 수 있습니다. 이 가닥들을 비트는 대중적인 방법은 'RoPE(Rotary Position Embedding)'라고 불리는 것에 기반합니다. RoPE는 AI에게 문장의 단어 순서를 이해하는 법을 알려주는 특별한 지침서와 같습니다. 이 지침서는 자연스럽게 스파게티를 서로 연결된 쌍(pair)의 형태로 나눕니다.

이 논문이 던지는 핵심 질문은 이것입니다. 우리가 데이터를 맞추기 위해 스파게티를 비틀 때, 전체 가닥 묶음을 한꺼번에 비틀어야 할까요, 아니면 지침서가 말하는 특정 쌍의 가닥들만 비틀어야 할까요? 지침서의 쌍을 존중하는 것이 더 논리적으로 보일 것입니다, 그렇지 않나요? 저자들은 더 똑똑하고 효율적인 데이터 비틀기 방법을 찾고자 이 '쌍 단위 회전(pairwise twisting)' 아이디어를 테스트하기로 했습니다.

작동하지 않은 비틀기

연구자 셰이한 왕(Shuhan Wang), 이린 루오(Yilin Luo)와 그 팀은 이 '쌍 단위 회전' 아이디어를 검증하기로 했습니다. 그들은 RoPE 지침서를 완벽하게 따르는 방식으로 데이터를 비틀려면 수학적으로 반드시 특정 쌍만을 비틀어야 한다는 수학적 이론을 구축했습니다. 심지어 그들은 각 쌍을 비틀기에 가장 적절한 각도를 계산하여, 이론적으로 해당 쌍에 대해 최적의 '비틀기(variance)'를 구현하는 로컬 옵티멈(local optimum)을 찾아냈습니다.

하지만 실제로 동적 4비트 양자화(dynamic 4-bit quantization, 데이터를 줄이는 특정 방식)를 사용하여 이 방법을 현실 세계에 적용했을 때, 결과는 반전이 있었습니다. 그들의 완벽한 수학적 계산에도 불구하고, '쌍 단위 전용' 방식은 오히려 기존의 전체 묶음 회전 방식보다 AI의 언어 이해 능력을 떨어뜨렸습니다.

네 가지 다른 AI 모델(Llama 및 Mistral 포함)을 대상으로 한 실험에서, 전체 헤드 회전을 그들의 새로운 '수학적으로 완벽한 쌍 회전'으로 교체하자 모델의 혼란도가 증가했습니다. 논문은 이 혼란도를 '퍼플렉시티(perplexity)'라는 점수로 측정합니다. 퍼플렉시티가 높을수록 모델은 더 길을 잃은 상태임을 의미합니다. 연구 결과, 쌍 단위 방식은 모델의 퍼플렉시티를 모델에 따라 +0.05에서 +1.33 포인트까지 증가시켰습니다. 예를 들어, Llama-3.2-1B 모델의 경우, 쌍 단위 방식은 표준 방식보다 퍼플렉시티를 1.33 포인트 더 높였습니다. 심지어 양자화되는 데이터(K 스트림)만을 고려하여 비틀기 각도를 계산하도록 수학적 수정을 가했음에도 불구하고, 쌍 단위 방식은 여 전체 헤드 방식을 따라잡지 못했습니다.

왜 완벽한 수학이 실패했는가?

저자들은 문제가 수학이 틀린 것이 아니라, 그들의 수학이 사용하는 특정 도구에 대해 '잘못된 문제'를 풀고 있었다는 점을 깨달았습니다.

이렇게 생각해 보세요. 연구자들은 특정 자물쇠(데이터 쌍의 수학적 분산)에 완벽하게 맞는 열쇠(쌍 단위 회전)를 설계했습니다. 하지만 그들이 열려고 했던 문(양자화 도구)은 그 자물쇠를 사용하지 않았습니다. 그 문은 전혀 다른 메커니즘을 사용했습니다. 즉, 아주 작은 쌍 단위가 아니라 훨씬 더 큰 그룹 전체에 걸친 데이터의 범위를 살펴보는 방식이었습니다.

논문에 따르면, '쌍 단위' 방식은 무거운 지점을 두 가닥에 걸쳐 분산시키는 힘만 가지고 있습니다. 하지만 '전체 헤드' 방식은 그 무거운 지점을 128개의 가닥(또는 모델에 있는 가닥 전체)에 걸쳐 넓게 펼칠 수 있습니다. 이는 마치 거대한 바위를 평평하게 만드는 것과 같습니다. 만약 당신에게 한 번에 두 곳만 때릴 수 있는 망치만 있다면 툭 튀어나온 부분이 남을 것입니다. 하지만 바위 전체를 한 번에 때릴 수 있는 망치가 있다면 완전히 평평하게 만들 수 있습니다. '믹싱 서포트(mixing support)', 즉 비틀기가 영향을 미칠 수 있는 가닥의 수가 진짜 주인공이었습니다. 저자들이 비틀 수 있는 가닥의 블록 크기를 2개에서 128개까지 점점 키워가며 테스트했을 때, 더 많은 가닥을 섞을 수 있을수록 모델의 혼란도가 낮아지는 것을 확인했습니다.

시사점

여기서 얻을 수 있는 주요 교훈은, 어떤 방법이 특정 규칙(예: RoPE의 쌍 구조)에 대해 수학적으로 완벽하다고 해서, 그것이 실제 작업(데이터를 작은 상자에 담는 일)에 최선이라는 의미는 아니라는 점입니다. 저자들은 동적 양자화의 경우, 데이터를 전체 그룹 전체에 걸쳐 섞고 분산시키는 능력이 지침서의 쌍 단위 구조를 엄격히 따르는 것보다 더 중요하다는 것을 발견했습니다.

그들은 데이터를 비트는 더 나은 새로운 방법을 찾아낸 것이 아니라, 왜 겉보기에 더 똑똑하고 구조적인 접근 방식이 실패했는지에 대한 명확한 이유를 찾아냈습니다. '쌍 단위' 회전의 '로컬(local)'한 완벽함은 '전체 헤드' 회전의 '글로벌(global)'한 이점을 극복할 수 없었습니다. 결국, 이 논문은 AI 도구를 설계할 때, 단순히 AI 아키텍처의 구조적 규칙을 따르는 것이 자동으로 더 나은 결과를 가져올 것이라고 가정하기보다는, 우리의 수학적 목표가 우리가 사용하는 양자화 도구의 실제 규칙과 일치하는지 확인해야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →