← 최신 논문
💬 NLP

GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries

GaugeQuant는 캘리브레이션 데이터가 필요 없거나 언어 모델링 목적 함수를 변경하지 않고도 저비트 양자화 시 퍼플렉시티를 크게 감소시키기 위해, LLM 대칭성과 LogSumExp 손실 항을 활용하여 훈련 중에 양자화에 최적화된 기저를 동적으로 학습하는 온라인 학습 방법입니다.

원저자: Miguel P. Bento, João F. Seabra

게시일 2026-07-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Miguel P. Bento, João F. Seabra

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 지식의 도서관을 아주 작은 배낭에 집어넣으려고 애쓰는 모습을 상상해 보세요. 이것이 현대 인공지능(AI)이 매일 겪는 고충입니다. '대규모 언어 모델(LLM)'이라 불리는 이 AI 시스템의 '두뇌'는 너무나 거대해서, 이를 실행하는 데만 산더로 쌓인 컴퓨터 메모리가 필요합니다. 이들을 더 작은 기기에 담기 위해 과학자들은 **양자화(quantization)**라는 기술을 사용합니다. 이것은 고화질 영화를 용량을 줄이기 위해 저화질 파일로 압축하는 것과 비슷합니다. 디테일은 일부 손실되지만, 영화는 여전히 볼 만한 상태를 유지하죠. 하지만 여기에는 함정이 있습니다. 때때로 영화에 지나치게 밝거나 어두운 장면(이를 '아웃라이어(outliers)'라고 부릅니다)이 포함될 수 있는데, 이 극단적인 장면들에 맞춰 전체 파일을 압축하려고 하면 나머지 장면들이 흐릿해지거나 왜곡되는 문제가 발생합니다.

오랫동안 과학자들은 AI가 이미 만들어진 후에 이를 수정하려고 노력해 왔습니다. 마치 영화 촬영이 끝난 후에 편집을 시도하는 것과 같습니다. 그들은 '밝은 부분'을 찾아내고 별도의 데이터를 사용해 이를 부드럽게 다듬으려 했습니다. 하지만 이 논문은 새로운 아이디어를 제시합니다. 만약 AI가 구축되는 동안 스스로 자신의 도서관을 정리하도록 가르칠 수 있다면 어떨까요? 그러면 나중에 지저도한 뒷수습 없이도 자연스럽게 배낭에 쏙 들어갈 수 있을 것입니다. 연구진은 AI의 내부적인 '유연성'을 활용하여, 데이터가 압축되기 전에 훨씬 깔끔하게 재배열하는 방법을 제안합니다.


논문: GaugeQuant

여러분이 읽고 있는 이 논문은 GaugeQuant라고 불리는 영리한 새로운 기술에 관한 것입니다. 저자인 미겔 P. 벤토(Miguel P. Bento)와 주앙 F. 세아브라(João F. Seabra)는 이러한 AI 모델의 내부 구조에 숨겨진 초능력이 있다는 것을 발견했습니다. 그것은 바로 **대칭성(symmetry)**입니다.

이를 이해하기 위해, AI의 두뇌가 수천 개의 회전하는 톱니바퀴로 이루어져 있다고 상상해 보세요. 많은 곳에서 이 톱니바퀴들은 AI가 내놓는 최종 답변을 바꾸지 않으면서도 서로 완벽하게 동기화되어 회전할 수 있습니다. 마치 무용수 팀과 같습니다. 모든 무용수가 함께 90도 회전하더라도, 관객의 입장에서는 안무가 똑같아 보이는 것과 같습니다. AI는 데이터가 어떤 특정 '각도'에서 오는지에는 상관하지 않습니다. 톱니바퀴들 사이의 관계만 유지된다면 말이죠.

문제는 우리가 AI를 압축(양자화)할 때 특정 각도를 선택해야 한다는 점입니다. 만약 잘못된 각도를 선택하면, '아웃라이어'(너무 밝거나 어두운 데이터 지점들)가 늘어나면서 압축을 망쳐버립니다. 보통 과학자들은 AI 훈련이 끝난 후 별도의 데이터셋을 사용하여 최적의 각도를 찾아내야 합니다.

GaugeQuant는 이 과정을 훈련 도중에 수행함으로써 판도를 바꿉니다. 저자들은 AI의 숙제에 특별한 '벌칙'을 추가했습니다. 예를 들어, AI가 이야기를 쓰는 법을 배우고 있는데 선생님(컴퓨터)이 이렇게 말하는 상황을 상상해 보세요. "좋은 이야기구나! 하지만 너무 극단적이거나 이상한 단어를 사용하면 점수를 깎을 거야." 이 벌칙은 LogSumExp라고 불리는 수학적 공식에 기반합니다. 이 공식은 AI가 데이터를 회전시켜서 단 하나의 숫자라도 극단적인 아웃라이어가 되지 않도록 부드럽게 유도합니다.

여기서 마법 같은 부분이 일어납니다. AI는 자신의 이야기를 쓰는 능력을 망치지 않으면서 이 재배열 작업을 수행해야 합니다. 저자들은 '스톱 그래디언트(stop-gradient)' 기법을 사용했습니다. 이것은 마치 '한 방향 거울(one-way mirror)'과 같습니다. AI는 일반적인 학습을 통해 더 좋은 이야기를 쓰는 법을 배우지만, 압축을 위해 데이터를 정리하는 법은 별도의 보이지 않는 레슨을 통해 배웁니다. 이 두 과정은 서로 간섭하지 않습니다. 따라서 AI는 자동으로 데이터의 '완벽한 각도'를 찾아내며, 결과적으로 압축되었을 때 품질 저하 없이 모든 것이 딱 맞게 들어맞게 됩니다.

연구 결과

연구진은 두 가지 유명한 AI 모델인 Qwen-2.5 0.5BLLaMA-2 7B를 대상으로 테스트를 진행했습니다. 그들은 모델을 매우 낮은 정밀도(가중치와 활성화 함수 모두 4비트만 사용하는 매우 타이트한 설정)로 압축하는 상황을 시뮬레이션했습니다.

결과는 꽤 유망했습니다:

  • LLaMA-2 7B 모델의 경우, 가중치와 활성화 함수를 모두 4비트로 압축(W4A4, 그룹 크기 128)했을 때, '퍼플렉시티(perplexity, 낮을수록 AI가 덜 혼란스러워함을 의미하는 점수)'가 8.22에서 6.73으로 떨어졌습니다.
  • 가중치만 4비트로 압축하고 활성화 함수는 원래의 정밀도를 유지(W4A4)했을 때는 성능이 더욱 극적으로 향로되어, 점수가 11.16에서 5.45로 떨어졌습니다.
  • 더 작은 모델인 Qwen-2.5 0.5B에서도 개선 효과는 상당했습니다. W4A4 설정에서 점수가 187.8에서 61.2로 떨어졌습니다.

저자들은 이 방법이 특별한 캘리브레이션 데이터(별도의 테스트 세트)를 필요로 하지 않으며, 훈련 과정에 추가되는 시간도 거의 없다는 점에 주목했습니다. 이는 보통 훈련이 끝난 후 모델을 고정하고 광범로 테스트를 거쳐야 하는 기존 방식들과 경쟁할 수 있는 수준입니다.

한계점 (그리고 여전히 알려지지 않은 것들)

이 방법이 해결하지 못하는 부분도 알아두는 것이 중요합니다. 저자들은 만약 활성화 함수를 단 **하나의 스케일(전체 토큰에 적용되는 매우 엄격한 설정인 'per-token')**로 4비트 압축하려고 하면, 회전 기법을 사용하더라도 모델이 제대로 작동하지 않고 쓸모없게 된다는 것을 발견했습니다. 이 방법은 어느 정도의 그룹화(예: 그룹 크기 128)를 허용할 때 가장 잘 작동합니다.

또한, 저자들은 자신들의 방법이 실제 압축 오차를 나타내는 '프록시(대리물)'에 의존하고 있음을 인정했습니다. 그들은 아웃라이어가 어디에 있는지 예측하기 위해 LogSumExp 공식을 사용하지만, 이것이 실제 세상의 압축을 완벽하게 시뮬레이션하는 것은 아닙니다. 이 방식이 때로는 모델이 유사한 것들을 구별하는 데 실제로 필요한 데이터까지도 너무 매끄럽게 만들어버릴 수 있다고 그들은 제안합니다.

마지막으로, 이 결과들은 시뮬레이션과 두 가지 특정 모델(0.5B 및 7B)에 대한 훈련 결과에 기반하고 있습니다. 저자들은 수학적 원리는 탄탄하지만, 이 방식이 훨씬 더 큰 모델이나 다른 실제 환경에서 어떻게 작동할지는 아직 알 수 없다고 말합니다. 그들은 이것이 훈련 중에 사용할 수 있는 새로운 도구이며, 이후 더 나은 결과를 위해 다른 '사후 훈련(post-training)' 수정 기법들과 결합될 수 있다고 제안합니다. 다만, 모든 AI 아키텍처에 대해 작동한다는 것을 아직 증명한 것은 아닙니다.

요약하자면, GaugeQuant는 AI가 배우는 동안 스스로 데이터를 정리하도록 가르침으로써, 내용물을 쏟지 않고도 거대한 AI의 두뇌를 훨씬 작은 배낭에 담을 수 있다는 것을 보여줍니다. 이는 거대한 AI의 두뇌를 압축할 때 발생하는 복잡한 현실을 다루는 유쾌하고 효율적인 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →