← 최신 논문
🤖 machine learning

Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models

이 논문은 매개변수 간의 상관관계를 포착하기 위해 전체 피셔 정보 행렬(Fisher information matrix)의 크로네커 인수 분해 근사(Kronecker-factored approximation)를 활용하여 기존의 대각 기반 압축 기술들을 크게 능가하는, 대규모 언어 모델을 위한 확장 가능한 사후 학습 압축 방법인 일반화된 피셔 가중치 SVD(Generalized Fisher-Weighted SVD, GFWSVD)를 제안한다.

원저자: Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva, Andrey Kuznetsov, Evgeny Frolov

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva, Andrey Kuznetsov, Evgeny Frolov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 거대하고 정교한 도서관을 그 안의 이야기들을 하나도 잃지 않은 채 배낭 안에 들어갈 수 있도록 줄이려고 노력 중이라고 상상해 보십시오. 이것은 인공지능 분야, 특히 인간의 뇌처럼 학습하도록 설계된 컴퓨터 프로그램인 "신경망"을 연구하는 과학자들의 일상적인 도전 과제입니다. 이 프로그램들은 "파라미터(매개변수)"라고 불리는 수백만 개의 작은 스위치들로 구축됩니다. 이 프로그램들을 더 빠르게 실행하고 더 작은 기기에서 구동하기 위해, 연구자들은 별로 일을 많이 하지 않는 스위치들을 잘라내려고 시도합니다. 하지만 까다로운 점은, 이 스위치들이 혼자 작동하지 않는다는 것입니다. 이들은 마치 복잡한 무용단과 같아서, 만약 무용수 한 명을 빼버리면 그 무용수가 다른 사람과 손을 잡고 있었기 때문에 전체 공연이 무너질 수도 있습니다.

오랫동안, 어떤 무용수를 잘라낼지 결정하는 표준적인 방법은 그들의 '손잡기(연결)'를 무시한 채 각자를 개별적으로 살펴보는 것이었습니다. 이는 마치 무용수가 누군가를 지탱해주고 있다는 사실을 알아차리지 못한 채, 그 무용수가 피곤한지만 확인하는 것과 같았습니다. 이 방식은 빨랐지만, 종종 공연을 망치곤 했습니다. 당신이 읽게 될 이 논문은 이 "춤"을 바라보는 새로운 방법을 도입함으로써 이 문제를 다룹니다. 이 논문은 "피셔 정보 행렬(Fisher Information Matrix)"이라는 수학적 도구를 사용하는데, 이는 모든 스위치가 다른 모든 스위치와 어떻게 연결되어 있는지를 보여주는 지도 역할을 합니다. 목표는 이 지도를 사용하여 (AI 모델이라는) 도서관을 줄이되, 그 안의 이야기들(지능)은 완벽하게 온전하게 유지하는 것입니다.

핵심 아이디어: 무용수 개인이 아닌, 전체 춤을 보다

이 논문의 저자인 빅토리아 체칼리나(Viktoriia Chekalina)와 그녀의 팀은 기존의 지도들이 너무 흐릿하다는 것을 깨달았습니다. 그들은 단순히 어떤 무용수가 중요한지를 넘어, 그들이 어떻게 연결되어 있는지를 보여주는 지도를 원했습니다. 이를 위해 그들은 **MFF(Matrix-free Fisher Factorization)**라는 새로운 알고리즘을 발명했습니다.

피셔 정보 행렬을 전체 무대 위를 덮고 있는 거대하고 밀도 높은 안개라고 상상해 보십시오. 과거에는 이 안개를 뚫고 연결성을 찾아내는 것이 불가능했는데, 왜냐하면 안개가 너무 두껍고 무대 또한 너무 넓었기 때문입니다. 기존의 방법들은 연결 관계가 단순할 것이라고(예를 들어 직선 형태라고) 추측했는데, 이는 실제 춤의 복잡한 곡선을 놓치는 결과를 초래했습니다.

팀의 새로운 기술인 MFF는 안개를 완전히 제거하지 않고도 안개의 구조를 볼 수 있게 해주는 특수한 안경을 가진 것과 같습니다. 모든 연결을 일일이 기록하려고 하는 대신(이는 너무 많은 메모리를 소모합니다), 이 알고리즘은 춤의 특정 "층(layer)"에 집중하여 실시간으로 연결성을 계산합니다. 이것은 "행렬 프리(matrix-free)" 접근 방식이며, 이는 실제로 거대하고 무거운 지도를 직접 구축하는 것이 아니라, 단지 그 지도의 형태를 이용해 절단의 방향을 안내한다는 것을 의미합니다.

해결책: 모델을 축소하는 새로운 방법

이러한 연결성을 보는 새로운 방식을 사용하여, 팀은 **GFWSVD(Generalized Fisher-Weighted SVD)**라는 방법을 개발했습니다. 만약 AI 모델을 찰흙 덩어리라고 상상한다면, 표준적인 방법들은 단순히 가장자리를 깎아낼 것입니다. 그러나 GFWSVD는 찰흙의 내부 결(grain)을 이해합니다. 이 방법은 어떤 부분의 찰흙이 서로 단단히 엮여 있으며, 형태를 유지하기 위해 특정 방식으로 잘라야 하는지를 알고 있습니다.

논문은 특정 수학적 조건(구체적으로, 연결이 "행렬-변량 정규 분포(Matrix-Variate Normal distribution)"라는 패턴을 따르는 경우) 하에서, 그들의 방법이 모델을 축소하는 유일하고 최적인 방법임을 증명합니다. 이것은 단순한 추측이 아닙니다. 파라미터를 제거할 때 모델의 성능에 가해지는 손상을 최소화하는 수학적으로 완벽한 방법입니다.

발견한 내용: 모델의 절반을 깎아내다

팀은 코딩부터 채팅까지 모든 것을 수행하는 거대 언어 모델인 Llama 2Llama 3.1을 포함하여, 가장 유명한 AI 모델 중 일부에 이 새로운 방법을 테스트했습니다. 또한 텍스트 이해에 사용되는 모델인 BERT에 대해서도 테스트를 진행했습니다.

그들이 발견한 결과는 다음과 같습니다:

  • 압축 능력: 이들은 이 거대 모델들을 최대 **50%**까지 축소할 수 있었습니다. 즉, 파라미터의 수를 절반으로 줄인 것입니다.
  • 성능: 크기가 절반이 되었음에도 불구하고, 모델들은 원래 버전만큼 잘 작동하거나 때로는 원래보다 더 나은 성능을 보여주었습니다. 많은 테스트에서 GFWSVD는 (대각 근사나 활성화 기반 방법과 같은) 현재의 최고 방법들을 전방위적으로 압도했습니다.
  • 붕괴 방지: 모델을 40% 압축했을 때, 표준적인 방법들은 실패하기 시작하여 AI가 추론하거나 질문에 답하는 능력을 잃게 만들었습니다. 그러나 GFWSVD는 견고하고 신뢰할 수 있는 상태를 유지했습니다.
  • 속도: 모델이 더 작아졌기 때문에 더 빠르게 실행됩니다. 강력한 컴퓨터 칩(NVIDIA A100)에서, 압축된 모델은 압축되지 않은 원래 모델보다 텍스트를 1.34배 더 빠르게 처리했습니다.

이것이 중요한 이유

저자들은 파라미터 사이의 숨겨진 연결(비대각 요소)에 주목함으로써, 모델을 망가뜨리지 않고 훨씬 더 공격적으로 AI 모델을 축소할 수 있음을 보여주었습니다. 그들은 대부분의 다른 방법들이 하는 것처럼 이러한 연결을 무시하는 것이, 잠재적인 성능을 상당 부분 놓치는 결과를 낳는다는 것을 증명했습니다.

또한 그들은 이 방법이 다른 학습 과정의 훌륭한 "시작점(starter)"이 될 수 있음을 보여주었습니다. 만약 GFWSVD를 사용하여 먼저 모델을 축소한 다음, 모델이 조금 더 학습할 수 있도록(미세 조정/fine-tune) 한다면, 표준적인 축소 방법을 사용했을 때보다 정확도를 훨씬 더 잘 유지할 수 있습니다.

요약하자면, 이 논문은 거대한 AI 모델을 잘라내기 위한 새롭고 수학적으로 타당한 "가위"를 제공합니다. 이는 지능은 그대로 유지하면서 부피만 버릴 수 있게 하여, 강력한 AI를 더 작은 기기에서도 사용할 수 있게 하고, 원래 모델의 마법을 잃지 않으면서도 더 저렴하게 운영할 수 있도록 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →