← 최신 논문
💬 NLP

From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

이 논문은 기존의 레이어 기반 방식의 한계를 극복하기 위해 어텐션(Attention) 및 피드포워드(FeedForward) 구성 요소에 대해 개별적으로 피팅된 잔차 바이패스(residual bypass)를 갖는 비연속적 서브모듈 수준의 선택을 가능하게 함으로써, 다양한 모델과 희소성 수준에 걸쳐 우수한 정확도-퍼플렉시티 트레이드오프 및 추론 효율성을 달성하는 사후 학습 LLM 압축 방법인 SubFit을 소개한다.

원저자: Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)을 수백 개의 동일한 워크스테이션(레이어)을 가진 거대하고 고급스러운 공장 조립 라인이라고 상상해 보십시오. 이 공장에는 두 명의 주요 작업자가 있습니다. 한 명은 어텐션(Attention) 전문가(문맥을 살피고 아이디어를 연결하는 역할)이고, 다른 한 명은 피드포워드(FeedForward) 전문가(아이디어를 처리하고 변형하는 역할)입니다.

이 공장을 더 빠르게 실행하고 전기를 덜 사용하게(메모리 절약) 만들기 위해, 당신은 몇몇 워크스테이션을 제거하려고 합니다. 하지만 문제는, 단순히 조립 라인 중간에서 워크스테이션을 통째로 뽑아내 버리면 정보의 흐름이 끊겨 제품(AI의 답변)이 망가진다는 것입니다.

기존 방식: "동네 전체 철거"

이전의 방법들은 (예를 들어 10번부터 15번까지의) 연속된 블록의 워크스테이션을 통째로 골라 한꺼번에 제거하려고 시도했습니다. 그러고 나서 그 전체 블록을 대체할 하나의 작고 단순한 "지름길 터널"을 만들려고 했습니다.

이 논문의 저자들은 이것이 마치 망가진 동네를 고치기 위해 집 한 줄을 통째로 허물고 그 자리에 아주 작은 창고 하나를 짓는 것과 같다고 주장합니다. 이는 너무 투박한 방식입니다. 그들은 다음을 깨달았습니다:

  1. 중복성은 깔끔하지 않다: 제거할 수 있는 "잉여" 작업은 항상 깔끔하고 연속적인 행으로 존재하지 않습니다. 라인 중간의 어떤 워크스테이션은 거의 아무 일도 하지 않는 반면, 바로 옆에 있는 다른 워크스테이션은 매우 많은 일을 할 수도 있습니다.
  2. 작업자마다 필요한 해결책이 다르다: "어텐션" 작업자와 "피드포워드" 작업자는 서로 다릅니다. 그들을 효과적으로 대체하기 위해서는 각기 다른 유형의 지름길이 필요합니다.

새로운 방식: "SUBFIT" (맞춤형 패치 작업)

이 논문은 SUBFIT이라는 방법을 소개합니다. SUBFIT은 동네 전체를 철거하는 대신, 숙련된 재단사나 외과의사처럼 행동합니다.

  1. 철거가 아닌 절개와 패치: 이 방식은 라인의 어디에 있든 상관없이 모든 개별 워크스테이션을 개별적으로 살펴봅니다. 그리고 가장 적은 양의 고유한 작업을 수행하는(즉, "중복된") 특정 워크스테이션을 골라 제거합니다. 이들은 반드시 서로 붙어 있을 필요가 없으며, 공장 곳곳에 흩어져 있을 수 있습니다.
  2. 맞춤형 바이패스(Bypass): 제거된 모든 워크스테이션에 대해, 각각 맞춤형 "바이패스"(지름길)를 제작하여 연결합니다.
    • 어텐션 작업자를 위해: 매우 단순하고 낮은 랭크(low-rank)의 지름길(마치 좁은 오솔길 같은 것)을 사용합니다.
    • 피드포워드 작업자를 위해: 약간 더 복적인 경로를 사용하지만, 여기서 영리한 트릭이 등장합니다. 이 경로의 "설계도"를 제거된 모든 피드포워드 작업자 간에 공유합니다. 이는 마치 하나의 마스터 키를 사용하여 여러 개의 문을 여는 것처럼 엄청난 공간을 절약해 줍니다.

결과: 더 빠르고, 더 작지만, 여전히 똑똑함

저자들은 열 가지 서로 다른 AI 모델(기본 모델 및 지시 이행 학습 모델 모두)에 대해 테스트를 진행했습니다. 그들은 SUBFIT을 기존의 "동네 전체 철거" 방식들과 비교했습니다.

  • 트레이드오프(Trade-off): 보통 AI를 압축하면 속도는 빨라지지만 실수가 많아집니다(높은 퍼플렉서티(perplexity)와 낮은 정확도).
  • 승자: SUBFIT은 기존 방식들보다 AI를 훨씬 더 똑똑하게 유지했습니다. 25% 압축 수준(워크스테이션의 4분의 1을 제거)에서 기존 방식들은 원래 지능의 약 81% 수준으로 떨어졌습니다. 반면 SUBFIT은 **84.6%**를 유지했습니다.
  • "공격적인" 테스트: 모델을 더 많이 압축하려고(37.5%) 시도했을 때, 기존 방식들은 완전히 무너졌습니다. 하지만 SUBFIT은 훨씬 더 잘 버텨냈습니다.
  • 속도: 실제로 무거운 기계(서브모듈)를 제거했기 때문에 공장은 더 빠르게 돌아갑니다. AI는 첫 단어를 더 빨리 생성하며, 대화를 기억하기 위한 메모리(KV-캐시)도 적게 사용합니다.

핵심 요약

이 논문은 압축의 "입도(granularity)"(잘라내는 조각의 크기)를 전체 레이어에서 개별 서브 컴포넌트로 바꾸고, 각 컴포넌트의 역할에 따라 다르게 처리함으로써, 지능을 크게 잃지 않으면서도 AI 모델을 대폭 축소할 수 있다고 주장합니다.

이는 엔진 무게를 줄이기 위해 엔진 블록 전체를 교체할 필요가 없다는 것을 깨닫는 것과 같습니다. 단지 별로 하는 일이 없는 특정 무거운 볼트들을 신중하게 제거하고, 그 자리에 가볍고 딱 맞는 스페이서(spacer)를 끼워 넣기만 하면 됩니다. 그 결과, 여전히 매끄럽게 작동하면서도 더 가벼운 엔진을 얻게 되는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →