← 최신 논문
💬 NLP

Two-Stage Regularization-Based Structured Pruning for LLMs

이 논문은 LLM 의 구조적 가지치기 시 지식 손실과 재학습 부담을 해결하기 위해, 학습 가능한 가중치에 대한 1\ell_1 정규화와 층 간 지식 이전을 유도하는 추가 정규화를 2 단계로 적용하는 TRSP 방법을 제안하여 재학습 없이도 기존 방법보다 우수한 성능과 가속화를 달성함을 보여줍니다.

원저자: Mingkuan Feng, Jinyang Wu, Siyuan Liu, Shuai Zhang, Ruihan Jin, Feihu Che, Pengpeng Shao, Zhengqi Wen, Jianhua Tao

게시일 2026-04-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mingkuan Feng, Jinyang Wu, Siyuan Liu, Shuai Zhang, Ruihan Jin, Feihu Che, Pengpeng Shao, Zhengqi Wen, Jianhua Tao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 을 가볍게 만드는 'TRSP' 방법: 지혜를 잃지 않는 두 단계 정리법

이 논문은 거대하고 무거운 인공지능 (LLM) 을 더 작고 빠르게 만들면서도, 그 지능을 잃지 않도록 하는 새로운 방법인 TRSP를 소개합니다.

기존의 방법들은 "중요하지 않은 부분"을 잘라내면 그 안에 숨겨진 중요한 지식도 함께 사라져 버려, 다시 가르치는 데 엄청난 시간이 걸리는 문제가 있었습니다. TRSP 는 이 문제를 **두 단계의 '정리'**를 통해 해결합니다.


🏠 비유: 거대한 도서관을 작은 책방으로 바꾸기

거대 언어 모델을 수천 권의 책이 꽉 찬 거대한 도서관이라고 상상해 보세요. 이 도서관은 너무 커서 관리하기 어렵고, 책을 꺼내는 데도 시간이 많이 걸립니다. 우리는 이 도서관을 작은 책방으로 줄이고 싶지만, 중요한 지식 (책 내용) 은 그대로 유지하고 싶습니다.

❌ 기존 방법: "무작위 철거" (기존 방식의 문제점)

기존의 정리 방법 (Structured Pruning) 은 도서관 사서가 "이 책들은 별로 안 읽히니까 버려라"라고 판단해서 책장을 통째로 떼어내는 방식입니다.

  • 문제: "안 읽히는 책"이라고 해서 그 책장에 있는 중요한 지식까지 다 버리게 됩니다.
  • 결과: 도서관이 작아지긴 했지만, 내용이 너무 많이 빠져서 "이제 이 도서관은 쓸모없다"는 결론이 나고, 다시 책을 채우기 위해 **수천 시간의 재교육 (Retraining)**이 필요합니다.

✅ TRSP 방법: "지혜 이전"을 통한 두 단계 정리

TRSP 는 책장을 통째로 버리기 전에, 그 책장에 있는 지식을 다른 책장으로 옮겨놓는 두 단계의 과정을 거칩니다.

1 단계: "누가 가장 덜 쓰이는가?"를 학습 (첫 번째 정규화)

  • 도서관의 각 책장 (레이어) 에 가변적인 무게를 달아줍니다.
  • 아주 적은 양의 책 (데이터) 을 가지고 "어떤 책장이 가장 덜 쓰이는지"를 반복해서 학습합니다.
  • 마치 "이 책장은 지금 비어있네, 저 책장은 많이 쓰이네"라고 파악하는 과정입니다.

2 단계: "지식 이전" (두 번째 정규화) - 이것이 핵심입니다!

  • 이제 "버릴 책장 (가장 덜 쓰이는 책장)"을 결정하기 전에, 그 책장에 있는 중요한 지식들을 "남아있는 책장"으로 미리 옮겨놓습니다.
  • 어떻게 옮길까요? 버릴 책장의 입력 (들어오는 정보) 과 출력 (나가는 정보) 가 거의 똑같아지도록 유도합니다.
  • 비유: 버릴 책장에 있던 책 내용을, 남아있는 책장들이 "내가 다 알아서 처리할게!"라고 흡수하도록 만드는 것입니다. 버릴 책장은 이제 "아무것도 안 하고 그냥 통과만 시키는 통로"가 됩니다.
  • 효과: 버릴 책장의 지식이 이미 남아있는 책장에 녹아들었기 때문에, 이제 그 책장을 통째로 떼어내도 도서관의 전체 지식은 그대로 유지됩니다.

3 단계: 정리 완료 (Pruning)

  • 지식이 모두 옮겨진 상태이므로, 이제 "통로"만 남은 책장들을 물리적으로 제거합니다.
  • 결과: 도서관은 훨씬 작아졌지만 (가속화), 중요한 지식은 하나도 빠지지 않았습니다. 그리고 다시 가르칠 필요가 없습니다 (Retraining-free)!

🌟 TRSP 의 주요 장점

  1. 지식 보존 (Retention of Knowledge):

    • 단순히 잘라내는 게 아니라, 지식을 다른 곳으로 이동시킨 후 잘라내므로, 모델의 성능이 크게 떨어지지 않습니다.
    • 비유: 집을 헐기 전에, 집 안의 보물들을 안전한 금고로 먼저 옮긴 뒤 집을 부수는 것과 같습니다.
  2. 압도적인 성능 (Effectiveness):

    • 실험 결과, 기존 방법들보다 훨씬 더 좋은 성능을 유지하면서도 속도가 빨라졌습니다.
    • 예를 들어, LLaMA2-7B 모델을 25% 줄였을 때, 기존 방법들은 성능이 많이 떨어졌지만 TRSP 는 거의 그대로 유지했습니다.
  3. 비용 절감 (Minimal Cost):

    • 기존 방법은 잘라낸 후 다시 수천 번의 학습이 필요했지만, TRSP 는 재학습이 거의 필요 없습니다.
    • 아주 적은 양의 데이터만으로도 정리가 가능합니다.

🚀 결론

TRSP 는 거대 인공지능을 효율적으로 만들기 위해, "무작정 잘라내는 것"이 아니라 "지식을 옮겨놓고 잘라내는" 똑똑한 전략을 제시합니다.

이 방법은 인공지능을 더 가볍게 만들어 스마트폰이나 개인용 컴퓨터에서도 빠르게 실행할 수 있게 해주는 혁신적인 기술로 평가받고 있습니다. 마치 거대한 도서관을 작은 책방으로 줄이면서도, 모든 지혜를 잃지 않고 보존하는 마법 같은 정리법이라고 할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →