← 최신 논문
🤖 machine learning

RAP: Runtime Adaptive Pruning for LLM Inference

본 논문은 다양한 메모리 예산과 작업 부하 조건 하에서 모델 가중치와 KV 캐시 보존을 공동으로 최적화하여 실시간으로 LLM 추론 가지치기 전략을 동적으로 적응시키는 강화 학습 기반 프레임워크인 RAP를 소개합니다.

원저자: Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 매우 똑똑한 도서관 보조원 (대형 언어 모델, 또는 LLM) 이 있다고 상상해 보세요. 이 보조원은 이야기를 쓰고, 질문에 답하며, 문제를 해결할 수 있습니다. 하지만 함정이 하나 있습니다. 이 보조원은 너무 거대해서 계속 작동시키려면 메모리 역할을 하는 창고 전체의 선반과 컴퓨팅 파워 역할을 하는 거대한 작업자 팀이 필요합니다.

이 보조원을 스마트폰이나 노트북 같은 작은 장치에서 실행하려고 하면, 공간이 부족하거나 너무 느려져서 종종 충돌이 발생합니다.

문제: "일률적 적용"의 실수

현재 대부분의 사람들은 영구적으로 이 거대한 보조원의 일부를 잘라내는 방식으로, 예를 들어 고정된 규칙에 따라 선반을 제거하거나 작업자를 해고하는 방식으로 이 보조원을 축소하려고 시도합니다. 그들은 "좋습니다, 우리는 도서관의 30% 를 항상 잘라내겠습니다"라고 말합니다.

이 논문은 이것이 나쁜 아이디어라고 주장합니다. 왜냐하면 도서관의 필요는 매일 변하기 때문입니다.

  • 시나리오 A: 사용자가 매우 짧은 질문을 합니다. 보조원은 대화를 기억하는 데 아주 적은 공간만 필요합니다.
  • 시나리오 B: 사용자가 1 만 단어 분량의 소설을 쓰라고 요청합니다. 보조원은 지금까지의 이야기를 추적하는 "스크래치패드 (KV 캐시)"를 유지하기 위해 갑자기 엄청난 양의 공간이 필요합니다.

휴대폰에 맞추기 위해 보조원의 뇌 30% 를 영구히 잘라낸다면, 누군가 긴 질문을 할 때 보조원이 고장 날 수 있습니다. 아무것도 잘라내지 않으면 아예 휴대폰에 들어가지 않습니다. 기존 방법들은 딱딱한 갑옷과 같습니다. 너무 무거워 입을 수 없거나, 가볍게 만들기 위해 잘라내면 노출이 됩니다.

해결책: RAP (런타임 적응형 가지치기)

저자들은 RAP를 제안합니다. 이는 보조원에게 실시간으로 모양을 바꾸는 스마트하고 탄력 있는 갑옷을 주는 것과 같습니다.

보조원을 한 번만 잘라내는 대신, RAP 는 강화 학습 (RL) 에이전트를 사용합니다. 이 에이전트를 매우 숙련된 교통 통제관이나 무대 감독관으로 생각하세요.

  1. 군중을 관찰합니다: 보조원이 작업을 시작하기 전에, 에이전트는 특정 요청을 살펴봅니다. 짧은 질문인가요? 긴 이야기인가요? 다른 앱이 실행 중이라 휴대폰 메모리가 가득 찼나요?
  2. 즉각적인 결정을 내립니다: 에이전트는 자신이 본 것에 기반하여 지금 바로 무엇을 일시적으로 숨길지 결정합니다.
    • 요청이 짧고 메모리가 부족하다면, 공간을 절약하기 위해 무거운 "생각" 부분 (FFN 레이어) 일부를 숨길 수 있습니다.
    • 요청이 길고 메모리가 가득 차 있다면, 긴 이야기를 추적하는 데 필요한 "어텐션" 부분 (MHA 레이어) 일부를 숨길 수 있습니다.
  3. 가장 좋은 부분을 유지합니다: 에이전트는 뇌의 모든 부분이 동등하지 않다는 것을 알고 있습니다. 일부 레이어는 특정 작업에 더 중요합니다. 에이전트는 어떤 부분을 안전하게 치워도 답변을 망치지 않을지 정확히 파악하기 위해 특별한 "중요도 스캐너 (Greedy Sequential Importance)"를 사용합니다.

작동 방식 (비유)

날씨가 아직 어떻게 될지 모르는 여행용 가방을 싸는 상황을 상상해 보세요.

  • 기존 방식: 항상 무거운 겨울 코트와 수영복을 집에 두고 가기로 결정합니다. 비가 오면 젖게 되고, 햇살이 비치면 수영할 옷이 없습니다.
  • RAP 방식: 스마트 로봇 보조원이 있습니다.
    • 당신은 로봇에게 "작은 가방 (메모리 제한) 이 있고 해변 (긴 대화) 으로 가겠습니다"라고 말합니다.
    • 로봇은 즉시 무거운 코트를 가벼운 티셔츠로 바꾸고 수영복은 그대로 둡니다.
    • 당신은 로봇에게 "작은 가방이 있고 산 (짧은 대화) 으로 가겠습니다"라고 말합니다.
    • 로봇은 수영복을 따뜻한 모자로 바꿉니다.

로봇은 경험 (강화 학습) 을 통해 매번 완벽한 교환을 하도록 학습하여, 가방에 들어맞으면서도 특정 여행에 정확히 필요한 것을 갖도록 보장합니다.

발견한 점

이 논문은 이 "스마트 로봇"을 Llama 와 Qwen 과 같은 여러 인기 있는 AI 모델에서 테스트했습니다.

  • 더 나은 결과: 메모리가 부족할 때 RAP 는 기존의 "고정된 잘라내기" 방법보다 AI 가 훨씬 잘 작동하도록 유지했습니다. 충돌이 발생하지 않았고, 답변은 여전히 똑똑했습니다.
  • 유연성: 인간의 재조정 없이 다양한 유형의 요청 (짧은 것 vs 긴 것) 을 처리했습니다.
  • 속도: 결정을 내리는 "로봇"이 매우 빠르고 작아 프로세스 속도를 전혀 늦추지 않았습니다. 대화에 거의 추가 시간이 들지 않았습니다.

결론

RAP 는 작은 장치에서 큰 AI 모델을 실행하는 새로운 방법입니다. AI 의 일부를 영구히 잘라내는 대신, 특정 작업과 사용 가능한 공간에 필요한 부분만 유지하면서 AI 를 실시간으로 동적으로 재구성합니다. 이는 무겁고 딱딱한 갑옷을 입는 것과, 그날 하는 일에 맞춰 적응하는 스마트하고 신축성 있는 갑옷을 입는 것의 차이입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →