← 최신 논문
💬 NLP

Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference

이 논문은 다양한 작업과 KV 캐시 예산 요구사항에 맞춰 토큰 선택 계층을 적응적으로 결정하여 추론 속도와 정확도 간의 균형을 최적화하는 새로운 방법인 ASL 을 제안합니다.

원저자: Rei Taniguchi, Yuyang Dong, Makoto Onizuka, Chuan Xiao

게시일 2026-04-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rei Taniguchi, Yuyang Dong, Makoto Onizuka, Chuan Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 거대한 도서관의 비밀: "ASL"이 어떻게 기억을 정리하는가?

이 논문은 최근 화제가 되는 **거대 언어 모델 (LLM)**이 아주 긴 글을 읽거나 대화할 때 겪는 '기억 과부하' 문제를 해결하는 새로운 방법, **ASL(Adaptive Selection Layer)**을 소개합니다.

이해하기 쉽게 거대한 도서관비서의 비유로 설명해 드릴게요.


1. 문제: "모든 책을 다 기억할 수는 없어요!" 📚🤯

LLM 이 긴 문서를 읽을 때, 중요한 정보 (키 - 밸류, KV) 를 KV 캐시라는 메모리에 저장해 둡니다. 마치 비서가 대화 내용을 종이에 적어두고 나중에 참고하는 것과 같습니다.

  • 기존 방식의 문제:
    • 기존 기술들은 **"무조건 15 번째 페이지에서 중요한 내용만 골라라"**라고 정해져 있었습니다.
    • 쉬운 질문 (예: "책 제목이 뭐야?") 이라면 15 페이지에서 바로 답을 찾을 수 있어 좋습니다.
    • 하지만 어려운 질문 (예: "책 100 페이지와 200 페이지의 숨겨진 연관성을 찾아줘") 이라면, 15 페이지에서는 답을 찾을 수 없습니다. 중요한 정보가 훨씬 뒤에 숨어있기 때문입니다.
    • 결과: 정해진 규칙 (고정된 층) 을 따르다 보니, 어려운 질문을 할 때 비서가 중요한 정보를 버리고 엉뚱한 답을 내놓는 경우가 많았습니다.

2. 해결책: "상황에 따라 언제 골라야 할지 스스로 판단하는 비서" 🧐✨

이 논문에서 제안한 ASL은 정해진 규칙이 아니라, 상황을 보고 스스로 판단합니다.

🕵️‍♂️ 핵심 아이디어: "주목도 (Attention) 가 안정될 때까지 기다려라"

비서가 책을 읽을 때, 처음에는 모든 페이지에 골고루 눈이 가지만 (혼란), 점점 중요한 부분으로 시선이 집중됩니다.

  • ASL 의 방법:
    1. 비서가 책을 읽으며 "어떤 페이지가 가장 중요한지" 순위를 매깁니다.
    2. 몇 페이지를 더 읽을 때마다, 이 순위가 얼마나 변하는지 확인합니다.
    3. 순위가 더 이상 크게 변하지 않고 안정화되면, "아, 이제 중요한 부분들이 확실해졌구나!"라고 판단합니다.
    4. 그 순간을 선택의 순간으로 정하고, 그 시점부터는 중요한 정보만 기억하고 나머지는 버립니다.

🎯 비유: "등산로에서 휴식 지점 정하기"

  • 기존 방식: "등산로 500m 지점에서 무조건 휴식해." (어떤 산이든 똑같음)
    • 가파른 산 (어려운 과제) 이라면 500m 지점에서는 숨이 턱까지 차서 더 이상 오를 수 없습니다.
  • ASL 방식: "숨이 차고 다리가 떨릴 때까지 계속 올라가다가, 숨이 차는 정도가 일정해지면 그곳을 휴식 지점으로 정해."
    • 평탄한 길 (쉬운 과제) 이라면 일찍 휴식하고, 가파른 길 (어려운 과제) 이라면 더 올라간 후 휴식합니다.

3. ASL 의 장점: "똑똑하고, 빠르고, 정확해요" 🚀

  1. 어떤 과제도 척척:
    • 쉬운 질문에는 일찍 정보를 정리해서 빠르게 답을 내고, 어려운 질문에는 정보를 더 오래 보관했다가 정리해서 정확하게 답을 냅니다.
  2. 학습 불필요:
    • 모델을 다시 가르칠 필요 없이, 기존 모델을 그대로 쓰면서 이 방법만 적용하면 됩니다. (훈련 없는 방법, Training-free)
  3. 기존 기술과 함께 작동:
    • ASL 은 '언제' 정보를 골라낼지 정하고, 기존 기술 (SnapKV 등) 은 '어떻게' 정보를 압축할지 도와줍니다. 두 기술이 손잡고 일하는 셈입니다.

4. 실험 결과: "어려운 미션에서 압도적 승리" 🏆

연구진은 아주 긴 문서를 다루는 다양한 테스트 (InfiniteBench, RULER 등) 를 진행했습니다.

  • 쉬운 질문: 기존 방법과 비슷하게 빠르고 정확했습니다.
  • 어려운 질문 (예: 책 속의 특정 숫자 찾기, 복잡한 코드 디버깅): 기존 방법들은 실수하거나 답을 못 찾았지만, ASL 은 거의 완벽하게 정답을 찾아냈습니다.
  • 속도: 정확도가 높아진 대신, 아주 미세하게 시간이 더 걸릴 수 있지만, 그 대가로 얻는 정확도 향상은 매우 큽니다.

📝 한 줄 요약

"ASL 은 LLM 이 긴 글을 읽을 때, '언제' 중요한 정보를 골라내야 할지 스스로 판단하게 해주는 똑똑한 비서입니다. 어려운 문제일수록 더 오래 기다렸다가 정확한 답을 찾아내어, 기존 방식보다 훨씬 똑똑하게 작동합니다."

이 기술 덕분에 앞으로 AI 는 더 긴 문서도 더 정확하게, 그리고 더 효율적으로 처리할 수 있게 될 것입니다! 🌟

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →