← 최신 논문
💬 NLP

Compressing Sequences in the Latent Embedding Space: KK-Token Merging for Large Language Models

이 논문은 기존 토큰 공간 기반 접근법의 한계를 극복하기 위해 잠재 임베딩 공간에서 연속된 K 개의 토큰을 단일 임베딩으로 병합하는 'K-Token Merging'을 제안하여, 입력 길이를 최대 75% 줄이면서도 성능 저하를 최소화하는 효율적인 LLM 압축 프레임워크를 제시합니다.

원저자: Zihao Xu, John Harvill, Ziwei Fan, Yizhou Sun, Hao Ding, Hao Wang

게시일 2026-04-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zihao Xu, John Harvill, Ziwei Fan, Yizhou Sun, Hao Ding, Hao Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

📚 비유: "도서관 사서님의 지혜로운 요약법"

생각해 보세요. 거대한 도서관 (LLM) 에 사서님이 계신데, 독자가 아주 긴 책 (긴 프롬프트) 을 가져와서 "이 책의 핵심을 알려줘"라고 요청합니다.

기존의 방식들은 두 가지였습니다:

  1. 책장 갈아치우기 (Hard Compression): 중요한 페이지만 남기고 나머지를 찢어버리는 방법입니다. 하지만 중요한 내용이 실수로 잘릴 수 있어 위험합니다.
  2. 새로운 단어 만들기 (Soft Compression): 책 내용을 더 짧은 단어로 바꾸는 방법인데, 여전히 책 한 장 한 장 (토큰) 을 하나하나 세어서 처리해야 해서 시간이 많이 걸립니다.

이 논문이 제안하는 **K-Token Merging (K-토큰 병합)**은 완전히 다른 접근법입니다.

🚀 핵심 아이디어: "친구들을 한 팀으로 묶기"

이 방법은 **"책장을 읽을 때, 연속된 K 장의 페이지를 묶어서 '한 팀'으로 간주하고, 그 팀의 내용을 한 번에 파악하는 능력"**을 훈련시킵니다.

  • 기존 방식: 사서님이 페이지 1, 2, 3, 4, 5 를 하나씩 읽으며 메모합니다. (매우 느리고 메모리 많이 사용)
  • 이 방법 (K-Token Merging): 사서님이 "1~4 페이지는 한 팀이야!"라고 생각하며, 4 장을 한 번에 읽어서 '한 장의 요약 메모'로 만듭니다.
    • 이때, 4 장의 내용을 지우는 게 아니라, 4 장의 내용을 압축해서 하나의 '고급 요약 카드'로 변환하는 것입니다.
    • 이 '요약 카드'를 만들어주는 작은 도구가 **경량 인코더 (Encoder)**입니다.

🛠️ 어떻게 작동할까요? (3 단계 과정)

  1. 입력 단계 (책 읽기):

    • 사용자가 긴 글을 보내면, 모델은 그 글을 4 장씩 (K=4) 묶습니다.
    • 묶인 4 장의 내용을 작은 도구 (인코더) 가 분석해서 **하나의 '요약 카드' (압축된 임베딩)**로 바꿉니다.
    • 결과적으로 100 장의 글이 25 개의 요약 카드로 줄어듭니다! (입력 길이 75% 단축)
  2. 학습 단계 (새로운 언어 배우기):

    • 모델은 이 '요약 카드'를 이해할 수 있도록 **LoRA(작은 학습 도구)**를 붙여서 훈련합니다.
    • 마치 사서님이 "이 요약 카드가 원래 4 장의 내용을 담고 있구나"라고 빠르게 학습하는 것입니다.
  3. 생성 단계 (답변하기):

    • 중요한 점은, 답변을 쓸 때는 다시 원래의 글자 (단어) 로 풀어써서 출력합니다.
    • 요약 카드로 생각은 하지만, 사용자에게는 원래의 자연스러운 문장으로 답을 줍니다.

📊 왜 이것이 획기적인가요?

논문의 실험 결과를 보면 놀라운 성과가 나옵니다.

  • 성능 유지: 75% 의 입력 길이를 줄였는데도, 모델의 똑똑함 (정확도) 은 거의 떨어지지 않았습니다. (예: 나무 구조 이해하기, 감정 분석, 코드 수정 등)
  • 비용 절감: 컴퓨터가 생각할 때 가장 무거운 작업인 '긴 글을 한 번에 비교하는 작업'의 양이 약 94%나 줄어듭니다. (입력이 4 배 줄면 계산량은 16 배 줄기 때문)
  • 유연성: 기존 방법들은 중요한 정보를 잘라내거나, 너무 많은 새로운 단어를 만들어내야 했지만, 이 방법은 원래의 단어를 모두 보존하면서 효율만 높입니다.

💡 한 줄 요약

"긴 글을 읽을 때, 한 번에 여러 페이지를 묶어서 '한 번에 이해하는 요약 카드'로 바꾸고, 그 카드로 생각한 뒤 원래 글자로 답변하는 똑똑한 비서 시스템을 만들었습니다."

이 기술은 앞으로 AI 가 긴 문서나 긴 대화 내용을 처리할 때, 더 빠르고, 더 저렴하며, 똑똑하게 작동할 수 있는 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →