← 최신 논문
💬 NLP

Lizard: An Efficient Linearization Framework for Large Language Models

이 논문은 소프트맥스 어텐션의 이차적 복잡성과 KV 캐시 메모리 병목 현상을 해결하기 위해, 적응형 메모리 제어와 하드웨어 인식 알고리즘을 통해 사전 훈련된 트랜스포머 기반 대규모 언어 모델을 고품질의 서브 2 차 구조로 변환하는 'Lizard'라는 선형화 프레임워크를 제안합니다.

원저자: Chien Van Nguyen, Huy Nguyen, Ruiyi Zhang, Hanieh Deilamsalehy, Puneet Mathur, Viet Dac Lai, Haoliang Wang, Jayakumar Subramanian, Ryan A. Rossi, Trung Bui, Nikos Vlassis, Franck Dernoncourt, Thien Hu
게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chien Van Nguyen, Huy Nguyen, Ruiyi Zhang, Hanieh Deilamsalehy, Puneet Mathur, Viet Dac Lai, Haoliang Wang, Jayakumar Subramanian, Ryan A. Rossi, Trung Bui, Nikos Vlassis, Franck Dernoncourt, Thien Huu Nguyen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🦎 '라이저 (Lizard)': 거대 AI 의 무거운 가방을 가볍게 만드는 마법

이 논문은 인공지능 (AI) 이 긴 이야기를 읽거나 기억할 때 겪는 '메모리 부족'과 '느린 속도' 문제를 해결한 새로운 기술, **라이저 (Lizard)**에 대해 설명합니다.

기존의 AI(트랜스포머) 는 마치 모든 단어를 한눈에 보려고 책상 위에 펼쳐진 수천 권의 책을 동시에 펼쳐놓는 것과 같습니다. 책이 많을수록 (문장이 길어질수록) 책상 공간이 부족해지고, 책을 넘기는 데 시간이 너무 오래 걸립니다.

라이저는 이 문제를 해결하기 위해 **"필요한 것만 기억하고, 나머지는 요약해서 정리하는 똑똑한 비서"**를 도입했습니다.


1. 문제: 왜 기존 AI 는 긴 글을 못 할까?

기존 AI 는 긴 글을 읽을 때 두 가지 큰 병목 현상을 겪습니다.

  • ** quadratic complexity (제곱 복잡도):** 글이 2 배 길어지면 계산량은 4 배, 10 배 길어지면 100 배로 늘어납니다. 이는 메모리 폭탄과 같습니다.
  • 기억의 한계: AI 가 글을 생성할 때, 이전에 쓴 모든 단어를 '단어장 (KV Cache)'에 저장해 둡니다. 글이 길어질수록 이 단어장이 너무 커져서 AI 가 숨을 쉴 공간 (메모리) 이 없어집니다.

2. 해결책: 라이저 (Lizard) 의 두 가지 마법

라이저는 기존 AI 의 지능을 유지하면서, 메모리 사용량을 일정하게 유지하는 선형 (Linear) 구조로 바꿉니다. 이를 위해 두 가지 핵심 기술을 섞었습니다.

🪄 마법 1: "스마트한 비서" (게이트 모듈)

  • 비유: imagine you have a smart assistant who reads a long book for you.
  • 기능: 이 비서는 책의 모든 내용을 다 외울 필요 없이, **"이 부분은 중요하니까 기억해, 저 부분은 잊어버려"**라고 스스로 결정합니다.
  • 효과: 과거의 정보를 무작정 다 저장하는 게 아니라, 필요한 정보만 선택적으로 기억하고 나머지는 정리해버립니다. 덕분에 글이 아무리 길어져도 메모리 사용량은 일정하게 유지됩니다. 또한, 이 비서는 글의 순서 (위치) 를 고정된 규칙이 아니라 상황에 따라 스스로 학습해서 기억하므로, 훈련 때보다 훨씬 긴 글을 읽어도 잘 이해합니다.

🪄 마법 2: "현미경과 망원경" (앵커 윈도우 어텐션)

  • 비유: 망원경으로 먼 곳의 큰 그림을 보고, 현미경으로 가까운 곳의 디테일을 보는 것과 같습니다.
  • 기능:
    • 망원경 (게이트 모듈): 전체적인 흐름과 먼 곳의 맥락을 압축해서 기억합니다.
    • 현미경 (로컬 윈도우): 지금 읽고 있는 바로 앞의 단어들은 아주 정확하게 세세하게 봅니다.
    • 마법 토큰 (Meta-memory): 여기에 더해, **"주변의 소음"**을 흡수하는 특수한 토큰을 추가했습니다. 마치 소음 제거 이어폰처럼, 중요한 정보에 집중할 때 방해되는 불필요한 신호를 잡아먹어 AI 가 혼란스러워하지 않게 합니다.

3. 하드웨어의 비밀: "고속도로의 차선 변경"

라이저는 단순히 구조만 바꾼 게 아니라, 컴퓨터 칩 (GPU) 이 가장 빠르게 작동할 수 있도록 계산 방식을 바꿨습니다.

  • 문제: 기존 방식은 계산할 때 숫자가 너무 작아지거나 커져서 (오버플로우/언더플로우), 컴퓨터가 "안전하게 하려면 정밀한 계산 (float32) 을 해야겠다"며 느린 모드로 전환했습니다.
  • 해결: 라이저는 계산 과정을 로그 (Log) 공간으로 옮겨서, 컴퓨터 칩이 가장 좋아하는 **빠른 저정밀도 계산 (Tensor Core)**을 그대로 사용할 수 있게 했습니다.
  • 결과: 같은 작업을 할 때 약 32% 더 빨라졌습니다.

4. 실험 결과: 얼마나 잘할까?

  • 성능: 라이저는 원래 AI(선생님 모델) 의 성능을 거의 100% 그대로 유지했습니다. (기존 다른 방법들은 성능이 20~24 점이나 떨어졌는데, 라이저는 거의 떨어지지 않음)
  • 기억력: "Haystack(건초더미) 에서 바늘 찾기" 테스트에서, 훈련 때보다 훨씬 긴 (64K 토큰) 글에서도 정확히 필요한 정보를 찾아냈습니다. 다른 방법들은 글이 길어지면 바로 망가졌지만, 라이저는 끄떡없었습니다.
  • 효율: 긴 글을 생성할 때 메모리 사용량이 일정하게 유지되어, 무한한 길이의 글도 생성할 수 있게 되었습니다.

5. 결론: 왜 라이저가 중요한가?

라이저는 "효율성"과 "지능"을 모두 잡은 기술입니다.
지금까지 긴 글을 처리하려면 거대한 서버가 필요했지만, 라이저를 쓰면 개인용 컴퓨터나 작은 서버에서도 긴 문서를 읽고, 긴 대화를 나누는 AI 를 쉽게 만들 수 있습니다. 마치 무거운 짐을 들고 가는 대신, 필요한 것만 챙겨서 가볍게 여행하는 것과 같습니다.


한 줄 요약:

**라이저 (Lizard)**는 AI 가 긴 글을 읽을 때 겪는 '메모리 폭탄'을 해결하기 위해, 필요한 것만 기억하는 스마트 비서정밀한 현미경을 결합하여, 기존 AI 의 지능은 그대로 유지하면서 속도와 효율은 획기적으로 높인 혁신적인 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →