← 최신 논문
🤖 AI

LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models

LaCache는 불변하는 중간 결과들을 캐싱하기 위해 무손실 상태 메모이제이션을 채택하고 메모리 대역폭 병목 현상을 줄이기 위해 그룹별 FP8 양자화를 활용함으로써 디퓨전 거대 언어 모델(Diffusion Large Language Models)의 상당한 속도 향상을 달성하는 훈련이 필요 없는 가속 프레임워크이다.

원저자: Xingru Chen, Zelang Liang, Yongjia Ma, Jiqing Zhan, Shuling Yang, Lian Wen, Kun Zhan

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Xingru Chen, Zelang Liang, Yongjia Ma, Jiqing Zhan, Shuling Yang, Lian Wen, Kun Zhan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 사람이 책장을 넘기듯 단어를 하나씩 읽는 것이 아니라, 문장 전체를 한꺼번에 보고 빠진 부분을 한꺼번에 추측할 수 있는 세상을 상상해 보세요. 이것이 바로 "디퓨전 대규모 언어 모델(Diffusion Large Language Models)"의 마법입니다. 이는 무질서한 기호 덩어리에서 시작하여 단계적으로 정돈하며 명확한 이야기를 만들어내는 새로운 종류의 AI입니다. 마치 조각가가 대리석 블록을 깎아내는 것과 같습니다. 다만 돌 대신 문장을 드러내기 위해 노이즈를 깎아내는 것입니다. 문제는 이 과정이 믿을 수 없을 정도로 느리고 에너지를 많이 소비한다는 점입니다. AI가 텍스트를 정리하기 위해 단계를 밟을 때마다, 아직 변하지 않은 문장의 부분들을 다시 계산하는 경우가 많아 엄청난 시간과 전기를 낭비하게 됩니다. 이는 마치 요리사가 스튜에 새로운 재료를 추가할 때마다, 이미 완벽하게 다져져서 그릇 안에 담겨 있는 모든 채소를 다시 다지기로 결정하는 것과 같습니다.

이때, 결과물의 맛을 바꾸지 않으면서도 이러한 낭비를 막기 위해 설계된 영리하고 새로운 프레임워크인 LaCache가 등장합니다. 이 프로젝트의 연구진은 이러한 AI 모델에서 대부분의 텍스트는 변하지 않은 채 그대로 유지되며 오직 아주 작은 부분만이 업데이트된다는 사실을 깨달았습니다. 문장 전체를 매번 다시 계산하는 대신, LaCache는 매우 효율적인 사서처럼 작동합니다. 변하지 않은 부분들에 대한 "무손실(lossless)"(완벽하게 정확한) 기록을 보관하여, AI가 지루하고 반복적인 작업을 건너뛰고 새로운 부분에만 집중할 수 있도록 합니다. 또한, 그들은 약간 덜 정밀한 방식으로 무거운 작업을 수행하는 방법—마치 밀리미터 단위까지 완벽할 필요가 없는 측정에 대해 조금 더 작은 자를 사용하는 것과 같은 방식—을 도입하여 속도를 더욱 높였습니다. 그 결과, AI는 훨씬 더 빠르게 실행되며, 다른 기술들과 결합했을 때는 최대 40배까지 빨라지면서도 여전히 정확히 동일한 정답을 제공합니다.

문제점: "다시 읽기" 루프

LaCache가 왜 그토록 중요한지 이해하려면, 먼저 이 디퓨전 모델들이 어떻게 작동하는지 살펴봐야 합니다. 당신이 긴 문장을 채워 넣어야 하는 퍼즐을 풀고 있는데, 한 번에 몇 단어씩만 고칠 수 있다고 상상해 보세요. 모델은 "블록" 단위로 작동합니다. 문장의 작은 구역을 선택하여 그 안의 단어들을 수정하려고 시도한 뒤 다음으로 넘어갑니다. 하지만 여기에는 함정이 있습니다. 모델이 그 작은 구역을 고치는 동안, 문장의 나머지 부분(앞부분과 뒷부분)은 정확히 그대로 유지된다는 것입니다.

그럼에도 불구하고, 기존의 방식은 컴퓨터가 매 단계를 밟을 때마다 전체 문장을 처음부터 다시 계산하도록 강요했습니다. 이는 마치 편지 중간의 오타를 고치는 동안, 컴퓨터가 손대지 않은 부분을 포함하여 편지 전체를 다시 써야 한다고 고집하는 것과 같았습니다. 이는 엄청난 양의 "중복 계산(redundant computation)", 즉 낭비되는 노력을 초래했습니다. 연구진은 이 낭비가 세 가지 특정 지점에서 발생한다는 것을 발견했습니다:

  1. 번역 단계: 단어를 숫자로 변환하는 과정 (Embedding).
  2. 위치 지정 단계: 단어가 문장에서 어디에 위치하는지 파악하는 과정 (RoPE).
  3. 어텐션 단계: 어떤 단어들이 서로 중요한지 결정하는 과정 (FlashAttention).

해결책: 세 가지 마법의 캐시

LaCache는 **무손실 상태 메모이제이션(Lossless State Memoization, LSM)**이라는 시스템을 도입하여 이 문제를 해결합니다. "메모이제이션"을 암기 노트라고 생각하면 쉽습니다. 만약 수학 문제를 이미 풀었다면, 다시 풀 필요가 없도록 답을 적어두는 것입니다. LaCache는 AI를 위해 세 가지 특정 암기 노트를 만듭니다:

  1. EmbedCache (단어 사전): 이 캐시는 변하지 않은 단어에 대한 숫자 변환 값을 기억합니다. 만약 문장 시작 부분에 "apple"이라는 단어가 있고 그 자리에 그대로 있다면, 컴퓨터는 "apple"을 숫자로 다시 변환할 필요가 없습니다. 저장된 숫자를 그냥 가져오면 됩니다.
  2. RoPECache (위치 지도): 이 캐시는 변하지 않은 단어들의 "위치 수학"을 기억합니다. 이는 첫 번째 단어는 항상 "첫 번째"라는 것을 기억하는 것과 같습니다. 따라서 문장 중간의 단어를 고칠 때마다 그 위치를 매번 다시 계산할 필요가 없습니다.
  3. FACache (어텐션 암기 노트): 이것은 가장 복잡한 것입니다. 이는 건드리지 않는 문장 부분에 대한 "어텐션 통계"를 저장합니다. AI가 바라보고 있는 단어들에 비추는 조명(스포트라이트)을 상상해 보세요. 만약 AI가 문장의 중간 부분만을 보고 있다면, 조명이 문장의 맨 앞이나 맨 뒤에 있는 단어들에 어떻게 비춰지는지를 매번 다시 계산할 필요가 없습니다. FACache는 이러한 계산을 저장하여 AI가 이를 완전히 건너뛸 수 있게 합니다.

이 세 가지 캐시를 사용함으로써, AI는 이미 완벽해진 텍스트 부분에 대한 무거운 작업을 건너뛸 수 있습니다. AI는 현재 수정하려고 시 하는 특정 단어 블록에 대해서만 힘든 작업을 수행합니다.

속도 향상: 정밀도의 기술

작업을 건너뛰는 것도 좋지만, 연구진은 더 빠르게 만들고 싶었습니다. 그들은 AI의 "두뇌"(구체적으로 FFN 레이어라고 불리는 부분)가 때때로 매우 정밀한 숫자를 사용하지만, 실제로는 정답을 얻기 위해 그 정도로 정밀할 필요가 없다는 점을 발견했습니다. 이는 마치 방의 크기를 측정할 때, 일반적인 줄자로도 충분히 가능한데도 10억 분의 1인치까지 측정하는 레이저 자를 사용하는 것과 같습니다.

LaCache는 **per-group FP8 양자화(per-group FP8 quantization)**라는 기술을 사용합니다. 이것은 그들이 특정 계산 그룹에 대해 "더 작은 자"(FP8)로 전환하는 기술을 사용하는 아주 멋진 방법입니다. 그들은 혼란을 주지 않으면서도 모델이 감당할 수 있는 부분에 대해서만 이 작업을 신중하게 수행합니다. 이를 통해 컴퓨터 하드웨어가 이러한 더 작은 숫자들을 더 효율적으로 처리할 수 있어 훨씬 더 빠르게 작동할 수 있습니다. 이는 무거운 돌 블록을 운반하는 것에서 가벼운 폼 블록을 운반하는 것으로 바꾸는 것과 같습니다. 폼 블록이 올바른 모양이기만 하다면, 훨씬 더 빠르게 움직일 수 있으며 건물은 여전히 완벽하게 서 있을 수 있습니다.

결과: 빠르고, 정확하며, 준비된 성능

연구팀은 수학 문제를 풀거나 코드를 작성하는 등 다양한 AI 모델과 작업에 대해 LaCache를 테스트했습니다. 결과는 인상적이었습니다:

  • 속도: LaCache 단독으로는 표준 버전보다 약 1.3배 더 빠르게 만들었습니다. 하지만 이를 기존의 다른 가속 기술들과 결합했을 때, AI는 최대 40.2배 더 빠르게 작동했습니다.
  • 정확도: 가장 중요한 점은 AI가 "멍청해지지" 않았다는 것입니다. 연구진은 답변이 원래의 느린 버전과 거의 동일하다는 것을 발견했습니다. 코드를 작성하는 경우와 같이 어떤 경우에는, 속도 향상이 AI가 동일한 시간 내에 더 많은 옵션을 탐색할 수 있게 하여 오히려 약간 더 나은 답변을 생성하는 데 도움을 주기도 했습니다.
  • 범용성: 이 모델은 추론(퍼즐 풀기)과 코드 생성(컴퓨터 프로그램 작성)을 포함한 다양한 작업에서 잘 작동했습니다.

논문은 몇 가지 한계점도 언급합니다. "완벽한" 캐싱은 AI 두뇌의 가장 첫 번째 레이어에서만 작동하며, 더 깊은 레이어들은 더 복적이며 약간 다른 기술이 필요할 수 있습니다. 또한, 이 속도 향상은 이러한 작은 숫자들을 잘 다룰 수 있는 현대적인 컴퓨터 칩을 보유하고 있는지에 달려 있습니다. 오래된 컴퓨터를 사용한다면 아직 이 기술을 활용하지 못할 수도 있습니다.

이것이 중요한 이유

AI의 세계에서 속도와 비용은 전부입니다. AI가 생각하는 데 너무 오래 걸리면 비용이 많이 들고 사용하기 답답해집니다. LaCache는 우리가 더 빠른 결과를 얻기 위해 반드시 더 크고 강력한 컴퓨터를 가질 필요는 없다는 것을 보여줍니다. 때로는 우리가 이미 알고 있는 것을 다시 하지 않는 것만으로도 충분합니다. 이미 알고 있는 것을 기억하고 나머지에 대해서는 더 스마트한 도구를 사용함으로써, 우리는 강력한 AI 모델의 지능을 잃지 않으면서도 빛처럼 빠르게 실행되도록 만들 수 있습니다. 이는 인공지능을 향한 경주에서, 효율적인 것이 강력한 것만큼이나 중요하다는 사실을 일깨워 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →