Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving
Irminsul은 기존 접두어 매칭 방식에 내재된 캐시 무효화 문제를 극복하여 멀티헤드 잠재 어텐션의 아키텍처 구조를 활용하여 콘텐츠 주소 지정 키-값 캐싱을 가능하게 하는 에이전트형 LLM 을 위한 네이티브 위치 독립적 캐싱 시스템을 도입하여 프롬프트 토큰 복구율을 최대 83% 까지 달성하고 프리필 에너지 소비를 63% 절감합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 바쁘고 고속으로 돌아가는 도서관을 운영한다고 가정해 봅시다. 여기서 사서 (AI) 는 질문에 답하기 위해 방대한 문서 더미를 읽어야 합니다. 속도를 높이기 위해 사서는 가장 최근에 읽은 페이지들의 "요약 노트 (캐시)"를 보관하여 매번 처음부터 다시 읽지 않도록 합니다.
문제: "위치" 대 "내용"
기존 방식 (프래픽스 캐싱이라고 함) 에서는 사서의 요약 노트가 위치에 따라 엄격하게 정리되어 있었습니다.
- "1 페이지는 시스템 프롬프트입니다."
- "2 페이지는 문서 A 입니다."
- "3 페이지는 문서 B 입니다."
만약 사서가 새로운 질문을 하고 순서가 약간 바뀐다면—예를 들어 "1 페이지는 여전히 시스템 프롬프트이지만, 이제 문서 A 는 5 페이지에 있다"—기존 요약 노트는 무효가 됩니다. 사서는 "아, 2 페이지가 다르군. 그러면 전체 요약 노트를 버리고 처음부터 다시 모두 읽어야겠다"라고 생각합니다.
에이전트 AI(도구를 사용하고 웹을 검색하며 다른 AI 와 대화하는 AI) 세계에서는 이런 일이 끊임없이 발생합니다. AI 가 같은 문서를 불러올지라도, 이를 대화의 다른 부분에 삽입하면 "위치"가 바뀝니다. 기존 시스템은 이를 완전히 새로운, 읽을 수 없는 뭉개진 것으로 간주하여 AI 가 이미 알고 있는 내용을 다시 읽는 시간과 에너지를 낭비하게 만듭니다.
해결책: 이리무술 (Irminsul, "내용" 기반 사서)
이 논문은 이리무술이라는 새로운 시스템을 소개합니다. 이리무술은 페이지가 어디에 놓여 있는지에 따라 요약 노트를 정리하는 대신, 페이지가 실제로 무엇을 말하는지에 따라 정리합니다.
다음과 같이 생각해 보세요:
- 기존 방식: "책이 3 번째 선반에 있을 때만 기억해."
- 이리무술: "책이 어느 선반에 있든, 그것이 해리 포터의 복사본이기 때문에 기억해."
이리무술은 실제 텍스트 (내용) 를 기반으로 대화를 조각으로 나눕니다. AI 가 "문서 A"를 다시 보게 되더라도, 그것이 다른 위치에 있더라도 이리무술은 "이 정확한 텍스트는 이전에 본 적이 있어! 내 노트를 재사용할 수 있겠어"라고 말합니다.
비결: "위치" 조정
물어볼 수 있습니다. "텍스트는 같지만 위치가 다르면 AI 가 혼란을 겪지 않을까?"
네, 보통은 그렇습니다. AI 에서 단어의 "위치"는 매우 중요합니다 (단어가 문장의 시작에 있는지 끝에 있는지 아는 것과 같습니다).
- 기존 문제: 위치를 수정하기 위해 기존 시스템은 매 단어마다 전체 요약 노트를 다시 작성해야 했습니다. 마치 페이지 번호만 바꾸기 위해 책 전체를 다시 쓰는 것과 같습니다. 이는 느리고 비용이 많이 들었습니다.
- 이리무술의 트릭: 이 논문은 MLA(Multi-Head Latent Attention, 다중 헤드 잠재 어텐션) 라는 특정 AI 아키텍처에 초점을 맞춥니다. 이 아키텍처는 특별한데, "노트"를 두 부분으로 분리합니다:
- 내용 (90%): 단어의 실제 의미입니다. 이 부분은 위치에 관계없이 동일합니다.
- 위치 (10%): "내가 여기에 있다"라고 말하는 작은 태그입니다.
이리무술은 그 작은 10% 태그만 조정하면 된다는 것을 깨닫습니다. -회전이라고 불리는 교묘한 수학적 "비틀기"를 사용하여 전체 책을 다시 쓰는 대신 위치 태그를 즉시 업데이트합니다. 이는 문서의 사진을 찍어 책상 위의 새로운 위치로 미끄러뜨리는 것이지, 방 전체의 사진을 다시 찍는 것과 같습니다.
결과
이 논문은 에이전트처럼 행동하는 세 가지 실제 AI 시스템 (DeepSeek, Kimi, JoyAI) 에서 이를 테스트했습니다.
- 회복: AI 가 문서를 이동시키는 복잡한 작업에서 이리무술은 기존 시스템이 버렸던 작업의 약 **77% 에서 83%**를 재사용할 수 있었습니다.
- 에너지: 텍스트를 다시 읽지 않아도 되므로, 반복되는 부분을 처리하는 데 필요한 에너지를 약 63% 절감했습니다.
- 정확도: AI 는 이전과 마찬가지로 정확하게 답변합니다. 새로운 방식으로 인해 혼란을 겪지 않습니다.
"첫 페이지" 규칙
작은 함정이 하나 있습니다. 어떤 대화의 매우 처음 몇 단어가 AI 의 주의를 위한 "중력 닻" 역할을 합니다. 논문은 대화의 시작 부분 바로에서 시작하는 조각을 재사용하려고 하면 AI 가 혼란을 겪는다는 것을 발견했습니다.
- 해결책: 이리무술은 매번 텍스트의 매우 첫 번째 조각 (처음 32 단어) 을 다시 읽지만, 그 이후의 모든 것은 지능적인 "내용 기반" 재사용을 사용합니다. 이 작은 비용이 시스템의 나머지 부분이 완벽하게 작동하도록 보장합니다.
요약
이리무술은 AI 가 기억하는 더 현명한 방법입니다. "슬롯 #5 에 있었기 때문에 기억해"라고 말하는 대신, "같은 이야기이기 때문에 기억해"라고 말합니다. "위치"보다 "이야기 (내용)"가 더 중요하다는 것을 깨닫고, 위치 태그를 빠르게 수정하기 위한 특별한 트릭을 사용하여 AI 에이전트를 더 빠르고, 실행 비용이 저렴하며, 복잡하고 변화무쌍한 대화를 처리하는 데 훨씬 더 뛰어나게 만듭니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.