← 최신 논문
🤖 machine learning

LRAgent: Efficient KV Cache Sharing for Multi-LoRA LLM Agents

LRAgent는 KV 캐시를 공유된 베이스와 저차원 어댑터 구성 요소로 분해하는 멀티-LoRA LLM 에이전트를 위한 KV 캐시 공유 프레임워크로, 높은 정확도와 처리량을 유지하면서 메모리 및 연산 오버헤드를 크게 줄이는 혁신적인 Flash-LoRA-Attention 커널을 활용합니다.

원저자: Hyesung Jeon, Hyeongju Ha, Jae-Joon Kim

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hyesung Jeon, Hyeongju Ha, Jae-Joon Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

각기 다른 전문 분야를 가진 형사들이 복잡한 미스터리를 해결하기 위해 협력하는 팀을 상상해 보세요. 각 형사는 고유한 기술을 가지고 있습니다. 한 명은 계획 세우기에 능숙하고, 다른 한 명은 도구를 사용하여 단서를 수집하는 전문가이며, 세 번째 형사는 정답이 맞는지 확인하기 위해 증거를 검토하는 데 달인입니다.

인공지능의 세계에서 이 형사들은 "LLM 에이전트"입니다. 이들에게 특정한 역할을 잘 수행하도록 하기 위해, 우리는 공통된 "두뇌"(대규모 사전 학습 모델)를 부여하되, 각자에게 작은 맞춤형 "노트"(LoRA 어댑터라고 불림)를 부착합니다. 이 노트는 전체 두뇌를 다시 학습시키지 않고도 그들에게 특정 역할을 가르쳐 줍니다.

문제점: 너무 많은 노트

문제는 이 형사들이 길고 복잡한 사건을 함께 해결할 때 발생합니다. 그들은 지금까지 일어난 일들에 대한 동일한 긴 단서 목록과 대화 내용(즉, "컨텍스트")을 기억해야 합니다.

표준적인 설정에서는 모든 형사가 지금까지 일어난 모든 일에 대한 전체 복사본의 기억을 각자 보유합니다. 비록 모두가 정확히 같은 단서들을 보고 있음에도 불구하고, 형사 A는 자신의 노트에 기록하고, 형사 B는 자신의 노트에 기록하며, 형사 C 역시 똑같이 기록합니다.

  • 결과: 팀은 매우 빠르게 책상 공간(메모리)을 다 써버리게 되며, 똑같은 내용을 반복해서 적느라 많은 시간(연산 오버헤드)이 소요됩니다.

기존의 해결책들은 메모리를 공유하려고 시도했지만, 이는 마치 각 형사가 사용하는 고유한 은어를 잃지 않으면서 세 가지 서로 다른 언어를 하나의 사전으로 합치려는 것과 같았습니다. 이는 지저분했고 종종 형사들의 정확도를 떨어뜨렸습니다.

해결책: LRAgent

이 논문의 저자들은 영리한 사실을 깨달았습니다:

  1. 공유된 두뇌: 메모리의 대부분은 메인 "두뇌"에서 오는 것이며, 이는 모두에게 거의 동일합니다. 그것은 기본적인 사실들입니다.
  2. 맞춤형 노트: 형사들 사이의 유일한 진짜 차이점은 그들의 커스텀 "노트"(LoRA 어댑터)에 의해 추가된 아주 작고 구체적인 메모입니다.

모두를 위해 전체 메모리를 복사하는 대신, LRAgent는 메모리를 두 부분으로 나눕니다:

1. "Base Cache" (공유된 청사진)

메인 두로의 메모리는 모두에게 동일하기 때문에, 팀은 이것을 단 한 번만 기록합니다. 세 형사 모두 이 단 하나의 공유된 청 blueprint를 가리킵니다. 이를 통해 엄청난 양의 책상 공간을 절약합니다.

2. "LR Cache" (작은 포스트잇)

LoRA 어댑터에서 나온 커스텀 메모리는 매우 작고 구체적입니다. LRAgent는 이를 긴 문장으로 쓰는 대신, 고도로 압축된 "저차원(low-rank)" 형식(예: 긴 풍자적인 문장을 쓰는 대신 "풍자적인 어조를 약간 추가할 것"이라고 적힌 작은 포스트잇)으로 저장합니다.

  • BaseShared: 이 방식은 큰 청사진을 공유하고 각 형사를 위한 아주 작은 포스트잇을 유지합니다.
  • BaseLRShared: 이것은 초효율적인 버전입니다. 만약 형사들이 그들의 "다운 프로젝션(down-projection, 단서를 읽는 방식)"이 동일한 설정을 사용한다면, 그들은 심지어 포스트잇까지 공유할 수 있습니다! 그들은 실제로 말을 할 때만 자신만의 고유한 "업 프로젝션(up-projection, 마지막 손길)"을 적용하면 됩니다.

마법 같은 기술: Flash-LoRA-Attention

여러분은 이렇게 물을 수도 있습니다: "메모리가 압축되어 있다면, 필요할 때 다시 온전한 문장으로 확장하는 데 추가 시간이 걸리지 않을까요?"

보통은 그렇습니다. 하지만 저자들은 Flash-LoRA-Attention이라는 특별한 도구를 발명했습니다.
이것은 마치 거대한 솥의 국물을 맛보기 위해 굳이 국 전체를 다 요리할 필요가 없는 요리사와 같습니다. 이 도구는 작은 포스트잇을 사용하기 전에 온전한 문장으로 확장하는 대신, 수학적 방식을 재구성합니다. 즉, 메모리를 사용하기 전에 작은 포스트잇을 온전한 문장으로 확장하는 것이 아니라, 프로세스가 진행되는 동안 공유된 청사진에 직접 작은 메모를 적용합니다.

  • 이점: 이 도구는 메모리를 확장하는 무거운 작업을 피하게 해주어, 팀이 개별적인 전문성을 유지하면서도 마치 전체 메모리를 공유하고 있는 것처럼 거의 빠르게 작업할 수 있게 해줍니다.

결과

논문은 이 "형사 팀"이 어려운 수수께마다 (HotpotQA 및 ScienceQA와 같은) 문제를 해결하는 과정을 테스트했습니다.

  • 정확도: 팀은 각자의 전체 메모리를 별도로 유지했을 때와 마찬가지로 수수께다를 해결했습니다. 지능을 전혀 잃지 않았습니다.
  • 속도 및 공간: 이들은 컴퓨터 메모리를 현저히 적게 사용했으며(평소의 약 1/3 수준), 특히 사건이 매우 길어질 때 훨씬 더 빠르게 작업을 완료했습니다.

요약하자면: LRAgent는 AI 전문가 팀이 메모리를 공유하는 스마트한 방법입니다. 그들은 공통된 사실은 하나의 공유 파일에 보관하고, 자신들만의 고유하고 작은 차이점만을 압축된 형식으로 저장함으로써, 개별적인 전문성을 잃지 않고 더 빠르고 저렴하게 협력할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →