← 최신 논문
🤖 machine learning

Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse

이 논문은 동일한 제품군 내의 서로 다른 크기의 모델 간에 KV 캐시를 효율적으로 재사용할 수 있게 하는 폐쇄형 선형 매핑 기술을 제안하며, 이를 통해 수신 측이 단독 정확도의 73~98%를 유지하면서도 중복된 프리필링(prefilling) 과정을 건너뛰어 추론 지연 시간을 크게 줄일 수 있도록 한다.

원저자: Taekyung Heo, Rasoul Shafipour, Ritchie Zhao, Maximilian Golub, Mohammad Mahdi Kamani, Ritika Borkar, Makesh Tarun Chandran, Pantea Zardoshti, Bita Darvish Rouhani

게시일 2026-08-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Taekyung Heo, Rasoul Shafipour, Ritchie Zhao, Maximilian Golub, Mohammad Mahdi Kamani, Ritika Borkar, Makesh Tarun Chandran, Pantea Zardoshti, Bita Darvish Rouhani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 다양한 경력을 가진 작가 팀이 집필한 책들이 가득한 거대하고 똑똑한 도서관을 운영하고 있다고 상상해 보십시오. 때로는 빠르고 간단한 답변이 필요해서 주니어 어시스턴트에게 물어보기도 하고, 때로는 깊고 복잡한 분석이 필요해서 시니어 전문가를 부르기도 합니다. 인공지능의 세계에서 이 "어시스턴트"와 "전문가"는 서로 다른 크기를 가진 거대 언어 모델(LLM)들입니다. 대화가 매끄럽게 흘러가도록 하기 위해, 시스템은 종종 대화 도중에 이러한 서로 다른 모델들 사이를 전환해야 합니다.

하지만 여기에는 문제가 하나 있습니다. 주니어 어시스턴트에서 시니어 전문가로 전환할 때마다, 전문가는 문맥을 이해하기 위해 대화 전체 기록을 처음부터 다시 읽어야 합니다. "프리필(prefill)"이라고 불리는 이 과정은 마치 전문가가 첫 장에서 무슨 일이 있었는지 기억하기 위해 100페이지짜리 소설을 처음부터 다시 읽는 것과 같습니다. 이 과정은 많은 시간과 에너지, 그리고 비용을 소모합니다. 과학자들은 시니어 전문가가 처음부터 다시 읽는 과정을 건너뛰기 위해 주니어 어시스턴트의 노트(이를 "KV 캐시"라고 부릅니다)를 "빌려올" 수 있는지 알아내기 위해 노력해 왔습니다. 하지만 그 노트들은 서로 약간 다른 필체로 쓰여 있어서 직접 읽기가 어렵습니다.

"Cross-Model KV Cache Transfer"라는 제목의 이 논문은 바로 그 문제를 다룹니다. 연구진은 작은 모델의 노트와 큰 모델의 노트가 겉보기에는 달라 보일지라도, 실제로는 숨겨진 직선적 관계를 공유하고 있다는 사실을 발견했습니다. 그들은 단순한 수학적 기법인 "폐쇄형 선형 매핑(closed-form linear mapping)"을 사용하면, 모델을 재학습시키거나 복잡한 신경망을 사용하지 않고도 주니어 어시스턴트의 노트를 시니어 전문가의 언어로 번역할 수 있다는 것을 찾아냈습니다.

이렇게 생각해보십시오. 주니어 어시스턴트는 특정 세트의 크레파스를 사용하여 이야기를 씁니다. 시니어 전문가는 그 이야기를 다른 세트의 크레파스로 필요로 합니다. 전문가에게 이야기를 다시 읽고 처음부터 다시 쓰라고 요청하는 대신, 연구진은 "크레파스 번역기"를 만들었습니다. 이 번역기는 "만약 주니어가 여기서 빨간색 크레파스를 사용했다면, 시니어는 저기서 파란색 크레파스를 사용해야 한다"라고 말해주는 단순한 공식입니다. 놀랍게도, 이 단순한 번역은 매우 효과적이었습니다. 일부 모델 쌍의 경우, 시니어 전문가는 스스로 이야기를 읽었을 때 가질 수 있었던 정확도의 98%를 달ow하면서도, 이를 2.7배에서 25배 더 빠르게 수행했습니다.

연구팀은 이를 세 가지 유명한 제품군(Qwen3, Llama 3.1, Ministral)에 속하는 여섯 가지 모델 쌍에 대해 테스트했습니다. 그 결과, 네 가지 모델 쌍의 경우 이 단순한 "크레파스 번역기"가 거의 완벽하게 작동한다는 것을 발견했습니다. 단순한 번역기가 어려움을 겪은 두 쌍의 경우에는, 약간 더 복잡한 도구(비선형 MLP)가 오류를 수정하여 성능을 최대 37%포인트까지 끌어올릴 수 있음을 보여주었습니다. 이 논문은 성공의 핵심이 단순히 노트가 얼마나 잘 일치하느냐가 아니라, 번역 오류가 어디에서 발생하는지에 달려 있다고 제안합니다. 만약 오류가 전문가가 주의를 기울이지 않는 부분에서 발생한다면 상관없지만, 만약 중요한 부분에서 발생한다면 번역은 실패하게 됩니다.

요약하자면, 저자들은 우리가 모델 사이에 비싸고 복잡한 다리를 건설할 필요가 없다고 제안합니다. 대신, 단순하고 빠르며 학습이 필요 없는 수학적 지도가 서로 다른 크기의 AI 모델들이 자신들의 "기억"을 즉각적으로 공유할 수 있게 해줍니다. 이는 AI 대화를 훨씬 더 빠르고 저렴하게 만들어, 시스템이 처음부터 다시 시작하는 지연 시간 없이 빠르고 똑똑한 모드 사이를 전환할 수 있게 해줄 것입니다. 이 결과는 테스트된 모델들에 대해 측정되었으며 견고하며, 이 "노트 빌리기" 전략이 AI의 미래를 가속화할 실용적인 방법임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →