← 최신 논문
🤖 machine learning

Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers

이 논문은 가중치 공유 트랜스포머(weight-tied Transformers) 내 루프 인덱싱된 KV 캐시의 저계수(low-rank) 구조를 활용하여, SVD 초기화 및 증류(distillation)를 통해 근사 무손실 성능을 유지하면서도 극단적인 압축(최대 32배)을 달성하고 배치 용량을 크게 증가시키는 사후 학습 코덱인 Looped Latent Attention (LLA)을 소개한다.

원저자: James O' Neill, Fergal Reid

게시일 2026-07-20
📖 5 분 읽기🧠 심층 분석

원저자: James O' Neill, Fergal Reid

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

AI 두뇌의 메모리 문제

로봇에게 이야기를 쓰는 법을 가르치고 있다고 상상해 보세요. 로봇은 단어들이 어떻게 연결되는지 아는 수백만 개의 작은 스위치(파라미터)로 이루어진 두뇌를 가지고 있습니다. 하지만 문제는, 긴 이야기를 쓰기 위해 로봇은 단순히 자신의 두뇌만 들여다보는 것이 아니라 '연습장'이 필요하다는 점입니다. 새로운 단어를 쓸 때마다, 로봇은 자신이 방금 무엇을 썼는지 기억하여 내용을 반복하거나 줄거리를 놓치지 않아야 합니다. 인공지능의 세계에서 이 연습장은 **KV 캐시(Key-Value cache)**라고 불립니다. 이것은 모든 대화마다 생성되는 개인용 공책이며, 로봇이 말을 할 때마다 점점 더 커집니다.

이제, 매우 효율적으로 설계된 특별한 종류의 로봇을 상상해 보세요. 이 로봇은 다양한 작업을 수행하기 위해 많은 서로 다른 방(레이어)을 가진 거대한 두뇌를 갖는 대신, 반복해서 방문할 수 있는 작고 영리한 방 하나를 가지고 있습니다. 이 로봇은 더 깊게 생각하기 위해 동일한 일련의 지침을 반복해서 사용하며 루프를 돕니다. 이를 **루프드 트랜스포머(Looped Transformer)**라고 합니다. 이는 두뇌 자체의 공간을 절약해주므로 매우 좋습니다. 하지만 여기에는 교활한 문제가 있습니다. 로봇이 동일한 방을 재사용하더라도, 루프를 돌 때마다 연습장에 새로운 페이지를 써야 한다는 점입니다. 만약 로봇이 수학 문제를 풀기 위해 네 번 루프를 돈다면, 이야기의 같은 순간에 대해 네 개의 별도 메모 페이지를 갖게 됩니다. 즉, "루프형" 로봇은 여전히 실행을 위해 엄청난 양의 메모리가 필요하며, 이는 효율성을 추구하는 목적을 무색하게 만듭니다. 과학자들의 큰 질문은 이것입니다: "우리가 로봇이 생각하는 법을 잊어버리게 만들지 않으면서, 저 연습장을 줄일 수 있을까?"

논문의 발견: 메모리 속의 비밀 지름길

이 논문은 그 메모리 문제를 해결하기 위해 **루프드 레이턴트 어텐션(Looped Latent Attention, LLA)**이라는 영리한 기술을 소개합니다. 연구진은 로봇의 메모리가 보기만큼 엉망이 아니라는 사실을 발견했습니다. 로봇이 사고 과정을 루프 through 할 때, 동일한 단어에 대해 작성하는 메모는 급격하게 변하지 않습니다. 대신 그것은 완만한 언덕을 굴러 내려가는 구슬처럼 매끄럽고 예측 가능한 경로를 따릅니다. 연구진은 로봇의 연습장 모든 페이지를 전부 저장하는 대신, 그 경로의 아주 작은 "요약본"과 로봇이 실제로 읽어야 할 때 특정 페이지를 다시 구축하는 방법(지침)만을 저장합니다.

이렇게 생각해 보세요. 주인공이 복도를 걸어가는 영화를 보고 있다고 가정해 봅시다. 일반적인 컴퓨터라면 주인공이 발걸음을 옮길 때마다 고화질 사진 한 장을 모두 저장할 것입니다. 이는 엄청난 저장 공간을 차지합니다. 하지만 LLA를 사용하면, 주인공이 그저 직선으로 걷고 있다는 것을 깨닫게 됩니다. 그래서 수천 장의 사진을 저장하는 대신, 주인공의 사진 한 장과 "2단계에서는 1인치 앞으로, 3단계에서는 2인치 앞으로 이동"이라는 간단한 메모를 저장합니다. 컴퓨터가 3단계에서 주인공을 봐야 할 때, 이 메모를 사용하여 빠르게 그림을 그려냅니다. 이것이 바로 이 논문이 AI를 위해 하는 방식입니다. 즉, "루프" 부분의 메모를 압축하여, 네 페이지의 뭉치를 단 하나의 작은 요약본으로 변환한 뒤, 필요할 때 즉시 전체 페이지로 확장할 수 있게 만드는 것입니다.

연구진은 이 방법을 Ouro-1.4B와 같은 여러 AI 모델에 테스트했습니다. 그 결과, 이 방법이 놀라울 정도로 잘 작동한다는 것을 발견했습니다. 실제로, H200이라는 강력한 컴퓨터 칩에서 이들은 이전에는 32개의 대화만 수용할 수 있었던 것에 비해, 한 번에 768개의 서로 다른 대화를 메모리에 담을 수 있었습니다. 이는 동시에 AI를 사용할 수 있는 사람의 수가 비약적으로 늘어났음을 의미합니다. 또한, 이 기술이 매우 길고 어려운 수학 문제를 풀 때도 작동함을 보여주었지만, 다만 로봇이 선생님을 따라 하는 것이 아니라 자신의 이야기를 직접 쓸 때 혼란을 겪지 않도록 약간의 추가 훈련이 필요합니다.

이 논문이 "아니오"라고 말하는 것들

이 방법이 아닌 것이 무엇인지 아는 것도 중요합니다. 연구진은 먼저 매우 단순한 아이디어를 테스트했습니다: "만약 우리가 처음 세 페이지의 메모를 버리고 마지막 한 페이지만 남겨둔다면 어떻게 될까?" 그들은 로봇이 몇 번의 루프 후에 최종 답안에 안착하므로 초기 메모는 중요하지 않을 것이라고 생각했습니다. 그들은 이를 시도해 보았으나, 결과는 참담했습니다. AI는 수학 문제를 푸는 법을 완전히 잊어버려 테스트에서 0점을 기록했습니다. 이는 메모가 지나가는 "경로"가 중요하다는 것을 증명합니다. 즉, 단순히 도착 지점만 가져와서는 안 됩니다. 그 여정을 포착해야 합니다.

또한 그들은 메모를 압축(양자화, quantization)하거나 뇌의 서로 다른 부분 간에 메모를 공유하는 방식(헤드 축 압축, head-axis compression)과 같은 다른 메모 축소 방식과 비교했습니다. 이러한 방식들도 약간의 도움은 되지만, 논문은 "루프" 축을 압축하는 것이 핵심 비결임을 보여줍니다. 만약 루프 대신 다른 부분을 압축하려고 하면, AI는 추론 능력을 상실합니다. 논문은 명확히 밝히고 있습니다: 루프가 메모에서 가장 중복되는 부분이며, 압축해야 할 곳은 오직 그곳뿐이라는 점입니다.

얼마나 확신하는가?

저자들은 직접 측정한 결과를 바탕으로 이 결과에 대해 상당히 자신감을 갖고 있습니다. 그들은 단순히 추측한 것이 아니라, GSM8K(수학 문제) 및 HumanEval(코드 작성)과 같은 실제 작업에 AI를 실행했습니다. 그들은 4배 압축(메모리를 4배 작게 만듦)을 적용했을 때도 AI가 원래의 압축되지 않은 버전과 거의 비슷하게 성능을 낸다는 것을 보여주었습니다. 극한의 압축(21.3배)까지 밀어붙였을 때도 AI는 많은 작업을 처리할 수 있었지만, 매우 길고 복적인 추론 단계에서는 어려움을 겪기 시작했습니다.

그들은 또한 32번까지 루프를 도는 다른 구조의 AI 모델인 Huginn-3.5B에서도 이 실험을 진행했으며, 그곳에서도 이 방법이 작동하여 이것이 특정 로봇만의 우연한 현상이 아님을 입증했습니다. 논문은 이 "저계수 궤적(low-rank trajectory, 메모리의 매끄러운 경로)"이 루프형 로봇이 생각하는 방식의 근본적인 특성임을 시사합니다. 이들은 메모리 절약과 용량 증대 측면에서 효과적임을 입증했지만, 매우 긴 작업에서 최상의 성능을 내기 위해서는 로봇이 단순히 선생님을 모방하는 것이 아니라 자신의 압축된 메모리를 가지고 연습하는 '온 폴리시(on-policy)' 훈련 단계가 필요하다고 언급했습니다. 이 훈련은 로봇이 자신의 이야기를 직접 쓸 때 발생하는 작은 오류들을 수정해 줍니다.

요약하자면, 이 논문은 루프형 AI 모델의 메모리가 특정한 방식으로 반복된다는 점을 이용해 훨씬 더 효율적으로 만들 수 있음을 보여줍니다. 반복되는 부분의 전체 메모리 대신 아주 작은 요약본을 저장함으로써, 우리는 값비싼 하드웨어 없이도 더 많은 사람이 강력한 AI를 사용할 수 있도록 단일 컴퓨터 칩에 수백 배 더 많은 대화를 담을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →