PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory
이 논문은 모든 컨텍스트 청크를 동시에 처리하고 강화 학습 기반의 적응형 종료를 통해 공유 메모리를 반복적으로 정교화하는 병렬-반복 메모리 메커니즘인 PI-Mem을 소개하며, 이를 통해 대규모 언어 모델이 최대 360만 토큰에 달하는 긴 컨텍스트 추론 작업에서 탁월한 정확도와 상당한 추론 속도 향상을 달성할 수 있게 합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 360만 페이지에 달하는 거대한 미스터리 소설을 풀려고 노력하고 있다고 상상해 보세요. 당신에게는 매우 똑똑하지만 단기 기억력이 매우 짧은 천재 탐정, 즉 대규모 언어 모델(LLM)이 있습니다. 만약 당신이 이 탐정에게 책 전체를 한꺼번에 건네준다면, 탐정의 두뇌는 과부하가 걸려 1,000,000페이지에 도달할 때쯤에는 10페이지에 있던 단서를 잊어버리기 시작할 것입니다. 이것이 바로 인공지능의 '롱 컨텍스트(long-context)' 문제, 즉 컴퓨터가 마지막 부분을 읽는 동안에도 어떻게 첫 부분에 대한 주의력을 유지하게 할 것인가에 대한 문제입니다.
이를 해결하기 위해 과학자들은 두 가지 주요 기술을 시도했습니다. 첫 번째는 고무줄을 늘리는 것과 같습니다. 모델이 모든 것을 한꺼번에 기억하도록 강요하는 것인데, 이 경우 고무줄이 끊어지거나 너무 느려지는 문제가 발생합니다. 두 번째로 더 대중적인 기술은 '순환 메모리(Recurrent Memory)' 방식입니다. 이는 탐정이 책을 한 장(chapter)씩 읽는 상황을 상상하게 합니다. 탐정은 1장을 읽은 후, 작은 요약 노트를 작성하고, 그 장을 버린 뒤 2장으로 넘어갑니다. 2장을 읽고, 노트를 업데이트하고, 다시 그 장을 버리는 식입니다. 문제는 만약 탐정이 나중에 혼란스러운 장을 읽게 된다면, 1장에서 얻은 중요한 단서를 적어둔 노트를 실수로 덧쓰거나 지워버려 결정적인 단서를 영원히 잃어버릴 수 있다는 점입니다. 이는 탐정이 다음 노트를 완성할 때까지 기다려야 하는 느린 직렬적 과정이며, 이로 인해 조사 전체가 지체됩니다.
여기서 새로운 연구팀이 PI-Mem(Parallel-Iterative Memory)이라는 신선한 아이디어로 등장합니다. PI-Mem은 탐정이 한 장씩 읽고 노트를 업데이트하며 이동하는 대신, 탐정에게 하나의 초능력을 부여합니다. 그것은 바로 모든 장을 동시에 읽되, 약간의 반전이 있는 방식입니다.
실제 논문에서 PI-Mem이 작동하는 방식은 다음과 같습니다. 탐정이에게 '공유 글로벌 메모리(Shared Global Memory)' 게시판이 있다고 상상해 보세요. 탐정은 순차적으로 책을 읽는 대신, 현재 메모리 게시판의 상태를 가이드 삼아 모든 장을 동시에 살펴봅니다. 각 장에 대해 탐정은 다음과 같이 질문합니다. "이 페이지에 내 게시판에 아직 없는 '새로운' 단서가 있는가?" 만약 답이 '예'라면, 탐정은 그 특정 단서만을 뽑아냅니다. 만약 '아니오'라면, 나머지 잡음들은 무시합니다.
모든 장을 병렬로 스캔하고 나면, 탐정은 찾아낸 '새로운' 단서들만을 가져와 메모리 게시판에 병합하여 더 깨끗하고 완전한 그림을 만들어냅니다. 그런 다음, 이 과정을 반복합니다. 탐정은 다시 모든 장을 살펴보지만, 이번에는 업데이트된 게시판을 가이드로 사용합니다. 예를 들어, 200장에서 발견한 조각과 일치하는 것을 방금 찾았기 때문에 5장에서 놓쳤던 단서가 갑자기 이해될 수도 있습니다. 탐정은 새로운 단서가 발견되지 않거나 제한에 도달할 때까지 이러한 '라운드(round)' 형태의 스캐닝을 계속합니다. 마지막으로, 탐정은 360만 페이지의 책 전체가 아니라, 게시판에 통합된 단서들만을 사용하여 미스터리를 해결합니다.
연구진은 이 방법을 두 가지 다른 AI 모델(Qwen3.5 및 Qwen2.5)을 사용하여 테스트했습니다. 이 테스트는 방대한 문서 전체에서 정보를 찾아내야 하는 까다로운 질문들을 다루는 HotpotQA 벤치마크를 활용했습니다. 그들은 컨텍스트 길이를 무려 360만 토큰(대략 거대한 도서관 규모)까지 밀어붙였습니다.
결과는 놀라웠습니다. 기존의 '하나씩 읽는' 방식(순환 메모리)과 비교했을 때, PI-Mem은 단순히 더 나은 답을 내놓는 데 그치지 않고 훨씬 빠르게 답을 찾아냈습니다. 360만 토큰 테스트에서 PI-Mem은 이전의 최고 방식보다 정확도를 6.25에서 7.81 퍼센트 포인트 향상시켰습니다. 더욱 인상적인 점은, 더 큰 모델에서는 6.1배, 더 작은 모델에서는 2.1배 더 빨랐다는 것입니다. 기존 방식은 탐정이 다음 단계로 넘어가기 전에 반드시 매 단계를 마칠 때까지 기다려야 했기에 매우 느렸습니다. 모든 것을 병렬로 읽는 PI-Mem은 느리고 구불구불한 길을 고속도로로 바꾸어 놓았습니다.
연구팀 또한 AI에게 언제 멈춰야 할지를 가르치기 위해 '강화 학습(Reinforcement Learning)'이라는 특별한 훈련 기법을 사용했습니다. 그들은 충분한 증거를 확보했다면 조사를 빠르게 끝낼 경우 AI에게 '보너스'를 주어, 불필요한 추가 읽기 라운드를 수행하지 않도록 유도했습니다. 이를 통해 시스템이 이미 해결한 장을 다시 읽으며 시간을 낭비하지 않도록 보장했습니다.
요약하자면, 이 논문은 AI가 긴 문서를 '생각'하는 방식을 바꾸는 것—즉, 느린 순차적 기록자에서 병렬적이고 반복적인 조사관으로 전환하는 것—을 통해, 우리가 문서의 시작 부분에 있는 단서를 놓치지 않으면서도 방대한 양의 텍스트에서 복잡한 문제를 해결할 수 있음을 시사합니다. 이는 AI에게 모든 것을 한꺼번에 기억하도록 강요할 필요가 없다는 것을 증명합니다. 그저 단서를 찾을 때마다 퍼즐 조각을 정리할 수 있는 더 나은 방법을 제공하면 될 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.