← 최신 논문
🤖 AI

MoNe: Modular Neural Memory for Efficient Long Context Inference

MoNe은 고정된 트랜스포머에 부착되어 추론 비용을 컨텍스트 길이로부터 분리함으로써, 재학습 없이 상수 쿼리 복잡도와 현저히 감소된 메모리 사용량을 달성하여 효율적인 장문 컨텍스트 추론을 가능하게 하는 경량화되고 모듈화된 신경 메모리 시스템이다.

원저자: Wonguk Cho, Kyubyung Chae, Tribhuvanesh Orekondy, Sunghyun Park, Hyoungwoo Park, Jeongho Kim, Arash Behboodi, Kyuwoong Hwang, Sungrack Yun

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wonguk Cho, Kyubyung Chae, Tribhuvanesh Orekondy, Sunghyun Park, Hyoungwoo Park, Jeongho Kim, Arash Behboodi, Kyuwoong Hwang, Sungrack Yun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능는 책 한 권 전체를 읽거나, 수년간의 채팅 로그를 분석하거나, 방대한 법률 계약서를 한 번에 소화할 수 있는 지점에 도달했습니다. 이를 위해 이 시스템들은 현재의 질문을 이해하기 위해 방금 처리한 모든 내용을 되돌아볼 수 있게 해주는 메커니즘에 의존합니다. 하지만 이러한 능력에는 가혹한 대가가 따릅니다. 텍스트의 양이 늘어남에 따라, 이를 처리하는 데 필요한 에너지와 컴퓨터 메모리는 단순히 증가하는 것이 아니라 폭발적으로 늘어납니다. 지금 읽고 있는 단어 하나하나를 지금까지 읽은 모든 단어와 일일이 비교하며 도서관 전체를 읽으려고 노력하는 상황을 상상해 보십시오. 필요한 노력은 매우 빠르게 증가하여, 휴대폰이나 노트북에서 발견되는 일반적인 컴퓨터들이 수천 단어 이상을 처리하는 것을 불가능하게 만듭니다. 이러한 한계로 인해 현재의 시스템들은 긴 이야기의 앞부분을 잊어버리거나, 특정 사실을 찾기 위해 외부 도구에 의존해야 하며, 이 과정에서 흩어진 세부 사항들을 연결하는 더 큰 그림을 놓치곤 합니다.

퀄컴 AI 리서치(Qualcomm AI Research)의 연구진은 MoNe라고 불리는 새로운 접근 방식을 개발했는데, 이는 인공지능 모델이 재학습을 하거나 하드웨어에 과부하를 주지 않고도 방대한 양의 정보를 처리할 수 있게 해줍니다. 모델이 대화나 문서의 전체 이력을 매번 다시 읽도록 강요하는 대신, MoNe는 모델이 읽으면서 기록하는 특화된 노트처럼 작동합니다. 이 시스템은 긴 텍스트를 작고 관리 가능한 덩어리로 나누어 처리합니다. 각 덩어리를 읽을 때마다, 모델은 이 내부 노트를 업데이트하며 필수적인 정보를 압축된 형태로 추출합니다. 전체 텍스트를 다 읽고 노트가 채워지면, 모델은 오직 그 노트의 내용만을 사용하여 질문에 답할 수 있습니다. 결정적으로, 모델은 원본의 긴 텍스트를 다시 돌아볼 필요가 전혀 없습니다. 이러한 설계 덕분에, 질문에 답하는 데 드는 비용은 원본 문서가 짧은 이메일이든 10만 단어짜리 소설이든 상관없이 동일하게 유지됩니다.

연구진은 모델이 거대한 텍스트 더미 속에 숨겨진 특정 사실을 찾아낼 수 있는지 확인하기 위해 설계된 표준적인 도전 과제들, 즉 흔히 '건초더미에서 바늘 찾기'라고 불리는 작업을 통해 이 방법을 테스트했습니다. 또한 자주 언급되는 단어를 추출하는 능력과, 텍스트 전반에 흩어져 있는 여러 조각의 정보를 연결해야 하는 문제를 해결하는 능력도 테스트했습니다. 텍스트 길이가 모델의 원래 학습 범위를 벗어나지 않았을 때, 이 새로운 방식은 모든 것을 한꺼번에 읽으려는 표준적인 방식보다 뛰어난 성능을 보이며 거의 완벽하게 수행되었습니다. 더욱 인상적인 점은, 연구진이 시스템이 설계된 원래 범위를 훨씬 초과하여 최대 12만 8천 토큰까지 텍스트 길이를 밀어붙였을 때도, 이 새로운 방식은 높은 정확도를 유지하며 계속 작동했다는 것입니다. 반면, 텍스트 전체를 한꺼번에 읽으려고 시도하는 표준적인 방식은 텍스트가 길어짐에 따라 완전히 실패하며 정확도가 거의 제로에 가깝게 떨어졌습니다. 관련 텍스트 조각을 검색하려고 시도하는 흔한 대안적 방법 역시, 여러 가지 흩어진 사실들을 종합해야 하는 답변을 요구할 때는 어려움을 겪었습니다.

이 새로운 방식의 효율성 이점은 상당합니다. 가장 긴 텍스트 길이를 테스트했을 때, 연구진은 이 접근 방식이 표준 방식에 비해 필요한 컴퓨터 전력을 약 80% 감소시킨다는 것을 발견했습니다. 또한 피크 메모리 요구량도 같은 비율로 줄였습니다. 이는 강력한 긴 문맥 추론 기능이 결국 거대하고 비싼 서버가 아닌, 자원이 제한된 기기에서도 실행될 수 있음을 의미하기 때문에 매우 중요한 개선입니다. 이 시스템은 내부 노트의 크기가 텍스트가 길어진다고 해서 커지지 않도록 메모리 점유율을 일정하게 유지함으로써 이를 달성합니다. 연구진은 이 시스템을 핵심 구조를 변경하지 않고도 기존의 사전 학습된 모델에 부착할 수 있으며, 약간의 추가 데이터 저장 공간만을 더하면 된다는 것을 입증했습니다. 또한, 텍록을 고정된 크기의 세그먼트로 나누어 단계별로 내부 상태를 업데이트함으로써, 시스템이 학습한 것보다 32배 더 긴 텍스트 길이에도 일반화될 수 있음을 보여주었습니다.

현재의 실험은 특정 모델 크기를 사용한 특정 검색 작업에 집중되었지만, 결과는 인공지능이 실세계의 긴 형태의 정보를 처리하는 데 있어 더 유능해질 수 있는 실행 가능한 경로를 제시합니다. 이 방법은 완전히 새로운 유형의 컴퓨터 두뇌를 처음부터 만들 필요도 없고, 모델을 거대한 새로운 데이터셋으로 재학습시킬 필요도 없습니다. 대신, 정보를 실시간으로 압축하는 법을 배우는 가볍고 모듈화된 기능을 도입합니다. 이를 통해 시스템은 과거에 대한 명확하고 일정한 기억을 유지하면서도, 현재를 생각하는 데 드는 비용을 낮게 유지할 수 있습니다. 몇 시간 동안의 대화나 수천 페이지의 문서를 바탕으로 추론할 수 있는 인공지능에 대한 수요가 계속 증가함에 따라, 이 접근 방식은 그러한 시스템이 빠르고 효율적이며, 자신이 탐색하도록 요청받은 세상의 전체 맥락을 이해할 수 있도록 유지하는 실질적인 방법을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →