← 최신 논문
💬 NLP

BCMT: Blockwise Causal Memory Transformer

BCMT(Blockwise Causal Memory Transformer)는 블록 요약의 지수적 인과 메모리를 통해 국소적 토큰 상호작용을 전역적 문맥 전파로부터 분리함으로써, 롱 컨텍스트 모델링에서 밀집형 트랜스포머와 대등한 성능을 달성하는 동시에 훈련 처리량을 크게 개선하고 메모리 소비를 줄이는 혁신적인 아키텍처를 도입한다.

원저자: Rachid Arezki

게시일 2026-08-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rachid Arezki

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구에게 백만 단어에 달하는 긴 이야기를 들려주려고 한다고 상상해 보세요. 인공지능의 세계에서, 이야기를 쓰는 컴퓨터(언어 모델)는 대개 플롯을 이해하기 위해 '트랜스포머(Transformer)'라는 도구를 사용합니다. 트랜스포머를 책 전체의 모든 단어를 훑어보며 현재 문장을 이해하려고 노력하는 매우 체계적인 사서라고 생각해 보세요. 이 방식은 짧은 이야기에는 놀라울 정도로 잘 작동하지만, 책이 길어질수록 사서는 압도당하게 됩니다. 책이 1,000단어라면 사서는 1,000개의 연결을 만들어야 합니다. 만약 10,000단어라면 100,000개의 연결을 만들어야 하죠. 이는 마치 경기장에 있는 모든 사람과 동시에 악수를 하려는 것과 같아서, 그 노력이 너무 빠르게 늘어나 결국 컴퓨터의 메모리와 시간이 부족해지고, 아주 긴 책을 읽는 것이 불가능해집니다.

과학자들은 이 "긴 책 문제"를 해결하기 위해 수년간 노력해 왔습니다. 어떤 이들은 사서가 마지막 몇 페이지에만 집중하도록 만들기도 했고(이는 전체적인 맥락을 놓치게 됩니다), 또 다른 이들은 과거를 기억하기 위해 사서가 메모를 적어두는 특별한 메모리 뱅크를 만들기도 했습니다. 하지만 이러한 해결책들은 종종 복잡해지거나 컴퓨터를 다양한 방식으로 느리게 만들었습니다. 큰 질문은 이것입니다. 과연 모든 단어를 일일이 대조하는 엄청난 두통 없이도, 저 '슈퍼 사서'만큼 긴 이야기를 잘 이해할 수 있는 컴퓨터를 만들 수 있을까요?

여기서 연구자 라시드 아레즈키(Rachid Arezki)가 제안한 BCMT(Blockwise Causal Memory Transformer)라는 새로운 아이디어가 등장합니다. BCMT는 컴퓨터가 책 전체를 한꺼번에 보도록 강요하는 대신, 이야기를 작고 관리하기 쉬운 덩어리, 즉 '블록(blocks)'으로 나눕니다. 당신이 소설을 읽고 있는데, 1페이지부터 500페이지까지의 모든 단어를 기억하려고 애쓰는 대신, 한 장(chapter)을 읽고 나서 무슨 일이 일과 있었는지에 대한 빠르고 똑똑한 요약본을 작성하여 주머니에 넣는다고 상상해 보세요. 그다음 장을 읽고, 또 다른 요약을 작성하여 주머니에 넣는 식입니다.

여기서 영리한 점은 BCMT가 단순히 예전 장들을 잊어버리는 것이 아니라는 것입니다. 이 모델은 '지수적 메모리(exponential memory)' 시스템을 사용합니다. 이것은 마치 '희미해지는 메아리'와 같습니다. 가장 최근에 작성한 요약은 머릿속에 크고 선명하게 남아 있지만, 더 이전 장들의 요약은 여전히 존재하되 시간이 흐를수록 점점 더 작고 희미해집니다. 이를 통해 컴퓨터는 과거의 모든 세부 사항을 활성 메모리에 유지할 필요 없이 이야기의 전반적인 흐로를 기억할 수 있습니다.

이 논문은 WikiText-103이라는 데이터셋을 사용하여 표준 언어 작업에서 이 아이디어를 테스트했습니다. 연구진은 BCMT가 문장의 다음 단어를 예측할 때, 문맥이 최대 1,024 토큰에 달할 때도 기존의 '슈퍼 사서' 방식만큼 거의 비슷하게 잘 작동한다는 것을 발견했습니다. 하지만 진짜 마법은 속도와 효율성에 있습니다. BCMT는 모든 단어를 서로 대조할 필요가 없기 때문에 훨씬 빠르게 학습합니다. 표준 그래픽 카드를 사용하는 컴퓨터에서, 새로운 방식은 초당 약 204,200 토큰을 처리할 수 있었던 반면, 기존 방식은 초당 119,900 토큰에 불과했습니다. 이는 엄청난 도약입니다. 또한 컴퓨터 메모리도 훨씬 적게 사용했습니다(기존 14.37 GB 대비 약 10.48 GB).

연구진은 속도가 단순히 이야기를 작은 덩어리로 나누었기 때문이 아니라는 것을 확인하기 위해 특정 테스트를 수행했습니다. 그들은 이야기를 덩어리로 나누긴 했지만 '특별한 메모리 주머니'를 사용하지 않은 버전의 모델을 만들었습니다. 그 버전은 성능이 더 떨어졌습니다. 이는 "희미해지는 메아리" 메모리 시스템이 단순히 텍스트를 조각내는 행위가 아니라, 진정한 주인공임을 시사합니다.

요약하자면, BCMT는 긴 이야기를 다루는 AI를 구축하는 새로운 방법을 제시합니다. 이 방식은 '즉각적인 주변 환경(현재의 텍스트 블록)'을 이해하는 작업과 '역사를 기억하는 작업(메모리 주머니)'을 분리합니다. 비록 오래된 요약들이 점점 희미해지기 때문에 아주 먼 과거의 세부 사항을 완벽한 정밀도로 기억하지는 못하지만, 전체적인 그림을 염두에 두면서도 매우 효율적인 방법을 제공합니다. 저자는 이 접근 방식이 AI가 긴 텍스트를 더 빠르고 유능하게 읽을 수 있도록 만드는 유망한 대안이라고 결론지으면서도, 아주 오래된 세부 사항에 대한 완벽한 회상이 필요한 작업에는 여전히 기존의 "모든 것을 확인하는" 방식이 필요할 수 있다고 언급했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →