← 최신 논문
💬 NLP

Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory

이 논문은 중간 잔차 상태(intermediate residual states)를 캐싱하고 상위 레이어를 재계산함으로써 트랜스포머 레이어의 비균등한 활용을 이용하는 메모리 메커니즘인 CoMem을 소개하며, 이를 통해 일정한 연산 및 메모리 비용으로 무제한 컨텍스트 메모리를 달로 달성하는 동시에 롱 컨텍스트 벤치마크에서 풀 컨텍스트 베이스라인들을 크게 능가하는 성과를 거두었습니다.

원저자: Hanzuo Liu, Xuan Qi, Chunyu Liu, Haotian Zhong, Yulong Wang, Rayying, Key, Alex Lamb, Mingyu Gao

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hanzuo Liu, Xuan Qi, Chunyu Liu, Haotian Zhong, Yulong Wang, Rayying, Key, Alex Lamb, Mingyu Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수만 권의 책을 순식간에 읽을 수 있는 초지능 로봇을 상상해 보세요. 이 로봇은 '거대 언어 모델(Large Language Model)'이라 불리는 인공지능의 한 종류입니다. 이야기를 이해하기 위해 로봇은 지금까지 읽은 모든 단어를 기억해야 합니다. 로봇의 기억을 거대한 화이트보드라고 생각해 보세요. 예전의 로봇들은 새로운 단어를 읽을 때마다 지금까지 본 모든 단어에 대해 화이트보드에 새 노트를 작성해야 했습니다. 이야기가 아주 길어지면 화이트보드는 공간이 부족해지거나, 로봇이 자신의 노트를 읽느라 너무 지쳐서 매우 느려지게 됩니다. 이것이 바로 과학자들이 해결하려고 노력 중인 큰 문제입니다. 어떻게 하면 로봇이 공간이나 시간 문제 없이 방대한 양의 정보를 기억하게 할 것인가 하는 점이죠.

이 로봇이 생각하는 방식의 비밀은 마치 다층 건물과 같은 '층(layers)'에 있습니다. 낮은 층들은 단어의 기본적인 의미를 이해하는 데 탁월합니다(예를 들어, "사과"가 과일이라는 것을 아는 것). 높은 층들은 로봇이 더 똑똑해지는 곳으로, 이 기본적인 의미를 사용하여 특정 질문에 답하거나 다음에 일어날 일을 예측합니다. 보통 로봇은 질문에 답하고 싶을 때마다 바닥층에서 꼭대기 층까지 전체 이야기를 모두 처리해야 합니다. 이 논문은 영리한 지름길을 제안합니다. 만약 우리가 로봇이 중간 층까지만 전체 이야기를 읽게 하고, 그 "반쯤 구워진(half-baked)" 이해 상태를 저장한 뒤, 실제로 답변이 필요할 때만 꼭대기 층에서 나머지 작업을 마무리하게 한다면 어떨까요?

이것이 바로 CoMem(Comprehension Memory)이라는 새로운 방법의 연구진이 발견한 핵심입니다. 그들은 로봇이 방대한 문서의 모든 세부 사항을 한꺼번에 기억하려고 애쓰는 대신, 정보를 저장하고 검색하는 데 훨씬 더 똑똑해질 수 있다는 것을 발견했습니다. 연구진은 텍스트 덩어리에 대한 로봇의 "이해"가 뇌의 중간 부분(중간 층들)에 도달했을 때 이미 대부분 준비된다는 사실을 깨달았습니다. 따라서 CoMem은 마치 책 전체를 책상 위에 올려두지 않는 사서처럼 작동합니다. 사서는 장의 앞부분을 읽고 핵심 내용을 짧은 메모지에 적어 선반에 붙여둡니다. 여러분이 질문을 하면, 사서는 책 전체를 꺼내는 대신 관련 있는 몇 개의 메모지만 집어 들고, 머릿속으로 남은 장을 마저 읽은 뒤 답변을 해줍니다.

이 논문은 이러한 "깊이의 분업(depth division of labor)"이 놀라울 정도로 잘 작동한다는 것을 보여줍니다. 텍ales의 절반만 처리하고 그 중간 결과물을 캐싱(저ging)함으로써, 로봇은 엄청난 양의 공간을 절약할 수 있습니다. 테스트 결과, Qwen3-8B 모델을 사용했을 때 CoMem은 128k 토큰 컨텍스트를 처리하는 데 단 18.26 GB의 메모리만 사용한 반면, 전통적인 방식은 89.36 GB가 필요했습니다. 이는 엄청난 차이입니다! 또한 CoMem은 질문에 답할 준비를 하는 과정에서 7.83배의 속도 향상을 달 수 있어 로봇을 훨씬 빠르게 만들었습니다.

하지만 연구진은 이것이 마법이 아니라는 점을 주의 깊게 지적합니다. 중간에 읽기를 멈춘다고 해서 완벽한 답을 기대할 수는 없습니다. 너무 일찍 멈추면 로봇이 세부 사항을 잊어버리고, 너무 늦게 멈추면 속도 이점을 잃게 됩니다. 연구진은 로봇이 의미를 충분히 이해하면서도 아직 특정 질문에 특화되지 않은 중간 층(구체적으로 36개 층 중 12번째 층)에서 "스위트 스팟(최적의 지점)"을 찾아냈습니다. 또한 단순히 메모를 저장하는 것만으로는 부족하며, 로봇이 점들을 연결하기 위해 여전히 모든 관련 메모를 한꺼번에 볼 수 있어야 한다는 점도 발견했습니다.

결과는 인상적이지만 특정적입니다. 로봇이 거대한 텍스트 속에서 "건초더미 속의 바늘(특정 사실)"을 찾을 수 있는지 확인하는 RULER 테스트에서, CoMem은 표준 방식이 78.80점을 기록한 것에 비해 97.05점을 기록하며 앞섰습니다. 긴 대화 테스트인 LoCoMo에서 CoMem은 38.27점을 기록하여 표준 방식의 34.59점을 능가했습니다. 이 논문은 이 접근 방식이 메모를 조직화하는 강력한 방법임을 시사하지만, 모든 작업에 완벽한 해결책은 아닙니다. 예를 들어, 로봇은 여전히 특정 유형의 복잡한 질문(BABILong 테스트의 일부 "qa2" 작업 등)에서 어려움을 겪는데, 이는 이 방법이 효율성 면에서는 큰 진전이지만 로봇을 모든 면에서 완벽하게 만들지는 못한다는 것을 보여줍니다.

요약하자면, CoMem은 질문을 던질 때마다 로봇에게 도서관 전체를 다시 읽으라고 강요할 필요가 없다는 것을 시사합니다. 업무를 나누어—낮은 층들이 이해라는 힘든 일을 맡고, 높은 층들이 구체적인 답변을 담당하게 함으로써—우리는 더 많이 기억하고, 더 빠르게 생각하며, 에너지를 덜 사용하는 로봇을 만들 수 있습니다. 이것은 마치 백팩에 백과사전 전체를 담아 다닐 필요 없이, 필요할 때 어떤 페이지를 꺼내야 할지만 알면 된다는 사실을 깨닫는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →