← 최신 논문
🤖 machine learning

LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining

이 논문은 국소적 패턴을 포착하기 위한 로컬 퓨전 어텐션(Local Fusion Attention)과 명시적인 전역 지식 검색을 위한 디커플드 지식 메모리 모듈(decoupled Knowledge Memory Module)을 통합함으로써 사전 학습 효율과 수렴 속도를 향상시킨 새로운 대규모 언어 모델 아키텍처인 LoKiFormer를 소개한다.

원저자: Qiuwu Chen, Zimo Liu, Yuchen Li, Ying Sun, Yifan Zhang, Zhijie Qiu, Zeng You, Ryan Dong, Simeng Ma, Yaofo Chen, Mingkui Tan

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Qiuwu Chen, Zimo Liu, Yuchen Li, Ying Sun, Yifan Zhang, Zhijie Qiu, Zeng You, Ryan Dong, Simeng Ma, Yaofo Chen, Mingkui Tan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능 로봇에게 읽고 쓰는 법을 가르치려 한다고 상상해 보세요. 이 로보는 '거대 언어 모델(LLM)'이라 불리는 인공지능의 일종으로, 이야기 쓰기부터 수학 문제 풀이까지 모든 분야에서 놀라운 실력을 갖추게 되었습니다. 하지만 문제가 하나 있습니다. 이 로봇을 가르치는 것은 마치 티스푼으로 수영장을 채우려는 것과 같습니다. 엄청난 양의 시간과 컴퓨터 연산 능력이 필요하며, 로봇은 때때로 자신이 실제로 무엇을 배우고 있는지에 대해 혼란을 겪기도 합니다.

왜 그런지 이해하려면, 인간이 문장을 읽는 방식을 생각해 보세요. 우리는 단어들이 서로 바로 옆에 붙어 있을 때 대개 연결되어 있다는 것(예: "뜨거운"과 "커피")을 즉각적으로 이해하지만, 동시에 몇 년 전에 배웠던 사실들(예: "커피는 원두로 만든다")도 기억해 내야 합니다. 현재의 AI 모델들은 '어텐션(attention)'이라는 메커니즘을 사용하여 이 두 가지를 동시에 수행하려고 노력하는데, 이는 모든 단어를 살펴보고 그 단어들이 어떻게 연관되는지 확인하는 방식입니다. 문제는 이것이 마치 페이지 위의 모든 글자를 한꺼번에 뚫어지게 쳐다보며 책을 읽는 것과 같아서, 국소적인 연결을 처리하기에는 매우 지치고 비효율적이라는 점입니다. 또한, 로봇이 역사나 과학 같은 일반적인 지식을 저장하려고 할 때, 그 지식을 뇌 깊숙한 곳에 무질서하게 숨겨두기 때문에 필요한 사실을 적시에 꺼내기가 어렵습니다. 과학자들은 더 빨리 배우고, 에너지를 덜 사용하며, 정보를 정확히 어디에서 찾아야 하는지 아는 로봇을 만들고 싶어 합니다.

여기, 로봇의 안경과 기억 저장소를 똑똑하게 업그레이드하는 설계인 LoKiFormer가 등장했습니다. 이 논문의 저자인 Qiuwu Chen과 Zimo Liu가 이끄는 연구진은 기존의 방식이 에너지를 낭비하고 있다는 점에 주목했습니다. 그들은 로봇의 학습 과정을 해결하기 위해 두 가지 새로운 도구를 제안했습니다. 하나는 '국소적인(local)' 것(바로 옆에 있는 단어들)을 처리하기 위한 것이고, 다른 하나는 '전역적인(global)' 것(세상의 거대한 사실들)을 처리하기 위한 것입니다.

첫째, 그들은 국소적인 문제를 **국소 융합 어텐션(Local Fusion Attention, LFA)**이라는 것으로 해결했습니다. 당신이 문장을 읽고 있다고 상상해 보세요. 로봇이 "고양이"라는 단어가 문단 내의 다른 모든 단어와 어떻게 연관되는지 즉시 파악하려고 애쓰는 대신, LFA는 로봇에게 특별한 "국소 망원경"을 쥐여줍니다. 이 망원경은 바로 옆에 있는 몇 개의 단어에만 초점을 맞춰 그것들을 먼저 하나로 섞어줍니다. 이는 마치 로봇이 전체 도시를 이해하기 전에, 주변 동네의 요약본을 빠르게 훑어보는 것과 같습니다. 이를 통해 로봇은 불필요한 작업을 줄일 수 있습니다. 논문에 따르면, 이 간단한 단계를 추가함으로써 로봇은 국소적인 패턴을 훨씬 빠르게 이해하게 되며, 나중에 더 크고 복잡한 관계에 집중할 수 있는 두뇌 전력을 확보할 수 있습니다.

둘째, 그들은 **지식 메모리 모듈(Knowledge Memory-Module, KMM)**을 통해 기억 문제를 해결했습니다. 기존 모델에서 로봇의 지식은 책들이 선반에 본드로 붙어 있고 읽는 방법과 뒤섞여 있는 도서관과 같았습니다. 만약 로봇이 "물리학"에 관한 사실을 찾으려 한다면, 엉망이 된 도서관 전체를 헤집어야 했습니다. LoKiFormer의 KMM은 읽기 지침과는 분리된, 완벽하게 정리되고 라벨이 붙은 서류함과 같습니다. 이것은 사실들을 특정하고 주소 지정이 가능한 슬롯에 저장합니다. 로봇이 "화학"에 대해 알고 싶을 때, 로봇은 주의가 산만해지지 않고 곧장 "화학" 서랍으로 걸어가서 알맞은 파일을 꺼낼 수 있습니다. 이는 지식을 '저장하는 것'과 '사용하는 것'을 분리하여 과정을 훨씬 명확하고 유연하게 만듭니다.

이 두 가지 도구를 결합한 결과는 인상적입니다. 연구진은 새로운 LoKiFormer 모델을 학습시켰으며, 이 모델이 표준 모델보다 1.33배 더 빠르게 학습한다는 것을 발견했습니다. 이를 체감할 수 있게 설명하자면, 표준 모델이 특정 수준의 이해에 도달하기 위해 10,000번의 학습 단계를 거쳐야 했다면, LoKiFormer는 단 7,500번의 단계만으로 동일한 수준에 도달했습니다. 이는 시간과 에너지 측면에서 엄청난 절약입니다. 더욱 흥-미로운 점은, 70억 개의 파라미터를 가진 이 모델의 작은 버전이 다른 기업들의 훨씬 더 큰 유명 모델들보다 더 뛰어난 성능을 보였다는 것입니다. 언어 이해, 추론, 심지어 코딩 테스트에서도 그들을 앞질렀습니다.

이 논문은 새로운 아키텍처가 단순히 로봇을 더 빠르게 만드는 것이 아니라, 자신이 아는 것을 사용하는 데 더 똑똑하게 만든다는 점을 시사합니다. "국소적" 읽기와 "전역적" 메모리를 분리함으로써, 모델은 복잡한 과제를 더 효과적으로 처리할 수 있습니다. 연구진은 또한 이 "서류함(KMM)"이 학습 과정 중에 스스로를 조직화했다는 것을 보여주었는데, 서로 다른 서랍들이 역사, 물리학, 대수학 같은 서로 다른 주제의 전문가가 되도록 자연스럽게 변했다는 것입니다. 이는 로봇이 단순히 암기하는 것이 아니라, 인간이 자신의 지식에 접근하는 방식과 유사하게 정보를 검색하는 법을 배우고 있음을 의미합니다.

요약하자면, LoKiFormer는 AI 모델을 더 좋게 만들기 위해 반드시 모델을 더 크게 만들고 비용을 더 많이 들일 필요는 없다는 것을 보여줍니다. 세부 사항을 보는 더 나은 도구와 큰 사실들을 저장하는 더 깔끔한 방법을 제공함으로써, 우리는 더 빨리 배우고, 훈련 비용이 적게 들며, 세상을 더 명확하게 이해하는 AI를 구축할 수 있습니다. 이는 때때로 초지능 기계를 만드는 가장 좋은 방법은 그 기계가 책상을 정리하도록 돕는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →