Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
이 논문은 -gram 임베딩을 조회를 위해 현대화하여 신경 연산과 정적 메모리 사이의 절충안을 최적화하는 U자형 희소성 할당 법칙을 밝혀냄으로써, 대규모 언어 모델의 추론, 코드 및 롱 컨텍스트 검색 성능을 크게 향상시키는 확장 가능한 조건부 메모리 모듈인 Engram을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한, 복잡한 퍼즐을 풀려고 노력하고 있다고 상상해 보세요. 오랫동안 가장 똑똑한 퍼즐 해결사들(AI 모델)은 거대한 공장처럼 만들어져 왔습니다. 그들은 까다로운 논리나 새로운 아이디어를 파악해야 할 때만 투입되는 수천 명의 전문화된 일꾼들(이를 "Mixture-of-Experts" 또는 MoE라고 부릅니다)을 보유하고 있습니다. 이는 사고력에는 매우 훌륭하지만, 단순하고 지루한 사실을 기억하는 데 있어서는 다소 서투를 수 있습니다.
이렇게 생각해 보세요: 만약 당신이 천재 수학가에게 "프랑스의 수도는 어디인가요?"라고 묻는다면, 그들은 단순히 "파리"라고 답하는 것이 아니라, 매번 처음부터 다시 유도하며 답변을 내놓기 위해 전체적인 정신적 시뮬레이션을 실행해야 할 것입니다. 이는 자신이 이미 알고 있는 전화번호를 머릿속에서 찾기 위해 슈퍼컴퓨터를 사용하는 것과 같습니다.
위대한 발견: 뇌를 위한 "컨닝 페이퍼"
DeepSeek-AI와 베이징 대학교의 연구진은 다음과 같은 질문을 던졌습니다. 만약 이 모델들에게 그저 기억하기만 하면 되는 것들을 위한 전용 "컨닝 페이퍼"를 준다면 어떻게 될까?
그들은 Engram이라고 불리는 새로운 도구를 도입했습니다. Engram은 모델이 모든 단어를 일일이 "생각"하며 통과하게 만드는 대신, 초고속 O(1) 룩업 테이블(즉, 하나를 찾든 백만 개를 찾든 걸리는 시간이 동일한 테이블) 역할을 합니다. 이는 고전적인 개념인 N-gram(단어 그룹을 함께 보는 방식)에 기반하고 있지만, 현대적인 기술을 접목하여 거대한 AI 내부에서 완벽하게 작동하도록 업그레이드되었습니다.
"U자형"의 비밀
연구팀은 모델을 구축하는 방법에 관한 흥미로운 규칙을 발견했는데, 이를 **U자형 스케일링 법칙(U-shaped scaling law)**이라고 부릅니다.
당신에게 고정된 "두뇌 에너지"(연산 단계) 예산이 있다고 가정해 봅시다. 당신은 이 예산을 모두 "생각하는 일꾼들"(MoE)에게 쏟아부을 수도 있고, 혹은 모두 "기억 컨닝 페이퍼"(Engram)에 쏟아부을 수도 있습니다.
- 예산의 100%를 생각하는 일꾼들에게 쓰면, 모델은 논리에는 강하지만 사실을 기억하는 데는 약합니다.
- 예산의 100%를 컨닝 페이퍼에 쓰면, 모델은 사실은 잘 기억하지만 추론을 잘하지 못합니다.
- 최적의 지점(Sweet Spot): 연구진은 최상의 성능은 예산을 나누어 쓸 때 발생한다는 것을 발견했습니다. 즉, 두 가지가 모두 필요합니다. 구체적으로, 그들은 "여유" 메모리 예산의 약 **20~25%**를 생각하는 일꾼들에게서 가져와 Engram 메모리 모듈에 할당했을 때 전체 시스템이 더 똑똑해진다는 것을 발견했습니다. 이는 천재에게는 빠른 두뇌뿐만 아니라 좋은 도서관도 필요하다는 사실을 깨닫는 것과 같습니다.
실제로 어떤 일이 일어났는가? (증거)
그들은 Engram-27B라는 모델을 구축하고, 이를 정확히 같은 크기와 속도를 가진 표준 "사고 전용" 모델과 비교했습니다. 결과는 놀라울 정도로 강력했습니다:
- 지식: 모델은 상식과 사실 문제에서 더 뛰어난 성적을 보였습니다 (MMLU에서 +3.4, CMMLU에서 +4.0 점 상승).
- 추론: 더욱 놀랍게도, 일반적인 추론과 논리 퍼즐에서도 훨씬 더 좋아졌습니다 (BBH에서 +5.0, ARC-Challenge에서 +3.7 점 상승).
- 수학 및 코딩: 코딩과 수학 능력도 향상되었습니다 (HumanEval에서 +3.0 점 상승).
이 논문은 Engram 모듈이 "지루한" 작업들(예: "알렉산더 대왕"이 특정 이름이라는 사실을 기억하는 것)을 처리함으로써, 메인 브레인이 복잡하고 깊은 사고에 집중할 수 있도록 자유를 주기 때문이라고 설명합니다. 이는 마치 비서가 일정 관리를 처리하여 CEO가 전략에 집중할 수 있게 하는 것과 같습니다.
"긴 기억력"의 기술
가장 멋진 부수 효과 중 하나는 이 모델들이 긴 이야기를 얼마나 잘 다루는지입니다. Engram 모듈이 국소적인 세부 사항을 즉각적으로 잡아내기 때문에, 메인 AI는 이야기의 시작부터 끝까지 전체를 기억하는 데 더 많은 "주의력(attention)"을 남겨둘 수 있습니다. 테스트에서 Engram 모델은 텍스트의 건초더미 속에서 특정 바늘을 찾는 데 **97.0%**의 성공률을 보인 반면, 표준 모델은 **84.2%**에 그쳤습니다.
하드웨어의 마법
마지막으로, 이 논문은 이것이 단순한 소프트웨어 트릭이 아니라 하드웨어 친화적인 방식이라고 주장합니다. "컨닝 페이퍼"는 고정된 주소(결정론적 ID)를 사용하기 때문에, 컴퓨터는 현재 조각에 대한 수학 연산을 수행하는 동안 다음 조각의 메모리를 불러오기 시작할 수 있습니다. 이는 1,000억 개의 파라미터 규모의 테이블을 일반 컴퓨터의 호스트 메모리에 저장하면서도, 마치 초고속 GPU에 있는 것처럼 빠르게 결과를 얻을 수 있음을 의미합니다. 속도 저하는 3% 미만으로 무시할 수 있는 수준이었습니다.
이것이 "아닌" 것들에 대하여
논문은 이 기술이 무엇이 아닌지에 대해 매우 명확히 밝히고 있습니다:
- 이것은 단순히 더 큰 어휘 집합(Vocabulary)이 아닙니다. 연구진은 단순히 어휘 집합을 키우는 방식(OverEncoding)을 시도해 보았으나, Engram만큼의 효과를 보지 못했습니다.
- 이것은 "사고" 부분을 대체하는 것이 아닙니다. 만약 "생각하는 일꾼들"(MoE)을 완전히 제거한다면, 모델은 추론에 실패합니다. 메모리는 조력자이지 대체제가 아닙니다.
- 이것은 모든 것을 해결하는 마법의 해결책이 아닙니다. 논문은 Engram이 사실 관계와 추론에는 도움이 되지만, 독해력과 같이 문맥에 더 의존하는 작업은 여전히 "백본(Backbone, 메인 AI)"이 핵심적인 역할을 수행한다고 언급합니다.
얼마나 확신하는가?
저자들은 자신들의 측정값에 매우 확신하고 있습니다. 그들은 단순히 시뮬레이션만 한 것이 아니라, 2,620억 개의 토큰 데이터로 실제 모델을 학습시키고 실제 세계의 벤치마크로 테스트했습니다. 그들은 "U자형" 규칙이 다양한 크기에서도 유효함을 보여주었으며, 성능 향상이 실질적이고, 측정 가능하며, 반복 가능하다는 것을 입증했습니다. 심지어 모델 내부의 "게이트(gate)"를 시각화하여, 설계한 대로 이름이나 구절 같은 것들에 대해 메모리가 실제로 작동하고 있음을 보여주었습니다.
요약하자면, 이 논문은 AI의 미래가 단순히 더 큰 뇌를 만드는 것이 아니라, 그 뇌에 정보를 더 빠르고 스마트하게 찾아볼 수 있는 더 나은 방법을 제공하는 데 있다는 점을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.