← 최신 논문
🤖 machine learning

Little by Little: Continual Learning via Incremental Mixture of Rank-1 Associative Memory Experts

이 논문은 거친 입도의 LoRA 기반 Mixture-of-Experts를 라우팅 모호성과 간섭을 제거하기 위한 미세한 입도의 자기 활성화 랭크-1 연상 메모리 유닛으로 대체함으로써, 대규모 사전 학습된 모델의 가소성-안정성 트레이드오프를 크게 개선하고 파괴적 망각을 줄이는 지속 학습 프레임워크인 MoRAM을 소개한다.

원저자: Haodong Lu, Chongyang Zhao, Minhui Xue, Lina Yao, Kristen Moore, Dong Gong

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haodong Lu, Chongyang Zhao, Minhui Xue, Lina Yao, Kristen Moore, Dong Gong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 세상의 모든 것을 알고 있는 거대하고 믿을 수 없을 정도로 똑똑한 도서관(거대 사전 학습 모델)을 가지고 있다고 상상해 보세요. 이제 당신은 이 도서관에 특정 견종을 인식하거나 코드를 작성하는 법과 같은 새롭고 구체적인 기술을 가르치고 싶지만, 기존에 알고 있던 다른 모든 것들을 잊어버리게 하고 싶지는 않습니다.

이것이 바로 **연속 학습(Continual Learning)**의 문제입니다. 현재 대부분의 방법은 마치 기존의 책장에 새로운 책을 넣기 위해 기존의 책장을 다시 쓰는 것과 같습니다. 만약 새로운 책을 위한 공간을 만들기 위해 기존의 책장에 너무 강하게 글을 쓰면, 의도치 않게 예전의 이야기들을 지워버리게 됩니다. 이를 "파괴적 망각(catastrophic forgetting)"이라고 부릅니다.

다른 방법들은 각 새로운 기술을 위한 별도의 격리된 방(이하 "전문가")을 만드는 것을 시도합니다. 하지만 이 방들은 종종 너무 크고 무질서합니다. 그 안에는 너무 많은 일반 정보가 들어 있어서, 어떤 작업에 어떤 방을 사용해야 할지 혼란을 겪게 되며, 이는 간섭과 혼동을 초래합니다.

이 논문은 MoRAM(Mixture of Rank-1 Associative Memory)이라 불리는 새로운 해결책을 제안합니다. 이 방식이 어떻게 작동하는지 쉬운 비유를 통해 설명해 드리겠습니다.

1. 문제점: "큰 상자" vs "단일 원자"

현재의 방법들은 "LoRA"(Low-Rank Adaptation)를 사용하는데, 이는 마치 도서관에 새로운 작업을 할 때마다 거대한 공구 상자를 통째로 추가하는 것과 같습니다.

  • 문제점: 아주 작은 나사 하나를 고쳐야 할 때도 무거운 공구 상자 전체를 끌고 나와야 합니다. 그 공구 상자 안에는 이 특정 작업에 필요 없는 도구들이 들어 있어 오히려 방해가 됩니다. 더 많은 공구 상자를 추가할수록 도서관은 무질서해지고, 사서(라우터)는 어떤 공구 상자를 꺼내야 할지 혼란에 빠집니다.

2. 해결책: MoRAM의 "원자적 메모리"

MoRAM은 철학을 바꿉니다. 거대한 공구 상자를 추가하는 대신, 개별적이고 아주 작은 지식의 원자들을 추가합니다.

  • 비유: 도서관의 지식이 책에 저장되는 것이 아니라, 모든 단일 종이 한 장이 하나의 "Rank-1 전문가"인 거대하고 무한한 서류 보관함에 저장되어 있다고 상상해 보세요.
  • 새로운 작업을 배울 때, MoRAM은 새로운 방을 만들지 않습니다. 그저 서류 보관함에 몇 장의 구체적인 새 종이를 추가할 뿐입니다.
  • 핵심 특징: 각 종이는 매우 작고 구체적이어서 오직 하나의 아주 작은 것(예: "푸른 하늘" 또는 "비행기 날개")에 대해서만 이야기합니다.

3. 정보를 찾는 방법: "자기 활성화"

기존 시스템에서는 질문을 보고 어떤 큰 공구 상자를 열지 결정하기 위해 사서(라우터)가 필요합니다. 이 사서는 도서관이 커짐에 따라 자주 실수를 저지릅니다.

MoRAM은 이 사서를 아예 없애버립니다.

  • 비유: 서류 보관함의 모든 종이는 자기만의 자석 라벨("키")을 가지고 있습니다. 당신이 질문을 던지면, 그 질문 자체가 하나의 자석 역할을 합니다.
  • 질문과 일치하는 자석 라벨을 가진 종이들만이 질문에 "달라붙습니다". 나머지 종이들은 선반에 그대로 머물러 있습니다.
  • 이것을 **콘텐츠 기반 검색(Content-Addressable Retrieval)**이라고 합니다. 질문이 중간 관리자의 결정 없이 스스로 답을 찾아내는 것입니다. 이는 혼란을 방지하고 적절한 "메모리"가 사용되도록 보장합니다 합니다.

4. "조금씩 조금씩"

제목인 "Little by Little"은 이 시스템이 성장하는 방식을 의미합니다.

  • 대대적인 개편 대신, MoRAM은 지식을 점진적으로 추가합니다.
  • 기존의 "원자"들은 동결(freeze)하여 절대 지워지지 않게 하고, 현재 작업에 필요한 몇 개의 새로운 원자들만 활성화합니다.
  • 이는 거대한 구조물에 단 하나의 레고 블록을 추가하는 것과 같습니다. 구조물은 더 커지지만, 기존의 블록들은 정확히 그 자리에 온전하게 유지됩니다.

5. 결과

저자들은 이 시스템을 거대 AI 모델(이미지를 위한 CLIP 및 텍언어를 위한 LLM 등)에 대해 테스트했습니다.

  • 망각 감소: 기존 지식이 각각의 작고 고립된 원자에 동결되어 있기 때문에, 새로운 것을 배우는 것이 기존의 것을 덮어쓰지 않습니다.
  • 더 나은 전문화: 각 "원자"가 매우 작기 때문에, 모든 것을 조금씩 아는 일반론자가 아닌, 정확히 한 가지 일에 특화된 전문가가 됩니다.
  • 효效율성: 시스템은 특정 작업에 필요한 몇 개의 원자만을 "깨우기" 때문에, 에너지와 컴퓨 计算 능력을 절약합니다.

요약하자면: MoRAM은 학습을 뇌를 다시 쓰는 과정이 아니라, 서류 보관함에 스스로 선택되는 작은 기억 메모지들을 추가하는 과정으로 취급합니다. 이 메모지들은 당신이 무엇을 묻느냐에 따라 스스로의 위치를 찾아내며, 이를 통해 도서관이 과거를 결코 잊지 않으면서도 더 똑똑하게 성장하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →