← 최신 논문
💬 NLP

MeMo: Memory as a Model

이 논문은 새로운 지식을 전용 메모리 모델에 인코딩하여 동결된 대규모 언어 모델과 플러그인 방식으로 통합할 수 있도록 하고, 모델 가중치에 대한 의존성 없이도 복잡한 교차 문서 정보의 견고한 검색을 제공하며 파국적 망각을 방지하는 모듈식 프레임워크인 MeMo 를 소개합니다.

원저자: Ryan Wei Heng Quek, Sanghyuk Lee, Alfred Wei Lun Leong, Arun Verma, Alok Prakash, Nancy F. Chen, Bryan Kian Hsiang Low, Daniela Rus, Armando Solar-Lezama

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ryan Wei Heng Quek, Sanghyuk Lee, Alfred Wei Lun Leong, Arun Verma, Alok Prakash, Nancy F. Chen, Bryan Kian Hsiang Low, Daniela Rus, Armando Solar-Lezama

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"MEMO: Memory as a Model" 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 제시합니다.

큰 문제: "얼어붙은 뇌"

어떤 특정 날짜까지 전 세계의 모든 책을 읽어본 천재적이고 전지전능한 사서 (대형 언어 모델 또는 LLM) 를 상상해 보세요. 이 사서는 매우 똑똑하여 거의 모든 질문에 답할 수 있습니다. 하지만 함정이 하나 있습니다: 그들의 뇌는 얼어붙어 있습니다. 훈련이 끝나면 새로운 것을 배울 수 없습니다. 어제 뉴스나 지난주 특정 의학 breakthrough 에 대해 물어보면 그들은 전혀 모릅니다.

이를 해결하기 위해 보통 세 가지 방법 중 하나를 시도하지만, 모두 결점이 있습니다:

  1. "책 더미" 방법 (검색): 사서에게 책 더미를 건네주며 "이것들을 읽고 답하라"고 말합니다. 문제는 사서가 한 번에 들 수 있는 책의 양에 한계가 있다는 점입니다. 만약 답이 50 개의 서로 다른 문서에 걸쳐 있는 정보를 연결해야 한다면, 그들은 압도되어 연결점을 놓칩니다. 또한, 더미에 잡동사니 (노이즈) 가 많으면 혼란에 빠집니다.
  2. "뇌 수술" 방법 (재훈련): 사서의 뇌에 새로운 정보를 주입하여 다시 훈련시키려 합니다. 문제는 이것이 엄청나게 비싸고 시간이 오래 걸리며, 종종 사서가 이전에 알던 모든 것을 잊게 만든다는 점입니다 (이를 "파국적 망각"이라고 합니다).
  3. "비밀 메모" 방법 (잠재 기억): 새로운 정보를 사서의 뇌 안에 작고 비밀스러운 코드로 압축하려 합니다. 문제는 이 코드가 오직 그 특정 사서만이 이해하는 언어로 쓰여 있다는 점입니다. 이 코드를 다른 사서에게 줄 수 없습니다.

해결책: MEMO (모델로서의 기억)

저자들은 MEMO라는 새로운 시스템을 제안합니다. 사서의 얼어붙은 뇌를 고치거나 messy 한 책 더미를 건네주는 대신, 그들을 위해 전문적인 외부 조수를 구축합니다.

이렇게 생각해보세요:

  • 실행 모델 (사서): 이것이 주요 AI 입니다. 이는 얼어붙고 변하지 않습니다. 사서의 역할은 생각, 추론, 그리고 당신과 대화하는 것입니다.
  • 기억 모델 (전문 조수): 이는 사서가 알고 싶어 하는 새로운 정보만으로 훈련된 작고 전용 AI 입니다. 사서가 참조할 수 있는 초정리된 초전문 백과사전처럼 행동합니다.

작동 원리: 세 단계 대화

복잡한 질문을 할 때, 시스템은 단순히 답을 "검색"하지 않습니다. 대신 사서와 전문가 간의 구조화된 세 단계 대화를 사용합니다:

  1. Grounding ("무엇에 대해 이야기하는가?" 단계):
    사서는 당신의 크고 복잡한 질문을 작고 간단한 단서로 분해합니다. 전문가에게 "여기 주요 인물은 누구인가?" 또는 "이것은 어느 해에 관한 것인가?"라고 묻습니다. 전문가는 짧고 정확한 사실로 답합니다.
  2. 개체 식별 ("지정" 단계):
    그 단서들을 이용해 사서는 당신이 정확히 누구무엇에 대해 묻는지 좁혀갑니다. 목표가 100% 확실해질 때까지 (예: "간호사 린다인가, 의사 린다인가?") 전문가에게 후속 질문을 계속합니다.
  3. 답변 종합 ("모아내기" 단계):
    목표가 지정되면, 사서는 질문에 답하는 데 필요한 구체적인 세부 사항을 전문가에게 요청합니다. 사서는 그런 깨끗하고 검증된 사실들을 받아 당신의 최종 답변을 작성합니다.

전문가를 어떻게 훈련시켰는가

"원시 데이터를 그냥 쏟아부어 이 전문가를 가르치는 것이 아니라면, 어떻게 가르치는가?"라고 궁금해할 수 있습니다.
저자들은 데이터 합성 파이프라인을 만들었습니다. "생성기 (Generator)" (똑똑한 AI) 가 원시 문서를 읽어 전문가를 위한 Q&A 훈련 매뉴얼로 변환한다고 상상해 보세요.

  • 사실을 추출합니다.
  • 관련 사실을 병합합니다 (예: "린다는 간호사다" + "린다는 응급실에서 일한다"를 "린다는 응급실 간호사다"로 만듭니다).
  • 오류를 확인하고 혼란스러운 질문을 다시 씁니다.
  • 서로 다른 페이지의 정보를 연결해야 하는 "문서 간" 질문을 생성합니다.

이를 통해 전문가는 무작위 문장이 아니라 사실 간의 관계를 배우게 됩니다.

MEMO 가 더 나은 이유 (초능력)

이 논문은 MEMO 가 기존 방법들의 문제를 해결한다고 주장합니다:

  • 복잡한 연결을 처리합니다: 전문가는 사실 간의 관계를 "내면화"했기 때문에, "책 더미" 방법이 어려워하는 여러 문서에 걸친 연결점을 요구하는 질문에 답할 수 있습니다.
  • 노이즈를 무시합니다: "책 더미" 방법에 가짜 뉴스 기사 뭉치를 주면 혼란에 빠집니다. MEMO 의 전문가는 이미 진실을 필터링하고 학습했으므로 잡동사니를 무시합니다.
  • 뇌 수술이 필요 없습니다: 주요 사서 (실행 모델) 는 절대 변하지 않습니다. 재훈련할 필요가 없으므로 원래 지식을 잊지 않습니다.
  • 플러그 앤 플레이: 전문가는 표준 언어 (질문과 답변) 로 말하기 때문에, 오픈소스이든 유료 폐쇄형 (기업용 AI 등) 이든 어떤 사서와도 함께 사용할 수 있습니다. 내부 코드를 볼 필요가 없습니다.
  • 속도: 문서 라이브러리가 거대해져도 답을 찾는 비용이 더 비싸지지 않습니다. 전문가는 고정된 크기이므로 검색 시간은 일정하게 유지됩니다.

결과

저자들은 이 시스템을 세 가지 어려운 과제에서 테스트했습니다:

  1. BrowseComp-Plus: 다단계 탐색을 요구하는 심층 연구.
  2. NarrativeQA: 긴 이야기 (책이나 대본 등) 이해.
  3. MuSiQue: 여러 위키백과 페이지의 사실을 결합해야 하는 질문 답변.

이 테스트에서 MEMO 는 표준 검색 엔진이나 AI 재훈련을 시도하는 방법과 같은 기존 최선 방법들을 능가했습니다. 특히 "노이즈" (관련 없는 정보) 처리와 복잡한 다단계 퍼즐 해결에 탁월했습니다.

하나의 함정: "병합" 트릭

이 논문은 여러 새로운 주제 (예: 새로운 의학 데이터, 그다음 새로운 법률 데이터) 를 배워야 할 때 사용할 수 있는 멋진 트릭도 보여줍니다. 매번 처음부터 전문가를 재훈련하는 대신, 의학 데이터용 작은 전문가 하나, 법률 데이터용 또 다른 하나를 훈련한 다음 그들의 "뇌" (가중치를 수학적으로 결합) 를 병합하여 하나의 슈퍼 전문가로 만들 수 있습니다. 처음부터 재훈련하는 것에 비해 막대한 컴퓨팅 파워를 절약하지만, 완전한 재훈련보다 정확도가 약간 낮을 수 있습니다.

요약하자면: MEMO 는 "생각"과 "알음"을 분리합니다. 주요 AI 는 얼어붙고 똑똑하게 유지하면서, 새로운 것을 완벽하게 아는 전용 고도로 훈련된 조수를 제공하여, 아무것도 잊지 않고 노이즈에 혼란스러워지지 않으면서 복잡한 질문에 답할 수 있도록 함께 일하게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →