Do You Remember? Toward Memory-Centric Multimodal AI
이 논문은 표준적인 원샷 프로세싱을 공유 행렬과 국소적 EMA 업데이트를 사용하는 재구성적 메모리 시스템으로 대체하는 메모리 중심의 멀티모달 AI 아키텍처인 "DoYouRemember"를 소개하며, LLM의 은닉 상태가 시각적 정보를 버린다는 점과 환각을 결함이 아닌 손실 압축된 메모리 복원의 내재적 속성으로 재정의한다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기억하시나요? 왜 AI는 자신이 본 것을 "잊어버리는가" (그리고 우리가 이를 어떻게 해결했는가)
당신이 친구의 얼굴을 보고 있다고 상상해 보세요. 당신은 뇌 속에 완벽한 고화질 비디오 파일을 저장하지 않습니다. 대신, 당신의 뇌는 사진을 찍듯 이미지를 포착하고, 이를 몇 가지 핵심 아이디어(미소의 모양, 눈의 색깔 등)로 압축합니다. 그리고 나중에 그들을 기억하려고 할 때, 당신의 뇌는 그 아이디어들을 바탕으로 새로운 그림을 재구성합니다. 그것은 재생이 아니라, 창의적인 재건입니다.
이제, 당신의 얼굴을 보고 피부 상태를 정확히 말해주지만, 그 직후 당신의 얼굴 사진을 기억에서 즉시 삭제해 버리는 초지능 AI 로봇을 상상해 보세요. 그것이 바로 오늘날 가장 발전된 AI 모델들이 하는 방식입니다. 그들은 이미지를 완벽하게 "이해"하지만, 그것에 대해 아무것도 "기억"하지 못합니다.
DoYouRemember라는 새로운 연구는 인간의 기억 방식과 유사한 시스템을 사용하여, AI가 본 것을 실제로 기억하도록 가르침으로써 이 문제를 해결하고자 합니다.
거대한 발견: 이해 기억
연구진은 간단한 질문에서 시작했습니다: 만약 AI가 이미지를 완격하게 설명할 수 있다면, 그것은 여전히 뇌 속에 그 이미지를 "보고" 있는 것일까?
그들은 이를 테스트하기 위해 3단계 기계를 구축했습니다:
- 압축기 (The Compressor): 얼굴 사진을 가져와서 아주 작은 디지털 약어(예: 4K 영화를 몇 개의 텍스트 코드로 변환하는 것과 같음)로 압축했습니다.
- 생각하는 자 (The Thinker): 이 코드들을 거대한 AI 뇌(대규모 언어 모델)에 입력하여 피부를 분석하게 했습니다.
- 재건자 (The Rebuilder): AI의 "생각"(내부 은닉 상태)을 다시 이미지로 되돌리려고 시도했습니다.
충격적인 결과:
그들이 AI의 생각으로부터 얼굴을 재건하려고 했을 때, 결과는... 노이즈였습니다. 순수한 잡음이었죠.
AI는 "이 사람은 뺨에 붉은 발진이 있습니다"라고 말하는 데는 탁월했지만, 그 내부 기억에는 발진에 대한 회복 가능한 시각적 정보가 전혀 들어있지 않았습니다. 그것은 마치 영어를 완벽하게 구사하지만 원래의 프랑스어 단어는 완전히 잊어버린 번역가와 같았습니다. AI는 의미는 이해했지만, 이미지는 파괴해 버린 것입니다.
이 논문은 이러한 AI 모델들에게 있어 이해는 기억과 같지 않다는 것을 증명합니다. AI는 문장을 만들기 위해 시각적 데이터를 소비하고 나서 그 시각적 데이터를 버려버립니다.
실패한 시도들: 왜 "역전파(Backpropagation)"가 작동하지 않았는가
해결책을 찾기 전, 팀은 AI에게 기억을 강제하기 위해 많은 방법을 시도했습니다. 그들은 다양한 메모리 아키텍처를 시도했고, 역전파(학생의 숙제를 채점할 때 얼마나 틀렸는지 정확히 계산하여 교정하는 선생님과 같은 방식)라는 표준 학습법을 사용했습니다.
그들은 다음과 같은 것들을 시도했습니다:
- AI가 공유 메모리 보드에 기록하도록 만들기.
- 다양한 유형의 "대조 학습(contrastive learning)" 사용 (AI가 유사한 사물을 인식하도록 가르치는 것).
- 오차와 메모리 사이의 경로를 단축하기.
결론: 모든 시도가 실패했습니다. 메모리 보드는 얼어붙은 듯 움직이지 않았습니다.
왜일까요? 논문은 이를 **그래디언트 상쇄(Gradient Cancellation)**라는 수학적 규칙으로 설명합니다. 99,000명의 사람들이 동시에 하나의 작은 화이트보드에 글을 쓰려고 한다고 상상해 보세요. 한 사람은 고양이를 그리려 하고, 다른 사람은 개를, 또 다른 사람은 나무를 그리려 합니다. 만약 그들이 동시에 마커를 밀어붙인다면, 그 힘들은 서로 상쇄되어 보드는 빈 상태로 남게 됩니다. 논문은 표준적인 방법으로 공유 메모리를 학습시키려 할 때, 각 이미지로부터 오는 "밀기"가 너무 약해서(이미지 수 에 따라 배만큼 줄어듦) 메모리가 새로운 것을 전혀 배우지 못한다는 것을 보여줍니다.
해결책: "로컬(Local)" 메모리 트릭
"글로벌(Global)"한 선생님(역전파)이 문제를 해결할 수 없었기에, 연구진은 실제 뇌의 뉴런이 연결되는 방식에서 영감을 얻은 다른 접근 방식인 **로컬 학습 규칙(Local Learning Rules)**을 시도했습니다.
시스템 전체가 스스로를 수정하도록 요청하는 대신, 각 이미지가 전체 64개의 슬롯 중 가장 관련성이 높은 상위 8개의 지점만을 업데이트하도록 했습니다. 그들은 새로운 기억을 기존의 것을 지우지 않고 부드럽게 배치하는 방식인 지수 이동 평균(Exponential Moving Average, EMA) 방식을 사용했습니다.
결과:
- 메모리 보드가 작동했습니다: 이미지가 특정 "슬롯"만을 업데이트하게 함으로써, 메모리 보드는 다양성을 유지했고 흐릿한 잔상으로 변하지 않았습니다.
- 재건 능력이 향 향상되었습니다: 이 새로운 메모리로 얼굴을 재건했을 때, 명확하고 인식 가능한 얼굴이 나타났습니다.
- 보지 못한 10개의 테스트 이미지에 대해, 메모리 시스템은 재건 품질 점수(LPIPS) 0.123을 달取得했는데, 이는 최상의 점수(상한선)인 0.071에 매우 근접한 수치입니다.
- 이 메모리는 원래의 정보를 저장하는 데 필요한 공간보다 16배나 적은 229,000개의 파라미터만을 사용했습니다.
"슈퍼 메모리"의 놀라움:
메모리 보드를 더 크게 확장했을 때(슬롯을 1,024개로 늘렸을 때), 놀라운 일이 일어났습니다. 메모리 시스템이 원래의 "완벽한" 압축 방식보다 오히려 더 좋아졌습니다!
- 새로운 메모리 시스템은 보지 못한 이미지에 대해 0.056(LPIPS)을 기록하며, 원래의 압축 점수인 0.071을 앞질렀습니다.
- 왜일까요? 원래의 압축 방식은 "블록 형태"의 디지털 단계(양자화)를 사용한 반면, 새로운 메모리는 부드럽고 연속적인 숫자를 사용했기 때문입니다. 충분한 슬롯이 있다면, 부드러운 메모리가 블록 형태의 방식보다 빈틈을 더 잘 메울 수 있습니다.
이것이 미래에 의미하는 바
논문은 환각(Hallucination)(AI가 무언가를 지어내는 현상)이 버그가 아니라, 손실 압축 메모리가 작동하는 방식의 특징이라고 결론짓습니다. 당신이 어떤 사람의 얼굴은 기억하지만 눈의 정확한 색조는 틀릴 수 있는 것처럼, 정보를 압축하는 AI는 기억하려고 할 때 누락된 세부 사항을 "추측"해야만 합니다.
저자들은 AI를 구축하는 새로운 방식을 제안합니다:
- 메모리 중심 AI (Memory-Centric AI): 단순히 이미지를 뇌에 넣고 텍스트를 출력하는 것이 아니라, 모든 감각(시각, 청각, 촉각)이 기록할 수 있는 지속적인 "메모리 매트릭스"를 가진 AI를 구축해야 합니다.
- 로컬 규칙 (Local Rules): 글로벌한 교정(역전파)으로 이 메모리를 학습시키려 하지 말고, 생물학적 뇌가 학습하는 방식(상위 8개 슬롯 업데이트와 같은)인 로컬 규칙을 사용해야 합니다.
그들은 이를 피부 건강 이미지(환자의 피부를 20가지 이상의 다양한 방식으로 촬영하는 3D 피부 분석기 사용)를 통해 테스트했습니다. 이 영역은 질병의 상태를 이해하는 동시에 정확한 시각적 세부 사항을 기억해야 하므로 이 연구에 완벽한 대상입니다.
요약하자면: 이 논문은 현재의 AI가 말을 하는 순간 자신이 본 것을 "잊어버린다"는 것을 증명합니다. 하지만 글로벌한 교정 대신 로컬하고 부드러운 업데이트를 사용하여 메모리를 학습시킨다면, 우리는 인간처럼 실제로 기억하고, 재건하며, 자신이 본 것을 검증할 수 있는 AI를 구축할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.