← 최신 논문
🤖 AI

Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers

본 논문은 고정 크기의 재귀적 3 차원 메모리 텐서를 Transformer 에 부가하여 상태 용량을 시퀀스 길이와 분리하면서도 공간적 귀납 편향을 유지함으로써 장기 비디오 이해와 가림에 민감한 추론을 개선하는 경량 모듈인 텐서 메모리를 소개합니다.

원저자: Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, Antonio Torralba

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, Antonio Torralba

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

오랜 시간 동안 복잡한 이야기를 기억하려고 노력한다고 상상해 보세요. 수백 개의 장면이 있는 영화처럼요.

문제: "무한 스크롤" 기억
현재의 AI 모델 (Transformer) 은 마치 사람이 거대하고 끊임없이 확장되는 테이블 앞에 자신이 본 모든 프레임을 남겨두며 영화를 기억하려는 사람과 비슷하게 작동합니다.

  • 문제점: 영화가 길어질수록 테이블도 거대해집니다. 이를 관리하는 데 비용이 많이 들고, 수천 개의 흩어진 프레임 사이에서 구체적인 세부 사항을 찾으려다 사람이 압도당하게 됩니다.
  • 약점: 영화 속 캐릭터가 잠시 나무 뒤에 숨어 있다면 (가림 현상), AI 는 그 캐릭터가 어디에 있는지 추측하기 위해 모든 흩어진 프레임을 다시 뒤져야 합니다. 현재 사물들이 어디에 있는지에 대한 단일하고 조직화된 "정신 지도"를 가지고 있지 않기 때문입니다.

해결책: "스마트 파일 캐비닛"
저자들은 텐서 메모리 (Tensor Memory) 라는 새로운 모듈을 제안합니다. 이는 AI 에게 뇌 옆에 놓인 작고 고정된 크기의 3 차원 파일 캐비닛 (voxel grid) 을 제공하는 것과 같습니다. 영화나 문서가 얼마나 길어도 캐비닛의 크기는 동일하게 유지됩니다.

다음은 단계별 작동 방식입니다:

  1. 캐비닛에 쓰기 ("소프트 드롭"):
    AI 는 특정하고 경직된 서랍에 메모를 밀어 넣는 대신, 캐비닛의 3 차원 공간 내에서 정보가 속해야 할 위치를 예측합니다. 그런 다음 해당 지점 주변에 정보를 부드러운 빛나는 구름 (가우시안 볼륨) 처럼 "떨어뜨립니다".

    • 비유: 스펀지에 잉크 한 방울을 떨어뜨리는 것을 상상해 보세요. 그것은 단순히 한 가닥의 섬유에 닿는 것이 아니라 약간 퍼져나가 목표 주변의 공간을 채웁니다. 이를 통해 AI 는 메모리를 정확히 어디에 배치할지 유연하게 결정할 수 있습니다.
  2. 캐비닛 업데이트 ("재귀"):
    캐비닛은 정적이지 않습니다. 새로운 정보를 기존 정보와 혼합하는 내장 메커니즘 (부드러운 국소 바람과 같은) 이 있어 AI 가 장면에 대한 "신념"을 업데이트할 수 있게 합니다. 캐릭터가 나무 뒤에 있다가 걸어 나오면, 캐비닛은 전체 영화를 다시 읽지 않고도 새로운 현실을 반영하도록 업데이트됩니다.

  3. 캐비닛에서 읽기 ("표적 검색"):
    AI 가 무언가를 기억해야 할 때, 프레임 전체 테이블을 스캔하지 않습니다. 대신 캐비닛 내의 좌표 (특정 X, Y, Z 지점) 를 예측하고 해당 영역을 "후비어" 관련 맥락을 꺼냅니다.

    • 비유: 책의 모든 페이지를 넘겨 이름을 찾는 대신, 색인을 바로 찾아 페이지 번호를 확인하고 해당 특정 줄을 읽는 것과 같습니다.
  4. 안전 밸브 ("게이트"):
    시스템은 캐비닛을 사용할지 말지 결정하는 지능형 스위치 ("게이트") 를 갖추고 있습니다. 작업이 간단하고 장기 기억이 필요하지 않으면 게이트가 닫혀 AI 가 에너지를 절약하기 위해 캐비닛을 무시합니다. 반면 작업이 어렵다면 (숨겨진 객체를 추적하는 경우 등), 게이트가 열려 AI 가 캐비닛에 의존합니다.

중요성 (논문에 따르면)
저자들은 이 아이디어를 세 가지 주요 영역에서 테스트했습니다:

  • 언어: 텍스트 데이터셋 (WikiText-2) 에서 이 캐비닛을 사용하면 AI 가 긴 문장을 훨씬 더 잘 이해하게 되어 표준 모델에 비해 혼란도 (perplexity) 가 크게 감소했습니다.
  • 이미지: 이미지의 누락된 부분을 재구성할 때, 캐비닛을 가진 AI 는 구조를 올바르게 유지하는 데 약간 더 나은 성과를 보였습니다.
  • 비디오: 비디오 게임과 유사한 작업 (UCF-101) 에서 캐비닛을 가진 AI 는 특히 객체가 일시적으로 숨겨졌을 때 장면의 "상태"를 유지할 수 있었기 때문에 동작 인식 능력이 더 뛰어났습니다.

트레이드오프
논문은 비용이 따른다고 인정합니다. AI 가 이 3 차원 그리드를 지속적으로 업데이트해야 하므로 학습에 더 많은 시간이 걸립니다 (비디오 작업의 경우 "벽시계 시간"이 훨씬 더 길었습니다). 그러나 그 이점은 AI 가 과거 토큰의 무한히 확장되는 테이블이 더 이상 필요하지 않다는 점이며, 대신 세상을 기억하는 간결하고 영구적이며 조직화된 방식을 갖추게 되었다는 것입니다.

요약하자면, 텐서 메모리는 Transformer 에게 작고 고정된 크기의 "세계 모델"을 제공하여, 데이터의 바다에 빠지지 않고도 길고 복잡한 이야기를 처리할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →