← 최신 논문
🤖 AI

Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval

이 논문은 시각적 기억을 명시적이고, 검사 가능하며, 조회 가능한 기저로 간주함으로써 선택적 인덱싱, 계층적 기억 조직화, 그리고 에이전트 검색을 통해 온라인 장영역 이해를 향상시키는 학습이 불필요한 프레임워크인 비주얼 에이전틱 메모리 (VAM) 를 제안하며, 이를 통해 OVO-Bench 와 MM-Lifelong 과 같은 벤치마크에서 최첨단 성능을 달성합니다.

원저자: Aiden Yiliu Li, Nels Numan, Anthony Steed

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aiden Yiliu Li, Nels Numan, Anthony Steed

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

50 일간의 휴가 동안 일어난 모든 일을 기억하려고 상상해 보세요. 머릿속에 비디오의 모든 단위를 한 번에 담으려 한다면 뇌가 과부하가 걸릴 것입니다. 반면 '요지'(예: "우리는 해변에 갔다") 만 기억한다면 아이스크림을 떨어뜨린 구체적인 순간을 잊어버려, 정확히 언제 일어났는지 증명하는 것이 불가능해질 수 있습니다.

이 논문은 컴퓨터가 압도당하거나 사실을 잃지 않고 장영 비디오를 처리할 수 있는 새로운 방법인 **비주얼 에이전틱 메모리 **(Visual Agentic Memory, VAM)를 소개합니다. VAM 을 모든 것을 저장하는 거대한 하드 드라이브가 아니라, 실시간으로 비디오 스트림을 지켜보며 검색 가능한 도서관을 구축하는 스마트하고 능동적인 사서로 생각하세요.

다음은 이를 세 가지 간단한 부분으로 나누어 설명한 것입니다:

1. "스마트 필터" (온라인 인덱싱)

박물관 입구의 경비원을 상상해 보세요. 대부분의 사람들은 같은 행동 (예: 가만히 서 있거나 천천히 걷기) 을 하며 지나갑니다. 경비원은 모든 사람의 사진을 찍을 필요가 없습니다.

  • VAM 의 역할: 비디오가 재생되는 동안 VAM 은 이 경비원처럼 행동합니다. 흐릿한 프레임이나 변화가 없는 순간 (중복) 은 무시합니다. 새로운 것이나 중요한 일이 발생할 때만 "사진을 찍어"(프레임을 저장) 저장합니다.
  • 결과: 수백만 개의 프레임을 저장하는 대신, 원본의 고품질 증거를 여전히 포함하고 있는 하이라이트 릴처럼 가장 흥미로운 프레임만 보관합니다.

2. "정리된 서랍장" (계층적 메모리)

이제 사서가 사진을 확보했다면 어떻게 정리할까요? 무작정 더미에 던져둘 수는 없습니다.

  • VAM 의 역할: 이 사진들을 "이벤트"(책의 장과 같은) 단위로 그룹화합니다.
    • 요약: 각 장마다 짧은 텍스트 요약 (예: "오후 2 시에 팀 회의가 있었다") 을 작성합니다. 이를 통해 올바른 장을 빠르게 찾을 수 있습니다.
    • 증거: 중요하게도, 해당 장의 실제 사진을 별도의 폴더에 보관합니다.
  • 비유: 목차 (요약) 가 정확한 페이지 (원본 사진) 를 가리켜 세부 사항을 직접 확인할 수 있게 하는 것과 같습니다. 이는 컴퓨터가 압축된 요약만 기반으로 추측하는 것을 방지합니다.

3. "탐정 에이전트" (에이전틱 검색)

질문을 할 때 (예: "차량이 충돌했을 때 차의 색깔은 무엇이었나요?"), 일반적인 AI 는 기억을 바탕으로 단순히 추측할 수 있습니다. VAM 은 탐정을 활용합니다.

  • VAM 의 역할: 탐정은 즉시 답변하지 않습니다. 엄격한 절차를 따릅니다:
    1. 검색: 올바른 장을 찾기 위해 "목차"를 살펴봅니다.
    2. 검토: 해당 장의 실제 사진을 꺼내 차를 자세히 살펴봅니다.
    3. 검증: 환각 (hallucination) 이 발생하지 않도록 증거를 다시 확인합니다.
    4. 답변: 증거를 본 후에만 답변을 제공하며, 정확히 어떤 사진을 보았는지 인용합니다.
  • 이점: 이로써 AI 가 사실을 만들어내는 것이 방지됩니다. 증거가 없다면 탐정은 이야기를 지어내는 대신 이를 인정합니다.

왜 이것이 중요한가 (결과)

저자들은 이 시스템을 두 가지 매우 어려운 과제에서 테스트했습니다:

  1. **실시간 스트리밍 **(OVO-Bench): 시스템이 미래의 내용을 보지 못한 채 비디오가 재생되는 도중에 질문에 답할 수 있는지 테스트했습니다. VAM 은 이 부분에서 가장 뛰어난 성과를 보였으며, 가장 강력한 "올인원" AI 모델조차 능가했습니다.
  2. **한 달 이상의 비디오 **(MM-Lifelong): 51 일 동안 촬영된 105 시간짜리 비디오로 테스트했습니다. 이는 한 달 반 동안 한 사람의 삶을 담은 비디오를 보는 것과 같습니다.
    • 마법 같은 점: 다른 시스템들은 전체를 기억하려다 실패하거나, 세부 사항을 잃을 정도로 너무 많이 압축한 반면, VAM 은 원본 비디오의 0.06% (1,100 만 장 중 약 6,800 장) 만 보관했습니다.
    • 점수: 이렇게 적은 데이터만 저장했음에도 VAM 은 이 테스트에서 두 번째로 높은 점수를 받아, 모든 것을 흐릿하게 기억하는 것보다 몇 장의 좋은 사진을 갖는 것이 더 낫다는 것을 증명했습니다.

결론

이 논문은 장영 비디오를 이해하기 위해 AI 를 더 "똑똑하게" 만들거나 메모리를 더 크게 주는 것만으로는 부족하다고 주장합니다. 대신 AI 에게 자신의 증거를 체계적으로 저장, 정리, 검증할 수 있는 방법을 제공해야 합니다.

VAM 은 압축된 요약이 아닌 검색 가능하고 검사 가능한 아카이브로 시각적 메모리를 다룹니다. 이를 통해 AI 는 단순히 추측하는 것이 아니라 "이 특정 프레임을 확인했기 때문에 답을 알고 있습니다"라고 말할 수 있게 됩니다.

참고: 이 논문은 해당 시스템이 현재 시각 정보만 처리하며 (오디오는 처리하지 않음) 원본 비디오 저장은 개인정보 보호 문제를 제기한다고 명시적으로 언급하고 있습니다. 저자들은 실제 사용 시 이를 신중하게 관리해야 한다고 지적합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →