← 최신 논문
💬 NLP

HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding

이 논문은 기존 모델이 직면한 실시간 스트리밍 비디오 이해의 한계를 해결하기 위해 KV 캐시를 계층적 메모리 프레임워크로 활용하는 HERMES 를 제안하며, 추가 계산 없이 실시간 응답과 낮은 GPU 메모리 오버헤드를 보장하면서도 기존 최첨단 모델 대비 10 배 빠른 TTFT 와 높은 정확도를 달성한다고 설명합니다.

원저자: Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu

게시일 2026-04-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

HERMES: 영상 스트리밍을 위한 '기억의 층위'를 활용한 혁신적인 AI

이 논문은 HERMES라는 새로운 기술을 소개합니다. 이 기술은 멀티모달 대규모 언어 모델 (MLLM) 이 **실시간으로 흐르는 영상 (스트리밍)**을 볼 때, 메모리 부족이나 느린 반응 속도 없이도 정확하고 빠르게 이해할 수 있게 해줍니다.

기존의 AI 는 영상을 한 번에 다 받아서 분석하는 '오프라인' 방식에 익숙했는데, 실시간으로 계속 들어오는 영상을 처리하려니 메모리가 터지거나 답장이 늦어지는 문제가 있었습니다. HERMES 는 이 문제를 해결하기 위해 AI 의 '기억 (KV Cache)'을 계층적으로 관리하는 새로운 방식을 제안합니다.


🧠 핵심 비유: "AI 의 기억을 3 층 아파트로 생각하세요"

기존의 AI 는 영상을 볼 때 모든 정보를 한꺼번에 쌓아두려다 보니, 오래된 정보는 잊어버리거나 (메모리 부족), 최신 정보만 보고 전체 맥락을 놓치는 (정확도 저하) 문제가 있었습니다.

HERMES 는 AI 의 기억 공간을 3 층짜리 아파트처럼 설계했습니다. 각 층마다 다른 역할을 맡게 한 거죠.

1. 1 층: 감각 기억 (Sensory Memory) - "새로운 소식만 빠르게 받아주는 로비"

  • 역할: 가장 최근에 들어온 영상 프레임 (화면) 을 빠르게 받아줍니다.
  • 특징: "방금 뭐가 일어났지?"에 집중합니다. 오래된 정보는 금방 잊어버리고 최신 정보만 남깁니다.
  • 비유: 카페 로비에 들어와서 가장 최근에 들어온 손님의 주문만 기억하는 직원의 모습입니다.

2. 2 층: 작업 기억 (Working Memory) - "현재 상황을 정리하는 회의실"

  • 역할: 1 층의 최신 정보와 3 층의 오래된 정보를 연결해 줍니다.
  • 특징: "지금 일어나는 일"과 "아까 일어났던 일"을 적절히 섞어서 맥락을 이해합니다.
  • 비유: 회의실에서 최신 안건과 과거의 결정 사항을 모두 참고하며 현재 상황을 판단하는 팀장 같은 역할입니다.

3. 3 층: 장기 기억 (Long-term Memory) - "핵심 요약본을 보관하는 도서관"

  • 역할: 영상 전체의 흐름과 중요한 장면 (앵커 포인트) 을 기억합니다.
  • 특징: 매 순간의 세부 사항보다는 "이 영화의 주인공은 누구였지?", "결말이 어떻게 되었지?" 같은 전체적인 스토리를 기억합니다.
  • 비유: 도서관에서 방대한 책들을 다 읽을 수는 없지만, 핵심 요약본이나 목차만 기억해서 전체 줄거리를 설명할 수 있는 사서 같은 역할입니다.

🚀 HERMES 가 해결한 3 가지 문제

1. "메모리가 부족해서 영상 끊기는 현상" 해결 (효율성)

  • 기존 방식: 영상을 볼 때마다 모든 정보를 저장하려다 보니 메모리가 금방 찼습니다.
  • HERMES 방식: 위 3 층 구조를 통해 불필요한 정보는 과감히 버리고 (압축), 중요한 정보만 선별해서 저장합니다.
  • 결과: 영상 토큰 (데이터 조각) 을 최대 68% 까지 줄여도 정확도는 오히려 좋아졌습니다. 마치 책상 위를 정리해서 중요한 문서만 남긴 것과 같습니다.

2. "질문하면 답이 늦게 나오는 현상" 해결 (실시간성)

  • 기존 방식: 사용자가 질문을 하면, AI 는 외부 저장장치 (하드디스크 등) 에서 과거 영상을 다시 찾아와야 해서 시간이 걸렸습니다.
  • HERMES 방식: 모든 중요한 정보가 AI 내부의 메모리 (KV Cache) 에 바로 준비되어 있습니다.
  • 결과: 질문을 하면 즉시 답변이 나옵니다. 기존 최고 성능 기술보다 10 배나 더 빠릅니다 (약 30ms 이내).

3. "오래된 영상을 보면 망각하는 현상" 해결 (정확도)

  • 기존 방식: 영상이 길어질수록 앞부분 내용을 잊어버려서 "그때 누가 왔었지?" 같은 질문을 못 했습니다.
  • HERMES 방식: 3 층 (장기 기억) 에 중요한 핵심 정보만 **요약본 (Summary Token)**으로 남겨둡니다.
  • 결과: 영상 길이가 길어져도 맥락을 잃지 않고 정확한 답변을 합니다.

💡 요약: 왜 이것이 중요한가요?

지금까지 AI 는 영상을 '한 번에 다 보고' 분석하는 데는 능숙했지만, **실시간으로 흘러가는 영상 (라이브 방송, CCTV, 실시간 게임 등)**을 보며 대화하는 데는 서툴렀습니다.

HERMES는 마치 훌륭한 비서처럼 작동합니다.

  1. 방금 들은 말은 바로 기억하고 (1 층),
  2. 지금 대화 중인 내용을 잘 정리하고 (2 층),
  3. 오래된 대화 내용 중 중요한 부분만 요약해서 기억해 둡니다 (3 층).

이 덕분에 사용자는 메모리 부족이나 지연 없이, 영상과 실시간으로 자연스럽게 대화할 수 있게 되었습니다. 이 기술은 앞으로 실시간 영상 분석, 보안 감시, 실시간 번역, 그리고 실시간 게임 AI 등 다양한 분야에서 혁신을 이끌 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →