← 최신 논문
🤖 AI

OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

OmniMem은 양식 인식 할당 전략과 섭동 인식 메모리 선택을 채택하여 엄격한 메모리 예산 하에서 정확도를 크게 향상시킴으로써 긴 비디오 추론의 한계를 극복하는 오디오-비주얼 LLM을 위한 메모리 효율적인 스트리밍 프레임워크입니다.

원저자: Guangzhi Sun, Yixuan Li, Yudong Yang, Chao Zhang

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Guangzhi Sun, Yixuan Li, Yudong Yang, Chao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 작은 스마트폰으로 3시간짜리 영화를 보려고 한다고 상상해 보세요. 그런데 이 스마트폰은 저장 공간이 매우 제한적입니다. 영화가 재생되는 동안, 당신의 휴대폰은 모든 프레임과 모든 대사를 기억하려고 노력합니다. 결국 휴대폰은 메모리가 부족해져서 화면이 멈추거나, 새로운 장면을 위한 공간을 만들기 위해 무언가를 무작위로 삭제해야 하는 상황에 처합니다. 이것이 바로 현대의 "오디오-비주얼 거대 언어 모델(영상을 보고 소리를 듣는 AI)"이 긴 영상을 이해하려고 할 때 직면하는 문제입니다.

이 논문은 이 문제를 해결하기 위해 OmniMem이라는 새로운 시스템을 소개합니다. OmniMem을 AI의 기억력을 위한 매우 똑똑하고 체계적인 사서라고 생각하면 됩니다.

작동 원리는 다음과 같습니다.

1. 문제점: "일률적인 방식(One-Size-Fits-All)"의 실수

현재의 AI 시스템은 비디오(보는 것)와 오디오(듣는 것)를 메모리에 저장할 때 완전히 동일하게 취급합니다.

  • 불균형: 일반적인 영상에는 수천 개의 시각적 "토큰"(이미지 데이터의 아주 작은 조각들)이 있지만, 오디오 토큰(단어나 소리)은 단 몇 개뿐입니다.
  • 결함: 표준적인 메모리 제한을 사용하면, AI는 정적인 배경과 같은 중복된 시각적 세부 사항을 수천 개씩 쌓아두는 동안, 결정적인 오디오 단서(예: "뒤를 봐!"라고 말하는 캐릭터의 목소리)를 실수로 버리게 됩니다. 이는 마치 배낭에 똑같이 생긴 돌멩이 100개를 채워 넣느라 정작 중요한 지도 한 장을 넣을 공간을 놓치는 것과 같습니다.

2. 해결책: OmniMem의 두 갈래 전략

OmniMem은 **별도의 주머니(Separate Pockets)**와 **스마트한 선택(Smart Selection)**이라는 두 가지 기술을 사용하여 이 문제를 해결합니다.

기술 A: 별도의 주머니 (오디오-비주얼 예산 할당)

OmniMem은 하나의 커다란 메모리 통을 사용하는 대신, AI에게 시각용과 오디오용이라는 두 개의 별도 주머니를 줍니다.

  • 비유: 복잡한 요리를 하는 요리사를 상상해 보세요. 그들은 모든 재료를 하나의 큰 솥에 그냥 던져 넣지 않습니다. 향신료는 작고 귀한 병에 담고, 채소는 커다란 통에 담아 따로 보관합니다.
  • 작동 방식: OmniMem은 오디오는 희귀하지만 가치 있고, 비주얼은 풍부하지만 반복적이라는 점을 인식합니다. 따라서 오디오 "주머니"에 특정하고 공정한 양의 메모리를 할당하여, 너무 많은 그림 때문에 중요한 말소리가 삭제되지 않도록 합니다.

기술 B: 스마트한 선택 (섭동 인식 메모리)

AI가 메모리 주머니를 갖춘 후에는, 영상이 재생되는 동안 무엇을 유지하고 무엇을 버릴지 결정해야 합니다. 기존 방식은 단순히 두 요소가 얼마나 유사한지만을 따졌습니다(예: "이 두 프레임은 비슷하게 생겼으니 하나를 삭제하자").

  • 기존 방식의 결함: 두 프레임이 비슷해 보인다고 해서 중요하지 않은 것은 아닙니다. 어쩌면 그 "지루한" 프레임 안에 AI가 나중에 필요로 할 미묘한 단서가 들어있을 수도 있습니다.
  • OmniMem의 접근법: OmniMem은 "만약에?"라는 질문을 던집니다. 메모리의 한 부분을 삭제하는 상황을 시뮬레이션한 뒤 이렇게 묻습니다: "만약 내가 이것을 삭제한다면, AI의 답변이 바뀔까?"
    • 만약 토큰을 삭제했을 때 AI가 혼란에 빠지거나 생각을 바꾼다면, OmniMem은 그것을 유지합니다.
    • 만약 토큰을 삭제해도 아무런 변화가 없다면, OmniMem은 그것을 버립니다.
  • 비유: 이것은 영화 편집과 같습니다. 실력이 부족한 편집자는 장면의 길이에 따라 컷을 나누지만, OmniMem은 스마트한 편집자처럼 그 장면이 없어도 이야기가 여전히 말이 되는지를 기준으로 컷을 나눕니다. 즉, "복도를 걷는 긴 장면"은 삭제하더라도, "반전이 일어나는 장면"은 반드시 남겨둡니다.

3. "학습" 보너스

논문은 또한 AI에게 이러한 새로운 메모리 규칙을 구체적으로 가르칠 때(이 과정을 "파인튜닝"이라고 합니다) 성능이 더욱 좋아진다고 언급합니다.

  • 비유: AI에게 새로운 규칙을 주는 것은 학생에게 새로운 학습 가이드를 주는 것과 같습니다. 그 후 이 규칙을 사용하여 연습 테스트를 치르게 하면, 학생은 자신의 노트를 훨씬 더 효율적으로 정리하는 법을 배우게 되어, 제한된 공간에서 훨씬 더 많은 가치를 뽑아낼 수 있게 됩니다.

결과

연구진은 여러 가지 긴 영상 벤치마크(VideoMME 및 LVBench 등)를 통해 OmniMem을 테스트했습니다.

  • 결과: 추가 학습 없이도 OmniMem은 기존의 최고 방법들보다 2~4% 더 높은 정확도를 보였습니다.
  • 학습 시: 새로운 메모리 규칙을 사용하도록 AI를 학습시킨 후에는, 1~2%의 정확도가 추가로 향상되었습니다.
  • 효율성: 이 모든 과정은 AI의 속도를 늦추거나 컴퓨터 자원을 눈에 띄게 더 많이 사용하지 않고도 이루어졌습니다.

요-약

OmniMem은 AI가 뇌 용량 부족 문제 없이 긴 영상을 시청할 수 있게 해주는 새로운 방식입니다. 이는 오디오와 비디오를 동일하게 취급하는 것을 멈추고, 각각의 전용 메모리 공간을 부여하며, AI가 놓치지 않을 것이라고 확신하는 정보만을 삭제하도록 합니다. 그 결과, AI는 이전보다 훨씬 더 정확하게 긴 영상 콘텐츠를 이해할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →