← 최신 논문
💬 NLP

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

본 논문은 토큰 선택을 관련성, 중요도 및 다양성에 기반한 top-KK 검색 문제로 재정의함으로써, Omni-Modal LLM의 시간 단위 오디오-비디오 이해를 향상시키고 긴 형식의 벤치마크에서 최첨단 성능을 달성하는 동시에 1시간 길이의 컨텍스트에서도 견고함을 유지하는 검색 영감 기반의 토큰 압축 프레임워크인 AVOC를 제안한다.

원저자: Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 수 시간 동안 이어지는 영화와 회의 녹화 영상이 가득한 거대한 라이브러리가 있다고 상상해 보세요. 당신은 그중 한 영상에 대해 아주 구체적인 질문을 던지고 싶습니다. 예를 들어, "특정 대사가 나온 직후에 몇 명의 사람이 지하실로 걸어 들어갔지?"와 같은 질문 말이죠.

문제는 AI의 "두뇌"(메모리 창)가 이 전체 영상을 한꺼번에 담기에는 너무 작다는 것입니다. 만약 전체를 다 입력하려고 하면 AI는 과부하가 걸려 멈춰버립니다. 그렇다고 무작위로 프레임을 골라 크기를 줄이려고 하면, 결정적인 순간을 놓칠 수도 있습니다. 반대로 모든 세부 사항을 다 유지하려고 하면, 공간이 부족해집니다.

AVOC: 스마트한 사서

이 논문의 저자들은 AVOC라고 불리는 새로운 시스템을 만들었습니다. AVOC를 1시간짜리 영화를 AI를 위한 10페이지 분량의 요약 노트로 요약해야 하는 매우 숙련된 사서라고 생각해보세요. 단, 이 사서에게는 아주 구체적인 목표가 있습니다. 바로 그 요약 노트가 당신의 질문에 답하는 데 필요한 오직 그 정보만을 담고 있어야 한다는 것입니다.

AVOC가 작동하는 방식은 검색 엔진이 최적의 결과를 찾는 데 사용하는 세 가지 간단한 규칙을 빌려와 설명할 수 있습니다.

1. 관련성(Relevance): "질문과 일치하는가?"

만약 당신이 사서에게 "누가 지하실로 걸어 들어갔나요?"라고 묻는다고 가정해 봅시다.

  • 기존 방식: 사서는 주방 장면이나 날씨 장면처럼 소리가 크거나 색감이 화려한 페이지를 보여줄 수도 있습니다.
  • AVOC의 방식: AVOC는 질문을 먼저 살핍니다. 비디오와 오디오를 스캔하며 이렇게 말합니다. "좋아, 지하실에 대해 이야기하는 부분을 찾아야겠어." 그리고 질문과 직접적으로 관련된 비디오의 특정 순간과 오디오의 특정 단어들을 강조합니다. 이것을 **텍스트 가이드 점수 산정(Text-Guided Scoring)**이라고 합니다.

2. 중요도(Importance): "질문 없이도 이것은 흥미로운가?"

때로는 질문이 모호하거나, 답변이 영상에서 말로 설명되지는 않지만 시각적으로 보여주는 내용에 달려 있을 수도 있습니다.

  • 비유: 당신이 군중 속에서 특정 인물을 찾고 있다고 상상해 보세요. 그 사람의 이름을 모르더라도, 그 사람이 밝은 빨간색 모자를 쓰고 있다거나(독특한 시각적 단서), 혼자 춤을 추고 있다거나(독риста한 오디오 단서) 하는 특징 때문에 발견할 수 있습니다.
  • AVOC의 방식: AVOC는 어떤 순간이 그 자체로 "중요한지"를 확인합니다. 비디오와 오디오가 서로 어떻게 상호작용하는지 살핍니다. 만약 어떤 사람의 얼굴(비디오)이 특정 소리(오디오)와 일치한다면, 질문에서 언급하지 않았더라도 그 순간은 높은 "중요도" 점수를 받게 됩니다. 이를 통해 AI가 숨겨진 단서를 놓치지 않도록 보장합니다.

3. 다양성(Diversity): "똑같은 것을 두 번 보여주지 마세요!"

이 부분이 가장 까다로운 부분입니다. 만약 어떤 캐릭터가 방에 들어왔다가, 나갔다가, 다시 들어오는 장면이 있다면, 멍청한 시스템은 이 세 순간을 모두 선택할 수도 있습니다. 왜냐하면 세 장면이 모두 비슷해 보이기 때문입니다. 이는 공간을 낭비하게 됩니다.

  • 비유: 여행을 위해 캐리어를 싸고 있다고 상상해 보세요. 똑같은 빨간 양말 세 켤레를 챙길 필요는 없습니다. 다양한 용도를 충족하기 위해 빨간 양말 한 켤레, 파란 양말 한 켤레, 초록 양말 한 켤레를 챙겨야 합니다.
  • AVOC의 방식: AVOC는 **시계열 인지 다양성(Temporal-Aware Diversity)**이라는 특별한 규칙을 사용합니다. "이미 누군가 방에 들어가는 순간을 선택했다면, 바로 다음 초에 일어나는 똑같은 행동은 선택하지 않겠다"라고 결정합니다. 하지만 만약 영화의 한 시간 뒤에 같은 일이 다시 일어난다면, AVOC는 그것이 다른 시간대의 사건이므로 그 순간을 선택할 것입니다. 이를 통해 중복 없이 전체 타임라인을 커버하면서도 요약 내용을 신선하게 유지합니다.

결과: 초스마트 요약본

이 세 가지 규칙을 결 der 결합함으로써, AVOC는 방대하고 긴 비디오 및 오디오 스트림을 매우 효율적인 "토큰" 시퀀스로 압축합니다. 지루하거나 반복적이거나 관련 없는 부분은 버리고, 오직 "황금 같은 정보의 조각"들만을 남깁니다.

무엇을 발견했나요?

  • 다른 모델보다 뛰어납니다: 긴 영상(최대 90분)을 대상으로 테스트했을 때, AVOC는 다른 최고 수준의 모델들보다 훨씬 더 정확하게 질문에 답했습니다. 평균적으로 2위 모델보다 약 5점 높은 점수를 기록했습니다.
  • "건초더미 속의 바늘"을 찾아냅니다: 1시간짜리 영상 어딘가에 숨겨진 비밀 숫자를 AI가 찾을 수 있는지 테스트했습니다. AVOC는 영상이 1시간에 달하더라도 거의 완벽하게 찾아낼 수 있었던 반면, 다른 모델들은 영상이 길어질수록 성능이 떨어지기 시작했습니다.
  • 빠릅니다: 이 복잡한 분류 작업을 수행함에도 불구하고, AVOC는 AI의 속도를 크게 늦추지 않습니다. 사실, 쓸모없는 데이터를 많이 버리기 때문에 AI는 이전보다 더 빠르게 영상을 처리할 수 있습니다.

요약하자면, AVOC는 AI에게 더 나은 독서법을 가르칩니다. 단순히 500페이지짜리 책의 모든 단어를 읽는 것이 아니라, 질문에 완벽하게 답하기 위해 핵심적인 부분을 훑어보고, 강조하고, 불필요한 내용은 무시하는 법을 배우는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →