← 최신 논문
💻 computer science

Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding

이 논문은 선택된 비디오 프레임들을 분포 가이드형 잠재 인터페이스(distribution-guided latent interface)를 통해 쿼리 관련 교차 프레임 증거로 조직하는 생성적 잠재 증거 집계 프레임워크인 GenEvA를 소개하며, 이는 최소한의 계산 오버헤드로 긴 비디오 이해 성능을 크게 향상시킨다.

원저자: Bowen Liu, Shuning Wang, Xinpeng Ding, Zhiheng Wu, Bodong Du, Xiaomeng Li

게시일 2026-07-31
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bowen Liu, Shuning Wang, Xinpeng Ding, Zhiheng Wu, Bodong Du, Xiaomeng Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀려고 노력하고 있다고 상상해 보세요. 하지만 단 하나의 단서 대신, 100시간 분량의 보안 카메라 영상이 당신에게 주어졌습니다. 당신의 뇌는 모든 순간을 다 지켜보는 것이 불가능하므로, 가장 중요한 순간들—용의자가 걸어 들어오는 장면, 창문이 깨지는 장면, 도주 차량이 빠르게 사라지는 장면 등—을 골라낼 방법이 필요합니다. 이것이 인공지능을 위한 '롱 비디오 이해(long-video understanding)'의 과제입니다. 현재의 AI 모델들은 몇 개의 핵심 프레임을 골라낸 뒤 즉시 정답을 추측하라는 지시를 받은 탐정과 같습니다. 문제는 AI가 설령 올바른 프레임들을 골라냈더라도, 그 프레임들 사이의 점들을 연결하는 데 실패하는 경우가 많다는 것입니다. 용의자와 깨진 창문을 각각 별개의 사진으로 볼 수는 있지만, 그 둘을 잇는 이야기를 놓칠 수 있으며, 이는 잘못된 추측으로 이어집니다. 과학자들이 이 문제에 주목하는 이유는, 우리가 AI에 점점 더 많은 비디오 데이터를 입력함에 따라, AI가 단순히 조각들을 '보는' 것을 넘어 압도되지 않고 전체 퍼즐을 진정으로 '이해'할 수 있을 만큼 똑똑해져야 하기 때문입니다.

여기에 GenEvA라는 새로운 방법이 등장했습니다. 이는 마치 최종 결론을 내리기 전에 단서들을 정리하는 유능한 탐정의 조수와 같습니다. 이 논문의 주요 발견은 AI에게 단순히 올바른 사진들을 보여주는 것만으로는 충분하지 않으며, AI가 답변을 하기 전에 그 사진들을 하나의 명확한 아이디어로 결합할 수 있는 특별한 '정신적 메모장(mental scratchpad)'이 필요하다는 것입니다. 저자들은 단순히 증거를 사용할 수 있게 해준다고 해서 AI가 그것을 올바르게 사용할 것이라고 보장할 수는 없다고 주장합니다. 대신, 그들은 선택된 프레임들의 압축된 요약을 생성함으로써 AI가 훨씬 더 나은 성능을 발휘할 수 있음을 보여줍니다. 저자들은 네 가지 비디오 퀴즈를 통해 이를 측정했으며, 그 결과 그들의 방식이 아주 적은 양의 추가적인 '생각 공간'만을 사용하면서도 AI의 정확도를 일관되게 향상시켰으며, 때로는 엄청난 차이를 만들어냈음을 발견했습니다.

GenEvA가 어떻게 작동하는지 재미있는 비유를 통해 설명해 드리겠습니다.

문제점: "흩어진 단서"의 딜레마

당신이 영화에 관한 시험을 보고 있는데, 오직 8개의 특정 스크린샷만 볼 수 있다고 가정해 봅시다. 당신은 가장 중요한 장면 8개를 골랐습니다. 그런데 질문이 다음과 같습니다. "두 번째 노래에 등장한 세 번째 가수의 의상 색깔은 무엇이었습니까?"

만약 당신이 8개의 사진을 하나씩 따로 본다면, 당신의 뇌는 혼란에 빠질 수 있습니다. 사진 3번에서 파란색 옷을 입은 가수를 보고, 사진 5번에서 황금색 옷을 입은 가수를 봅니다. 하지만 질문은 가수의 순서를 세고 기억할 것을 요구합니다. 만약 당신의 뇌가 사진을 그저 훑어보기만 한다면, 처음 본 것에 매몰되어 "파란색"이라고 답할 수도 있으며, "세 번째 가수"라는 조건을 놓칠 수 있습니다. 이것이 현재 AI 모델들이 겪는 문제입니다. 그들은 사진(증거)을 가지고 있지만, 그것들을 하나의 이야기로 엮어내는 데 실패합니다. 그들은 '무엇(what)'은 알지만, '언제(when)'와 '몇 명인지(how many)'를 놓칩니다.

해결책: "정신적 메모장"

알리바바와 바이두 같은 기업 및 대학 출신의 저자들은 GenEvA(Generative Latent Evidence Aggregation)라고 불리는 새로운 단계인 '정신적 메모장' 혹은 '단서 게시판'을 제안합니다. 이는 AI가 8개의 사진을 뽑은 직과 답변을 작성하기 전 사이에 구축하는 것입니다.

  1. 프레임 선택: 먼저, 표준 AI 도구가 이전과 마찬가지로 가장 관련성이 높은 8개의 프레임을 뽑습니다.
  2. 마법의 단계 (잠재적 증거 집계): 8개의 사진을 단순히 생성기(generator)로 전달하는 대신, GenEvA는 특별히 압축된 요약을 만듭니다. AI는 스스로에게 묻습니다: "각 사진에 나의 정신적 에너지를 얼마나 할애해야 할까?"
    • 만약 정답이 단 하나의 사진에 달려 있다면 (예: "자동차의 색깔은?"), AI는 거의 모든 정신적 에너지를 그 한 장의 사진에 집중합니다.
    • 만약 정답이 여러 사진을 비교하는 것에 달려 있다면 (예: "고양이와 강아지 중 누가 먼저 나타났는가?"), AI는 이들을 서로 연결하기 위해 관련 있는 모든 사진에 정신적 에너지를 분산시킵니다.
  3. "메모장" 토큰: 이 과정은 '잠재 토큰(latent tokens)'이라는 작은 묶음을 만들어냅니다 (이는 가장 중요한 연결 고리들이 적힌 포스트잇과 같습니다). 이 포스트잇들은 원래의 사진들과 함께 AI에게 전달됩니다.
  4. 적응형 호출 (Adaptive Invocation): 여기가 영리한 부분입니다. AI는 자신의 정신적 에너지가 얼마나 분산되어 있는지 확인합니다. 만약 에너지가 한 곳에 집중되어 있다면, AI는 메모장을 무시하고 사진만을 바탕으로 답합니다. 만약 에너지가 분산되어 있다면, AI는 점들을 연결하기 위해 메모장이 필요하다는 것을 인지합니다. AI는 실제로 필요할 때만 이 추가적인 "메모장"을 사용하여 시간과 에너지를 절약합니다.

결과: 적은 노력으로 얻는 더 똑똑한 답변

연구진은 네 가지 비디오 퀴즈(MLVU, Video-MME, LongVideoBench, LVBench)를 대상으로 두 가지 서로 다른 AI 백본(LLaVA-Video와 Qwen2.5-VL)을 사용하여 테스트했습니다.

  • 큰 폭의 상승: 단 8개의 프레임만 사용했을 때, GenEvA는 네 가지 테스트 전체에서 LLaVA-Video 모델의 평균 점수를 5.2점 높였습니다. LVBench 테스트에서는 Qwen2.5-VL 모델의 정확도를 무려 10.1점이나 향상시켰습니다.
  • 미미한 비용: 가장 놀라운 점은 이 "정신적 메모장"이 매우 효율적이라는 것입니다. 이 방식은 추가적인 "토큰" 비용(디지털 방식의 추가 생각 시간)을 단 0.11%에서 0.40% 정도만 더할 뿐입니다. 즉, AI는 거의 추가 비용 없이 지능의 거대한 도약을 이뤄냈습니다.
  • 거인들을 이기다: GenEvA는 단 8개의 프레임만으로도 16개, 32개, 심지어 1,024개의 프레임을 사용하는 다른 방법들보다 더 나은 성능을 보였습니다. 이는 더 많은 단서를 갖는 것보다, 가진 단서를 더 똑똑하게 사용하는 방법이 더 중요하다는 것을 증명했습니다.

이것이 왜 중요한가

이 논문은 비디오 AI의 미래가 단순히 컴퓨터에 더 많은 데이터를 주입하거나 더 많은 프레임을 보여주는 것에 있지 않다고 시사합니다. 그것은 컴퓨터가 이미 가지고 있는 데이터를 어떻게 조직화할지 가르치는 것에 있습니다. AI가 말을 하기 전에 생각을 정리하는 중간 단계인 이 '잠재적 증거 인터페이스(latent evidence interface)'를 추가함으로써, 우리는 AI를 느려지게 하거나 더 힘들게 만들지 않고도 길고 복잡한 이야기를 이해하는 데 훨씬 더 똑똑하게 만들 수 있습니다. 이것은 단순히 사진을 쳐다보는 탐정과 실제로 사건을 해결하는 탐사의 차이와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →