← 최신 논문
🤖 machine learning

Incentivizing Vision Language Models to Search for Long Video Question Answering

이 논문은 검색된 시각적 증거를 형식적 시간 논리 명세에 따라 체계적으로 검증하는 다회차 탐색 과정으로 과업을 변환하기 위해 신경-기호적 보상을 활용한 강화 학습을 채택함으로써 롱 비디오 질의응답 능력을 향상시키는 에이전트 기반 프레임워크인 VSeek을 소개한다.

원저자: Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 2시간짜리 다큐멘터리가 주어지고, "남자가 꽃병을 떨어뜨릴 때 쓰고 있던 모자의 색깔은 무엇인가?"와 같이 매우 구체적인 질문을 받았다고 상상해 보십시오.

과거의 방식 (수동적 인지):
현재의 AI 모델들은 보통 전체 영화에서 무작위로 추출한 몇 개의 프레임(예: 전체에 고르게 퍼진 64개의 스냅샷)을 훑어보는 방식으로 이 질문에 답하려고 시도합니다. 이는 마치 건초더미 속에서 특정 바늘을 찾기 위해 무작위로 한 움큼의 건초를 집어 드는 것과 같습니다. 만약 그 한 움큼 안에 바늘이 없다면, AI는 결정적인 순간을 놓치게 되어 종종 오답을 내놓게 됩니다.

새로운 방식 (VSeek):
이 논문은 더 똑똑한 AI 에이전트인 VSeek를 소개합니다. VSeek는 마치 인간 탐정처럼 행동합니다. 무작위로 추측하는 대신, VSeek는 비디오 타임라인을 능동적으로 "스크러빙(scrubbing)"합니다. VSeek는 "꽃병이 떨어지는 부분을 찾아야 해"라고 생각하고, 자연어를 사용하여 정확히 그 장면을 검색합니다. 이는 마치 비디오 플레이어의 '찾기' 기능을 사용하여 관련 순간으로 바로 점프할 줄 아는 스마트한 비서와 같습니다.

문제점: AI에게 어떻게 잘 검색하도록 가르칠 것인가?
AI에게 좋은 탐정이 되는 법을 가르치는 것은 어렵습니다. 보통 우리는 AI에게 최종 답변이 맞았는지 틀렸는지만 알려줍니다(마치 시험이 끝난 후 채점하는 선생님처럼 말이죠). 하지만 만약 AI가 엉뚱한 것을 검색했는데 운 좋게 정답을 맞혔다면, AI는 나쁜 습관을 배우게 됩니다. AI에게는 단순히 최종 결과뿐만 아니라, 어떻게 검색했는지에 대한 피드백이 필요합니다.

해결책: VETL (시각적 단위 테스트)
이를 해결하기 위해 저자들은 VETL(Visual Evidence via Temporal Logic)이라는 시스템을 만들었습니다. 이것을 하나의 체크리스트 또는 레시피로 만든다고 생각하십시오.

  1. 세분화하기: 이 시스템은 복잡한 질문을 작고 부정할 수 없는 사실들(primitives)로 나눕니다.

    • 질문: "그녀가 뜨거운 물을 부은 후에 요거트 위에 무엇을 올렸나요?"
    • 체크리스트:
      1. 여성이 등장한다.
      2. 그녀가 뜨거운 물을 붓는다.
      3. 그녀가 요거트를 뜬다.
      4. 그녀가 토핑을 추가한다.
      5. 토핑이 보인다.
  2. 보상: AI가 영상을 검색할 때, 시스템은 그 AI의 '영수증'(찾아낸 클립들)을 확인합니다. AI가 물을 붓는 장면을 찾았나요? 요거트를 찾는 장면을 찾았나요? 만약 AI가 체크리스트와 일치하는 클립들을 찾아낸다면, 최종 답변을 내놓기도 전에 "보너스 점수(보상)"를 받게 됩니다.

이는 마치 게임에서 최종 보스를 물리쳤을 때만 점수를 받는 것이 아니라, 가는 길에 특정 아이템을 수집할 때마다 점수를 받는 비디오 게임과 같습니다. 이는 AI가 더 철저하고 정밀하게 검색하도록 가르칩니다.

결과:
이 "체크리스트" 방식을 사용하여 AI를 훈련시킨 결과, VSeek는 긴 영상에서 정답을 찾는 능력이 훨씬 향려되었습니다.

  • 단순히 추측하거나 무작위로 검색하는 모델들에 비해 정확도가 크게 향상되었습니다.
  • AI는 더 나은 검색 질문을 던지는 법을 배웠습니다 (예: 단순히 "음식"이라고 검색하는 대신 "딸기 토핑"을 검색함).
  • AI는 전체 영화를 멍하니 바라보는 대신, 정확히 무엇을 찾아야 할지 알기에 훨씬 더 효율적으로 적은 양의 프레임만을 살펴봅니다.

요약하자면:
이 논문은 영상을 수동적으로 시청하는 것이 아니라 탐정처럼 정답을 능동적으로 사냥하는 AI인 VSeek를 제시합니다. AI가 효과적으로 사냥하는 법을 가르치기 위해, 저자들은 질문을 엄격한 시각적 사실의 체크리스트로 변환하는 VETL 시스템을 발명했습니다. 이를 통해 AI는 자신이 올바른 증거를 수집하고 있는지 즉각적인 피드백을 받게 되며, 결과적으로 긴 영상에 대해 훨씬 더 똑똑하고 정확한 답변을 내놓을 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →