← 최신 논문
🤖 machine learning

Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval

본 논문은 비디오 간 디리클레 기반 유사도 모델링과 적응형 최적 수송을 통한 비디오 내 소프트 정렬을 통해 다중 세분화 교차 모달 증거를 집계함으로써 부분적으로 관련 있는 비디오 검색에서 불확실성을 명시적으로 모델링하는 계층적 증거 학습 프레임워크인 Holmes 를 제안한다.

원저자: Jun Li, Peifeng Lai, Xuhang Lou, Jinpeng Wang, Yuting Wang, Ke Chen, Yaowei Wang, Shu-Tao Xia

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jun Li, Peifeng Lai, Xuhang Lou, Jinpeng Wang, Yuting Wang, Ke Chen, Yaowei Wang, Shu-Tao Xia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수천 개의 클립으로 구성된 거대한 라이브러리에서 특정 편집되지 않은 가정용 비디오를 찾아야 한다고 상상해 보세요. 이를 찾는 데 도움이 되는 짧은 모호한 메모 하나만 가지고 있습니다. 예를 들어 "누군가 수영을 하고 있다"는 내용입니다.

이것이 **부분적으로 관련 있는 비디오 검색 (Partially Relevant Video Retrieval, PRVR)**의 과제입니다. 비디오는 길고 지저분합니다 (편집되지 않았습니다). 하지만 메모는 그 안에 있는 아주 짧은 순간 하나만 설명합니다. 문제는 무엇일까요? 메모가 너무 짧아 실수로 수십 개의 다른 비디오와 일치할 수도 있고, 너무 모호해서 컴퓨터가 무엇을 찾고 있는지 전혀 알지 못할 수도 있습니다.

이 논문은 Holmes(유명한 탐정 이름에서 유래)라는 새로운 시스템을 소개하여 이 문제를 해결합니다. Holmes 는 단순히 "예" 또는 "아니오"라고 추측하는 대신, "이것에 대해 얼마나 확신할 수 있을까?"라고 묻는 탐정처럼 행동합니다.

다음은 Holmes 가 작동하는 방식을 간단한 비유로 설명한 것입니다:

1. 문제: "모호한 메모"와 "노이즈가 많은 도서관"

이 논문은 올바른 비디오를 찾기 어렵게 만드는 두 가지 주요 문제를 식별합니다:

  • 모호한 메모 (Video 간 모호성): 만약 "누군가 수영을 하고 있다"고 작성하면, 컴퓨터는 수영장 에서 수영하는 사람의 비디오, 바다에서 수영하는 사람의 비디오, 그리고 단순히 수영을 흉내 내는 사람의 비디오를 찾을 수 있습니다. 메모가 너무 많은 것에 적합하기 때문에 컴퓨터가 혼란을 겪습니다.
  • 노이즈가 많은 도서관 (Video 내 희소 감독): 하나의 긴 비디오 내부에서는 메모와 실제로 일치하는 몇 초만 존재합니다. 나머지는 배경 노이즈 (사람들이 걷거나 대화하는 등) 일 뿐입니다. 전통적인 방법들은 종종 가장 좋은 "단일" 초만 보고 나머지는 무시하는데, 이는 흐릿한 프레임 하나만 보고 전체 영화를 판단하려는 것과 같습니다.

2. 해결책: "탐정의 도구상자"

Holmes 는 **증거 학습 (Evidential Learning)**이라는 특수한 수학 유형을 사용합니다. 단일 점수를 매기는 대신 "증거"를 수집하고 그 증거를 얼마나 신뢰하는지 계산합니다.

부분 A: 단서 분류 (Video 간 수준)

Holmes 는 "모호한 메모"를 "삼중 원칙 (Three-Fold Principle)"을 사용하여 세 가지 범주로 분류합니다:

  1. 정확한 단서: 메모가 명확합니다 (예: "빨간 발레 신발을 묶는 소녀"). Holmes 는 매우 확신합니다. 이를 확실한 지문처럼 취급합니다.
  2. 다의적 단서 (이중 의미): 메모에 여러 의미가 있습니다 (예: "남자가 달리고 있다"). 조깅하는 사람일 수도 있고, 도망치는 범죄자일 수도 있습니다. Holmes 는 "무엇을 의미하는지 100% 확신하지 못한다"고 깨닫고, 단일 답변을 강요하지 않습니다. 가능성을 열어둡니다.
  3. 미결정 단서: 메모가 너무 짧거나 깨져 있습니다 (예: "수영..."). Holmes 는 "이 문제를 해결할 정보가 부족하다"고 인정합니다. 막연하게 추측하지 않고 증거 부족을 인정합니다.

마술 같은 트릭: Holmes 가 단서를 분류하면 "학습 규칙"을 조정합니다. 단서가 모호하면 컴퓨터에게 "아마도 맞는 비디오에 대해 너무 가혹하지 말라"고 말합니다. 단서가 명확하면 "엄격하게 정확한 일치물을 찾아라"고 말합니다. 이렇게 하면 컴퓨터가 모호한 메모에 혼란을 겪지 않게 됩니다.

부분 B: 비디오 정제 (Video 내 수준)

이제 Holmes 는 긴 비디오 내부에서 특정 순간을 찾기 위해 살펴봅니다.

  • 구식 방법: 가장 잘 일치하는 한 프레임만 보고 문장과 비디오를 일치시키려 한다고 상상해 보세요. 그 프레임이 결함이나 무작위 노이즈라면 전체 검색이 실패합니다.
  • Holmes 의 방법 (유연한 최적 수송): Holmes 는 "쓰레기통 버킷"을 사용합니다. 빨래를 분류한다고 상상해 보세요. 옷 더미 (비디오 클립) 와 필요한 목록이 있습니다.
    • 대부분의 옷은 "일치" 더미로 들어갑니다.
    • 하지만 일부 옷은 쓰레기이거나 관련이 없습니다 (소속되지 않는 양말처럼).
    • Holmes 는 특별한 쓰레기통을 가지고 있습니다. 쓰레기 양말을 목록과 일치시키려고 강요하는 대신, 쓰레기통에 버립니다. 이를 통해 컴퓨터는 중간에 있는 "노이즈"에 방해받지 않고 비디오의 관련 있는 부분에만 집중할 수 있습니다.

3. 결과: 더 똑똑한 탐정

이 두 단계를 결합함으로써 Holmes 는 이전 방법들보다 비디오를 훨씬 더 잘 찾습니다.

  • 단순히 "이 비디오가 일치한다"고 말하는 것이 아닙니다. "이 비디오가 일치하며, 저는 90% 확신합니다"라고 말하거나, "이 비디오가 일치하지만 메모가 모호했으므로 저는 60% 만 확신합니다"라고 말합니다.
  • 다른 시스템을 혼란스럽게 만드는 비디오의 "쓰레기" 부분을 무시합니다.

요약

이전 비디오 검색 엔진을 답을 암기하지만 까다로운 질문에 혼란을 겪는 학생이라고 생각하세요. Holmes는 다음과 같은 탐정처럼 행동합니다:

  1. 단서가 너무 모호할 때 인정합니다 (그래서 잘못 추측하지 않습니다).
  2. 단서의 명확성에 따라 분류합니다 (얼마나 열심히 찾아야 할지 알 수 있습니다).
  3. 쓰레기를 버립니다 (비디오의 관련 없는 부분) 그래서 실제 증거에 집중할 수 있습니다.

이 논문은 이 접근 방식이 검색 메모가 짧거나 지저분하거나 모호할 때조차 컴퓨터가 올바른 비디오를 훨씬 더 빠르고 정확하게 찾도록 돕는다고 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →