← 최신 논문
💻 computer science

MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation

MARQUIS 는 쿼리 확장, 구조화된 증거 추출, 제어된 기사 생성을 통해 복잡한 쿼리 처리 및 다중 비디오 합성의 한계를 해결함으로써 비디오 검색 증강 생성을 크게 향상시키는 3 단계 파이프라인으로, MAGMaR2026 공유 작업에서 최첨단 성능을 달성합니다.

원저자: Debashish Chakraborty, Dengjia Zhang, Jialiang Jin, Hanting Liu, Katherine Guerrerio, Hanxiang Qin, Tyler Skow, Alexander Martin, Reno Kriz, Benjamin Van Durme

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Debashish Chakraborty, Dengjia Zhang, Jialiang Jin, Hanting Liu, Katherine Guerrerio, Hanxiang Qin, Tyler Skow, Alexander Martin, Reno Kriz, Benjamin Van Durme

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 폭풍이나 정치 선거와 같은 복잡한 사건에 대한 상세한 뉴스 기사를 작성하라는 임무를 받은 기자라고 상상해 보십시오. 하지만 현장에 파견된 단일 기자는 없습니다. 대신 수백 대의 서로 다른 카메라로 촬영된 해당 사건의 10 만 개의 서로 다른 비디오 클립이 담긴 도서관이 있습니다. 당신의 임무는 올바른 클립을 찾아내고, 그 안에서 실제로 일어난 일을 파악하며, 각 사실을 입증한 정확한 비디오를 인용하여 일관된 이야기를 작성하는 것입니다.

이것이 바로 MARQUIS 시스템이 해결하려는 과제입니다. 해당 논문은 현재의 AI 도구들이 이 특정 업무에는 부적합하다고 주장합니다. 질문이 복잡할 때 올바른 비디오를 찾지 못하거나, 너무 많은 비디오를 한 번에 읽으려다 압도되어 환각 (사실을 지어내는 것) 에 빠지기 때문입니다.

MARQUIS 는 3 단계 뉴스룸 조립 라인처럼 작동함으로써 이 문제를 해결하며, 거대한 작업을 더 작고 관리 가능한 단계로 분해합니다.

1 단계: 탐정의 수사 (검색)

문제: "2025 년 선거 결과에 대해 모든 것을 알려 달라"고 AI 에게 요청하면, 표준 검색 엔진은 혼란을 겪을 수 있습니다. 전체 긴 질문을 하나의 "검색 코드 (임베딩)"로 변환하려다 뉘앙스를 놓치는 경우가 많습니다. 이는 전체 건초더미를 한 번에 설명하며 건초더미 속의 특정 바늘을 찾으려 하는 것과 같습니다.

MARQUIS 의 해결책:
MARQUIS 는 하나의 큰 검색 대신, 큰 사건을 작은 단서로 분해하는 탐정처럼 행동합니다.

  1. 분해: 큰 질문을 20 개 이상의 작고 구체적인 질문으로 나눕니다 (예: "자유당이 몇 석을 얻었는가?", "유권자 투표율은 어떻게 되었는가?", "어떤 지역구가 정권이 바뀌었는가?").
  2. 병렬 검색: 각 작은 질문별로 비디오 도서관을 검색합니다.
  3. 융합: 작은 질문들을 위해 찾은 모든 비디오 목록을 하나의 마스터 목록으로 병합합니다.
  4. 재순위화: 마지막으로 전문적인 "비디오 심사관"이 상위 후보들을 검토하여 가장 관련성 높은 것들이 맨 위에 오도록 순서를 다시 매깁니다.

결과: 이 방법은 건초더미가 어디에 있는지 추측하는 대신 특정 바늘을 찾기 위해 돋보기를 사용하는 것과 같습니다. 이 방법으로 올바른 비디오를 찾을 수 있는 시스템의 능력이 0.195 에서 0.759 로 (엄청난 도약) 향상되었습니다.

2 단계: 사실 확인자 (정보 추출)

문제: 비디오를 확보했다고 해서 전체 비디오 파일을 작성자에게 바로 제공할 수는 없습니다. 작성자는 구체적인 사실이 필요합니다. 또한 비디오는 까다로울 수 있습니다. 때로는 사람이 사실이 아닌 것을 말하거나, 카메라 앵글이 오해의 소지가 있을 수 있습니다.

MARQUIS 의 해결책:
MARQUIS 는 단순히 비디오를 "읽는" 것이 아니라, 구체적인 "주장"을 추출한 후 이를 보정합니다.

  1. 세 가지 유형의 노트:
    • 일반 노트: "빨간 코트를 입은 여성이 말하고 있다." (나중에 유용할 수 있는 사실).
    • 표적 주장: "비디오는 50 명의 구조된 사람들을 보여준다." (질문에 구체적으로 답하는 사실).
    • 질문 - 답변: 시스템이 비디오에 구체적인 질문을 하고 답변을 받습니다.
  2. 보정 (거짓말 탐지기): 이는 결정적인 단계입니다. 작성자가 주장을 보기 전에 "보정기" 모델이 주장과 원본 비디오를 나란히 검토합니다. "이 비디오가 실제로 이 문장을 입증하는가?"를 묻습니다. 확률 점수 (0 에서 1 사이) 를 부여합니다. 비디오가 주장을 지지하지 않으면 해당 주장은 걸러집니다.

비유: 기자가 작성한 모든 문장을 읽고 원본 영상을 다시 확인하여 검증하는 사실 확인 팀을 상상해 보십시오. 영상이 일치하지 않으면 그 문장은 쓰레기통에 버려집니다.

3 단계: 작성자 (기사 생성)

문제: 좋은 사실이 있더라도 매끄러운 기사를 작성하는 것은 어렵습니다. 작성자에게 500 개의 연결되지 않은 불릿 포인트를 주면 엉망인 목록을 작성할 수 있고, 2 시간 분량의 영상 대본을 주면 세부사항에 빠져 핵심을 잊을 수 있습니다.

MARQUIS 의 해결책:
시스템은 기사를 작성하는 세 가지 방법을 제공하지만, 가장 좋은 방법은 구조화된 접근법을 사용하는 것입니다.

  1. 클러스터링: 검증된 사실을 주제별로 그룹화합니다 (예: "사망자", "구조 활동", "정부 대응").
  2. 요약: 각 주제별로 인용된 짧은 문장을 작성합니다.
  3. 다듬기: 해당 문장들을 매끄럽고 읽기 쉬운 뉴스 기사로 연결하며, 모든 사실이 인용 (예: [비디오 #45, 0:12-0:15]) 되어 있는지 확인합니다.

"재귀적" 옵션 (MARQUIS-RLM):
논문은 또한 특수한 "관리자" AI(재귀 언어 모델을 기반으로 함) 를 소개합니다. 한 번만 작성하는 대신, 이 관리자는 지속적인 메모장을 가진 프로젝트 매니저처럼 행동합니다.

  • 자신이 가진 사실을 검토합니다.
  • "북부 지역의 사망자 수가 빠져 있다"고 깨닫습니다.
  • 1 단계와 2 단계로 돌아가서 해당 누락된 정보를 구체적으로 요청하고, 메모장에 추가한 후 충돌 여부를 확인합니다.
  • 메모장이 가득 차고 일관성이 있을 때만 최종 기사를 작성합니다.

결론

해당 논문은 문제를 분해함으로써—더 똑똑하게 검색하고, 사실을 엄격하게 검증하며, 작성 과정을 조직화함으로써—MARQUIS 가 기존 방법보다 훨씬 더 나은 결과를 산출한다고 주장합니다.

  • 검색: 올바른 비디오를 훨씬 더 자주 찾았습니다.
  • 생성: 더 일관성 있고 출처가 명확하여 인간이 더 높은 점수 (5 점 만점에 3.83 점, 기준선은 3.09 점) 를 매긴 기사를 생산했습니다.
  • 신뢰성: 시스템은 "근거 기반"으로 설계되어 비디오 증거로 뒷받침되지 않는 사실을 작성하는 것을 거부하며, 다른 AI 시스템에서 흔히 발생하는 "환각"을 피합니다.

요약하자면, MARQUIS 는 단일에 압도된 작성자가 아니라 매우 조직화된 다단계 뉴스룸처럼 행동함으로써 10 만 개의 비디오로 뒤죽박죽인 더미를 신뢰할 수 있고 출처가 명확한 뉴스 기사로 변환합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →