← 최신 논문
💻 computer science

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN 은 계층적 정제 및 도메인 적응을 통해 체인 오브 씽킹 추론 흔적이 포함된 고품질의 구조화된 비디오 추론 데이터를 자동으로 생성하는 다단계 에이전트 파이프라인으로, 복잡한 사건 추론 벤치마크에서 미세 조정된 비전-언어 모델의 성능을 크게 향상시킵니다.

원저자: Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

게시일 2026-05-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 영화 장면, 예를 들어 교통사고나 창고에서의 싸움과 같은 장면을 로봇이 이해하도록 가르친다고 상상해 보세요. 로봇에게 원본 비디오만 보여주고 "무슨 일이 일어났나요?"라고 묻는다면, 로봇은 혼란을 겪거나 세부 사항을 놓치거나 사실을 만들어낼 수 있습니다 (할루시네이션).

이 논문은 이러한 로봇을 위한 초-정리된 "시나리오 작가"이자 "교사"로 작동하도록 설계된 지능형 시스템 MAVEN을 소개합니다. MAVEN은 로봇에게 단순히 비디오를 제공하는 대신, 먼저 비디오를 구조화된 이야기로 분해한 뒤 그리고 나서 그 이야기를 활용하여 학습용 질문을 생성합니다.

다음은 MAVEN의 작동 방식을 간단한 비유를 통해 설명한 것입니다:

1. 3 단계 "줌인 (Zoom-In)" 프로세스

대부분의 시스템은 휴가가지를 한 번에 요약하는 관광객처럼 비디오 전체를 한 번에 설명하려 합니다. 그들은 종종 작고 중요한 세부 사항을 놓칩니다. MAVEN은 이를 다르게 수행하며, 3 단계 "줌" 접근 방식을 사용합니다:

  • 1 단계: 와이드 샷 (전체 맥락): 먼저 전체 장면을 살펴봅니다. 비가 오나요? 낮인가요 밤인가요? 거리는 어떻게 생겼나요? 이는 무대를 설정합니다.
  • 2 단계: 타임라인 (밀도 높은 사건): 다음으로 주요 사건의 타임라인을 작성하여 일이 정확히 언제 시작되고 멈췄는지 기록합니다.
  • 3 단계: 클로즈업 (세부 사항): 마지막으로 미묘한 세부 사항을 포착하기 위해 작고 짧은 클립으로 줌인합니다. 예를 들어, 사람이 주변을 힐끗 보거나 작은 물건을 집어 올리는 것과 같은 세부 사항입니다.

2. "마스터 청사진" (MSTED)

이 부분이 가장 중요합니다. MAVEN은 질문을 바로 던지는 대신, 위의 세 가지 설명을 모두 취해 단일하고 완벽한 **"마스터 청사진"**인 MSTED로 결합합니다.

이는 증인을 인터뷰하기 전에 형사가 완전한 사건 파일을 작성하는 것과 같습니다.

  • 중요한 이유: 로봇이 비디오에서 직접 답을 추측하려 한다면 사실을 invention 할 수 있습니다. 하지만 로봇이 먼저 "마스터 청사진"을 읽도록 강요받으면, 그곳에 명시적으로 적힌 내용만을 기반으로 답할 수 있습니다. 청사진이 허용된 유일한 진실의 출처이기 때문에 로봇은 사실을 만들어낼 수 없습니다.

3. "스마트 편집자" (에이전트 주도 적응)

보통 로봇에게 새로운 주제 (예: 교통 카메라에서 창고 보안으로 전환) 를 가르치고 싶다면, 로봇을 위한 모든 지시를 수동으로 다시 작성해야 합니다. 이는 많은 인간의 시간이 소요됩니다.

MAVEN에는 내장된 **"스마트 편집자"(AI 에이전트)**가 있습니다.

  • 작동 방식: 편집자에게 새로운 세계에 대한 설명 (예: "이곳은 높은 선반과 지게차가 있는 창고입니다") 과 몇 가지 예시 질문만 제공하면 됩니다.
  • 마법: 편집자는 위의 3 단계에 대한 모든 지시를 자동으로 다시 작성합니다. "아, 창고에서는 빨간불을 무시하고 달리는 차뿐만 아니라 셔츠 아래에 숨겨진 물건을 찾아야 해"라고 파악합니다. 이는 인간이 코드에 손을 대지 않아도 수행됩니다.

4. "품질 관리 루프"

사람들이 답변을 검토하고 실수를 발견하면 MAVEN은 단순히 "오류"라고 말하지 않습니다. 대신 자신의 실패를 조사하는 형사처럼 행동합니다.

  • 질문합니다: "비디오 설명에서 세부 사항을 놓쳤나요? 아니면 올바른 질문을 하지 못했나요?"
  • 설명이 나빴다면 설명 프롬프트를 수정합니다.
  • 구조가 잘못되었다면 (예: 비디오 청크가 너무 짧아 사건을 반으로 잘랐다면), 실제로 파이프라인에 새로운 단계를 추가하여 구조적 문제를 해결합니다.

그들이 달성한 것은 무엇인가요?

연구팀은 MAVEN을 사용하여 5,300 개 이상의 교통 비디오(거리 카메라와 차량 대시캠 모두 포함) 에 라벨을 지정했습니다. 그런 다음 이 데이터를 사용하여 Cosmos-Reason2라는 로봇 모델을 학습시켰습니다.

  • 결과: 학습된 로봇은 추론 능력이 놀라울 정도로 뛰어났습니다. 비공개 테스트에서 Gemini 2.5 ProGemini 3.1 Flash와 같은 최상위 모델들을 능가했습니다.
  • 놀라운 점: 그들은 거리 카메라 (CCTV) 비디오로만 학습시켰음에도 불구하고, 대시캠 테스트에서 대형 모델들과 동등한 성능을 발휘했습니다. 이는 로봇이 자동차가 어떻게 생겼는지 단순히 외운 것이 아니라, 사건에 대해 어떻게 추론할지를 배웠음을 시사합니다.
  • 다재다능함: 그들은 "스마트 편집자"가 지시를 적응하도록 함으로써 창고 비디오와 터널에서의 싸움과 같은 공공 안전 영상에서도 시스템이 작동함을 보여주었습니다. 이는 인간의 재설계 없이도 다른 환경을 처리할 수 있음을 입증했습니다.

간단히 말해: MAVEN은 지저분한 비디오를 완벽하고 구조화된 이야기로 변환하고, 그 이야기를 사용하여 로봇에게 논리적으로 사고하는 법을 가르치며, 새로운 환경에 자동으로 적응할 수 있는 자기 수정형 편집자를 갖춘 시스템입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →