← 최신 논문
💻 computer science

VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

본 논문은 실제 세계의 비디오 편집 지식과 운영적 추론에 대한 대규모 멀티모달 모델의 능력을 평가하기 위해 3,900 개의 고품질 편집 영상과 3,080 개의 인간 검증 QA 쌍으로 구성된 최초의 포괄적인 벤치마크인 VEBench 를 소개하며, 이는 현재 모델과 인간 수준의 편집 인지 능력 사이에 상당한 성능 격차가 있음을 드러냅니다.

원저자: Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

영화 편집자가 되어 있다고 상상해 보세요. 당신의 일은 단순히 영화를 보는 것이 아니라, 감독이 왜 한 장면에서 다른 장면으로 전환했는지 이해하고, 이야기를 완성하기 위해 완벽한 누락된 영상 조각을 찾아내는 것입니다.

이 논문은 인공지능 (AI) 이 이 일을 얼마나 잘 해낼 수 있는지 테스트하기 위해 설계된 새로운 '최종 시험'인 VEBENCH를 소개합니다. 연구원들은 오늘날 가장 똑똑한 AI 모델조차도 사전을 외웠지만 실제로 영화를 편집해 본 적은 없는 학생들과 같다고 발견했습니다. AI 는 장면을 묘사할 수는 있지만, 두 개의 서로 다른 영상 클립을 이어붙일 때의 리듬, 소리, 혹은 논리를 이해하는 데는 어려움을 겪습니다.

다음은 간단한 비유를 사용하여 이 논문의 핵심 아이디어를 정리한 것입니다:

1. 문제: AI 는 '창의적인 편집자'가 아닌 '수동적인 관찰자'입니다

현재의 AI 모델은 단일 영상을 보고 무슨 일이 일어났는지 (예: "개가 달리고 있다") 알려주는 데는 뛰어납니다. 하지만 실제 영상 편집은 다릅니다. 이는 능동적인 추론을 요구합니다.

  • 비유: 문법 규칙을 완벽하게 암송할 수 있는 학생이 시를 쓰라고 하면 얼어붙는 상황을 상상해 보세요. 마찬가지로 AI 는 영상 속의 '점프'를 인식할 수는 있지만, 편집자가 왜 점프를 했는지, 혹은 어떤 분위기에 맞는 다음 클립을 어떻게 찾아야 하는지는 이해하지 못합니다.
  • 격차: 이 논문은 AI 가 시각과 청각 인식 능력은 향상되고 있지만, 편집의 '창의적 논리' 측면에서는 여전히 형편없음을 보여줍니다.

2. 해결책: 두 부분으로 구성된 시험 (VEBENCH)

이를 해결하기 위해 연구원들은 VEBENCH라는 벤치마크를 구축했습니다. 이는 AI 를 위한 운전 면허 시험과 같지만, 대신 자동차를 운전하는 것이 아니라 AI 가 편집자의 타임라인을 '운전'해야 합니다. 이는 두 가지 주요 과제를 포함합니다:

A 부: '속임수 찾기' 시험 (기법 인식)

  • 과제: AI 는 영상을 보고 J-컷(다음 장면의 소리가 화면에 나타나기 전에 들리는 기법) 이나 스매시 컷(완전히 다른 장면으로 갑자기 거슬리는 전환) 과 같은 특정 편집 기법을 식별해야 합니다.
  • 도전 과제: 단순히 화면의 변화를 보는 것만으로는 부족합니다. AI 는 소리를 듣고 리듬을 느껴야 합니다.
  • 결과: AI 는 여기서 고전했습니다. 인간 편집자에게 "이 소리가 길을 안내하고 있어!"라고 알려주는 미묘한 오디오 단서들을 종종 놓쳤습니다.

B 부: '퍼즐 조각' 시험 (작동 시뮬레이션)

  • 과제: 이것이 더 어려운 부분입니다. AI 에게는 '참조 영상'(예: 영화에 대해 이야기하는 배우의 클립) 이 제공됩니다. 그다음 네 개의 다른 영상 클립 (옵션 A, B, C, D) 이 제시됩니다. AI 는 완벽하게 들어맞는 단 하나의 클립을 선택하고, 그 클립의 정확한 위치를 지적해야 합니다.
  • 비유: 레고 성을 짓고 있다고 상상해 보세요. 방금 지은 탑 (참조 영상) 이 있습니다. 네 가지 다른 벽돌 더미를 handed 받았습니다. 당신은 지붕을 완성할 수 있는 정확한 벽돌이 들어있는 더미를 골라야 하며, 필요한 특정 벽돌을 가리켜야 합니다.
  • 결과: AI 는 여기서 극적으로 실패했습니다. 종종 완전히 잘못된 벽돌 더미를 선택하거나, 잘못된 위치를 가리켰습니다. 인터뷰와 영화 클립 사이의 스토리 연결고리를 이해하지 못했습니다.

3. 데이터셋: '실제' 편집의 거대한 도서관

이 시험을 만들기 위해 연구원들은 가짜 영상을 만든 것이 아니라, 인터뷰와 영화 클립 등에서 3,900 개의 실제 편집된 영상(257 시간 이상의 영상) 을 수집했습니다.

  • 과정: 그들은 'Human-in-the-Loop(인간 개입)' 시스템을 사용했습니다. 전문가 편집자 팀이 AI 와 협력하여 모든 컷, 전환, 음향 효과를 하나하나 레이블링했다고 상상해 보세요. 이렇게 하여 시험이 정확하고 공정하도록 보장했습니다.
  • 규모: 이는 AI 가 한 번에 하나의 영상만 분석하는 것이 아니라, 여러 다른 영상 소스를 가로질러 추론하여 이야기를 구축하도록 요구한 최초의 시험입니다.

4. 결과: AI 와 인간 사이의 큰 격차

연구원들은 VEBENCH 에서 세계 최고의 AI 모델들 (Gemini 및 다양한 오픈소스 모델 등) 을 테스트했습니다.

  • 점수: 결과는 겸손하게 만들었습니다. 최고의 모델조차 인간 수준보다 훨씬 낮은 성능을 보였습니다.
  • '오디오' 요인: 논문은 AI 가 영상을 '들을' 수 없거나 (또는 자막이 제거된 경우) 성능이 떨어졌음을 발견했습니다. 이는 편집이 단순히 그림에 관한 것이 아니라, 소리와 시각 사이의 춤에 관한 것임을 증명합니다.
  • '시간' 요인: AI 는 컷할 정확한 순간을 찾는 데 형편없었습니다. 올바른 순간이 실제로 영상 중간에 있을 때, 영상 시작 부분을 추측하는 식이었습니다. 마치 기차를 타려는데 역에 한 시간 일찍 또는 늦게 도착하는 것과 같습니다.

요약

VEBENCH는 현실적인 점검입니다. 이는 AI 가 자신이 보는 것을 설명하는 데는 능숙해지고 있지만, 편집의 예술을 이해하는 데는 여전히 매우 멀었음을 보여줍니다. AI 는 아직 소리와 시각, 스토리를 매끄러운 경험으로 엮어내는 방법을 아는 인간 편집자처럼 생각할 수 없습니다. 이 벤치마크는 이제 창의성과 논리로 실제로 '편집'할 수 있는 차세대 AI 를 구축하는 데 연구원들을 돕기 위해 제공됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →