AgenticVBench: Can AI Agents Complete Real-World Post-Production Tasks?
본 논문은 업계 전문가의 자문을 바탕으로 구축된 100 개의 실제 비디오 후반 작업 과제로 구성된 AgenticVBench 를 소개하며, 이를 통해 최첨단 멀티모달 AI 에이전트들은 인간 전문가에 비해 성공률이 현저히 낮고 실행 환경의 선택에 매우 민감하다는 사실을 밝혀냈습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
영화 편집자가 되는 법을 로봇에게 가르치려 한다고 상상해 보세요. 단순히 영화에 대한 질문에 답하게 하는 것이 아니라, 실제로 영화를 만들게 하고 싶은 것입니다. 로봇은 장면을 잘라내고, 불량 오디오를 수정하며, 뒤죽박죽 섞인 클립을 재배열하고, 3 시간짜리 다큐멘터리를 60 초짜리 SNS 영상으로 다듬어야 합니다.
이 논문인 AgenticVBench는 이러한 직업을 배우려는 AI 로봇들을 위한 최종 시험과도 같습니다. 제작자들은 20 명의 인간 영화 전문가들이 수행한 실제 업무에 기반한 테스트를 구축했습니다. 그들이 무엇을 했으며 무엇을 발견했는지 간단한 비유를 통해 정리해 보겠습니다.
1. 테스트: "영화 편집자의 고난"
연구자들은 4 가지 범주로 나뉜 100 개의 구체적인 과제를 만들었습니다. 이는 영화 편집 워크숍의 4 개 다른 작업 구역과 같습니다.
- 조립 (퍼즐): 영화의 스토리보드 (영화의 만화 스케치) 와 비디오 클립 더미가 있다고 상상해 보세요. 당신의 임무는 스케치의 모든 그림에 정확히 맞는 클립을 고르는 것입니다. AI 는 단순히 "이게 개처럼 보이나요?"를 넘어 카메라 앵글과 샷 크기를 이해해야 합니다.
- 수리 (의사): 숨겨진 "질병" (기이한 메아리, 색상 결함, 또는 순서가 뒤바뀐 장면 등) 이 있는 비디오가 주어집니다. AI 는 그 질병을 찾아 고치고, 무엇을 했는지 설명하는 보고서를 작성해야 합니다.
- 연출 (시간 여행자): 이야기의 짧은 요약과 함께 순서가 뒤섞인 비디오 클립 더미가 주어집니다. AI 는 이야기가 논리적으로 이어지도록 클립을 올바른 연대순으로 재배열해야 합니다.
- 재활용 (축소): 3 시간짜리 긴 영화가 있고, 짧은 예고편이나 요약본을 만들라는 요청이 있습니다. AI 는 전체를 시청하고, 무엇을 남길지, 무엇을 잘라낼지 결정하며, "60 초여야 한다"거나 "재미있어야 한다"는 특정 규칙에 부합하는 새로운 짧은 영상을 조립해야 합니다.
2. 플레이어: AI 대 인간
연구자들은 현재 이용 가능한 가장 똑똑한 7 개의 AI "두뇌"(시각 - 언어 모델) 를 테스트했습니다. 그들은 이 두뇌들을 두 가지 유형의 "몸체"(하네스) 를 통해 실행했습니다.
- 네이티브 몸체: AI 회사들이 자체 모델을 위해 구축한 공식 도구들 (맞춤형으로 제작된 자동차와 같음).
- 오픈소스 몸체: 누구나 사용할 수 있도록 커뮤니티가 구축한 도구들 (일반적인 자동차 섀시와 같음).
또한 20 명의 인간 전문가들에게 동일한 과제를 수행하게 하여 인간이 얼마나 잘 수행해야 하는지에 대한 "골드 스탠더드"를 설정했습니다.
3. 결과: AI 는 여전히 초보입니다
결과는 AI 세계에 현실적인 경종을 울렸습니다.
- 점수: 최고의 AI 팀이 과제의 약 31% 만 올바르게 수행했습니다.
- 격차: 인간 전문가들의 점수는 훨씬 높았습니다 (과제에 따라 70
95%). 현재 AI 는 인간보다 **4365 퍼센트 포인트** 뒤처져 있습니다. - "몸체"의 중요성: AI 두뇌가 얼마나 똑똑한지만이 문제가 아니었습니다. AI 를 감싸는 소프트웨어 도구인 "몸체"도 똑같이 중요했습니다. 때로는 동일한 AI 두뇌가 한 도구 세트로 38% 점수를 받았다가 다른 도구 세트에서는 18% 점수만 받기도 했습니다. 이는 포뮬러 1 드라이버가 미니밴을 타고 있는 것과 같습니다. 드라이버는 훌륭하지만, 차가 그들을 제한합니다.
4. AI 가 넘어진 곳
이 논문은 AI 가 실패한 이유를 면밀히 조사하여 네 가지 주요 "나쁜 습관"을 발견했습니다.
- 도서관에서 길을 잃음 (긴 맥락 손실): "재활용" 작업 (긴 영상에서 짧은 영상을 만드는 것) 에서 AI 는 영화의 전체 대본을 읽으려 너무 바빠서 시간이 부족해지고 실제로 영상을 만들지 못했습니다. 이는 에세이를 쓰려는 대신 백과사전 전체를 읽는 학생과 같습니다.
- 나쁜 타이밍 (시간적 추론): "수리" 작업에서 AI 는 무엇이 잘못되었는지는 알았지만 언제 일어났는지는 파악하지 못했습니다. 올바른 음향 효과를 고치더라도 잘못된 장면에 적용하여 15 초에서 100 초까지 타이밍을 틀리게 만들었습니다.
- 잘못된 도구 (모달리티 불일치): AI 는 오디오 도구를 사용해 시각적 문제를 해결하려 하거나 그 반대를 시도했습니다.
- 환각: 때로는 존재하지 않는 장면을 만들어내거나, 결함이 수정되지 않았음에도 수정되었다고 주장하기도 했습니다.
5. 핵심 교훈
이 논문은 AI 가 이미지와 텍스트를 이해하는 능력은 향상되고 있지만, 영화 편집과 같은 복잡하고 다단계적인 창의적 업무를 계획하고 수행하는 능력에는 여전히 매우 멀었다고 결론 내립니다.
AI 를 단순히 "더 똑똑하게" 만드는 것만으로는 부족합니다. 논문은 AI 가 시간을 관리하고, 자신의 작업을 점검하며, 비디오 편집 소프트웨어를 올바르게 사용하는 방법을 이해하도록 돕는 더 나은 "도구상자"(하네스) 를 구축해야 한다고 주장합니다. 두뇌와 도구상자 모두를 고치지 않는 한, AI 영화 편집자는 감독이 아니라 중대한 인간의 감독이 필요한 보조 역할로 남을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.