Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
이 논문은 단순한 외형 변화를 넘어 지시어 기반의 비디오 편집 능력을 발전시키기 위해, 복잡한 멀티태스크 및 구조적 조작을 포함하는 200만 개의 지시어 정렬 비디오 편집 쌍으로 구성된 대규모 데이터셋인 Goku와 함께, Goku-Edit 모델 및 Goku-Bench 벤치마크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 "강아지가 더 빨리 뛰게 하고 하늘을 보라색으로 바꿔줘"와 같은 문장을 입력하기만 하면 영화 속 무엇이든 바꿀 수 있는 마법 같은 비디오 편집기를 가지고 있다고 상상해 보세요. 오랫동안 이러한 마법 도구들은 서투른 견습생 같았습니다. 셔츠 색상을 바꾸거나 불필요한 물체를 제거하는 일은 할 수 있었지만, 캐릭터를 방 저편으로 이동시키거나 카메라 각도를 바꾸라고 하면 혼란에 빠지거나, 멈춰버리거나, 엉망으로 만들어 버리곤 했습니다.
이 논문은 이러한 마법 편집기들을 진정한 숙련가로 훈련시키기 위해 설계된 거대한 새로운 프로젝트인 Goku를 소개합니다. 그들이 무엇을 했는지 아주 쉽게 설명해 드리겠습니다.
1. 문제점: "한 가지 기능만 하는" 데이터셋
이전의 AI 비디오 편집기를 위한 훈련 데이터는 자동차 색상을 바꾸는 법에 대해서만 다루는 책들로 가득 찬 도서관과 같았습니다. 만약 당신이 자동차를 운전하는 법(피사체 이동)이나 풍경을 바꾸는 법(카메라 움직임)을 배우고 싶다면, 그 도서관에는 관련 책이 하나도 없었습니다. AI 모델들은 단순히 '번호대로 색칠하기' 식의 작업만 할 줄 알았기에 성장이 멈춰 있었습니다.
2. 해결책: "Goku" 라이브러리
연구진은 200만 개의 비디오 쌍을 포함하는 거대하고 기술적인 라이브러리인 Goku를 구축했습니다. 이것은 AI를 위한 거대하고 첨단 기술이 집약된 훈련 체육관을 만드는 것과 같습니다.
- 내용물은 무엇인가? 기존의 라이브러리와 달리, 여기에는 복잡한 도전 과제들이 들어있습니다. 카메라가 주변을 회전하거나, 사람이 방 한쪽에서 다른 쪽으로 이동하거나, 여러 변화가 동시에 일어나는 영상(예: "셔츠를 바꾸고 모자를 써줘") 등이 포함됩니다.
- 어떻게 만들었나? 이 영상들을 단순히 촬영한 것이 아니라, 로봇 공장을 세워 만들어냈습니다. 그들은 고급 AI를 사용하여 복잡한 요청을 작고 관리 가능한 단계로 나누었습니다. 예를 들어, 강아지가 뛰게 만들려면 먼저 단일 이미지에서 강아지가 뛰는 법을 가르친 다음, 그 이미지가 영상 속에서 부드럽게 움직이도록 만드는 법을 가르쳤습니다.
- 품질 관리: 영상이 쓰레기가 되지 않도록 "3중 체크" 보안 시스템을 설치했습니다. 모든 영상은 지시 사항이 잘 지켜졌는지, 움직임이 실제처럼 보이는지, 영상에 오류가 없는지를 확인하기 위해 매우 똑똑한 AI(Gemini)에 의해 세 번씩 검사되었습니다. 연구진은 가장 뛰어난 200만 개만을 남기기 위해 약 88%의 시도를 폐기했습니다.
3. 새로운 도구: Goku-Edit
이 새로운 라이브러리를 바탕으로, 그들은 Goku-Edit라는 새로운 비디오 편집기를 만들었습니다.
- 두뇌: 이 편집기는 단순히 텍ak스트를 읽는 대신, "멀티모달 거대 언어 모델(MLLM)"을 사용합니다. 이는 편집기에게 단순히 키워드를 맞추는 수준을 넘어, 이야기와 지시 사항을 실제로 이해할 수 있는 두뇌를 주는 것과 같습니다.
- 두 손 방식: 가장 큰 혁신은 이 편집기가 함께 작동하는 두 개의 "손"을 가지고 있다는 점입니다.
- 손 A (설계자): 이 손은 변화가 일어날 위치에 대한 대략적인 지도(마스크)를 그립니다. 구조와 움직임에 집중합니다.
- 손 B (화가): 이 손은 디테일, 색상, 질감에 집중합니다.
- 왜 중요한가: "어디에서"와 "무엇을" 분리함으로써 편집기가 혼란을 겪지 않게 합니다. 덕분에 강아지의 털을 파랗게 칠해버리는 실수 없이, 강아지를 정확히 어디로 움직여야 할지 알 수 있습니다.
- "Spatial CFG": 이것은 일종의 안전망을 뜻하는 멋진 용어입니다. 편집기가 변화를 만들 때, 실수로 다른 부분까지 망쳐서 영상 전체를 망치는 일이 없도록 보장합니다. 이는 변화를 정밀하고 타이트하게 유지해 줍니다.
4. 테스트: Goku-Bench
새로운 편집기가 최고임을 증명하기 위해, 그들은 Goku-Bench라는 새로운 테스트를 만들었습니다.
- 단순한 테스트 대신, "고양이가 점프하는 동안 카메라를 왼쪽으로 움직여줘"와 같은 어려운 도전 과제 1,000개를 AI에게 주었습니다.
- 결과의 등급을 매기기 위해 "물리 법칙이 타당한가?", "카메라가 부드럽게 움직이는가?" 등을 확인하는 7가지 새로운 방식을 사용했습니다.
- 결과: Goku-Edit는 모든 오픈 소스 모델을 제치고 승리했으며, 지시 사항 이행 능력이 최대 8% 향상되었습니다. 특히 다른 모델들이 실패했던 움직임 처리나 복잡한 다단계 요청을 처리하는 데 탁월한 성능을 보였습니다.
요약
요약하자면, 이 논문은 다음과 같이 말합니다: "우리는 AI가 단순한 색상 교체가 아닌 복잡한 비디오 편집을 배울 수 있도록 가르치는 거대하고 고품질인 훈련 라이브러리(Goku)를 구축했습니다. 우리는 구조와 디테일을 별도로 이해하는 이중 시스템을 사용하는 새로운 편집기(Goku-Edit)를 만들었으며, 더 어렵고 새로운 테스트(Goku-Bench)를 통해 이것이 다른 어떤 것보다 뛰어나다는 것을 증명했습니다."
그들은 이 기술이 병원이나 특정 임상 용도로 사용될 준비가 되었다고 주장하지 않았습니다. 오직 비디오 편집을 더 똑똑하고, 유연하며, 복잡한 창의적 요청을 더 잘 처리할 수 있도록 만드는 데 집중했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.