← 최신 논문
💻 computer science

CoT-Edit: Let CoT Guide Instruction Video Editing

CoT-Edit는 사고의 사슬(Chain-of-Thought) 기능이 강화된 멀티모달 거대 언어 모델을 활용하여 정밀한 공간적 사전 정보와 속성이 풍부한 지시어를 생성함으로써, 복잡한 장면에서도 객체 위치 지정, 물리적 일관성 및 시간적 일관성이 향상된 텍스트 기반 비디오 편집을 가능하게 하는 계획 가이드 편집 프레임워크를 도입한다.

원저자: Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 홈 비디오를 편집하는 법을 가르치려 한다고 상상해 보세요. 복잡한 소프트웨어를 배우느라 몇 시간을 허비하고 싶지는 않을 것입니다. 그저 "강아지가 슈퍼히어로처럼 날게 해줘"라고 말하기만 하면 바로 실행되기를 바랄 뿐이죠. 이것이 바로 **지시 기반 비디오 편집(instruction-based video editing)**의 꿈입니다. 컴퓨터가 당신의 자연어 명령을 이해하고, 그 명령에 맞춰 비디오의 픽셀을 변경하도록 시도하는 분야죠. 하지만 여기 함정이 있습니다. 컴퓨터는 '상식'에 매우 취약하다는 점입니다. 만약 당신이 로봇에게 "UFO가 원을 그리며 날아가는 장면을 추가해"라고 말한다면, 로봇은 중력을 무시한 채 하늘에 단순히 UFO 이미지를 붙여버리거나, 장면에 개가 두 마리 있을 경우 엉뚱한 개를 고양이로 바꿔버릴 수도 있습니다. 이는 마치 요리사에게 어떤 향신료를 얼마나 넣어야 할지도 알려주지 않은 채 "향신료를 좀 넣어라"라고 레시피를 주는 것과 같습니다. 결과는 대개 엉망진창이 되기 마련이죠. 이를 해결하기 위해 연구자들은 모호한 인간의 언어와 비디오 속 정밀한 물리적 행동 사이의 간극을 메우려 노력하고 있습니다. 공이 던져졌다면 공이 물리 법칙을 따르게 하고, 특정 물체를 지칭했다면 컴퓨터가 정확히 어떤 물체인지 알 수 있도록 말이죠.

여기, 비디오 편집을 위한 명석한 단계별 프로젝트 매니저 역할을 하는 새로운 방법론인 CoT-Edit가 등장했습니다. CoT-Edit는 단순히 명령을 외치고 컴퓨터가 제대로 알아듣기를 기도하는 대신, AI가 "행동하기 전에 먼저 생각하도록" 강제합니다. 저자들은 **Plan–Guide–Edit(계획-가이드-편집)**라고 불리는 3단계 프레임워크를 제안합니다. 먼저, Planner(매우 똑똑한 AI 두뇌)는 비디오와 당신의 텍text 명령을 살펴봅니다. 이 단계에서 AI는 단순히 추측하는 것이 아니라, **연쇄 사고(Chain-of-Thought, CoT)**라는 기법을 사용하여 작업을 세분화합니다. AI는 장면을 분석하기 위해 구조화된 추론 단계를 수행합니다: "강아지가 무엇을 하고 있는가? 위치는 어디인가? 만약 내가 UFO를 추가한다면, 실제처럼 보이려면 어디로 날아가야 하는가?" 그런 다음, 객체를 표시하기 위한 일련의 정규화된 경계 상자(bounding boxes)를 생성하고, "UFO는 곡선 경로를 따라 움직여야 한다"와 같은 물리적 규칙을 포함한 더 상세하고 "풍부한" 지침을 작성합니다.

다음으로, Guide는 이 경계 상자들을 실제 마스크(masks)로 변환합니다. 이는 컴퓨터에게 어디에서 작업해야 할지를 알려주는 디지털 스텐실이나 오려낸 모양이라고 생각하면 됩니다. 이제 컴퓨터는 모호한 아이디어 대신 명확한 지도(상자)를 가지고 있기 때문에, 어떤 개를 바꿀지 혹은 새로운 객체가 어디에 놓여야 할지를 추측할 필요가 없습니다. 마지막으로, Editor(예술가)는 이 스텐실과 상세한 지침을 사용하여 비디오에 새로운 콘텐츠를 그려 넣습니다. 이는 화가에게 "새를 그려라"라고 말하는 것과, "새의 윤곽선을 그리고, 색상을 지정하며, 새가 공중에 떠 있는 것이 아니라 나뭇가지 위에 앉아 있어야 한다"라는 규칙을 주는 것의 차이와 같습니다.

이 논문은 이러한 "선(先) 사고" 방식이 기존의 방법들보다 훨씬 더 효과적이라는 것을 밝혀냈습니다. 테스트 결과, CoT-Edit는 유사한 객체가 많을 때(예: 갈색 개 대신 노란색 개를 선택하는 것) 훨씬 더 뛰어난 선택 능력을 보였으며, 새로운 객체가 물리적으로 현실감 있게 움직이는 방식(예: 공이 올바르게 튀는 것)에서도 우수함을 입증했습니다. 연구진은 두 단계로 시스템을 학습시켰습니다: 첫째, 공개 데이터셋을 혼합하여 마스크 생성기와 편집기를 각각 따로 학습시켰고, 그다음 약 10만 개의 고품질 비디오 편집 쌍을 사용하여 두 모델을 함께 학습시켰습니다. 테스트 결과, CoT-Edit는 움직임의 부드러움과 사용자 지시 이행 능력 등 거의 모든 카테까지에서 다른 최고 수준의 방법들을 능가했습니다. 저자들은 "무엇을(what)" 하기 전에 "어디서(where)"와 "어떻게(how)"를 명시적으로 계획함으로써, 시각적으로 인상적일 뿐만 아니라 인간의 눈에 논리적으로도 타당해 보이는 비디오 편집을 만들 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →