YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal
YOSE 는 배치 가변 길이 인덱싱을 통해 필수 토큰을 적응적으로 선택하고 확산 과정 시뮬레이터로 마스크되지 않은 영역을 시뮬레이션하여 추론 속도를 가속화함으로써 시각적 품질을 유지하면서 최대 2.5 배의 속도 향상을 이루는 디트 기반 비디오 객체 제거를 위한 효율적인 파인튜닝 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
busy한 거리의 비디오를 가지고 있다고 상상해 보세요. 그리고 프레임 전체를 가로지르는 특정 인물을 제거하고 싶다고 가정해 봅시다. 과거에 이를 시도했던 AI 모델들은 마치 화가 팀처럼, 단순히 그 인물만 덮어씌우는 대신 전체 거리와 하늘, 그리고 배경의 모든 자동차를 변경할 때마다 매번 다시 칠하기로 결정하는 것과 같았습니다. 이는 90%의 비디오가 전혀 건드릴 필요가 없었기 때문에 매우 느리고 낭비적인 과정이었습니다.
이 논문은 YOSE(You Only Select Essential Tokens)라는 새로운 방법을 소개합니다. 이는 마치 지능적이고 외과적인 편집자처럼 작동합니다. 전체 캔버스를 다시 칠하는 대신, YOSE는 수리해야 할 특정 부분만 칠하면서도 새로운 페인트가 손대지 않은 부분과 완벽하게 어우러지도록 보장합니다.
다음은 YOSE 가 작동하는 방식을 간단한 개념으로 분해한 것입니다:
1. 문제: "전체 캔버스" 접근법
현재의 AI 비디오 도구들 (DiT 라는 것에 기반한) 은 객체 제거에는 매우 뛰어나지만 속도가 느립니다. 비디오에서 작은 새 하나만 제거하고 싶더라도 컴퓨터는 비디오의 모든 단일 픽셀을 처리합니다. 이는 견과류를 깨기 위해 망치를 사용하는 것과 같습니다. 논문은 기존 최고의 도구들조차 초당 약 10 프레임 (FPS) 만 실행할 수 있다고 지적합니다. 이는 실시간 사용에는 너무 느립니다.
2. 해결책: 두 가지 지능형 도구
YOSE 는 기존 AI 에 두 가지 특수한 "장치"를 추가하여 품질을 해치지 않으면서 속도를 높입니다.
장치 A: "지능형 자르기" (배치 가변 길이 인덱싱)
- 비유: 100 장의 숙제 종이 더미가 있는데, 그중 5 장에만 실수가 있다고 상상해 보세요. 일반적인 교사는 100 장을 하나씩 모두 채점합니다. 반면 YOSE 는 실수가 있는 5 장의 종이를 즉시 잘라내어 그것들만 채점한 뒤 다시 더미에 넣는 교사와 같습니다.
- 작동 원리: AI 는 변경하려는 영역인 "마스크"를 살펴봅니다. BVI라는 기법을 사용하여 해당 마스크 내부의 데이터 포인트 (토큰) 만 물리적으로 선택합니다. 무거운 작업을 하는 동안 비디오의 나머지 부분은 무시합니다. 이를 통해 컴퓨터는 객체의 크기에 따라 가변적인 수의 항목을 처리할 수 있게 되며, 고정된 거대한 수의 항목을 처리하는 것이 아닙니다.
장치 B: "유령 속삭임자" (확산 과정 시뮬레이터)
- 비유: 사람이 있던 작은 부분만 칠한다면, 새로운 페인트가 주변 거리의 조명이나 질감과 맞지 않는 스티커처럼 보일 수 있습니다. 새로운 페인트를 자연스럽게 섞으려면 나머지 거리가 어떻게 보이는지 알아야 합니다.
- 문제: 시간을 절약하기 위해 "나쁜" 부분을 잘라내면, AI 는 "좋은" 부분이 어떻게 보이는지 잊어버립니다. 맥락을 잃게 되는 것입니다.
- 해결책: YOSE 는 DiffSim이라는 모듈을 사용합니다. 이는 실제로 "좋은" 부분의 비디오를 처리하지 않습니다 (이는 느릴 것입니다). 대신, 그 좋은 부분들이 무엇을 하고 있는지에 대한 시뮬레이션이나 "유령"을 생성합니다. 이는 AI 에게 "여기 저 하늘은 파랗고, 저기 차는 왼쪽으로 움직이고 있어"라고 속삭여, AI 가 새로운 패치를 자연스럽게 섞을 수 있도록 합니다. 이는 전체 도시의 지도를 가지고 있으면서도 한 동네만 걷는 것과 같습니다.
3. "완벽한 이어붙임" (퓨전 전략)
유령 속삭임자가 있더라도 새 비디오와 기존 비디오가 만나는 곳에 아주 작은 눈에 보이는 선이 있을 수 있습니다. YOSE 는 마지막 트릭을 사용합니다: 가장자리를 약간 겹치게 하고 밝기와 색상 통계 (평균과 분산) 를 조정하여 전환을 보이지 않게 만듭니다. 이는 사진 컷아웃의 가장자리를 깎아 배경으로 사라지게 하는 것과 같습니다.
결과: 빠르고 깨끗함
논문에 따르면 이러한 트릭을 사용하면 다음과 같은 결과가 나옵니다:
- 속도: YOSE 는 이전 최고의 방법보다 2.5 배 더 빠릅니다. 이전 방법이 10 초가 걸렸다면 YOSE 는 약 4 초가 걸립니다.
- 확장성: 속도는 제거하는 객체의 크기에 따라 달라집니다. 작은 얼룩을 제거하면 매우 빠릅니다. 거대한 건물을 제거하면 속도가 느려지지만, 이전 방법보다 느려지지는 않습니다.
- 품질: 비디오 품질은 느리고 전체 처리를 하는 방법만큼이나 좋습니다. 사실, 배경을 건드리지 않기 때문에 (무심코 망치지 않기 때문에) 배경은 오히려 더 안정적으로 보이는 경우가 많습니다.
요약
YOSE 는 단일 객체를 제거하기 위해 전체 우주를 다시 시뮬레이션할 필요가 없다는 것을 깨닫는 "지능형 편집자"입니다. YOSE 는 수행할 필요가 없는 작업을 잘라내고, 무시한 부분의 맥락을 기억하기 위해 교묘한 시뮬레이션을 사용하며, 모든 것을 완벽하게 다시 이어붙여 구별할 수 없게 만듭니다. 이는 느리고 무거운 과정을 빠르고 외과적인 과정으로 바꿉니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.