From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation
이 논문은 깊이 및 표면 법선 예측을 공유된 멀티모달 디퓨전 트랜스포머 백본 내의 구조화된 시각적 감독으로 통합함으로써, 유용한 구조적 지식을 다운스트림 생성 작업으로 전이하여 정밀하고 시간적으로 일관된 편집을 향상시키는 통합 이미지 및 비디오 생성 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 단순히 설명으로부터 그림을 그리는 것을 넘어, 기존의 비디오를 가져와서 비 오는 날을 화창한 날로 바꾸거나 달리는 강아지를 추가하는 것처럼 특정 세부 사항을 변경할 수 있는 세상을 상상해 보십시오. 이는 인공지능이 단일한 지침 세트로부터 이미지와 비디오 모두를 생성하고 편집하는 법을 배우는 분야인, 통합적 시각 창작의 약속입니다. 이러한 시스템이 제대로 작동하려면, "강아지를 추가하라"와 같은 단어의 의미뿐만 아니라 장면의 물리적 구조, 즉 물체가 어디에 있는지, 어떻게 겹쳐져 있는지, 그리고 시간이 흐름에 따라 어떻게 움직이는지도 이해해야 합니다. 이러한 구조적 이해가 없다면, 컴퓨터는 강아지를 추가하라는 명령은 수행할지 몰라도 옆에 서 있는 사람을 실수로 지워버리거나, 비디오가 재생되는 동안 새로운 동물이 나타났다 사라졌다 하며 깜빡거리게 만들 수 있습니다. 과제는 단일 모델이 다양한 명령을 따르면서도 시각적 세계의 기저에 깔린 기하학적 구조와 정체성을 온전히 유지하도록 가르치는 것이었습니다.
연구진은 컴퓨터가 세상을 창조하는 법을 배우는 동시에 세상을 3차원으로 보는 법을 가르치는 새로운 접근 방식을 개발했습니다. 모델에게 단순히 이미지나 비디오 쌍을 보여주고 변화를 추측하게 하는 대신, 연구팀은 새로운 학습 층을 추가했습니다. 그들은 모델에게 처리하는 모든 이미지에 대해 두 가지 특정 사항, 즉 사물이 얼마나 멀리 있는지 알려주는 장면의 깊이(depth)와 벽의 기울기나 공의 곡률처럼 표면이 향하는 방향을 설명하는 표면 법선(surface normals)을 예측하도록 요청했습니다. 이러한 예측이 최종 목표는 아닙니다. 연구진은 최고의 3D 스캐너를 만들려는 것이 아닙니다. 대신, 이 작업들을 이미지의 숨겨진 골격을 주목하게 만드는 방법으로 사용합니다. 이러한 구조적 지도를 재구성하는 법을 배움으로써, 모델은 경계가 어디인지, 물체들이 서로 어떻게 관계를 맺고 있는지에 대한 감각을 익히며, 이는 나중에 콘텐츠를 편집하도록 요청받았을 때 세부 사항을 보존하는 데 도움을 줍니다.
이를 구현하기 위해 연구진은 명령의 의미와 그 명령이 따라야 할 시각적 증거를 분리하는 시스템을 구축했습니다. 시스템의 한 부분은 텍스트 지침을 읽고 의도를 이해하며, 다른 한 부분은 소스 이미지나 비디오의 실제 픽셀을 살펴봄으로써 공간적 세부 사항을 선명하게 유지합니다. 이 두 정보의 흐름은 새로운 콘텐츠를 생성하는 것을 학습하는 공유된 두뇌에서 결합됩니다. 결정적으로, 연구진은 훈련 데이터를 생성하기 위한 특별한 방법을 고안했습니다. 단순히 비디오의 첫 프레임을 편집하고 그 변화를 앞으로 복사하는 방식은 종로 오류를 초래하기 쉬우므로, 그들은 변화가 서로 다른 시점에 발생하는 비디오 쌍을 생성하도록 시스템을 가르쳤습니다. 어떤 비디오는 장면을 보여주고, 쌍이 되는 비디오는 변화가 중간에 시작되거나 클립이 끝나기 전에 끝나는 동일한 장면을 보여줍니다. 이는 모델에게 변화를 정확히 언제, 어디에 적용해야 하는지 가르쳐주어, 나머지 비디오가 안정적이고 일관되게 유지되도록 보장합니다.
이러한 접근 방식의 결과는 구조적 학습을 추가하는 것이 편집의 품질을 유의미하게 향상시킨다는 것을 보여줍니다. 표준적인 비디오 편집 작업 세트로 테스트했을 때, 추가 훈련을 받은 모델은 이전 시스템들보다 높은 점수를 기록했으며, 특히 배경을 방해하지 않고 국소적인 물체를 추가하거나 변경하는 작업에서 뛰어난 성능을 보였습니다. 개선 효과는 편집되지 않은 부분이 자연스럽고 안정적으로 보이게 하는 능력에서 가장 눈에 띄었습니다. 연구진은 이 방법이 텍-기반 또는 참조 이미지를 바탕으로 새로운 비디오를 처음부터 생성하는 것부터 기존 비디오를 편집하는 것에 이르기까지 광범an한 작업에 걸쳐 잘 작동한다는 것을 발견했습니다. 그들은 단일 모델이 이 모든 다양한 작업을 처리할 수 있으며, 현재 사용 가능한 다른 통합 시스템들을 능가하는 높은 종합 점수를 달성했음을 입증했습니다.
하지만 연구진은 자신들의 성공에 대한 한계를 명확히 규정하는 데 주의를 기울였습니다. 그들은 자신들의 목표가 깊이나 표면 각도를 측정하는 우수한 도구를 만드는 것이 아니었으며, 모델을 해당 특정 작업들에 대해 테스트하지 않았음을 명시적으로 밝혔습니다. 깊이와 법선 예측의 가치는 전적으로 그것들이 생성 과정을 돕는 방식에 달려 있으며, 지도 자체의 정확성에 있는 것이 아닙니다. 이 연구는 이러한 구조적 지식의 전이가 실재하며 측정 가능하다는 것을 시사하지만, 모델이 물리적 세계에 대한 일반적인 이해를 달성했다고 주장하는 것은 아닙니다. 시스템은 캐릭터가 변하거나 외형이 바뀌는 매우 긴 비디오에서 여전히 어려움을 겪을 수 있으며, 매우 작은 물체나 여러 참조 정보가 충돌하는 상황에서도 문제를 일으킬 수 있습니다. 이 연구는 시각적 편집을 더 신뢰할 수 있게 만드는 중요한 단계이며, 모델에게 장면의 구조를 이해하도록 가르치는 것이 그 모델을 더 나은 예술가로 만든다는 것을 보여줍니다. 비록 그 예술가가 아직 완벽한 건축가는 아닐지라도 말입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.