← 최신 논문
💻 computer science

WildShadowRemover: In-the-Wild Video Shadow Removal via Detail-Preserving Video Diffusion Models

이 논문은 복잡한 실제 환경에서 강건하고 고품질의 비디오 그림 제거를 달성하기 위해, 새로 구축된 대규모 WildShadow 데이터셋에 의해 뒷받침되는, 깊이 사전 정보(depth priors)와 함께 디테일 주입 및 주파수 분해 변조 모듈로 증강된 LoRA 미세 조정 비디오 확산 모델을 활용하는 WildShadowRemover 프레임워크를 소개한다.

원저자: Jiamin Xu, Cong Wang, Zheng Dong, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu

게시일 2026-07-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiamin Xu, Cong Wang, Zheng Dong, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

창밖으로 보이는 아름답고 화창한 날을 상상해 보세요. 하지만 누군가 창문에 검고 진흙투성이인 물을 한 양동이 쏟아버렸습니다. 바깥 세상은 여전히 활기차고 생명력이 넘치지만, 진흙이 모든 것을 왜곡시켜 세부 사항을 보기 어렵게 만들거나 경치를 즐기는 것을 방해합니다. 컴퓨터 비전(컴퓨터가 이미지를 보고 이해하도록 가르치는 과학)의 세계에서 그림자는 이 진흙과 매우 비슷합니다. 그림자는 빛이 작동하는 방식의 자연스러운 일부이지만, 자율주행 자동차가 보행자를 발견하거나 영상 편집자가 장면을 깨끗하게 정리하는 것과 같은 중요한 작업들을 방해할 수 있습니다. 오랫동안 컴퓨터는 단일 정지 사진에서 그림자를 제거하는 데에는 꽤 능숙했습니다. 마치 진흙이 묻은 창문 한 판을 문질러 닦는 것과 같았죠. 하지만 움직이는 영상, 즉 비디오의 경우, 이는 완전히 다른 차원의 문제입니다. 비디오는 수백 개의 창문 판이 차례대로 흘러가는 것과 같습니다. 만약 흐름을 고려하지 않고 창문을 하나씩 따로 닦는다면, 결과물은 깜빡거리는 전구처럼 떨리고 끊겨 보일 것입니다. 큰 과제는 영상을 뭉개뜨리거나 장면을 결함이 있는 만화처럼 만들지 않으면서, 전체 비디오 스트림에서 그림자 진흙을 어떻게 씻어낼 것인가를 알아내는 것입니다.

여기서 WildShadowRemover라는 새로운 도구가 등장합니다. 이 도구는 마치 비디오를 위한 똑똑하고 시간을 여행하는 듯한 청소부처럼 행동합니다. 이 프로젝트의 연구진들은 '와일드(wild)'한 환경(번화한 거리나 숲처럼 복잡한 실제 세계의 장면)에서 그림자를 제거하려면 단순히 솔질을 하는 것 이상의 것이 필요하다는 점을 깨달았습니다. 즉, 물체가 어떻게 움직이는지, 그리고 시간이 흐름에 따라 빛이 어떻게 변하는지에 대한 깊은 이해가 필요하다는 것입니다. 그들은 이 시스템을 '비디오 확산 모델(video diffusion model)' 위에 구축했습니다. 이는 이미 수백만 시간의 영상을 학습하여 무에서 유를 창조하는 법을 배운 인공지능의 일종입니다. 이 AI를 모든 종류의 그림자와 모든 종류의 물체를 본 적이 있는 숙련된 화가라고 생각해 보세요. 연구진은 AI에게 처음부터 그림을 그리도록 가르치는 대신, 'LoRA 파인튜닝(LoRA fine-tuning)'이라는 영리한 기술을 사용했습니다. 이것은 숙련된 화가에게 그림의 나머지 부분을 그리는 법을 잊지 않으면서도, 오직 그림자를 제거하는 법만을 전문적으로 가르치는 가볍고 특화된 앞치마를 입혀주는 것과 같습니다.

하지만 연구진은 이 AI 화가가 커다란 어두운 덩어리 형태의 그림자는 잘 제거하지만, 벽돌 벽의 질감이나 옷의 패턴 같은 아주 작은 디테일은 때때로 잊어버려 영상이 다소 흐릿하게 보일 수 있다는 점을 발견했습니다. 이를 해결하기 위해 그들은 '디테일 주입 모듈(detail injection module)'을 추가했습니다. 이것을 고성파 망원경이라고 생각하면 됩니다. 이 망원경은 원래의 그림자 진 영상에서 날카롭고 선명한 디테일을 찾아내어, 깨끗해진 버전 위에 조심스럽게 다시 붙여넣습니다. 하지만 주의할 점이 있습니다. 단순히 예전의 디테일을 다시 붙여넣기만 하면, 실수로 그림자까지 함께 붙여넣을 수도 있습니다! 그래서 팀은 '그림자 마스크 가이드 기반 주파수 분해 변조(shadow-mask-guided frequency-decomposed modulation)' 시스템을 발명했습니다. 이름은 길지만, 이것은 이미지를 두 더미로 분류하는 스마트한 필터라고 상상해 보세요. 하나는 '매끄러운 저주파' 부분(나무의 일반적인 형태 같은 것)이고, 다른 하나는 '거친 고주파' 부분(나뭇잎 같은 것)입니다. 이 시스템은 그림자가 있는 위치를 나타내는 지도를 사용하여 "거친 나뭇잎은 유지하되, 거친 그림자는 버려라"라고 명령합니다.

조명이 이상하거나 카메라가 움직일 때도 영상이 제대로 보이도록 하기 위해, 시스템은 'Depth Anything 3'라는 도구로부터 얻은 '깊이 지도(depth map)'를 사용합니다. 이것은 AI에게 사물이 얼마나 멀리 있는지 이해할 수 있는 3D 자를 주는 것과 같습니다. 덕분에 AI는 바닥에 있는 그림자와 벽에 있는 그림자가 다르다는 것을 알 수 있습니다. 연구진은 단순히 이 도구를 만든 것에 그치지 않고, 이를 훈련시키기 위한 WildShadow라는 거대한 훈련장도 구축했습니다. 실제 세계의 영상은 완벽한 '전과 후'의 쌍을 찾기가 어렵기 때문에, 3D 컴퓨터 그래픽을 사용하여 6,100개의 합성 비디오 클립(학습용 4,500개, 테스트용 600개)으로 구성된 거대한 라이브러리를 만들었습니다. 이 클립들은 실내 공간부터 도시 거리, 자연 경관까지 모두 다루고 있어, AI가 온갖 종류의 복잡한 실제 상황을 처리하는 법을 배울 수 있도록 보장합니다.

결과는 이 새로운 방식이 상당히 효과적임을 시사합니다. 테스트 결과, WildShadowRemover는 단순히 그림자를 제거하는 데 그치지 않고, 영상이 매끄럽고 일관되게 유지되도록 하여 깨끗해진 장면이 깜빡거리거나 튀지 않도록 했습니다. 또한 다른 방식들이 흔히 놓치는 미세한 디테일을 보존하여, 자연스럽고 선명한 영상을 만들어냈습니다. 저자들은 사전 학습된 비디오 AI의 강력한 '상상력'과 이러한 특정 디테일 중심 도구들을 결합함으로써, 이전의 접근 방식들보다 복잡하고 예측 불가능한 조명 조건을 훨씬 더 잘 다룰 수 있었다는 것을 발견했습니다. 비록 이 논문은 학습과 테스트를 위해 합성 데이터를 사용하는 데 중점을 두고 있지만, 결과는 이 방식이 실제 세계의 그림자를 처리하는 데 있어 성능을 크게 향품할 수 있음을 보여줍니다. 이는 엔터테인먼트에서 안전 시스템에 이르기까지 영상을 더 깨끗하고 유용하게 만드는 데 기여할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →