← 최신 논문
💻 computer science

ScaleVid: Geometry-Aware Video Object Scaling with Mesh-Free Inference

ScaleVid는 의사 소스 재구성(pseudo-source reconstruction)을 사용하여 전경의 3D 변형과 배경 보존을 분리함으로써, 추론 시 명시적인 3D 재구성 없이도 기하학적 인지 비디오 객체 스케일링을 달성하는 메쉬 프리(mesh-free) 2단계 학습 프레임워크를 도입하여 사실적인 비등방성 리사이징을 가능하게 한다.

원저자: Youze Huang, Penghui Ruan, Bojia Zi, Xianbiao Qi, Shihao Zhao, Rong Xiao

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Youze Huang, Penghui Ruan, Bojia Zi, Xianbiao Qi, Shihao Zhao, Rong Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 현실을 조종하는 마법의 리모컨을 들고 있다고 상상해 보세요. 당신은 고양이 영상을 향해 리모컨을 겨누고 버튼을 누릅니다. 그러자 갑자기 고양이가 두 배로 넓어지거나, 배경에 있는 자동차가 장난감 크기로 줄어듭니다. 이것이 바로 인공지능이 뒷받it는 "비디오 편집"의 꿈입니다. 오랫동안 컴퓨터는 사물의 '외형'을 바꾸는 것—예를 들어 셔츠를 빨간색으로 만들거나 사진에서 사람을 제거하는 것—에는 뛰어났습니다. 하지만 비디오 속 물체의 '형태'나 '크기'를 바꾸면서도 실제처럼 보이게 유지하는 것은 어떨까요? 그것은 마치 고무줄을 늘릴 때 끊어지거나 이상한 덩어리로 변하지 않게 하려는 것과 같습니다. 컴퓨터는 만약 자동차를 옆으로 늘린다면, 바퀴가 단순히 taffy(엿)처럼 늘어나는 것이 아니라 실제로 3D 공간에서 더 넓어지는 것처럼 보여야 하며, 그 뒤의 배경은 완벽하게 정지된 상태를 유지해야 한다는 것을 이해해야 합니다. 컴퓨터가 이를 잘못 파악하면, 물체가 녹아내리거나 불가능한 방식으로 떠다니는 듯한 글리치 가득한 악몽 같은 영상이 됩니다.

여기서 "ScaleVid"라는 새로운 아이디어가 등장합니다. 연구자들은 하나의 특정한 퍼즐을 해결하고자 했습니다: 즉, 복잡한 3D 모델을 먼저 구축할 필요 없이 비디오 속 객체의 크기를 조절하는(크게 만들거나, 작게 만들거나, 넓히거나, 높이는) 방법입니다. 보통 이런 종류의 크기 조절을 하려면, 사물을 스캔하고, 3D 메쉬(와이어프레임 뼈대와 같은 것)를 구축한 다음, 그 뼈대를 늘리고 다시 비디오를 그 위에 입히는 과정이 필요합니다. 이는 느리고 비용이 많이 들며 많은 수작업을 요구합니다. ScaleVid는 더 똑똑하고 빠른 방법을 제안합니다. 3D 모델을 만드는 대신, 이 방식은 2단계의 "훈련" 트릭을 사용합니다. 먼저, 컴퓨터가 단순한 2D 방식으로 사물을 늘리는 법(사진을 평평하게 찌그러뜨리는 것과 같은)을 배웁니다. 그다음, 3D 모델로 만든 가짜 "연습용" 비디오를 사용하여 이러한 늘림이 3D 공간에서 일어날 때 어떻게 보이는지를 학습합니다. 일단 훈련이 되면, 컴퓨터는 실제 비디오를 가져와 사용자가 원하는 대로 사물을 늘리고, 배경을 완벽하게 채워 넣을 수 있습니다. 이 모든 과정은 실제 편집 과정에서 3D 모델을 전혀 구축하지 않고도 이루어집니다.

"ScaleVid: Mesh-Free 추론을 통한 기하학적 인지 비디오 객체 스케일링(ScaleVid: Geometry-Aware Video Object Scaling with Mesh-Free Inference)"이라는 제목의 이 논문은 작업을 두 개의 뚜렷한 단계로 나누어 이 문제를 해결한다고 설명합니다. 저자들은 기존 방식들이 텍로 프롬프트에 의존하거나(프롬프트는 "그것을 크게 만들어라"라고 말할 때 얼마나 크게 할지 말하지 않는 것처럼 모호한 경우가 많습니다), 무거운 3D 재구성이 필요하다(실시간 사용에는 너무 느립니다)고 주장합니다. ScaleVid는 "점진적인" 접근 방식을 제안합니다. 첫 번째 단계에서 시스템은 직사각형을 늘리는 것과 같은 단순하고 평면적인(2D) 변화를 처리하는 법을 배웁니다. 이는 배경을 안정적으로 유지하면서 객체를 변화시키는 법을 가르쳐 줍니다. 두 번째 단계에서 시스템은 진정한 3D 변형을 다루는 법을 배웁니다. 여기서 시스템은 비디오를 받아 사용자 지시(예: "너비를 1.5배, 높이를 0.8배로 늘려라")에 따라 특정 3D 늘림을 적용하는 특별한 "Deformer(변형기)" 모듈을 사용합니다. 결정적으로, 시스템은 3D 모델을 늘린 후 비디오 형식으로 렌더링하여 만든 "의사 소스(pseudo-sources)"를 사용하여 훈련됩니다. 이를 통해 AI는 실제 세계의 비디오(이미 크기가 조절된 객체가 포함된 비디오는 찾기가 거의 불가능합니다)를 필요로 하지 않고도 3D 기하학의 규칙을 학습할 수 있습니다.

결과는 매우 인상적입니다. 투명한 유리 잔부터 복잡한 자동차에 이르기까지 다양한 객체에 대해 테스트했을 때, ScaleVid는 기하학적 형태가 올바르게 보이도록 크기를 조절해 냈습니다. 예를 들어, 자동차의 깊이(depth)를 늘리면, 단순한 2D 늘림으로는 할 수 없는, 물리적으로 타당한 방식으로 뒷바퀴가 보이게 됩니다. 논문은 ScaleVid가 객체의 정체성(여전히 같은 자동차로 보이되 크기만 커진 상태)을 유지하고 배경을 보존하는 데 있어 다른 방법들보다 우수함을 보여줍니다. 저자들은 여러 지표를 통해 측정하였으며, 이 방식이 0.804(IoU)의 스케일 정확도 점수와 요(yaw) 값에 대해 단 0.237도의 기하학적 정렬 오차를 달enc하여, "DiffHandles"나 "GeoDiffuser"와 같은 경쟁 모델보다 훨씬 뛰어난 성과를 거두었음을 밝혔습니다.

하지만 논문은 이것이 모든 것을 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 명시하고 있습니다. 시스템에는 여전히 한계가 있습니다. 만약 객체가 완벽한 구(sphere)나 원기둥처럼 매우 대칭적이라면, 컴퓨터는 어느 쪽이 "너비"이고 어느 쪽이 "깊이"인지 혼동하여 모호한 결과를 초래할 수 있습니다. 또한, 객체가 크게 줄어드는 경우, 시스템은 이전에 객체 뒤에 숨겨져 있던 배경을 "발명(invent)"해야 하며, 때로는 그 새로운 영역에서 이상한 세부 사항을 환각(hallucinate)하기도 합니다. 저자들은 자신의 방법이 큰 진전이지만, 향-후 연구는 이러한 "발명" 작업들을 더 잘 처리하고, 까다로운 모양에 대해서도 3D 늘림을 더 견고하게 만드는 데 집중할 수 있다고 제안합니다.

본질적으로, ScaleVid는 간단하고 가짜인 재료로 먼저 요리 연습을 한 다음, 그 기술을 실제 신선한 재료에 적용하는 숙련된 요리사와 같습니다. "늘리는" 로직과 "그리는" 로직을 분리함으로써, 연구자들은 메시가 없는(mesh-free) 빠른 방식으로는 도달하기 어려웠던 기하학적 사실성을 가진 비디오 객체 크기 조절 시스템을 만들어냈습니다. 이는 우리가 항상 완전한 3D 세계를 구축할 필요는 없다는 것을 시사합니다. 때로는 영리한 훈련을 통해 AI에게 3D 공간의 '규칙'을 가르치는 것만으로도 충분히 마법을 부릴 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →