← 최신 논문
💻 computer science

Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval

본 논문은 무관한 비디오 클립을 필터링하기 위한 텍스트 조건부 디노이징(Text-Conditioned Denoising) 모듈과 보조 감독을 위한 텍스트 재구성 피드백(Text-Reconstruction Feedback) 모듈을 채택하여 벤치마크 데이터셋에서 최첨단 성능을 달성하는 새로운 패러다임인 Denoise-then-Retrieve Network (DRNet)를 제안한다.

원저자: Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

게시일 2026-08-07
📖 2 분 읽기☕ 가벼운 읽기

원저자: Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 가족 휴가 때 찍은 방대한 양의 편집되지 않은 홈 비디오에서 특정 장면을 찾으려고 한다고 상상해 보십시오. 당신에게는 "강아지가 수영장으로 뛰어드는 순간"과 같은 텍는 단서가 있습니다. 컴퓨터 과학의 세계에서 이 작업은 **비디오 모먼트 리트리벌(Video Moment Retrieval)**이라고 불립니다. 이는 컴퓨터가 이미지와 언어를 모두 이해하여 긴 비디오에서 정확히 언제 어떤 사건이 발생하는지 찾아내는 인공지능의 한 분야입니다. 문제는 대부분의 비디오가 "노이즈"로 가득 차 있다는 점입니다. 즉, 검색하려는 내용과는 아무런 관련이 없는 풍경, 사람들이 지나다니는 모습, 혹은 무관한 대화 등이 몇 시간 동안 이어집니다. 만약 컴퓨터가 비디오의 모든 초를 똑같이 분석하려고 시도한다면, 바람에 흩날리는 건초 더미 속에서 바늘을 찾는 것처럼 무관한 것들에 압도되어 버릴 것입니다. 연구자들은 더 나은 비디오 "검색 엔진"을 구축하기 위해 노력해 왔지만, 기존의 많은 방식은 비디오 속의 쓰레기 정보에 주의를 빼앗겨 부정확한 결과를 내놓곤 합니다.

이 논문은 **"디노이즈 덴 리트리브(Denoise-then-Retrieve, 노이즈 제거 후 검색)"**라고 불리는 영리한 새로운 전략을 소개합니다. 건초 더미가 여전히 어지러운 상태에서 바늘을 찾으려 하는 대신, 저자들은 두 단계의 과정을 제안합니다. 먼저, 쓰레기를 버려서 건초 더미를 깨끗하게 만든 다음, 그제야 바늘을 찾는 것입니다. 그들은 스마트한 필터 역할을 하는 DRNet(Denoise-then-Retrieve Network)이라는 시스템을 구축했습니다. 컴퓨터가 질문에 답하기 전, 이 시스템은 텍스트 쿼리를 사용하여 비디오를 스캔하고 "노이즈 마스크"를 생성합니다. 이 마스크는 마치 마법의 선글라스처럼 작동하여, 지루하거나 무관한 부분(예: 하늘이나 옆을 지나가는 사람)은 즉시 흐릿하게 만들고, 설명과 실제로 일치하는 클립(예: 강아지가 뛰어드는 장면)만을 강조합니다.

이 논문은 컴퓨터가 비디오의 모든 클립을 똑같이 중요하게 취급하는 기존의 방식에 반론을 제기합니다. 저자들은 대부분의 비디오에서 실제 "대상 모먼트"가 차지하는 시간은 30% 미만인 반면, "노이즈"가 섞인 클립이 대다수를 차지한다는 것을 보여줍니다. 컴퓨터가 먼저 노이즈를 무시하도록 강제함으로써, 시스템은 관련 있는 부분에 자신의 연산 능력을 집중할 수 있습니다. 이 필터링이 제대로 작동하는지 확인하기 위해, 시스템에는 내장된 "자기 점검" 기능도 있습니다. 시스템은 정제된 비디오 클립만을 사용하여 원래의 텍스트 단서를 다시 작성해 봅니다. 만약 재작성된 단서가 원래의 단서와 일치하지 않는다면, 시스템은 중요한 것을 걸러냈거나 너무 많은 쓰레기를 남겨두었다는 것을 인지하고 스스로를 조정합니다.

결과는 매우 유망합니다. 두 가지 인기 있는 비디오 데이터셋인 Charades-STAQVHighlights에서 테스트했을 때, 이 새로운 방식은 모든 지표에서 기존의 가장 뛰어난 기술들을 능가했습니다. 예를 들어, Charades-STA 데이터셋에서 이 새로운 방식은 가장 근접했던 경쟁 모델보다 정확도를 4.36 퍼센트 포인트 향상시켰습니다. 또한 저자들은 이러한 "먼저 깨끗하게 만든 뒤 찾는다"는 아이디어가 자신들의 시스템에만 좋은 것이 아니라, 다른 기존 비디오 검색 모델에 적용했을 때도 그 모델들의 성능을 높일 수 있다는 것을 발견했습니다. 요컨대, 이 논문은 비디오에서 올바른 순간을 찾는 비결은 단순히 모든 것을 더 열심히 보는 것이 아니라, 중요하지 않은 것들을 무시하는 법을 배우는 것임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →