← 최신 논문
💻 computer science

USV: Towards Understanding the User-generated Short-form Videos

본 논문은 주제 인식 및 비디오-텍스트 검색 과제를 수립하고 제안된 베이스라인 모델과 포괄적인 벤치마크를 수반하여 고수준 의미론적 비디오 이해를 발전시키기 위해 설계된 224K 개의 사용자 생성 숏폼 비디오로 구성된 대규모 데이터셋인 USV 를 소개합니다.

원저자: Haoyue Cheng, Su Xu, Liwei Jin, Wayne Wu, Chen Qian, Limin Wang

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haoyue Cheng, Su Xu, Liwei Jin, Wayne Wu, Chen Qian, Limin Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 거대하고 혼란스러운 도서관이라고 상상해 보세요. 오랫동안 '비디오 이해'를 연구해 온 연구자들은 할리우드 영화나 전문 다큐멘터리처럼 보이는 책들을 정리해 왔습니다. 이 책들은 잘 쓰여 있고, 명확하게 라벨이 붙어 있으며, 엄격한 규칙을 따릅니다. 하지만 최근 이 도서관의 새롭고 야생적인 섹션이 폭발적으로 성장했습니다: 사용자 생성 숏폼 비디오(틱톡, 인스타그램 릴스, 콰이 등을 생각하세요). 이들은 다듬어진 영화가 아닙니다. 매일 수백만 개의 일반인이 만든 빠르고 messy하며 창의적인 클립들입니다.

지금까지 아무도 이 새로운 섹션을 위한 적절한 지도를 만들지 못했습니다. **"USV: 사용자 생성 숏폼 비디오 이해를 위한 시도"**라는 제목의 이 논문이 바로 그 지도를 마침내 만든 팀입니다.

다음은 그들의 작업을 간단한 용어로 정리한 내용입니다:

1. 문제: 도서관이 너무 지저분하다

저자들은 기존 비디오 데이터셋이 백과사전 도서관과 같다고 설명합니다. 이들은 긴 전문 비디오에서 특정 행동(예: "사람이 점프하는 것")을 인식하는 데 초점을 맞춥니다. 하지만 새로운 숏폼 비디오는 다릅니다:

  • 짧고 집중되어 있습니다: 15 초 클립은 보통 복잡한 줄거리가 아니라 하나의 주요 아이디어(예: "ASMR"이나 "재미있는 고양이") 만 담고 있습니다.
  • 텍스트가 많습니다: 무슨 일이 일어나고 있는지 설명하는 제목, 자막, 댓글로 가득 차 있습니다.
  • 혼란스럽습니다: 매일 수백만 개가 업로드됩니다. 하나하나 수동으로 확인하고 라벨을 붙이는 것은 인간에게 수백 년이 걸릴 것입니다.
  • 다양합니다: 춤추는 사람들뿐만 아니라 강의, 슬라이드, 팟캐스트, 기이한 실험들도 포함됩니다.

2. 해결책: USV 데이터셋

이 팀은 USV-1.0이라는 새로운 데이터셋을 만들었습니다.

  • 수집 방법: 사람들이 비디오를 보고 라벨을 붙이는 것 (너무 느림) 대신 "웹 감독" 트릭을 사용했습니다. 비디오 플랫폼에 "ASMR'이나'블록체인'에 관한 모든 비디오를 보여줘"라고 요청했습니다. 플랫폼의 자체 검색 엔진이 작업을 수행한 것입니다.
  • 결과: 212 개의 서로 다른 주제를 아우르는 224,000 개의 비디오를 수집했습니다.
  • 단점: 모든 비디오를 수동으로 확인하지 않았기 때문에 데이터셋은 "노이즈가 많습니다". 'ASMR'로 라벨링된 일부 비디오는 실제로는 다른 것에 관한 것일 수 있습니다. 하지만 저자들은 이 노이즈가 현실 세계의 현실적인 표현이라고 주장하며, 작고 완벽한 데이터셋보다 크고 약간 지저분한 데이터셋이 낫다고 말합니다.

3. 새로운 게임: 두 가지 새로운 도전

컴퓨터가 이 지저분한 도서관을 이해할 수 있는지 테스트하기 위해 저자들은 두 가지 새로운 "게임"(작업) 을 고안했습니다:

게임 A: 주제 인식 ("이게 뭐지?" 게임)

  • 목표: 비디오를 보고 주요 주제를 추측하세요 (예: "이게 요리에 관한 건가 여행에 관한 건가?").
  • 반전: 그림만 보면 안 됩니다. 오디오를 듣고 자막도 읽어야 합니다. 비디오가 해변처럼 보일지라도 오디오가 "경제학"에 대한 강의라면 주제는 경제학입니다.
  • 도구: 그들은 **멀티 모달리티 퓨전 네트워크 (MMF-Net)**를 구축했습니다. 비디오를 위한 한 눈, 소리를 위한 한 귀, 텍스트를 읽기 위한 한 뇌를 가진 세 개의 머리를 가진 로봇이라고 상상해 보세요. 이 세 가지를 결합하여 현명한 추측을 합니다.

게임 B: 비디오 - 텍스트 검색 ("매칭 게임")

  • 목표: 비디오를 사용자가 쓴 제목과 매칭하세요 (또는 그 반대).
  • 반전: 제목은 종종 모호합니다. 해변 비디오의 제목이 "즐거운 휴가"일 수 있습니다. 컴퓨터는 "즐거운 휴가"라는 단어가 비디오에 문자 그대로 없더라도 "즐거운 휴가"가 해변 장면과 의미상 매칭된다는 것을 이해해야 합니다.
  • 도구: 그들은 **비디오 - 텍스트 대비 학습 (VTCL)**을 사용했습니다. 이는 컴퓨터에게 "매칭되는" 쌍 (비디오 + 제목) 을 정신적 공간에서 서로 가까이 당기고 "불일치하는" 쌍은 멀리 밀어내도록 가르치는 것이라고 생각하세요.

4. 그들이 발견한 것

  • 더 많은 것이 더 낫다: 이러한 짧은 비디오의 경우, 더 많은 프레임 (시간) 을 보는 것이 컴퓨터가 주제를 더 잘 이해하는 데 도움이 됩니다.
  • 옛 지도를 믿지 마라: 전문 영화 (Kinetics 등) 로 훈련된 모델들은 여기서 잘 작동하지 않았습니다. "숏폼" 스타일은 너무 다르기 때문입니다.
  • 세 가지의 힘: 가장 중요한 발견은 비디오, 오디오, 텍스트를 결합하는 것이 가장 잘 작동한다는 것입니다.
    • 비디오만 보면 핵심을 놓칠 수 있습니다.
    • 소리만 들으면 시각적 맥락을 놓칠 수 있습니다.
    • 하지만 세 가지를 모두 융합하면 컴퓨터는 틱톡을 볼 때 인간이 하듯 "전체적인" 이해를 얻습니다.

요약

이 논문은 기초적인 단계입니다. "다듬어진 영화만 연구하는 것을 멈추세요. 여기 짧고 지저분한 비디오의 거대한 현실 세계 데이터셋이 있습니다. 우리는 이를 위한 AI 테스트를 위한 두 가지 새로운 방법을 정의했고, 이러한 비디오를 진정으로 이해하려면 AI 가 읽기, 듣기, 보기를 동시에 해야 함을 보여주었습니다."

그들은 이것이 즉시 비디오 추천을 고치거나 질병을 진단할 것이라고 주장하지 않았습니다. 그들은 단순히 다른 연구자들이 이 특정하고 혼란스럽며 급격히 성장하는 숏폼 비디오 세계를 위한 더 나은 도구를 만들 수 있도록 기초 (데이터셋과 기준 방법) 를 닦았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →