← 최신 논문
🤖 machine learning

YTClickbait21K: Human-Annotated Multimodal Dataset for YouTube Clickbait Detection Across Diverse Channels and Content Categories

이 논문은 자동화된 클릭베이트 탐지 및 콘텐츠 중재 연구를 발전시키기 위해 설계된, 엄격한 레이블링과 다양한 메타데이터를 포함하여 21,000개 이상의 유튜브 영상으로 구성된 대규모 인간 주석 멀티모달 데이터셋인 YTClickbait21K를 소개한다.

원저자: Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene Ayari, Hamed Noori

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene Ayari, Hamed Noori

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 거대하고 북적이는 시장이라고 상상해 보세요. 이 시장에는 요리 팁부터 게임 하이라이트까지 모든 것을 판매하는 수천 개의 비디오 가판대(YouTube 채널)가 있습니다. 하지만 붐비는 시장에서처럼, 일부 상인들은 사람들을 유인하기 위해 화려하고 오해의 소지가 있는 간판을 사용하기도 합니다. 그들은 "다음 장면에 벌어질 일을 믿지 못할 거예요!"라고 외치거나, 실제로는 작은 샌드위치에 관한 영상인데도 거대한 버거 사진을 보여주며 당신을 멈춰 서게 할 수도 있습니다. 이것이 바로 **클릭베이트(clickbait)**입니다.

우리는 텍스트(가짜 뉴스 헤드라인 등)에서 이러한 속임수를 찾아내는 데는 꽤 익숙해졌지만, 비디오의 경우 단어와 이미지를 모두 다루어야 하기 때문에 이를 포착하는 것은 훨씬 더 어렵습니다. 지금까지 연구자들은 컴퓨터가 비디오의 이러한 속임수를 효과적으로 식별하도록 가르칠 수 있는 충분히 큰 "훈련 학교"를 갖지 못했습니다.

이 논문은 이 문제를 해결하기 위해 설계된 거대하고 새로운 도구인 YTClickbait21K를 소개합니다. 그들이 수행한 작업은 다음과 같이 간단히 나누어 볼 수 있습니다.

1. 비디오의 "거대한 도서관"

이 데이터셋은 21,238개의 비디오를 포함하는 거대한 도서관과 같습니다.

  • 어디에서 가져왔나? 그들은 단순히 무작위로 비디오를 고른 것이 아닙니다. 29개국에서 온 40개의 서로 다른 "가판대"(채널)를 신중하게 선정했습니다. 이 채널들은 진지한 뉴스나 다큐멘터리부터 재미있는 엔터테인먼트, 게임, 교육에 이르기까지 모든 분야를 아우릅니다.
  • 무엇이 들어있나? 모든 비디오에 대해 제목, 설명, 조회수/좋아요 수, 그리고 썸네일(클릭하기 전에 보이는 작은 그림)을 저장했습니다. 용량을 아끼기 위해 실제 비디오 파일 자체를 다운로드하지는 않았지만, 연구자들이 나중에 찾아볼 수 있도록 링크는 보관했습니다.

2. "인간 배심원" 시스템

컴퓨터에게 바로 무엇이 클릭베이트인지 결정하라고 할 수는 없습니다. 컴퓨터가 먼저 인간으로부터 배워야 하기 때문입니다. 라벨(표식)이 정확한지 확인하기 위해 연구자들은 단 한 명의 의견에 의존하지 않았습니다.

  • 과정: 그들은 15명의 서로 다른 사람들(주석 작성자)을 고용하여 배심원 역할을 맡겼습니다.
  • 규칙: 모든 비디오는 독립적으로 세 명의 서로 다른 사람에 의해 검토되었습니다. 그들은 판단하는 동안 서로 대화할 수 없었습니다.
  • 체크리스트: 각 사람은 따라야 할 구체적인 체크리스트를 가졌습니다. 그들은 다음과 같은 질문을 던졌습니다:
    • 제목이 호기심을 자극하기 위해 거짓말을 하고 있는가?
    • 썸네일이 실제 영상에 없는 것을 보여주고 있는가?
    • 전체적인 내용이 약속한 것과 전달하는 것 사이의 불일치가 있는가?
  • 판결: 세 명 중 최소 두 명이 해당 비디오를 클릭베이트라고 동의하면 "클릭베이트" 라벨이 붙었습니다. 만약 의견이 갈릴 경우, 시스템은 투표 방식을 사용하여 최종 답변을 결정했습니다.

3. 이 도서관이 특별한 이유

저자들은 기존의 시도들이 몇 가지 결함이 있었다고 설명합니다:

  • 너무 작음: 어떤 것들은 수백 개의 비디오만 가지고 있었는데, 이는 똑똑한 컴퓨터를 가르치기에 충분하지 않습니다.
  • 텍스트에 너무 치중됨: 많은 데이터셋이 단어만 보고 이미지(썸네일)를 무시했습니다. 하지만 썸네일은 비디오 클릭베이트의 중요한 단서입니다.
  • 게으른 라벨링: 일부는 실제 인간 대신 컴퓨터를 사용하여 라벨을 추측했습니다.
  • YTClickbait21K는 이 점을 개선하여, 거대하고(21,000개 이상의 비디오), 멀티모달 방식이며(단어 + 사진), 엄격하게 검증되었습니다(실제 인간에 의해).

4. 인간들은 서로 동의했는가?

연구자들은 인간들이 실제로 같은 생각을 하고 있는지 알고 싶었습니다. 그들은 "일관성 점수"라고 불리는 통계적 테스트(Cohen's Kappa)를 실행했습니다.

  • 결과: 점수는 약 0.65였습니다. 인간의 판단 영역에서 이는 "상당한 일치(substantial agreement)"로 간서됩니다. 이는 클릭베이트가 까다롭고 주관적일 수 있지만(농담이 재미있는지 결정하는 것과 같이), 인간들이 무엇이 오해의 소지가 있고 무엇이 그렇지 않은지에 대해 대체로 동의했다는 것을 의미합니다.
  • 신뢰도: 인간들은 또한 자신의 선택에 대해 매우 확신하며, 대부분의 경우 높은 신뢰도 점수(5점 만점에 거의 5점)를 부여했습니다.

5. 사람들이 이것으로 무엇을 할 수 있는가?

논문은 이 데이터셋이 이제 공개적인 "벤치마크"라고 밝히고 있습니다.

  • 연구자들을 위해: 이것은 표준 테스트 세트입니다. 만약 컴퓨터 과학자가 클릭베이트를 탐지하는 새로운 AI를 만든다면, 이 데이터셋을 사용하여 자신의 AI가 다른 모델들과 비교했을 때 얼마나 잘 작동하는지 확인할 수 있습니다.
  • 개발자들을 위해: 이는 플랫폼에서 오해의 소지가 있는 영상을 자동으로 표시하는 더 나은 도구를 만드는 데 도움이 됩니다.

요약

요약하자면, 저자들은 컴퓨터를 위한 거대하고 고품질인 훈련 매뉴얼을 만들었습니다. 그들은 수천 개의 실제 유튜브 영상을 수집했고, 엄격한 규칙에 따라 팀을 구성해 인간이 직접 라벨을 달게 했으며, 이 전체 컬렉션을 무료로 공개했습니다. 이를 통해 연구자들은 마침-로 텍스트와 이미지를 모두 사용하여, 진짜 영상과 오해의 소지가 있는 영상을 구분하는 법을 드디어 컴퓨터에게 가르칠 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →