← Últimos artículos
🤖 machine learning

YTClickbait21K: Human-Annotated Multimodal Dataset for YouTube Clickbait Detection Across Diverse Channels and Content Categories

El artículo presenta YTClickbait21K, un conjunto de datos multimodales a gran escala, anotado por humanos, que comprende más de 21.000 vídeos de YouTube con un etiquetado riguroso y metadatos diversos, diseñado para avanzar en la investigación de la detección automatizada de clickbait y la moderación de contenidos.

Autores originales: Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene Ayari, Hamed Noori

Publicado 2026-06-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene Ayari, Hamed Noori

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el internet como un mercado enorme y bullicioso. En este mercado, hay miles de puestos de videos (canales de YouTube) vendiendo de todo, desde consejos de cocina hasta momentos destacados de videojuegos. Pero, al igual que en cualquier mercado concurrido, algunos vendedores usan letreros llamativos y engañosos para trucarte y que te detengas a mirar. Podrían gritar: "¡No creerás lo que sucede después!" o mostrar la imagen de una hamburguesa gigante cuando en realidad el video trata sobre un sándwich diminuto. Esto es el clickbait.

Aunque nos hemos vuelto bastante buenos detectando estos trucos en el texto (como las noticias falsas), detectar estos trucos en los videos es mucho más difícil porque involucra tanto las palabras como las imágenes. Hasta ahora, los investigadores no tenían una "escuela de entrenamiento" lo suficientemente grande para enseñar a las computadoras a detectar estos trucos de video de manera efectiva.

Este artículo presenta YTClickbait21K, una nueva y masiva herramienta diseñada para solucionar ese problema. Aquí hay un desglose sencillo de lo que hicieron:

1. La "Biblioteca Gigante" de Videos

Piensa en el conjunto de datos como una biblioteca gigante que contiene 21,238 videos.

  • ¿De dónde los obtuvieron? No eligieron videos al azar. Seleccionaron cuidadosamente 40 "puestos" (canales) de 29 países diferentes. Estos canales cubren de todo, desde noticias serias y documentales hasta entretenimiento divertido, videojuegos y educación.
  • ¿Qué hay en la caja? Para cada video, guardaron el título, la descripción, el número de vistas/likes y la miniatura (la pequeña imagen que ves antes de hacer clic). No descargaron los archivos de video reales (para ahorrar espacio), pero conservaron los enlaces para que los investigadores puedan verlos más tarde.

2. El Sistema del "Jurado Humano"

No puedes simplemente pedirle a una computadora que decida qué es clickbait; primero debe aprender de los humanos. Para asegurar que las etiquetas fueran precisas, los investigadores no confiaron en una sola persona, sino que recurrieron a un proceso más riguroso.

  • El Proceso: Contrataron a 15 personas diferentes (anotadores) para que actuaran como un jurado.
  • La Regla: Cada uno de los videos fue revisado por tres personas diferentes de forma independiente. No podían hablar entre sí mientras juzgaban.
  • La Ficha de Evaluación: Cada persona tenía una lista de verificación específica que seguir. Hacían preguntas como:
    • ¿El título miente para generar curiosidad?
    • ¿La miniatura muestra algo que realmente no está en el video?
    • ¿Es todo un desajuste entre lo que promete y lo que entrega?
  • El Veredicto: Si al menos dos de las tres personas estaban de acuerdo en que un video era clickbait, este recibía la etiqueta de "Clickbait". Si no estaban de acuerdo, el sistema utilizaba un método de votación para decidir la respuesta final.

3. Por qué esta Biblioteca es Especial

Los autores explican que los intentos previos de construir estas bibliotecas tenían algunos defectos:

  • Demasiado Pequeñas: Algunas tenían solo unos pocos cientos de videos, lo cual no es suficiente para enseñar a una computadora inteligente.
  • Demasiado Centradas en el Texto: Muchas solo miraban las palabras, ignorando las imágenes (miniaturas), que son pistas enormes para el clickbait de video.
  • Etiquetado Perezoso: Algunas usaban computadoras para adivinar las etiquetas en lugar de humanos reales.
  • YTClickbait21K soluciona esto siendo masiva (más de 21,000 videos), multimodal (palabras + imágenes) y rigurosamente verificada por humanos reales.

4. ¿Coincidieron los Humanos?

Los investigadores querían saber si los humanos estaban realmente en la misma sintonía. Realizaron una prueba estadística (llamada Kappa de Cohen), que es como un "puntaje de consistencia".

  • El Resultado: El puntaje fue de aproximadamente 0.65. En el mundo del juicio humano, esto se considera un "acuerdo sustancial". Significa que, aunque el clickbait puede ser truculento y subjetivo (como decidir si un chiste es gracioso), los humanos generalmente coincidían en qué era engañoso y qué no lo era.
  • Confianza: Los humanos también estaban muy seguros de sus elecciones, otorgándose puntajes de confianza altos (casi 5 de 5) la mayor parte del tiempo.

5. ¿Qué pueden hacer las personas con esto?

El artículo establece que este conjunto de datos es ahora un "benchmark" o punto de referencia público.

  • Para Investigadores: Es un conjunto de prueba estándar. Si un científico de la computación construye una nueva IA para detectar clickbait, puede ejecutar su IA contra este conjunto de datos para ver qué tan bien lo hace en comparación con otros.
  • Para Desarrolladores: Ayuda a construir mejores herramientas para marcar automáticamente videos engañosos en las plataformas.

Resumen

En resumen, los autores construyeron un manual de entrenamiento masivo y de alta calidad para las computadoras. Recopilaron miles de videos reales de YouTube, hicieron que equipos de humanos los etiquetaran cuidadosamente siguiendo reglas estrictas, y pusieron toda la colección a disposición de forma gratuita. Esto permite que los investigadores finalmente enseñen a las computadoras cómo distinguir entre un video genuino y uno engañoso, utilizando tanto el texto como las imágenes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →