← Últimos artigos
🤖 machine learning

YTClickbait21K: Human-Annotated Multimodal Dataset for YouTube Clickbait Detection Across Diverse Channels and Content Categories

O artigo apresenta o YTClickbait21K, um conjunto de dados multimodal de grande escala, anotado por humanos, que compreende mais de 21.000 vídeos do YouTube com rotulagem rigorosa e metadados diversos, projetado para avançar a pesquisa em detecção automatizada de clickbait e moderação de conteúdo.

Autores originais: Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene Ayari, Hamed Noori

Publicado 2026-06-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene Ayari, Hamed Noori

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine a internet como um enorme e movimentado mercado. Neste mercado, existem milhares de bancas de vídeo (canais do YouTube) vendendo de tudo, desde dicas de culinária até destaques de jogos. Mas, assim como em qualquer mercado lotado, alguns vendedores usam placas chamativas e enganosas para te atrair. Eles podem gritar: "Você não vai acreditar no que acontece a seguir!" ou mostrar a foto de um hambúrguer gigante quando o vídeo é, na verdade, sobre um sanduíche minúsculo. Isso é o clickbait.

Embora tenhamos ficado muito bons em identificar esses truques em textos (como notícias falsas), identificar o clickbait em vídeos é muito mais difícil porque envolve tanto as palavras quanto as imagens. Até agora, os pesquisadores não tinham uma "escola de treinamento" grande o suficiente para ensinar os computadores a detectar esses truques de vídeo de forma eficaz.

Este artigo apresenta o YTClickbait21K, uma nova e massiva ferramenta projetada para resolver esse problema. Aqui está uma divisão simples do que eles fizeram:

1. A "Biblioteca Gigante" de Vídeos

Pense no conjunto de dados como uma biblioteca gigante contendo 21.238 vídeos.

  • De onde eles tiraram isso? Eles não escolheram vídeos aleatórios. Selecionaram cuidadosamente 40 diferentes "bancas" (canais) de 29 países diferentes. Esses canais cobrem tudo, desde notícias sérias e documentários até entretenimento divertido, jogos e educação.
  • O que tem na caixa? Para cada vídeo, eles salvaram o título, a descrição, o número de visualizações/curtidas e a thumbnail (a pequena imagem que você vê antes de clicar). Eles não baixaram os arquivos de vídeo reais (para economizar espaço), mas mantiveram os links para que os pesquisadores possam visualizá-los mais tarde.

2. O Sistema de "Júri Humano"

Você não pode simplesmente pedir a um computador para decidir o que é clickbait; ele precisa aprender com humanos primeiro. Para garantir que os rótulos fossem precisos, os pesquisadores não confiaram em apenas uma pessoa.

  • O Processo: Eles contrataram 15 pessoas diferentes (anotadores) para atuar como um júri.
  • A Regra: Cada vídeo foi analisado por três pessoas diferentes de forma independente. Elas não podiam conversar entre si enquanto julgavam.
  • A Planilha de Avaliação: Cada pessoa tinha um checklist específico para seguir. Elas faziam perguntas como:
    • O título está mentindo para gerar curiosidade?
    • A thumbnail mostra algo que não está realmente no vídeo?
    • Tudo isso é um descompasso entre o que promete e o que entrega?
  • O Veredito: Se pelo menos duas das três pessoas concordassem que um vídeo era clickbait, ele recebia o rótulo de "Clickbait". Se elas discordassem, o sistema usava um método de votação para decidir a resposta final.

3. Por que esta Biblioteca é Especial

Os autores explicam que as tentativas anteriores de construir essas bibliotecas tinham algumas falhas:

  • Muito Pequenas: Algumas tinham apenas algumas centenas de vídeos, o que não é suficiente para ensinar um computador inteligente.
  • Focadas Demais em Texto: Muitas olhavam apenas para as palavras, ignorando as imagens (thumbnails), que são pistas enormes para o clickbait de vídeo.
  • Rotulagem Preguiçosa: Algumas usaram computadores para adivinhar os rótulos em vez de humanos reais.
  • O YTClickbait21K corrige isso sendo enorme (mais de 21.000 vídeos), multimodal (palavras + imagens) e rigorosamente verificado por humanos reais.

4. Os Humanos Concordaram?

Os pesquisadores queriam saber se os humanos estavam realmente na mesma página. Eles realizaram um teste estatístico (chamado Kappa de Cohen), que é como um "índice de consistência".

  • O Resultado: O índice foi de cerca de 0,65. No mundo do julgamento humano, isso é considerado um "acordo substancial". Significa que, embora o clickbait possa ser traiçoeiro e subjetivo (como decidir se uma piada é engraçada), os humanos geralmente concordavam sobre o que era enganoso e o que não era.
  • Confiança: Os humanos também estavam muito seguros de suas escolhas, dando a si mesmos pontuações de confiança altas (quase 5 de 5) na maioria das vezes.

5. O Que as Pessoas Podem Fazer Com Isso?

O artigo afirma que este conjunto de dados é agora um "benchmark" público.

  • Para Pesquisadores: É um conjunto de teste padrão. Se um cientista da computação construir uma nova IA para detectar clickbait, ele pode rodar sua IA contra este conjunto de dados para ver como ela se sai em comparação com outras.
  • Para Desenvolvedores: Ajuda a construir melhores ferramentas para sinalizar automaticamente vídeos enganosos em plataformas.

Resumo

Em suma, os autores construíram um manual de treinamento massivo e de alta qualidade para computadores. Eles coletaram milhares de vídeos reais do YouTube, fizeram com que equipes de humanos rotulassem cuidadosamente com base em regras estritas e disponibilizaram toda a coleção gratuitamente. Isso permite que os pesquisadores finalmente ensinem os computadores a distinguir entre um vídeo genuíno e um enganoso, usando tanto o texto quanto as imagens.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →