← Últimos artigos
🤖 machine learning

CrediBench: Building Web-Scale Network Datasets for Information Integrity

Este artigo apresenta o CrediBench, um conjunto de dados multimodal em escala web que compreende oito meses de dados de grafos, texto e temporais de mais de 40 milhões de domínios, o qual aumenta significativamente o desempenho de modelos de previsão de credibilidade ao capturar sinais estruturais e dinâmicos frequentemente negligenciados por abordagens existentes de nível de afirmação.

Autores originais: Emma Kondrup, Sebastian Sabry, Hussein Abdallah, Zachary Yang, Jiaqi Xiong, Kellin Pelrine, James Zhou, Zhijin Guo, Michael M. Bronstein, Jean-François Godbout, Reihaneh Rabbany, Shenyang Huang

Publicado 2026-06-23
📖 4 min de leitura☕ Leitura rápida

Autores originais: Emma Kondrup, Sebastian Sabry, Hussein Abdallah, Zachary Yang, Jiaqi Xiong, Kellin Pelrine, James Zhou, Zhijin Guo, Michael M. Bronstein, Jean-François Godbout, Reihaneh Rabbany, Shenyang Huang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine a internet como uma cidade enorme e movimentada, onde cada website é um edifício. Alguns edifícios são bibliotecas honestas, outros são lojas suspeitas em becos escuros e alguns são armadilhas descaradas. No momento, está ficando difícil distingui-los porque atores mal-intencionados estão construindo fachadas falsas convincentes, e novos "edifícios" surgem a cada segundo.

Este artigo apresenta o CrediBench, uma nova ferramenta gigante projetada para nos ajudar a navegar por esta cidade e descobrir quais edifícios são confiáveis.

Aqui está a divisão do que eles fizeram, usando analogias simples:

1. O Problema: Os Mapas Antigos São Pequenos Demais

Anteriormente, pesquisadores que tentavam identificar notícias falsas ou websites perigosos enfrentavam dois problemas principais:

  • Eles olhavam apenas para o "cardápio": A maioria das ferramentas apenas lia o texto de uma única página da web (o cardápio) para decidir se é um bom restaurante. Elas ignoravam quem era o dono ou com quem ele era amigo.
  • Os mapas eram minúsculos: Os conjuntos de dados existentes eram como um mapa de um único bairro. Eles não tinham dados suficientes para ver a cidade inteira, especialmente como as conexões entre os edifícios mudam ao longo do tempo.

2. A Solução: Um Mapa de Cidade Gigante e Vivo

Os autores construíram o CrediBench, que é como um mapa de alta definição e em time-lapse de toda a internet durante oito meses.

  • A Escala: É massivo. Ele rastreia mais de 40 milhões de "edifícios" (domínios) e 1 bilhão de "estradas" (hyperlinks) conectando-os. Para colocar em perspectiva, é ordens de magnitude maior do que qualquer mapa anterior de sua espécie.
  • As Três Camadas: Em vez de apenas ler o texto, o CrediBench observa três coisas ao mesmo tempo:
    1. O Texto: O que está escrito nas páginas? (O cardápio).
    2. A Estrutura: Quem liga a quem? (A fofoca e as alianças do bairro).
    3. O Tempo: Como essas conexões mudam? (Uma biblioteca respeitável começou a linkar para uma loja suspeita na semana passada?).

3. A "Pontuação de Credibilidade"

Os pesquisadores ensinaram computadores a agir como inspetores especialistas. Eles criaram duas maneiras de testar o sistema:

  • O "Medidor de Confiança" (Regressão): Em vez de apenas dizer "Bom" ou "Ruim", o sistema fornece uma pontuação de 0 a 1, indicando o quão credível um site é.
  • O Teste "Passa/Falha" (Classificação): Um simples "Sim, isto é seguro" ou "Não, isto é perigoso".

Para treinar esses inspetores, eles não apenas adivinharam. Eles reuniram uma lista massiva de 662.000 websites que já haviam sido rotulados por especialistas, multidões e empresas de segurança como "créditos" ou "não confiáveis" (abrangendo desinformação, malware e phishing). Esta é a maior lista de seu tipo já reunida.

4. Os Resultados: O Trabalho em Equipe Vence

A equipe realizou experimentos para ver qual "sentido" era o mais importante: ler o texto, observar os links ou observar a linha do tempo.

  • A Descoberta: Você não pode confiar em apenas um sentido. Um modelo que apenas lê o texto é ok, mas um modelo que apenas olha os links também é ok.
  • O Vencedor: O Super-Inspetor que combina todos os três (Texto + Links + Tempo) foi o claro campeão.
    • Na tarefa do "Medidor de Confiança", ele reduziu os erros em uma margem enorme (caindo de 16% de erro para 10%).
    • No teste "Passa/Falha", ele saltou de estar certo 56% das vezes para estar certo 85% das vezes.

5. Por Que Isso Importa

O artigo argumenta que a desinformação se espalha como um vírus através das conexões entre os websites, não apenas através das palavras em uma página. Ao olhar para o mapa completo da cidade e como ela se move ao longo do tempo, podemos identificar os "bairros ruins" muito mais rápido.

Em resumo: Os autores construíram o mapa mais detalhado e abrangente da rede de confiança da internet já criado. Eles provaram que, para identificar um mentiroso, você precisa ler o que ele diz, ver com quem ele anda e observar como seus relacionamentos mudam ao longo do tempo. Eles disponibilizaram este mapa e as ferramentas de treinamento para que qualquer pessoa possa usar, para que pesquisadores futuros possam construir melhores "inspetores de cidade" para manter a internet segura.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →