Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web
Este estudo revela uma crescente assimetria no controle de acesso à web, onde sites de notícias de prestígio estão cada vez mais bloqueando rastreadores de IA via robots.txt e medidas ativas, enquanto sites de desinformação permanecem amplamente abertos, potencialmente enviesando os dados de treinamento disponíveis para Grandes Modelos de Linguagem.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine a internet como uma biblioteca gigante e movimentada, onde cada livro, artigo e post de blog é uma peça de informação esperando para ser lida. Por anos, "robôs" (programas de computador especiais) têm sido os bibliotecários deste mundo digital, caminhando silenciosamente pelos corredores para copiar livros para que os mecanismos de busca possam nos ajudar a encontrá-los. Mas recentemente, um novo tipo de bibliotecário chegou: o robô de Inteligência Artificial (IA). Estes não estão apenas procurando por um livro; eles estão tentando ler tudo ao mesmo tempo para aprender a escrever, responder perguntas e conversar conosco. Para gerenciar isso, os proprietários de sites têm um sinal simples e voluntário que podem colocar em sua porta chamado robots.txt. Pense nisso como uma placa de "Proibida a Entrada" ou "Por Favor, Entre" para esses bibliotecários digitais. Se um proprietário de site escrever "IA não permitida" nesta placa, espera-se que os robôs de IA educados escutem e mantenham distância. Mas aqui está a grande questão: todos os sites colocam essas placas? E se o fazem, eles as colocam pelos mesmos motivos? À medida que a IA se torna mais inteligente e poderosa, entender quem está abrindo suas portas e quem está trancando-as torna-se crucial, porque isso decide que tipo de informação a IA aprenderá.
Este artigo, intitulado "A Desinformação é Mais Aberta?", atua como uma história de detetive digital, investigando como dois grupos muito diferentes de sites lidam com esses sinais de "Proibida a Entrada" para a IA. Os pesquisadores analisaram dois grupos: sites de notícias "reputados" (os jornalistas sérios e que verificam fatos) e sites de "desinformação" (os lugares que espalham histórias falsas ou enganosas). Eles queriam ver se as organizações de notícias sérias eram melhores em dizer aos robôs de IA para ficarem longe em comparação com os sites de notícias falsas.
As descobertas revelam um contraste surpreendente e acentuado. Os pesquisadores descobriram que os sites de notícias reputados são muito mais propensos a colocar uma placa de "Proibida a Entrada" para os robôs de IA. De fato, 60,0% desses sites confiáveis disseram explicitamente a pelo menos um rastreador de IA para não entrar em seus arquivos robots.txt. Em forte contraste, apenas 9,1% dos sites de desinformação fizeram o mesmo. É como se as bibliotecas sérias estivessem trancando suas portas para os novos estudantes de IA, enquanto os panfleteiros de notícias falsas estão deixando suas portas escancaradas. Em média, um site de notícias reputado listou 15,5 diferentes robôs de IA que não queria que o visitassem, enquanto os sites de desinformação listaram menos de um.
O estudo também observou se esses sites realmente aplicavam seus sinais ou apenas os escreviam. Eles descobriram que os sites de notícias reputados não apenas escreviam as regras, mas também bloqueavam ativamente os robôs de IA que tentavam entrar sorrateiramente, combinando suas regras escritas com suas ações. Os sites de desinformação foram menos consistentes; embora alguns bloqueassem a IA, muitos nem sequer se deram ao trabalho de escrever as regras. Os pesquisadores também observaram como as coisas mudaram ao longo do tempo, olhando para instantâneos de setembro de 2023 a maio de 2025. Eles viram que os sites de notícias reputados estavam aprendendo rapidamente a trancar suas portas, com o número de sites bloqueando a IA saltando de 23% para quase 60% em apenas alguns anos. Os sites de desinformação, no entanto, permaneceram amplamente passivos, raramente atualizando seus sinais.
Os autores sugerem que este crescente abismo cria uma situação estranha: à medida que as fontes "boas" começam a trancar suas portas para proteger seu conteúdo, os robôs de IA podem acabar passando mais tempo lendo as fontes "ruins" que ainda estão abertas. Isso pode significar que a IA aprenderá mais com a desinformação do que com notícias precisas, simplesmente porque os sites de desinformação são mais fáceis de acessar. O artigo não afirma que isso já arruinou a IA, mas destaca um risco real: se não prestarmos atenção em quem está abrindo suas portas, o futuro da IA pode ser construído sobre um alicerce de falsidades.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.