Computer-generated content and the AI/ML retraction record, 2018– 2026: a characterization study
Este estudo de caracterização de 13.502 registros de retratações relacionados a IA/ML de 2018 a 2026 revela que o conteúdo gerado por computador é a maior causa inferida individual de retratações, respondendo por 34,8% dos casos e afetando predominantemente artigos publicados entre 2021 e 2023.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine o mundo da publicação científica como uma biblioteca enorme e movimentada. Durante anos, os bibliotecários (editores e revisores por pares) têm verificado os livros antes de irem para as prateleiras para garantir que as histórias sejam verdadeiras e que os autores tenham feito o próprio trabalho.
Este artigo é como um boletim de notas da pilha de "Devolução ao Remetente" dessa biblioteca entre 2018 e 2026. Especificamente, ele analisa a seção dedicada à Inteligência Artificial (IA) e ao Aprendizado de Máquina (Machine Learning).
Aqui está a história do que o autor, Anton Sokolov, descobriu, explicada de forma simples:
1. O Novo Problema: "Escritores Fantasmas"
Antes de 2022, se um livro nesta seção fosse devolvido, geralmente era porque o autor copiou a história de outra pessoa (plágio), mentiu sobre os dados ou pagou uma "fábrica de artigos" (uma fábrica que escreve artigos falsos) para fazer o trabalho.
Mas, começando em 2022, algo novo aconteceu. Os Grandes Modelos de Linguagem (como a IA com a qual você pode conversar) tornaram-se muito bons em escrever textos fluentes e com aparência científica. De repente, a biblioteca começou a receber uma enxurrada de livros escritos por esses "escritores fantasmas".
O estudo analisou 13.502 artigos na seção de IA que foram retirados das prateleiras (retraídos). Eles perguntaram: Por que esses livros foram devolvidos?
2. A Grande Descoberta
A descoberta mais surpreendente é que o motivo nº 1 para retirar esses artigos de IA foi o Conteúdo Gerado por Computador.
- Os Números: De cada 100 artigos de IA retraídos, cerca de 35 foram retirados especificamente porque o texto foi gerado por uma IA (como um chatbot).
- A Comparação: Isso é superior a "Revisão por Pares Comprometida" (22%), "Plágio" (18%) ou "Erros Editoriais" (13%).
Pense nisso como uma padaria. Durante anos, o principal motivo para o pão ser jogado fora era estar queimado ou velho. Mas, de repente, a padaria começou a descobrir que a própria massa era feita por um robô que não sabia assar. Esse se tornou o motivo mais comum para jogar o pão fora.
3. O Filtro de "Precisão" (A Rede de Segurança)
O autor foi cuidadoso para não apenas contar tudo de forma vaga. Ele criou uma "rede de segurança" com diferentes níveis de certeza:
- Alta Precisão: Artigos onde o título dizia claramente "IA" ou "Aprendizado de Máquina". (3.243 artigos).
- Rede Ampla: Artigos que eram apenas genericamente sobre "Ciência da Computação". (13.502 artigos).
Mesmo olhando apenas para o grupo de "Alta Precisão" (aqueles definitivamente sobre IA), 41,8% foram retraídos devido a texto gerado por IA. Portanto, o problema não é apenas um acaso de rotulagem imprecisa; é um problema real e dominante neste campo específico.
4. A Linha do Tempo: Uma Onda Repentina
O artigo acompanha os anos como um relatório meteorológico:
- 2018–2021: Pouquíssimos artigos gerados por IA foram detectados.
- 2022: A onda começou.
- 2023: A onda atingiu o pico. Este foi um ano de "tsunami", em grande parte porque uma grande editora (Hindawi/Wiley) fez uma limpeza massiva, retirando milhares de artigos de uma só vez.
- 2024–2025: Os números caíram em relação ao pico, mas permaneceram 10 vezes maiores do que eram antes de 2022.
A maioria desses artigos ruins foi escrita e publicada entre 2021 e 2023. Eles foram detectados rapidamente, geralmente dentro de um ano após serem publicados.
5. Quem Estava Envolvido?
O estudo lista as editoras e revistas com o maior número de artigos retraídos.
- Hindawi (uma editora) teve o maior número, respondendo por mais de um terço de todos os artigos retraídos desta lista.
- No entanto, o autor alerta: Isso não é necessariamente uma "lista de vergonha". Às vezes, uma editora tem muitas retrações porque está limpando ativamente suas prateleiras e pegando artigos ruins, em vez de ser a "pior" editora. É como uma loja com um balcão de "Trocas e Devoluções": um alto número de devoluções pode significar que a loja é muito rigorosa com a qualidade, não apenas que ela vende produtos ruins.
6. O Que Este Estudo NÃO É
O autor é muito claro sobre o que este relatório não nos diz:
- Não nos diz quantos artigos escritos por IA ainda estão nas prateleiras e não foram detectados ainda.
- Não prova que pesquisadores de IA são pessoas "más".
- Não diz que a pesquisa de IA falha mais frequentemente do que outros campos (como biologia ou física). Nós apenas não temos dados para comparar ainda.
A Conclusão Principal
Este artigo é um "estudo de caracterização". É como tirar uma fotografia da caixa de "Devolução ao Remetente" para artigos de IA.
A principal lição é simples: A era do texto gerado por IA chegou à ciência, e o primeiro grande sinal disso é um aumento maciço nas retrações onde o próprio texto foi escrito por uma máquina.
O estudo conclui que, para a ciência resolver isso, precisamos de rótulos claros e legíveis por máquina nessas retrações que digam: "Isso foi escrito por IA". Sem esses rótulos claros, não podemos medir o problema nem corrigi-lo adequadamente. O "substrato" (a base) para soluções futuras é simplesmente ter registros honestos e claros do que deu errado.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.