← Últimos artigos
💻 computer science

Detecting Evidence of LLM Contributions to Open Access Biomedical Literature: A Bibliometric Analysis

Esta análise bibliométrica de quase 3 milhões de artigos biomédicos de acesso aberto revela um aumento significativo pós-2022 na terminologia associada a LLMs, indicando a rápida adoção de ferramentas de IA generativa e destacando a necessidade urgente de transparência e métodos de detecção para preservar a integridade científica.

Autores originais: Gabriel M. Peterson, Marilyn H. Oermann, Jacqueline K. Owens, Gary F. Templeton, Hannah Bailey, Heather Carter-Templeton

Publicado 2026-09-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Gabriel M. Peterson, Marilyn H. Oermann, Jacqueline K. Owens, Gary F. Templeton, Hannah Bailey, Heather Carter-Templeton

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Por décadas, estudiosos têm dependido de ferramentas para tornar sua escrita mais clara e sua pesquisa mais eficiente. Corretores ortográficos e softwares de gramática têm sido, há muito tempo, auxiliares padrão, suavizando erros e sugerindo melhores escolhas de palavras sem alterar a voz central do autor. Nos últimos anos, uma nova geração dessas ferramentas surgiu, capaz de gerar parágrafos inteiros de texto que soam notavelmente humanos. Esses sistemas, conhecidos como modelos de linguagem de grande escala, são treinados em vastas quantidades de material escrito e podem produzir uma prosa coerente e polida sobre quase qualquer tópico. Embora ofereçam a promessa de acelerar o processo de escrita, eles também levantam uma questão difícil para a comunidade científica: como podemos distinguir entre uma frase escrita por um pesquisador humano e uma elaborada por uma máquina? Essa distinção é profundamente importante porque a integridade da literatura científica depende da autenticidade das ideias e da precisão dos fatos apresentados dentro dela. Se uma parte significativa das novas pesquisas está sendo redigida ou pesadamente editada por essas ferramentas, a maneira como lemos, confiamos e construímos sobre esse conhecimento pode precisar mudar.

Uma equipe de pesquisadores partiu para responder a essa pergunta olhando diretamente para as próprias palavras. Eles se concentraram na vasta coleção de artigos de pesquisa médica e biológica de acesso aberto disponíveis em um banco de dados público chamado PubMed Central. Esta coleção contém milhões de artigos, proporcionando uma janela massiva sobre como cientistas ao redor do mundo escrevem seu trabalho. A equipe não tentou adivinhar quais artigos específicos foram escritos por máquinas, uma tarefa que se provou difícil tanto para humanos quanto para programas de computador. Em vez disso, eles procuraram por um tipo diferente de sinal. Eles examinaram se certas palavras e frases, que estudos anteriores haviam descoberto serem usadas com muito mais frequência pela inteligência artificial do que por pessoas, tornaram-se subitamente muito mais comuns na literatura científica após o final de 2022, quando essas ferramentas se tornaram amplamente disponíveis ao público.

Os pesquisadores reuniram quase três milhões de artigos publicados entre 2019 e 2024. Eles criaram uma lista de 190 palavras e frases específicas que haviam sido sinalizadas em pesquisas anteriores como sendo características de texto gerado por IA. Estas incluíam adjetivos como "meticuloso" (meticulous) e "intrincado" (intricate), verbos como "explorar" (delve) e "sublinhar" (underscore), e frases mais longas como "navegando pelas complexidades de" (navigating the complexities of) ou "é importante notar que" (it is important to note). Eles então escanearam cada um dos artigos em seu conjunto de dados para ver com que frequência esses termos apareciam. O objetivo era ver se a frequência dessas palavras mudava ao longo do tempo, procurando especificamente por um salto acentuado no uso após o lançamento das novas ferramentas de IA.

Os resultados mostraram uma mudança clara e dramática na linguagem da pesquisa biomédica. Antes de 2022, o uso desses termos específicos crescia de forma lenta e constante, consistente com mudanças normais na forma como as pessoas escrevem. No entanto, começando em 2023 e continuando em 2024, o uso de muitas dessas palavras explodiu. Por exemplo, a palavra "meticulosamente" (meticulously), que aparecia menos de mil vezes em todo o banco de dados em 2019, apareceu mais de 16.000 vezes em 2024. A frase "é importante notar que" (it's important to note) teve um surto semelhante, saltando de apenas 29 instâncias em 2019 para quase 800 em 2024. Talvez os mais reveladores fossem as frases mais longas e complexas. A combinação "explorando as complexidades de" (delving into the intricacies of) era virtualmente inexistente na literatura antes de 2023, mas em 2024 já havia aparecido em dezenas de artigos. Os pesquisadores observaram que estes não eram apenas palavras isoladas tornando-se populares; as combinações específicas de palavras que são conhecidas como marcas registradas da escrita de IA estavam aparecendo juntas com frequência crescente.

O estudo também observou como essas palavras estavam sendo usadas em combinação umas com as outras. Eles descobriram que pares e grupos desses termos associados à IA estavam aparecendo juntos nos mesmos artigos em taxas que eram estatisticamente improváveis de acontecer por acaso. Por exemplo, os termos "inteligência artificial" (artificial intelligence) e "sublinhar" (underscore) começaram a aparecer juntos nos mesmos artigos com muito mais frequência do que antes. Os pesquisadores observaram que esses padrões não eram apenas uma evolução lenta do estilo de linguagem, o que aconteceria gradualmente ao longo de muitos anos, mas sim um ponto de inflexão súbito que coincidia exatamente com o lançamento público das ferramentas de IA generativa. Embora o estudo não possa provar que qualquer artigo individual foi escrito por uma máquina, a escala massiva desta mudança linguística sugere que essas ferramentas estão sendo usadas extensivamente por autores em todo o campo.

Os autores do estudo enfatizam que isso não significa que a própria pesquisa seja necessariamente falha, nem sugere que cada artigo que utiliza essas palavras seja inautêntico. Em vez disso, os achados apontam para uma adoção rápida e generalizada de novos auxílios de escrita que estão mudando a textura da comunicação científica. Os pesquisadores argumentam que, como essas ferramentas podem às vezes cometer erros ou produzir conteúdo que carece de compreensão real, a comunidade científica precisa desenvolver uma maneira melhor de identificar quando elas estão sendo usadas. Eles sugerem que, em vez de tentar banir essas ferramentas, que provavelmente estão aqui para ficar, estudiosos, editores e revisores devem focar na transparência. Ao reconhecer quando e como essas ferramentas são utilizadas, o registro científico pode permanecer confiável mesmo enquanto os métodos de criação dele continuam a evoluir. O estudo conclui que a linguagem da ciência está mudando, e reconhecer esses novos padrões é o primeiro passo para entender como a inteligência artificial está remodelando a maneira como compartilhamos o conhecimento.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →