← Ultimi articoli
💻 computer science

Detecting Evidence of LLM Contributions to Open Access Biomedical Literature: A Bibliometric Analysis

Questa analisi bibliometrica di quasi 3 milioni di articoli biomedici open-access rivela un significativo aumento post-2022 della terminologia associata ai LLM, indicando una rapida adozione degli strumenti di IA generativa e sottolineando l'urgente necessità di trasparenza e metodi di rilevamento per preservare l'integrità scientifica.

Autori originali: Gabriel M. Peterson, Marilyn H. Oermann, Jacqueline K. Owens, Gary F. Templeton, Hannah Bailey, Heather Carter-Templeton

Pubblicato 2026-09-21
📖 5 min di lettura🧠 Approfondimento

Autori originali: Gabriel M. Peterson, Marilyn H. Oermann, Jacqueline K. Owens, Gary F. Templeton, Hannah Bailey, Heather Carter-Templeton

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Per decenni, gli studiosi si sono affidati a strumenti per rendere la propria scrittura più chiara e la propria ricerca più efficiente. I correttori ortografici e i software grammaticali sono stati a lungo aiutanti standard, smussando gli errori e suggerendo una migliore scelta delle parole senza cambiare la voce fondamentale dell'autore. Negli ultimi anni, è emersa una nuova generazione di questi strumenti, capaci di generare interi paragrafi di testo che suonano straordinariamente umani. Questi sistemi, noti come modelli linguistici di grandi dimensioni, sono addestrati su enormi quantità di materiale scritto e possono produrre una prosa coerente e raffinata su quasi ogni argomento. Sebbene offrano la promessa di velocizzare il processo di scrittura, pongono anche una domanda difficile alla comunità scientifica: come possiamo distinguere tra una frase scritta da un ricercatore umano e una elaborata da una macchina? Questa distinzione è profondamente importante perché l'integrità della letteratura scientifica dipende dall'autenticità delle idee e dall'accuratezza dei fatti presentati al suo interno. Se una parte significativa della nuova ricerca viene redatta o pesantemente modificata da questi strumenti, il modo in cui leggiamo, ci fidiamo e costruiamo su tale conoscenza potrebbe dover cambiare.

Un team di ricercatori si è posto l'obiettivo di rispondere a questa domanda guardando direttamente alle parole stesse. Si sono concentrati sulla vasta collezione di articoli di ricerca medica e biologica ad accesso aperto disponibili in un database pubblico chiamato PubMed Central. Questa collezione contiene milioni di articoli, fornendo una finestra massiccia su come gli scienziati di tutto il mondo scrivano il proprio lavoro. Il team non ha cercato di indovinare quali articoli specifici fossero stati scritti da macchine, un compito che si è rivelato difficile sia per gli esseri umani che per i programmi informatici. Invece, hanno cercato un segnale diverso. Hanno esaminato se certe parole e frasi, che studi precedenti avevano rilevato essere usate molto più spesso dall'intelligenza artificiale rispetto alle persone, fossero diventate improvvisamente molto più comuni nella letteratura scientifica dopo la fine del 2022, quando questi strumenti sono diventati ampiamente disponibili al pubblico.

I ricercatori hanno raccolto quasi tre milioni di articoli pubblicati tra il 2019 e il 2024. Hanno creato un elenco di 190 parole e frasi specifiche che erano state segnalate in ricerche precedenti come caratteristiche del testo generato dall'IA. Queste includevano aggettivi come "meticoloso" (meticulous) e "intricato" (intricate), verbi come "approfondire" (delve) e "sottolineare" (underscore), e frasi più lunghe come "navigare le complessità di" (navigating the complexities of) o "è importante notare che" (it is important to note). Hanno poi scansionato ogni singolo articolo nel loro dataset per vedere quanto spesso questi termini apparissero. L'obiettivo era vedere se la frequenza di queste parole cambiasse nel tempo, guardando specificamente a un brusco salto nell'uso dopo il rilascio dei nuovi strumenti di IA.

I risultati hanno mostrato un cambiamento chiaro e drammatico nel linguaggio della ricerca biomedica. Prima del 2022, l'uso di questi termini specifici cresceva lentamente e costantemente, in linea con i normali cambiamenti nel modo in cui le persone scrivono. Tuttavia, a partire dal 2023 e continuando nel 2024, l'uso di molte di queste parole è esploso. Ad esempio, la parola "meticolosamente" (meticulously), che appariva meno di mille volte nell'intero database nel 2019, è apparsa più di 16.000 volte nel 2024. La frase "è importante notare che" (it's important to note) ha visto un aumento simile, passando da appena 29 istanze nel 2019 a quasi 800 nel 2024. Forse i più significativi erano le frasi più lunghe e complesse. La combinazione "approfondire le complessità di" (delving into the intricacies of) era quasi inesistente nella letteratura prima del 2023, eppure nel 2024 era apparsa in decine di articoli. I ricercatori hanno notato che non si trattava solo di parole isolate che diventavano popolari; le specifiche combinazioni di parole che sono note per essere marchi di fabbrica della scrittura dell'IA stavano apparendo insieme con frequenza crescente.

Lo studio ha anche esaminato come queste parole venissero utilizzate in combinazione tra loro. Hanno scoperto che coppie e gruppi di questi termini associati all'IA apparivano insieme negli stessi articoli a ritmi statisticamente improbabili che accadessero per caso. Per esempio, le parole "intelligenza artificiale" (artificial intelligence) e "sottolineare" (underscore) hanno iniziato ad apparire insieme negli stessi articoli molto più spesso rispetto al passato. I ricercatori hanno osservato che questi schemi non erano solo una lenta evoluzione dello stile linguistico, che avverrebbe gradualmente nel corso di molti anni, ma piuttosto un punto di inflessione improvviso che coincideva esattamente con il rilascio pubblico degli strumenti di IA generativa. Sebbene lo studio non possa provare che un singolo articolo sia stato scritto da una macchina, la scala enorme di questo cambiamento linguistico suggerisce che questi strumenti siano utilizzati estensivamente dagli autori in tutto il campo.

Gli autori dello studio sottolineano che questo non significa che la ricerca stessa sia necessariamente difettosa, né suggerisce che ogni articolo che usa queste parole sia inautentico. Invece, i risultati indicano un'adozione rapida e diffusa di nuovi ausili alla scrittura che stanno cambiando la trama della comunicazione scientifica. I ricercatori sostengono che, poiché questi strumenti possono talvolta commettere errori o produrre contenuti che mancano di una vera comprensione, la comunità scientifica debba sviluppare un modo migliore per identificare quando vengono utilizzati. Suggeriscono che, invece di cercare di vietare questi strumenti, che probabilmente sono qui per restare, studiosi, editori e revisori dovrebbero concentrarsi sulla trasparenza. Riconoscendo quando e come questi strumenti vengono utilizzati, il record scientifico può rimanere affidabile anche mentre i metodi per crearlo continuano a evolversi. Lo studio conclude che il linguaggio della scienza sta cambiando, e riconoscere questi nuovi schemi è il primo passo verso la comprensione di come l'intelligenza artificiale stia rimodellando il modo in cui condividiamo la conoscenza.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →