Em-ergence of the em-dash: a population-level rise in em-dash frequency in medRxiv preprints at the dawn of the large-language-model era
Questo studio preregistrato analizza oltre 69.000 preprint di medRxiv per rivelare un aumento significativo e graduale, a livello di popolazione, dell'uso della virgola em (em-dash) all'interno delle sezioni di discussione dopo l'avvento dei grandi modelli linguistici, suggerendo un distinto cambiamento stilistico nella scrittura scientifica durante i primi anni 2020.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di essere un detective che cerca di capire se una massiccia biblioteca di note mediche sia stata toccata da una nuova, invisibile mano. Non stai cercando impronte digitali o DNA; stai cercando un segno di punteggiatura specifico e minuscolo: la lineetta — (em-dash).
Ecco la storia di ciò che il documento ha scoperto, raccontata in modo semplice.
Il Mistero: Un "Errore" che non lo è
Per anni, gli scienziati hanno sussurrato una voce: "I Grandi Modelli Linguistici" (come ChatGPT) amano usare le lineette. Gli esseri umani, d'altro canto, solitamente le trovano fastidiose o difficili da digitare, quindi le usano con parsimonia. È come quando un essere umano potrebbe scrivere una frase con una virgola, mentre un robot potrebbe scriverla con un trattino drammatico per sembrare più "professionale".
Ma finora, questa era solo una chiacchiera. Nessuno aveva effettivamente contato le lineette in migliaia di veri articoli scientifici per vedere se la voce fosse vera.
L'Indagine: Contare le Lineette in un Mare di Testo
Il ricercatore, Przemysław Czuma, ha deciso di giocare al detective su scala massiccia. Non ha guardato libri pubblicati (che spesso vengono "ripuliti" dagli editori e perdono la loro punteggiatura originale). Inveve, ha esaminato medRxiv, un server dove gli scienziati caricano le loro bozze grezze, non editate (preprint), prima che vengano pubblicate.
- L'Obiettivo: Si è concentrato sulla sezione "Discussion" di questi articoli. Questa è la parte in cui gli scienziati raccontano una storia, spiegano i loro sentimenti riguardo ai risultati e cercano di persuadere il lettore. È la parte più "umana" di un articolo.
- Lo Strumento: Ha usato un programma per computer per scansionare oltre 69.000 di queste bozze, cercando specificamente il carattere della lineetta (—).
- La Cronologia: Ha diviso i dati in due ere:
- Prima di ChatGPT (prima di novembre 2022).
- Dopo ChatGPT (dopo novembre 2022).
I Risultati: Un Lento Incedere, non un Lampo
I risultati sono stati drammatici, ma non sono avvenuti dall'oggi al domani come l'accensione di un interruttore della luce.
- Prima del boom dell'IA: Solo circa il 4% degli articoli presentava anche una sola lineetta nella sezione Discussion. Era un evento raro.
- Dopo il boom dell'IA: Quel numero è salito all'11,5%.
- Il Trend: Non è successo immediatamente nel 2023. Il numero è rimasto basso, poi ha iniziato a salire lentamente nel 2024, e nel 2025 è decollato arrivando al 20%.
L'Analogia: Immaginate una festa tranquilla dove quasi nessuno indossa cappelli rossi. Poi, una nuova moda inizia a diffondersi. All'inizio, solo poche persone provano il nuovo stile. Poi, lentamente, altri si uniscono. Entro l'anno successivo, quasi una persona su cinque alla festa indossa un cappello rosso. Ecco cosa è successo alla lineetta.
La Prova: Escludere Altri Sospettati
Un buon detective controlla se esistono altre spiegazioni. Il ricercatore ha sottoposto i dati a diversi "testات poligrafo" per assicurarsi che l'aumento delle lineette non fosse solo un trend casuale o un cambiamento nel modo in cui il sito web formatta il testo.
- Il "Test della Sezione Noiosa": Ha controllato le sezioni "Acknowledgments" e "Data Availability" (le parti standard e noiose di un articolo). Se l'intero sito web avesse cambiato la sua formattazione, anche queste sezioni avrebbero avuto più lineette. Non è successo. L'aumento riguardava solo le parti narrative.
- Il "Test della Data Falsa": Ha guardato il periodo prima che ChatGPT esistesse e ha finto che una data casuale fosse l'inizio. Nulla era cambiato. Questo ha dimostrato che l'aumento non era solo una lenta, naturale deriva nel tempo.
- Il "Test della Scelta delle Parole": Ha cercato anche parole specifiche che i modelli di IA amano usare (come "delve", "groundbreaking" o "leverage"). Queste parole sono aumentate esattamente nello stesso momento delle lineette.
Cosa Significa (e Cosa Non Significa)
Il documento è molto attento a ciò che afferma.
- Dimostra CHE: Qualcosa di grande è cambiato nel modo in cui gli articoli scientifici vengono scritti tra il 2022 e il 2025. Lo stile di scrittura è cambiato in un modo che coincide con l'ascesa degli strumenti di IA. La lineetta è un segnale "a livello di popolazione", come notare che l'altezza media di una folla è aumentata, non che ogni singola persona sia diventata più alta.
- NON dimostra CHE: Non puoi guardare un singolo articolo con una lineetta e dire: "Questo è stato scritto da un robot". Un essere umano potrebbe semplicemente amare le lineette. Allo stesso modo, non puoi guardare un articolo senza una lineetta e dire: "Questo è al 100% umano".
- La Conclusione: Lo studio conferma che la "impronta digitale" della scrittura dell'IA sta diventando visibile nella letteratura scientifica. Non è accaduto istantaneamente; è accaduto mentre gli scienziati hanno iniziato lentamente a fidarsi e a usare questi nuovi strumenti per rifinire e scrivere le loro storie.
In breve: la lineetta è il "fumo" che suggerisce che un incendio (l'uso dell'IA) è iniziato nella cucina della scrittura scientifica, anche se non possiamo indicare esattamente quale fornello è stato usato per ogni singolo pentolino.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.