Em-ergence of the em-dash: a population-level rise in em-dash frequency in medRxiv preprints at the dawn of the large-language-model era
Deze vooraf geregistreerde studie analyseert meer dan 69.000 medRxiv-preprints om een significante, geleidelijke populatiebrede toename in het gebruik van de em-dash in discussiesecties te onthullen na de komst van grote taalmodellen, wat wijst op een duidelijke stilistische verschuiving in wetenschappelijk schrijven tijdens het begin van de jaren 2020.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die probeert uit te zoeken of een enorme bibliotheek met medische aantekeningen is aangeraakt door een nieuwe, onzichtbare hand. Je zoekt niet naar vingerafdrukken of DNA; je zoekt naar een specifiek, minuscuul leesteken: de em-dash (—).
Hier is het verhaal van wat het papier heeft gevonden, simpel verteld.
Het Mysterie: Een "Typfout" Die Geen Is
Jarenlang fluisterden wetenschappers een gerucht: "Large Language Models" (zoals ChatGPT) houden ervan om em-dashes te gebruiken. Mensen vinden ze daarentegen meestal irritant of lastig om te typen, dus gebruiken ze ze spaarzaam. Het is alsof een mens een zin met een komma zou schrijven, terwijl een robot een dramatische streep zou gebruiken om het meer "professioneel" te laten klinken.
Maar tot nu toe was dit slechts geruchtenstroom. Niemand had de strepen in duizenden echte wetenschappelijke artikelen daadwerkelijk geteld om te zien of het gerucht waar was.
Het Onderzoek: Het Tellen van Strepen in een Zee van Tekst
De onderzoeker, Przemysław Czuma, besloot een detective te spelen op grote schaal. Hij keek niet naar gepubliceerde boeken (die vaak door redacteuren worden "opgepoetst" en hun oorspronkelijke interpunctie verliezen), maar hij keek naar medRxiv, een server waar wetenschappers hun ruwe, onbewerkte concepten (preprints) plaatsen voordat ze worden gepubliceerd.
- Het Doel: Hij richtte zich op de "Discussion" (Discussie) sectie van deze artikelen. Dit is het deel waar wetenschappers een verhaal vertellen, hun gevoelens over de resultaten uitleggen en proberen de lezer te overtuigen. Het is het meest "menselijke" deel van een artikel.
- Het Instrument: Hij gebruikte een computerprogramma om meer dan 69.000 van deze concepten te scannen, specifief zoekend naar het em-dash karakter (—).
- De Tijdlijn: Hij splitste de gegevens in twee tijdperken:
- Vóór ChatGPT (vóór november 2022).
- Ná ChatGPT (ná november 2022).
De Bevindingen: Een Langzame Ontbranding, Geen Flits
De resultaten waren spectaculair, maar het gebeurde niet van de ene op de andere dag zoals het omklappen van een lichtschakelaar.
- Vóór de AI-boom: Slechts ongeveer 4% van de artikelen bevatte zelfs één em-dash in hun Discussie-sectie. Het was zeldzaam.
- Ná de AI-boom: Dat aantal sprong naar 11,5%.
- De Trend: Het gebeurde niet onmiddellijk in 2023. Het aantal bleef laag, begon daarna langzaam te stijgen in 2024, en tegen 2025 was het geëscaleerd naar 20%.
De Analogie: Stel je een rustig feestje voor waar bijna niemand een rode hoed draagt. Dan begint er een nieuwe modetrend. Eerst proberen slechts een paar mensen het. Daarna doen er langzaam meer mensen mee. Tegen het volgende jaar draagt bijna één op vijf mensen op het feestje een rode hoed. Dat is wat er gebeurde met de em-dash.
Het Bewijs: Andere Verdachten Uitsluiten
Een goede detective controleert of er andere verklaringen zijn. De onderzoeker voerde verschillende "leugendetectortests" uit om er zeker van te zijn dat de toename van de em-dash niet slechts een willekeurige trend of een verandering in de manier waarop de website tekst formatteert was.
- De "Saai Sectie" Test: Hij controleerde de "Acknowledgments" (Dankwoord) en "Data Availability" (Beschikbaarheid van gegevens) secties (de saaie, standaard onderdelen van een artikel). Als de hele website van opmaak was veranderd, zouden deze secties ook meer strepen bevatten. Dat deden ze niet. De toename was alleen in de verhalende delen.
- De "Foute Datum" Test: Hij keek naar de tijd vóór ChatGPT bestond en deed alsof een willekeurige datum de "startdatum" was. Niets veranderde. Dit bewees dat de toename niet slechts een langzame, natuurlijke drift over de tijd was.
- De "Woordkeuze" Test: Hij keek ook naar specifieke woorden die AI-modellen graag gebruiken (zoals "delve", "groundbreaking" of "leverage"). Deze woorden stegen op exact hetzelfde moment als de strepen.
Wat Dit Betekent (en Wat Het Niet Betekent)
Het artikel is zeer voorzichtig in wat het claimt.
- Het laat WEL zien: Er is iets groots veranderd in de manier waarop wetenschappelijke artikelen worden geschreven tussen 2022 en 2025. De schrijfstijl is verschoven op een manier die overeenkomt met de opkomst van AI-tools. De em-dash is een "populatieniveau" signaal, zoals het merken dat de gemiddelde lengte van een menigte is toegenomen, niet dat elke individuele persoon langer is geworden.
- Het laat NIET zien: Je kunt niet naar een enkel artikel met een em-dash kijken en zeggen: "Dit is door een robot geschreven." Een mens kan ook gewoon van strepen houden. Je kunt ook niet naar een artikel zonder een streep kijken en zeggen: "Dit is 100% menselijk."
- De Conclusie: De studie bevestigt dat de "vingerafdruk" van AI-schrijven zichtbaar wordt in de wetenschappelijke literatuur. Het gebeurde niet direct; het gebeurde terwijl wetenschappers langzaam begonnen deze nieuwe tools te vertrouwen en te gebruiken om hun verhalen te polijsten en te schrijven.
Kortom: de em-dash is de "rook" die suggereert dat er een vuur (AI-gebruik) is ontstoken in de keuken van het wetenschappelijk schrijven, zelfs als we niet precies kunnen aanwijzen welke kookplaat voor elke individuele pan werd gebruikt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.