More than half of recent astronomy papers are written with language-model assistance
Een hiërarchische Bayesiaanse analyse van meer dan 200.000 astronomische artikelen onthult dat meer dan de helft van de recente astro-ph-manuscripten linguïstische sporen vertoont van hulp door taalmodellen, een cijfer dat het minder dan 1% van de artikelen die dergelijk gebruik expliciet vermelden, ver overstijgt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de stille, data-rijke wereld van de astronomie besteden wetenschappers hun dagen aan het vertalen van het licht van verre sterren en sterrenstelsels naar verhalen over het universum. Decennialang was de geschreven taal van deze ontdekkingen een strikt, technisch dialect, ontdaan van franje en volledig gericht op precisie. Maar eind 2022 kwam er een nieuw instrument op het toneel: geavanceerde computerprogramma's die in staat zijn tot het schrijven van vloeiende, mensachtige teksten. Deze hulpmiddelen, bekend als taalmodellen, werden snel populair voor het helpen van onderzoekers bij het opstellen van papers, het controleren van grammatica en het organiseren van complexe ideeën. De vraag die al snel opkwam, was niet of deze hulpmiddelen werden gebruikt, maar hoe wijdverbreid hun invloed was geworden. Als een computer hielp bij het schrijven van een wetenschappelijk artikel, zou de tekst er dan anders uitzien? Zou het een subtiele vingerafdruk dragen, een specifieke set woorden die een menselijke schrijver zelden zou kiezen, maar die een machine juist verkiest?
Een team van onderzoekers van The Ohio State University en het Max Planck Instituut voor Astronomie zette zich in om het antwoord te vinden door naar de werkelijke woorden in de literatuur te kijken. Ze analyseerden de volledige tekst van meer dan 200.000 astronomische papers die werden ingediend tussen 2015 en medio 2026. Hun doel was om te tellen hoeveel van deze documenten tekenen vertoonden van computerondersteuning. Ze richtten zich op een specifieke lijst met woorden die algemeen zijn geworden in door machines gegenereerde tekst, zoals "delve" (diepgaand onderzoeken), "underscore" (benadrukken), "intricate" (complex) en "pivotal" (cruciaal). Dit zijn geen technische termen zoals "redshift" (roodverschuiving) of "supernova"; het zijn stilistische keuzes, woorden die een bepaald ritme aan een zin toevoegen. Voordat deze computertools opkwamen, gebruikten astronomen deze woorden spaarzaam. De onderzoekers wilden weten of de plotselinge verschijning van deze woorden in recente papers betekende dat de papers met hulp werden geschreven.
Om een duidelijk beeld te krijgen, telde het team niet alleen de woorden; ze bouwden een geavanceerd statistisch model om het signaal van de ruis te scheiden. Ze wisten dat taal verandert in de loop van de tijd, en dat sommige woorden populair kunnen worden om redenen die niets met computergebruik te maken hebben. Om dit te compenseren, keken ze naar hoe deze woorden werden gebruikt in papers geschreven vóór 2020, een tijd vóórdat de tools breed beschikbaar waren. Dit gaf hen een basislijn voor hoe vaak een menselijke astronoom deze woorden van nature zou gebruiken. Ze vergeleken deze basislijn vervolgens met de papers geschreven na 2022. Cruciaal was dat ze ook keken naar het kleine aantal papers waarin auteurs expliciet aangaven een taalmodel te hebben gebruikt. Deze toegegeven papers dienden als een kalibratiepunt, een bekend referentiepunt om het team te helpen begrijpen hoe een "door de computer ondersteund" paper eruitziet in de data.
De resultaten waren opmerkelijk. Tegen 2025 schatten de onderzoekers dat meer dan de helft van alle nieuwe astronomische papers een spoor van ondersteuning door taalmodellen vertoonde. Specifiek berekenden ze dat 54 procent van de papers een vocabulairepatroon vertoonde dat consistent is met computerhulp, met een foutmarge die het cijfer zelfs onder de meest conservatieve aannames comfortabel boven de 36 procent hield. Dit aantal is snel gestegen; in 2024 lag het cijfer rond de 20 procent, en tegen de eerste helft van 2026 was het gestegen naar bijna 87 procent. Dit suggereert dat het gebruik van deze tools is verschoven van een zeldzaam experiment naar een standaard onderdeel van het schrijfproces voor de meerderheid van de astronomen.
De geschiedenis is echter complexer dan een simpele telling van papers. De onderzoekers ontdekten dat de "vingerafdruk" van de computer moeilijker te zien wordt. In de begindagen van 2023 hadden de papers die deze tools gebruikten een zeer sterke overmaat aan de specifieke markerwoorden—ongeveer 3,5 keer meer dan een door mensen geschreven paper zou hebben. Tegen 2026 was die overmaat gedaald naar slechts 1,5 keer de basislijn. Dit gebeurde omdat auteurs zich begonnen aan te passen. Toen de specifieke woorden zoals "delve" beroemd werden als tekenen van computergebruik, stopten schrijvers met het zo intensief gebruiken ervan, of werkten ze ze uit de tekst, waardoor de hand van de computer minder duidelijk werd. De tools worden nog steeds gebruikt, maar ze worden subtieler en versmelten natuurlijker met menselijke schrijfstijlen.
Misschien wel de meest veelzeggende bevinding is de kloof tussen wat er gebeurt en wat er wordt gezegd. Terwijl de onderzoekers schatten dat 54 procent van de papers in 2025 werd ondersteund, bevatte slechts 0,81 procent van die papers een formele verklaring waarin stond dat een computer werd gebruikt. Met andere woorden: voor elk enkel paper waarbij een auteur het gebruik van het hulpmiddel toegegaf, waren er ongeveer 66 papers die dezelfde linguïstische sporen vertoonden maar er niets over zeiden. De onderzoekers controleerden hun detectiemethoden zorgvuldig en stelden vast dat ze niet veel verklaringen misten; de stilte lijkt echt te zijn. De meeste auteurs die wel iets zeiden, gaven aan de tools te hebben gebruikt voor grammatica, helderheid of taalkundige bewerking, taken die veel tijdschriften al toestaan. Het gebrek aan openheid lijkt niet voort te komen uit een poging om wangedrag te verbergen, maar uit een verlangen om een stigma te vermijden, aangezien de wetenschappelijke gemeenschap het nog niet eens is over de aanvaardbaarheid van het gebruik van deze tools.
De studie concludeert dat het landschap van het wetenschappelijk schrijven fundamenteel is verschoven. De tools zijn geen nieuwigheid meer; ze zijn een dominante kracht in hoe astronomische papers worden geproduceerd. De onderzoekers merken op dat deze verschuiving niet noodzakelijkerwijs een falen van integriteit is, maar een verandering in praktijk waar de gemeenschap nog niet op is ingelopen. Naarmate de linguïstische sporen van deze tools blijven vervagen en moeilijker te detecteren worden, sluit het venster om hun impact te meten zich. De auteurs suggereren dat de meest urgente stap voorwaarts niet is om de tools te verbieden of een vervagend signaal te achtervolgen, maar om een duidelijke norm van openheid vast te stellen. Als auteurs simpelweg zouden vermelden wanneer zij deze hulpmiddelen gebruikten, zou het vakgebied vooruit kunnen gaan zonder de verwarring van verborgen assistentie, door een praktijk die momenteel wordt genegeerd om te zetten in een die openlijk wordt begrepen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.