Detecting Evidence of LLM Contributions to Open Access Biomedical Literature: A Bibliometric Analysis
Deze bibliometrische analyse van bijna 3 miljoen open-access biomedische artikelen onthult een significante toename na 2022 in met LLM geassocieerde terminologie, wat wijst op een snelle adoptie van generatieve AI-tools en de dringende behoefte aan transparantie en detectiemethoden om de wetenschappelijke integriteit te waarborgen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Al decennia lang vertrouwen wetenschappers op hulpmiddelen om hun schrijven helderder te maken en hun onderzoek efficiënter te maken. Spellingcontrole en grammaticasoftware zijn al lang standaardhulpmiddelen die fouten gladstrijken en betere woordkeuzes suggereren zonder de kernstem van de auteur te veranderen. In de afgelopen jaren is een nieuwe generatie van deze hulpmiddelen opgekomen, die in staat is om hele paragrafen tekst te genereren die opmerkelijk menselijk klinken. Deze systemen, bekend als grote taalmodellen, zijn getraind op enorme hoeveelheden geschreven materiaal en kunnen coherente, gepolijste proza produceren over bijna elk onderwerp. Hoewel ze de belofte inhouden om het schrijfproces te versnellen, roepen ze ook een moeilijke vraag op voor de wetenschappelijke gemeenschap: hoe kunnen we het verschil zien tussen een zin geschreven door een menselijke onderzoeker en een die door een machine is vervaardigd? Dit onderscheid is van groot belang omdat de integriteit van de wetenschappelijke literatuur afhangt van de authenticiteit van de ideeën en de nauwkeurigheid van de gepresenteerde feiten. Als een aanzienlijk deel van het nieuwe onderzoek wordt opgesteld of zwaar bewerkt door deze tools, moet de manier waarop we die kennis lezen, vertrouwen en erop voortbouwen mogelijk veranderen.
Een team van onderzoekers zette zich uit om deze vraag te beantwoorden door direct naar de woorden zelf te kijken. Ze richtten zich op de enorme collectie open-access medische en biologische onderzoekspapers die beschikbaar zijn in een publieke database genaamd PubMed Central. Deze collectie bevat miljoenen artikelen, wat een enorm venster biedt op hoe wetenschappers wereldwijd hun werk opschrijven. Het team probeerde niet te raden welke specifieke papers door machines waren geschreven, een taak die zowel voor mensen als computerprogramma's moeilijk is gebleken. In plaats daarvan zochten ze naar een ander soort signaal. Ze onderzochten of bepaalde woorden en zinsneden, die eerdere studies hebben aangetoond veel vaker door kunstmatige intelligentie dan door mensen worden gebruikt, plotseling veel gebruikelijker zijn geworden in de wetenschappelijke literatuur na eind 2022, toen deze tools breed beschikbaar kwamen voor het publiek.
De onderzoekers verzamelden bijna drie miljoen artikelen gepubliceerd tussen 2019 en 2024. Ze stelden een lijst samen van 190 specifieke woorden en zinsneden die in eerder onderzoek waren gemarkeerd als kenmerkend voor door machine gegenereerde tekst. Deze omvatten bijvoeglijke naamwoorden zoals "meticulous" (zorgvuldig) en "intricate" (complex), werkwoorden zoals "delve" (diepgaand onderzoeken) en "underscore" (onderstrepen), en langere zinsneden zoals "navigating the complexities of" (navigeren door de complexiteit van) of "it is important to note" (het is belangrijk om op te merken). Vervolgens scantten ze elk artikel in hun dataset om te zien hoe vaak deze termen voorkamen. Het doel was om te zien of de frequentie van deze woorden in de loop van de tijd veranderde, waarbij specifiek werd gekeken naar een scherpe sprong in het gebruik na de release van de nieuwe AI-tools.
De resultaten toonden een duidelijke en dramatische verschuiving in de taal van het biomedisch onderzoek. Vóór 2022 groeide het gebruik van deze specifieke termen langzaam en gestaag, consistent met normale veranderingen in hoe mensen schrijven. Echter, beginnend in 2023 en voortdurend in 2024, explodeerde het gebruik van veel van deze woorden. Zo kwam het woord "meticulously" (met uiterste zorgvuldigheid), dat minder dan duizend keer in de gehele database voorkwam in 2019, meer dan 16.000 keer voor in 2024. De zinsnede "it's important to note" (het is belangrijk om op te merken) zag een vergelijkbare stijging, van slechts 29 instanties in 2019 naar bijna 800 in 2024. Misschien wel het meest veelzeggend waren de langere, complexere zinsneden. De combinatie "delving into the intricacies of" (het diepgaand onderzoeken van de complexiteit van) was vrijwel niet aanwezig in de literatuur vóór 2023, maar tegen 2024 kwam het in tientallen artikelen voor. De onderzoekers merkten op dat dit niet slechts geïsoleerde woorden waren die populair werden; de specifieke woordcombinaties die bekend staan als kenmerken van AI-schrijven, verschenen steeds vaker samen.
De studie keek ook naar hoe deze woorden met elkaar in combinatie werden gebruikt. Ze ontdekten dat paren en groepen van deze met AI geassocieerde termen samen in dezelfde artikelen verschenen met een frequentie die statistisch gezien onwaarschijnlijk is door toeval. Zo begonnen de woorden "artificial intelligence" (kunstmatige intelligentie) en "underscore" (onderstrepen) veel vaker samen in dezelfde papers te verschijnen dan voorheen. De onderzoekers observeerden dat deze patronen niet slechts een langzame evolutie van taalstijl waren, wat geleidelijk over vele jaren zou gebeuren, maar eerder een plotseling kantelpunt dat exact samenviel met de publieke release van generatieve AI-tools. Hoewel de studie niet kan bewijzen dat elk individueel artikel door een machine is geschreven, suggereert de enorme schaal van deze linguïstische verschuiving dat deze tools uitgebreid worden gebruikt door auteurs binnen het vakgebied.
De auteurs van de studie benadrukken dat dit niet betekent dat het onderzoek zelf noodzakelijkerwijs gebrekkig is, noch suggereert het dat elk paper dat deze woorden gebruikt inauthentiek is. In plaats daarvan wijzen de bevindingen op een snelle en wijdverspreide adoptie van nieuwe schrijfhulpmiddelen die de textuur van wetenschappelijke communicatie veranderen. De onderzoekers betogen dat omdat deze tools soms fouten kunnen maken of inhoud kunnen produceren die een echt begrip mist, de wetenschappelijke gemeenschap een betere manier moet ontwikkelen om te identificeren wanneer ze worden gebruikt. Ze suggereren dat in plaats van te proberen deze tools te verbieden, die waarschijnlijk hier zijn om te blijven, wetenschappers, redacteuren en beoordelaars zich moeten richten op transparantie. Door te erkennen wanneer en hoe deze tools worden gebruikt, kan het wetenschappelijke verslag betrouwbaar blijven, zelfs terwijl de methoden voor het creëren ervan blijven evolueren. De studie concludeert dat de taal van de wetenschap verandert, en het herkennen van deze nieuwe patronen is de eerste stap naar het begrijpen van hoe kunstmatige intelligentie de manier waarop we kennis delen vormgeeft.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.