RegCheck: A tool for structured comparisons between study registrations and papers
Dit artikel introduceert RegCheck, een modulaire, door LLM ondersteunde tool die is ontworpen om de gestructureerde vergelijking van studieregistraties met gepubliceerde artikelen te faciliteren door de efficiëntie van AI te combineren met menselijke expertise om de wetenschappelijke transparantie en reproduceerbaarheid te verbeteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen. De verdachte (een wetenschappelijke studie) heeft twee aanwijzingen achtergelaten: een Plan dat geschreven werd vóór de misdaad plaatsvond (de registratie van de studie) en een Verhaal dat geschreven werd na de misdaad (het gepubliceerde artikel). De grote vraag is: heeft de verdachte zich aan het plan gehouden, of heeft hij stiekem wijzigingen doorgevoerd om het verhaal er beter uit te laten zien?
Jarenlang was het controleren van deze twee aanwijzingen alsof je probeerde een specifieke naald in een hooiberg te vinden terwijl je dikke winterhandschoenen droeg. Het is traag, saai en vereist een supermenselijk niveau van concentratie. Omdat het zo moeilijk is, slaat de meeste detectives (beoordelaars en redacteuren) deze controle vaak over, in de hoop dat de verdachte eerlijk is geweest. Maar zoals de auteurs van dit artikel opmerken, is dat een riskante gok.
Maak kennis met RegCheck, een nieuwe digitale sidekick die de detective helpt zijn werk te doen zonder burn-out te raken.
Waarom niet gewoon een robot vragen?
Je denkt misschien: "Wacht eens even, kunnen we niet gewoon beide documenten naar een hippe chatbot uploaden en het hem laten vergelijken?" De auteurs zeggen nee, en dit is waarom:
- Het "Toverstaf"-probleem: Als je een standaard chatbot vraagt om twee teksten te vergelijken, verandert het antwoord afhankelijk van hoe je de vraag stelt, in welke stemming de robot is, of zelfs wat hij voor ontbijt heeft gegeten. De ene dag zegt hij "Alles komt overeen," en de volgende dag zegt hij "Ze zijn totaal verschillend." Dat is niet goed voor de wetenschap, waar we elke keer hetzelfde antwoord nodig hebben.
- Het Privacylek: Het uploaden van geheime, nog niet gepubliceerde onderzoeksartikelen naar een publieke chatbot is alsof je je geheime recept in een druk plein schreeuwt. Het bedrijf dat de bot beheert, kan je gegevens gebruiken om hun toekomstige robots te trainen.
- De Geheugenval: Chatbots onthouden wat je eerder in het gesprek hebt gezegd. Als de bot in de war raakt over het deel over de "hypothese", kan die verwarring doorsijpelen en ervoor zorgen dat hij denkt dat het gedeelte over de "resultaten" ook fout is, zelfs als dat niet zo is. De fouten stapelen zich op als dominostenen.
- Het "Hallucinatie"-risico: Chatbots verzinnen graag dingen. Als ze een antwoord niet kunnen vinden, verzinnen ze er vaak gewoon een en klinken ze heel zelfverzekerd over. Je zou het hele artikel zelf moeten lezen om te controleren of de robot niet heeft gelogen, wat het hele doel van het gebruik van een robot tenietdoet!
De Slimme Oplossing: RegCheck
In plaats van een robot simpelweg te vragen om het "te doen", hebben de auteurs RegCheck gebouwd, wat meer werkt als een hoogtechnologische lopende band met een menselijke supervisor. Het gebruikt een speciaal framework genaamd IDEA (Ingestion, Definition, Extraction, Adjudication) om de taak op te delen in kleine, beheersbare stappen:
- Ingestion (De Bibliothecaris): Het pakt het Plan en het Verhaal op en ruimt ze op, zodat de tekst klaar is om gelezen te worden.
- Definition (De Baas): Een menselijke expert (jij dus!) vertelt het systeem waar het naar moet kijken. Misschien geef je om de steekproefomvang, of de specieke medicatie-dosering. Jij bent de baas; de robot bepaalt niet wat belangrijk is.
- Extraction (De Scanner): In plaats van het hele boek te lezen, gebruikt het systeem een "slimme highlighter" (genaamd embeddings) om alleen de specifieke zinnen in het Plan en het Verhaal te vinden die passen bij de instructies van de baas. Het haalt de exacte citaten eruit, zoals een detective bewijsmateriaal op een kurkbord speldt.
- Adjudication (De Rechter): Pas bij deze laatste stap komt de robot (een Large Language Model) in actie. Hij kijkt naar de specifieke citaten die het systeem heeft gevonden en zegt: "Komen deze overeen?" Hij geeft een oordeel: Afwijking (ze hebben iets veranderd), Geen Afwijking (ze hielden zich aan het plan), of Onvoldoende Bewijs (we kunnen het niet zeggen omdat de informatie ontbreekt).
Een Praktijktest
De auteurs hebben dit getest met een fictieve klinische studie voor een diabetesmedicijn. Hier is wat RegCheck vond:
- Het Goede: Het bevestigde dat de medicijndosis, de randomisatiemethode en de startdatum exact waren zoals gepland.
- Het Slechte (Het Sluwe Gedrag):
- De Uitkomstwissel: Het plan zei dat ze de verandering in bloedsuikerspiegels zouden meten (een getal), maar het artikel rapporteerde het percentage mensen dat verbeterde (een ja/nee). Dit is een klassieke truc om resultaten sterker te laten lijken, en RegCheck zag het direct.
- De Strengere Regels: Het plan zei dat ze mensen met nierproblemen zouden uitsluiten als hun waarden onder de 30 lagen. Het artikel zei dat ze iedereen onder de 45 uitsloten. Dat is een kleine numerieke verandering, maar het kan betekenen dat ze zieker patiënten hebben uitgesloten om het medicijn veiliger te laten lijken. Een mens zou dit kunnen missen, maar RegCheck merkte het op.
- De Vroege Stop: Het plan zei dat ze 300 mensen wilden, maar ze stopten bij 212. RegCheck betrapte deze "onderbezetting"-afwijking.
Hoe Zeker Zijn We?
De auteurs zijn zeer zeker dat RegCheck het proces sneller en gemakkelijker maakt, maar ze zijn ook eerlijk over het feit dat het nog niet perfect is.
- Ze hebben niet bewezen dat RegCheck 100% nauwkeurig is.
- Ze beweren niet dat het menselijke experts vervangt. Sterker nog, ze benadrukken dat mensen in de loop moeten blijven om de definitieve beslissing te nemen.
- Ze suggereren dat RegCheck over het algemeen erg goed is in het vinden van de "naald in de hooiberg", maar ze geven toe dat het fouten kan maken (zoals een verandering markeren die eigenlijk geen probleem is, of een subtiele verandering missen).
- Ze voeren momenteel tests uit om te zien hoe goed het overeenkomt met menselijke experts. Hun doel is dat RegCheck net zo goed overeenkomt met mensen als mensen onderling met elkaar.
De Kern van het Verhaal
RegCheck is geen toverstaf die de problemen in de wetenschap van de ene op de andere dag oplost. Het is een instrument dat de drempel verlaagt. Het verandert een taak die uren van saai lezen kost in een snelle, gestructureerde controle die minuten duurt.
De auteurs hopen dat door deze controle makkelijker te maken, auteurs dit zelf zullen doen voordat ze artikelen indienen, en dat beoordelaars dit daadwerkelijk zullen doen tijdens het beoordelingsproces. Het gaat erom dat wanneer wetenschappers zeggen: "We hebben precies gedaan wat we van plan waren," ze dat ook echt menen. En als ze dat niet hebben gedaan? Nou, we hebben nu tenminste een manier om ze te betrappen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.