← Nieuwste papers
💬 NLP

From peer review nuances to best practices

Dit artikel analyseert de impact van drie specifieke nuances in peer review-data — paperversie, scoreversie en invoerformaat — op downstream-taken om best practices vast te stellen voor zowel dataleveranciers als gebruikers.

Oorspronkelijke auteurs: Sheng Lu

Gepubliceerd 2026-07-28
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sheng Lu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het geheime leven van wetenschappelijke reviews

Stel je een wereld voor waarin wetenschappers hun grote ideeën voorleggen aan een jury, net als bij een talentenjacht. Maar in plaats van te zingen of te dansen, presenteren zij onderzoeksartikelen. Deze juryleden, de "reviewers" genoemd, lezen het werk, schrijven gedetailleerde feedback en geven er een score aan om te beslissen of het gepubliceerd mag worden. Dit proces wordt peer review genoemd, en het is de poortwachter van de wetenschap. Er is echter een addertje onder het gras: het artikel dat een beoordelaar aan het begin van het proces leest, kan er heel anders uitzien dan de definitieve versie die uiteindelijk wordt gepubliceerd. Zo kan ook de score die een beoordelaar geeft voordat de auteur terugvecht, verschillen van de score die zij geven nadat de discussie heeft plaatsgevgevonden.

Onlangs zijn onderzoekers begonnen met het gebruik van superintelligente computerprogramma's, bekend als Large Language Models (LLM's), om te helpen bij dit beoordelingsproces. Deze modellen kunnen een artikel lezen en een review schrijven net als een mens. Maar hier is het probleem: als we deze computerprogramma's de verkeerde versie van een artikel voeren, of de scores van verschillende momenten door elkaar halen, kunnen de resultaten volkomen misleidend zijn. Het is alsof je een jury vraagt om de prestatie van een deelnemer te beoordelen op basis van een auditievideo, om vervolgens die beoordeling te vergelijken met de score die ze gaven nadat de deelnemer zijn fouten op het podium had gecorrigeerd. Om ervoor te zorgen dat deze computerjury's daadwerkelijk de juiste dingen leren, moeten we precies begrijpen naar welke versie van het artikel en welke score we kijken.

De grote ontdekking van het artikel: Meng je versies niet!

Dit artikel is een waarschuwing voor iedereen die onderzoekt hoe computers omgaan met wetenschappelijke reviews. De auteurs, onder leiding van Lu Sheng, ontdekten dat veel mensen in de haast om data voor onderzoek te gebruiken, per ongeluk verschillende "versies" van hetzelfde verhaal door elkaar halen, wat leidt tot verwarrende en soms onjuiste conclusies. Ze keken naar drie belangrijke zaken die door elkaar worden gehaald: de versie van het artikel (het concept versus de definitieve, gepolijste kopie), de versie van de score (de score vóór de discussie van de auteur versus ernaaf) en het inputformaat (hoe de tekst in de computer wordt gevoerd).

Het puzzelstukje van de artikelversie
Denk aan een artikel als een huis in aanbouw. Het "eerste concept" is het ruwe blauwdruk met enkele wankele muren. De "camera-ready versie" is het afgewerkte huis met een verse laag verf en een nieuw dak. De auteurs ontdekten dat artikelen die met lagere scores beginnen, de grootste transformaties ondergaan. Sterker nog, de "inhoudelijke" delen van het artikel (de methoden en resultaten) veranderen het meest, terwijl de "inkaderende" delen (zoals de inleiding) minder veranderen.

Hier komt het lastige deel: wanneer ze computermodellen vroegen om het ruwe concept en het afgewerkte huis te beoordelen, leken de scores bijna hetzelfde. Het leek alsof de computer niet om de verbeteringen gaf! Maar de auteurs groeven dieper en vonden een geheim ingrediënt: auteurinformatie. Wanneer de namen en universiteiten van de auteurs werden opgenomen, gaven de computermodellen hogere scores aan het afgewerkte huis, waarschijnlijk omdat ze onder de indruk waren van wie het geschreven had (een "autoriteitseffect"). Echter, wanneer ze de namen van de auteurs verborgen, gaven de computermodellen het afgewerkte huis daadwerkelijk een hogere score omdat de inhoud echt beter was. Deze twee effecten hieven elkaar op, waardoor het leek alsof er niets veranderde. Dit betekent dat als je niet controleert wie het artikel heeft geschreven, je het feit over het hoofd kunt zien dat het artikel daadwerkelijk beter is geworden.

De valstrik van de scoreversie
De auteurs keken ook naar wat er gebeurt nadat auteurs de kans krijgen om terug te argumenteren (een zogenaamde "rebuttal"). Ze ontdekten dat bijna één derde (29,7%) van de reviews de algemene score veranderde na deze discussie. Meestal bewoog de score met 0,5 punt. Dit klinkt misschien klein, maar het is enorm! Ongeveer 65,6% van deze veranderingen vond plaats direct bij de "beslissingslijn" (zoals van een 2,5 naar een 3,0 gaan), wat het verschil maakt tussen een artikel dat wordt geaccepteerd of afgewezen.

Het gevaar hier is het mengen van de tekst en de score. Stel je een dataset voor waarin de computer de oude reviewtekst leest (vóór de discussie) maar wordt gevraagd om de nieuwe score te voorspellen (na de discussie). De auteurs testten dit en ontdekten dat deze mismatch de computermodellen veel beter doet lijken dan ze in werkelijkheid zijn. Sterker nog, het "beste" computermodel veranderde afhankelijk van de vraag of je de juiste scores of de door elkaar gehaalde scores gebruikte. Als je de verkeerde scores gebruikt, denk je misschien dat een model een genie is, terwijl het in werkelijkheid gewoon raadt op basis van een verkeerd samengestelde puzzel.

Het mysterie van het inputformaat
Ten slotte vroegen de onderzoekers zich af: maakt het uit of je het artikel aan de computer voert als platte tekst, een gestructureerde lijst (JSON), een geformatteerd document (Markdown), of zelfs als een afbeelding van de pagina? Voor de meeste computermodellen die ze testten, veranderde het formaat de score niet veel. Echter, voor één specif specifieke grote model (gpt-oss-120b) maakte het formaat een groot verschil, waarbij het gestructureerde JSON-formaat leidde tot hogere scores. Dit suggereert dat verschillende computers verschillende formaten op verschillende manieren "lezen" en dat we er niet vanuit kunnen gaan dat ze allemaal hetzelfde werken.

Wat moeten we doen?

Het artikel sluit af met een reeks "best practices" om deze verwarring te voorkomen. Voor de mensen die data delen, geldt dat ze elke versie van het artikel en elke scoreversie moeten opslaan en labelen, en niet alleen de definitieve versies. Voor de mensen die de data gebruiken, moeten ze dubbelchecken: "Gebruik ik het concept of de definitieve versie? Gebruik ik de score vóór of na de discussie? En in welk formaat is dit?"

Door aandacht te besteden aan deze details, kunnen onderzoekers ervoor zorgen dat hun computermodellen leren van de juiste informatie. De auteurs suggereren dat deze "nuances" niet slechts saaie details zijn; ze zijn in feite krachtige instrumenten om te testen hoe slim onze computermodellen echt zijn. Als een model het verschil kan zien tussen een ruw concept en een gepolijste definitieve versie, of als het kan opmerken wanneer een score is veranderd, dan laat dat zien dat het model de inhoud echt begrijpt en niet alleen maar gokt. Dus de volgende keer dat je een studie ziet over AI die wetenschappelijke papers beoordeelt, onthoud dan om te vragen: "Welke versie van het verhaal vertellen ze?"

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →