Is Peer Review Really in Decline? Analyzing Review Quality across Venues and Time
Dit artikel daagt het populaire narratief van dalende standaarden uit door een nieuw kader te introduceren voor het kwantificeren van de kwaliteit van reviews en toont via een cross-temporele analyse van belangrijke AI- en taalkundige conferenties aan dat de mediane reviewkwaliteit in de loop van de tijd stabiel is gebleven.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De Grote Vraag: Worden Reviews Slechter?
Stel je voor dat je een enorme, wereldwijde talentenjacht organiseert. Elk jaar dienen duizenden zangers (onderzoekers) hun liedjes (papers) in om beoordeeld te worden door een jury van experts (reviewers). Onlangs is er veel geroddel in het publiek: "De juryleden worden lui! Ze luisteren niet meer goed genoeg. De kwaliteit van de feedback daalt omdat er te veel zangers zijn en te weinig juryleden."
Dit artikel stelt een simpele vraag: Is dit geroddel waar? Worden de reviews daadwerkelijk slechter naarmate de tijd verstrijkt, of is dat slechts een gevoel?
Het Probleem: Je Kunt Appels Niet Vergelijken met Peren
Om dit te beantwoorden, probeerden de onderzoekers "reviewkwaliteit" te meten. Maar ze liepen tegen een probleem aan. Stel je voor dat je de kwaliteit van een sandwich uit 2018 probeert te vergelijken met een sandwich uit 2025.
- In 2018 werd de sandwich misschien geserveerd op een servetje zonder instructies.
- In 2025 komt hij in een luxe doos met een checklist van ingrediënten.
- Sommige juryleden schrijven lange paragrafen; anderen schrijven opsommingstekens.
- Sommige juryleden schrijven in een specifiek format; anderen schrijven vrijuit.
Omdat de "formulieren" en stijlen door de jaren heen en over verschillende conferenties (zoals ICLR, NeurIPS en ACL) zo veel veranderden, was het onmogelijk om ze eerlijk te vergelijken. Het was alsof je de lengte van mensen probeerde te meten met een liniaal voor de ene groep en een meetlint voor de andere groep.
De Oplossing: De "Review Vertaler"
Om dit op te lossen, bouwden de auteurs een universele vertaler voor reviews.
- Afvlakken: Ze namen al die verschillende formulieren en maakten er één lange, doorlopende blok tekst van.
- Itemisatie: Ze gebruikten een slimme AI (een Large Language Model) die fungeerde als een professionele redacteur. Deze AI nam de rommelige tekst en organiseerde deze opnieuw in standaardsecties: Samenvatting, Sterktes, Zwaktes en Overig.
Beschouw dit als het nemen van elke sandwich, ongeacht hoe deze geserveerd werd, en het snijden in standaard stukken zodat je het brood, het vlees en de kaas apart kunt proeven. Hierdoor konden ze reviews uit 2018 direct vergelijken met reviews uit 2025.
Hoe Ze "Kwaliteit" Maten
Zodra de reviews gestandaardiseerd waren, mat het team ze met drie belangrijke "smaaktesten":
Substantie (Zit er genoeg vlees op de botten?):
- Lichtgewicht: Hoe lang is de review? (Tellen van karakters).
- Diepgaand: Hoeveel verschillende punten of "items" heeft de reviewer gemaakt?
- Analogie: Een korte review is als een klein cracker; een lange review is een volledige maaltijd. Ze telden hoeveel "hapjes" informatie er in de review zaten.
Actiegerichtheid (Kan de zanger zijn liedje daadwerkelijk verbeteren?):
- Gaf de reviewer specifieke instructies? (bijv. "Verander Figuur 3" versus "Dit is slecht").
- Analogie: Een goede review is als een coach die zegt: "Je linker voet staat te ver naar voren." Een slechte review is alleen maar roepen: "Je bent niet goed!" De auteurs maten hoeveel specifieke "fix-het-verzoeken" in de tekst stonden.
Gronding (Heeft de reviewer daadwerkelijk naar het paper gekeken?):
- Wijs de reviewer naar specifieke delen van het paper? (bijv. "Zie pagina 4, regel 10").
- Analogie: Een gegronde review is als een detective die naar bewijs op tafel wijst. Een ongegronde review is gewoon gokken zonder naar de aanwijzingen te kijken.
De Resultaten: Het Geroddel Was Onjuist
Na het analyseren van duizenden reviews van top computerwetenschappelijke conferenties over meerdere jaren, vertelde de data een verrassend verhaal:
De mediane kwaliteit van de reviews NAM NIET af.
Ondanks de angst dat reviewers burn-out raken of dat AI hen lui maakt, is de "gemiddelde" review vandaag de dag net zo behulpzaam, gedetailleerd en gegrond als de reviews van een paar jaar geleden. Het "geroddel" over achteruitgang werd niet ondersteund door de cijfers.
Waarom Voelt Het Dan Alsof De Kwaliteit Daalt?
Als de kwaliteit hetzelfde is, waarom voelt het dan voor iedereen alsof het slechter wordt? De auteurs bieden een paar theorieën (hypothesen) aan:
- De "Meer Mensen, Meer Ruis" Theorie: Zelfs als de gemiddelde kwaliteit gelijk blijft, neemt het totale aantal slechte reviews toe naarmate het aantal inzendingen groeit. Als je 100 reviews hebt en er zijn er 5 slecht, is dat 5%. Als je 10.000 reviews hebt en er zijn er 500 slecht, is dat nog steeds 5%, maar plotseling zijn er 500 mensen die boos zijn. Het volume van slechte ervaringen zorgt ervoor dat het voelt alsof alles kapot is.
- De "Slechtste Werd Slechter" Theorie: Misschien is het gemiddelde prima, maar worden de absoluut slechtste reviews zelfs nog slechter, en zijn dat de reviews waar mensen over praten op sociale media.
- De "We Weten Het Gewoon Niet" Theorie: Misschien is de kwaliteit wel degelijk gedaald op manieren die de auteurs niet konden meten (zoals de "ziel" van de review), maar hun huidige instrumenten konden dat niet zien.
De Conclusie
Het artikel concludeert dat we niet in paniek moeten raken en ervan uit moeten gaan dat het systeem instort. De "gemiddelde" review houdt stand. Echter, omdat het aantal papers explodeert, moeten we harder werken om ervoor te zorgen dat iedereen een goede review krijgt, en niet alleen de gemiddelde persoon.
De auteurs hebben ook een toolkit gebouwd (code en data) die andere onderzoekers kunnen gebruiken om de "gezondheid" van het reviewsysteem in de toekomst te blijven controleren, zodat we worden geleid door feiten en niet alleen door gevoelens.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.