← Nieuwste papers
💻 computer science

Guidelines for Empirical Studies in Software Engineering involving Large Language Models

Dit artikel presenteert een door 22 onderzoekers ontwikkeld raamwerk met een taxonomie van zeven studietypen en acht richtlijnen om reproduceerbaarheid en transparantie te waarborgen in empirisch software-engineeringonderzoek dat Large Language Models gebruikt.

Oorspronkelijke auteurs: Sebastian Baltes, Florian Angermeir, Chetan Arora, Marvin Muñoz Barón, Chunyang Chen, Lukas Böhme, Fabio Calefato, Neil Ernst, Davide Falessi, Brian Fitzgerald, Davide Fucci, Junda He, Christoph Treud
Gepubliceerd 2026-03-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sebastian Baltes, Florian Angermeir, Chetan Arora, Marvin Muñoz Barón, Chunyang Chen, Lukas Böhme, Fabio Calefato, Neil Ernst, Davide Falessi, Brian Fitzgerald, Davide Fucci, Junda He, Christoph Treude, Marcos Kalinowski, Stefano Lambiase, Daniel Russo, Mircea Lungu, Cristina Martinez Montes, Lutz Prechelt, Paul Ralph, Rijnard van Tonder, Stefan Wagner

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat Software Engineering (het bouwen van computerprogramma's) een enorme bouwplaats is. Vroeger werkten hier alleen menselijke bouwers met hun eigen gereedschap. Maar nu is er een nieuwe, magische robot genaamd LLM (Large Language Model) op de bouwplaats verschenen. Deze robot kan ontwerpen maken, instructies schrijven en zelfs deels bouwen.

Het probleem? Deze robot is een beetje onvoorspelbaar. Als je hem twee keer dezelfde opdracht geeft, geeft hij soms twee heel verschillende antwoorden. Hij onthoudt ook niet precies wat hij heeft geleerd (zijn "trainingsdata" is een geheim), en hij verandert constant van uiterlijk en gedrag.

Dit maakt het voor wetenschappers die onderzoek doen naar deze robot erg lastig. Als ze zeggen: "De robot werkt goed!", kan een ander wetenschapper dat niet controleren, omdat de robot misschien morgen alweer anders werkt.

Om dit op te lossen, hebben 22 experts uit de hele wereld samengewerkt. Ze hebben een grote handleiding (deze paper) geschreven met regels voor hoe je onderzoek moet doen met deze robot, zodat iedereen het resultaat kan begrijpen en controleren.

Hier is de handleiding, vertaald in simpele taal met een paar creatieve vergelijkingen:

1. De Zeven Manieren waarop de Robot wordt gebruikt (De "Soorten")

De experts hebben bedacht dat de robot op zeven verschillende manieren op de bouwplaats kan werken. Het is belangrijk om te weten welke rol hij heeft, want de regels zijn per rol iets anders:

  • De Vertaler: Hij helpt mensen om grote hoeveelheden tekst te ordenen (bijv. interviews samenvatten).
  • De Keurmeester: Hij kijkt of code of teksten goed zijn, net als een inspecteur.
  • De Samenvatter: Hij maakt grote hoeveelheden informatie beknopt en begrijpelijk.
  • De Acteur: Hij doet alsof hij een mens is in een experiment (bijv. een klant die een app test).
  • De Onderzoeker: Mensen kijken hoe andere mensen de robot gebruiken.
  • De Nieuwe Tool: Mensen bouwen nieuwe gereedschappen die de robot gebruiken.
  • De Testkandit: De robot zelf wordt getest om te zien hoe goed hij is.

2. De Acht Gouden Regels (De "Handleiding")

Om ervoor te zorgen dat het onderzoek eerlijk en controleerbaar is, moeten onderzoekers deze acht regels volgen:

Regel 1: Wees eerlijk over de robot (De "Open Deur" regel)

  • Vergelijking: Als je een gerecht kookt met een geheimzinnig poeder, moet je zeggen wat het is.
  • De regel: Je moet in je onderzoek duidelijk zeggen: "Ja, we hebben een robot gebruikt." Zeg ook precies wat hij deed en waar hij in het proces zat.

Regel 2: Vertel precies welk type robot het is (De "Paspoort" regel)

  • Vergelijking: Als je zegt "Ik heb een auto gebruikt", is dat niet genoeg. Was het een oude Ford of een nieuwe Tesla? En welke kleur?
  • De regel: Je moet de exacte naam, versie en instellingen van de robot noteren. Omdat de robot elke dag kan veranderen, moet je ook de datum noteren.

Regel 3: Laat de hele machine zien, niet alleen de motor (De "Motorblok" regel)

  • Vergelijking: Een robot is vaak ingebouwd in een grotere machine met knoppen, schakelaars en leidingen. Als je alleen de motor laat zien, begrijp je niet hoe de machine werkt.
  • De regel: Beschrijf hoe de robot is aangesloten op andere systemen. Hoe krijgt hij zijn informatie? Hoe geeft hij het antwoord terug?

Regel 4: Deel de instructies die je gaf (De "Recept" regel)

  • Vergelijking: Als je een taart bakt, moet je het recept delen. Als je de robot iets vraagt, is dat je "recept" (prompt).
  • De regel: Je moet laten zien wat je precies tegen de robot hebt gezegd. Zelfs de kleine aanpassingen die je tijdens het experiment hebt gedaan.

Regel 5: Laat een mens het controleren (De "Chef-kok" regel)

  • Vergelijking: Een robot kan een taart bakken, maar is hij lekker? Een mens moet proeven.
  • De regel: Als de robot iets maakt (zoals code of een oordeel), moet een mens controleren of het goed is. Je kunt niet alleen op de robot vertrouwen.

Regel 6: Gebruik een openbare robot als referentie (De "Vergelijkingsstok" regel)

  • Vergelijking: Als je zegt "Mijn nieuwe auto is sneller dan de vorige", moet je weten wat de vorige was.
  • De regel: Gebruik een robot die iedereen kan gebruiken (een "open" model) om je resultaten mee te vergelijken. Zo kan iedereen je onderzoek zelf narekenen.

Regel 7: Gebruik de juiste meetlat (De "Maatstok" regel)

  • Vergelijking: Je meet de lengte van een huis niet met een weegschaal.
  • De regel: Gebruik de juiste methoden om te meten of de robot goed werkt. Leg uit waarom je die methode kiest.

Regel 8: Wees eerlijk over wat er mis kan gaan (De "Waarschuwingsbord" regel)

  • Vergelijking: Als je een brug bouwt, moet je zeggen waar hij niet tegen kan (bijv. te veel wind).
  • De regel: Zeg eerlijk wat de beperkingen zijn. Misschien werkt het alleen met die ene robot, of misschien is het te duur voor iedereen.

Waarom is dit belangrijk?

Zonder deze regels zou het onderzoek naar deze robots een grote chaos worden. Iedereen zou andere resultaten krijgen, niemand zou weten wie gelijk heeft, en we zouden niet kunnen bouwen op elkaars werk.

Deze handleiding is als een gemeenschappelijke taal die wetenschappers met elkaar delen. Het zorgt ervoor dat de "magische robot" op de bouwplaats niet alleen cool is, maar ook betrouwbaar en veilig voor de toekomst.

De auteurs zeggen zelfs: "Dit is een 'levend' document." Ze houden de regels online bij (op llm-guidelines.org) en nodigen iedereen uit om ze te verbeteren, want de robot verandert immers elke dag!

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →