← Nieuwste papers
💻 computer science

Using LLMs to Evaluate Architecture Documents: Results from a Digital Marketplace Environment

Dit artikel onderzoekt de effectiviteit van het gebruik van Large Language Models om softwarearchitectuurdocumenten binnen een digitaal marktplaatsproject te evalueren, waarbij wordt vastgesteld dat hoewel LLM's veelbelovend zijn, hun consistentie met menselijke expertbeoordelingen sterk afhangt van de initiële kwaliteit van de architectuurartefacten.

Oorspronkelijke auteurs: Frank Elberzhager, Matthias Gerbershagen, Joshua Ginkel

Gepubliceerd 2026-01-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Frank Elberzhager, Matthias Gerbershagen, Joshua Ginkel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een stadsplanner bent die moet beslissen welke nieuwe digitale tools (zoals apps voor verkeer of afvalbeheer) je voor je stad gaat kopen. Je hebt een enorme online marktplaats vol met deze tools, maar je kunt niet de handleiding en de blauwdrukken van elk afzonderlijk instrument lezen. Je hebt een manier nodig om snel te controleren of de "blauwdrukken" (de software architectuurdocumenten) goed geschreven, helder en betrouwbaar zijn voordat je de bouwers inhuurt.

Dit artikel gaat over een experiment waarbij onderzoekers probeerden een super-slimme AI-robot (een Large Language Model, of LLM) te gebruiken om als een junior inspecteur deze blauwdrukken te controleren, en vervolgens de aantekeningen van de robot te vergelijken met die van een senior menselijk architect.

Hier is de opbouw van hun reis:

1. De Opzet: De "Digitale Marktplaats"

De onderzoekers werken aan een digitale marktplaats voor Duitse steden. Stel je een winkel voor waar bedrijven digitale oplossingen verkopen. Voordat een stad een oplossing kan kopen, moet ze weten: Is de documentatie goed? Is het ontwerp degelijk?

Normaal gesproken moet een menselijke expert honderden pagina's aan PDF's, diagrammen en tekst doorlezen om dit te kunnen beantwoorden. Dat is traag en duur. Daarom hebben de onderzoekers een tool gebouwd genaamd Quasar. Zie Quasar als een robot-bibliothecaris die al die documenten direct kan lezen en je een "rapportcijfer" kan geven.

2. Het Experiment: Robot versus Mens

Om te zien of de robot goed was, zetten ze een head-to-head competitie op:

  • De Deelnemers: Twee verschillende softwareprojecten (één met een enorme, gedetailleerde bibliotheek aan blauwdrukken, en één met een zeer kleine, schrale bibliotheek).
  • De Jury: Twee senior menselijke architecten en de Quasar-robot (met gebruik van verschillende AI-breinen zoals Qwen en Llama).
  • De Taak: Beiden keken naar dezelfde 25 specifieke vragen over de kwaliteit van de documenten (bijv. "Worden de ontwerpbeslissingen duidelijk uitgelegd?"). Ze gaven scores van 0 tot 4.

3. De Resultaten: Het Hangt Af van de "Grondstoffen"

De belangrijkste bevinding van dit paper is een simpele regel: Garbage In, Garbage Out (Rotte ingrediënten erin, rotte resultaten eruit). De kwaliteit van het antwoord van de AI hing volledig af van de kwaliteit van de documenten die de AI las.

  • Scenario A: De Goed Georganiseerde Bibliotheek (Project 1)

    • De Situatie: Het project had een enorme, goed gestructureerde set documenten.
    • De Uitkomst: De robot en de menselijke architecten waren het bijna perfect eens. De scores van de robot waren zeer consistent (hij gaf drie keer dezelfde score als hem drie keer dezelfde vraag werd gesteld).
    • De Analogie: Het is alsof je een chef-kok vraft om een perfect bereide biefstuk te proeven. Als de biefstuk geweldig is, kan zelfs een robot met een smaaksensor zeggen: "Dit is een 5-sterren biefstuk," en daarmee het eens zijn met de menselijke chef.
    • Tijd: Het duurde de mens ongeveer 60 minuten en de robot ongeveer 68 minuten. Ongeveer even snel.
  • Scenario B: Het Schamele Schetsboek (Project 2)

    • De Situatie: Het project had heel weinig documenten en weinig detail.
    • De Uitkomst: De robot en de menselijke architecten waren het totaal oneens. De scores van de robot varieerden enorm, en hij kon zelfs sommige vragen niet beantwoorden.
    • De Analogie: Het is alsof je diezelfde chef-kok vraagt om een biefstuk te proeven die nauwelijks gaar is en waarvan de helft van het vlees ontbreekt. De robot raakt in de war, begint te gokken en geeft een score die nergens op slaat vergeleken met de mens.
    • Tijd: De robot was sneller (14 min. vs. 22 min.), maar de snelheid maakte niet uit omdat de antwoorden onbetrouwbaar waren.

4. Wat Ze Hebben Geleerd (De "Kernboodschap")

De onderzoekers concludeerden dat AI een geweldige "eerste controle" is, maar nog geen vervanging voor een mens.

  • Wanneer het werkt: Als de documentatie duidelijk, compleet en goed georganiseerd is, kan de AI fungeren als een betrouwbare assistent die een snelle "sanity check" uitvoert die overeenkomt met wat een menselijke expert zou zeggen.
  • Wanneer het faalt: Als de documentatie rommelig, incompleet of vaag is, begint de AI te hallucineren (dingen te verzinnen) of geeft het inconsistente antwoorden. De AI kan niet, zoals een menselijke expert door ervaring, "de gaten invullen".

5. De Toekomst: De Robot Slimmer Maken

Het paper geeft toe dat hun huidige robot een beetje "dom" is omdat hij de documenten in kleine stukjes moest hakken om ze te kunnen lezen (alsof je een boek probeert te lezen door de pagina's er één voor één uit te scheuren).

Voor de toekomst willen ze:

  • De robot een groter "geheugen" geven zodat hij het hele boek in één keer kan lezen zonder de context te verliezen.
  • De robot specifiek trainen op software-architectuur zodat hij de jargon beter begrijpt.
  • De robot veranderen in een plugin die binnen de eigen tools van de software-architecten zit, waardoor zij direct feedback krijgen terwijl ze de blauwdrukken tekenen, in plaats van pas achteraf een beoordeling te krijgen.

Kortom: De AI-robot is een veelbelovende leerling die een uitstekend werk levert wanneer de meester duidelijke instructies en goede materialen aanlevert. Maar als de materialen rommelig zijn, raakt de leerling verdwaald, en heb je nog steeds de meester-architect nodig voor de definitieve controle.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →