← Nieuwste papers
💻 computer science

Benchmarking Requirement-to-Architecture Generation with Hybrid Evaluation

Deze paper introduceert R2ABench, een nieuw benchmark met real-world projecten en een hybride evaluatiekader, om de prestaties van Large Language Models bij het genereren van softwarearchitectuur uit requirements te analyseren en hun sterke syntactische vaardigheden maar fundamentele tekortkomingen in relationeel redeneren bloot te leggen.

Oorspronkelijke auteurs: Minxiao Li, Shuying Yan, Li Zhang, Yang Liu, Fang Liu

Gepubliceerd 2026-04-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Minxiao Li, Shuying Yan, Li Zhang, Yang Liu, Fang Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groot, complex gebouw wilt bouwen. Je hebt een beschrijving nodig van wat er in het gebouw moet komen: hoeveel kamers, waar de trappen zijn, hoe de leidingen lopen en welke muren waar staan. In de softwarewereld noemen we deze beschrijving een PRD (Product Requirements Document).

Vroeger moest een menselijke architect deze tekst lezen en vervolgens met de hand een blauwdruk tekenen. Dat kostte veel tijd, en als de beschrijving veranderde, moest de tekening opnieuw worden getekend.

Nu hebben we AI (grote taalmodellen) die dit voor ons kunnen doen. Je geeft de AI de tekst, en de AI tekent het blauwdrukje (in een taal die PlantUML heet) voor je.

Maar hier is het probleem: Hoe weet je of de AI een goed blauwdrukje heeft getekend? En werkt het echt goed?

De auteurs van dit papier (van de Beihang Universiteit in China) hebben een nieuwe manier bedacht om dit te testen. Ze noemen hun project R2ABench. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. De Testset: Een Reeks Bouwopdrachten

Stel je voor dat ze een map hebben met 17 echte bouwopdrachten uit de echte wereld (zoals een app voor muziek, een campus-hulpdienst of een dieet-app).

  • Voor elke opdracht hebben ze de originele tekst (de PRD).
  • Ze hebben ook een perfecte, door experts getekende blauwdruk (de "Ground Truth").
  • De AI moet proberen, puur op basis van de tekst, een blauwdruk te maken die lijkt op die van de experts.

2. De Beoordeling: Drie Manieren om te Kijken

Het is niet genoeg om te kijken of de AI de tekst goed heeft begrepen. Ze kijken op drie manieren naar het resultaat:

  • A. De "Bouwkundige" Check (Structuur):
    Kijkt de AI of de lijntjes en blokken wel echt bestaan?

    • Voorbeeld: Heeft de AI alle kamers (onderdelen) getekend? (Ja/Nee). Zijn de deuren (verbindingen) tussen de kamers op de juiste plek?
    • Het probleem: De AI is heel goed in het noemen van de kamers, maar heel slecht in het tekenen van de deuren ertussen. Het is alsof de AI een huis tekent met 10 slaapkamers, maar geen enkele deur ertussen. De kamers staan dan als eilanden in de lucht.
  • B. De "Menselijke" Check (Betekenis):
    Ze gebruiken een andere AI als "rechter" om te kijken of het blauwdrukje logisch is.

    • Vragen: Is het complete? Is het logisch? Ziet het er netjes uit?
    • Voorbeeld: Als de tekst zegt "een snelle app", maar de AI tekent een gebouw met een lift die uren duurt, dan is dat een slechte score.
  • C. De "Gevaarlijke Ontwerper" Check (Anti-patronen):
    Kijken ze naar fouten die architecten vaak maken.

    • De "God-Component": Een kamer die zo groot is dat alle andere kamers er direct mee verbonden zijn. Dat is een slecht ontwerp (alles hangt aan één punt).
    • De "Wees": Een kamer die helemaal nergens mee verbonden is. Die is nutteloos.

3. Wat Vonden Ze? (De Verassingen)

De onderzoekers hebben de beste AI's van dit moment getest, inclusief speciale "agenten" (AI's die samenwerken als een team). Hier zijn de resultaten:

  • De AI is een goede lijstmaker, maar een slechte planner:
    De AI kan perfect de onderdelen uit de tekst halen (de kamers), maar faalt volledig als het gaat om het plannen van de verbindingen (de deuren). Het resultaat is vaak een rommelige hoop losse onderdelen zonder een samenhangend geheel.

    • Analogie: De AI kan een lijst maken van alle ingrediënten voor een cake (meel, suiker, eieren), maar als je vraagt om het recept, schrijft hij: "Meel, suiker, eieren... en nu eet je het." Hij mist de stap "meng ze".
  • Speciale AI's doen het beter:
    AI's die gespecialiseerd zijn in code (zoals Qwen-Coder) zijn iets beter in het tekenen van de verbindingen dan de algemene AI's. Ze begrijpen beter hoe onderdelen aan elkaar moeten hangen.

  • Het "Teamwerk" (Agents) werkt niet zoals gehoopt:
    Je zou denken: "Laten we een team van AI's maken die samenwerken, dan wordt het beter!"

    • Resultaat: Nee. Het teamwerk maakte het vaak erger. De AI's begonnen elkaar te verwarren, of maakten onnodig complexe tekeningen. Het was alsof je drie architecten in één kamer zet die allemaal tegelijk praten; het resultaat is vaak een rommelig ontwerp in plaats van een beter eentje.
  • Te weinig informatie maakt het erger:
    Als je de AI een korte tekst geeft in plaats van een volledige beschrijving, kan hij de losse onderdelen nog steeds noemen, maar de verbindingen worden dan nog chaotischer. De AI probeert dan gaten op te vullen met "hallucinaties" (dingen die er niet in de tekst stonden, maar die hij zelf bedacht).

Conclusie in Eén Zin

De AI is momenteel een uitstekende secretaris die de lijst van onderdelen voor je uitschrijft, maar nog geen ervaren architect die weet hoe je die onderdelen logisch aan elkaar bouwt. We moeten nog veel leren voordat we de AI volledig kunnen vertrouwen om complexe software-ontwerpen te tekenen.

De auteurs hebben hun testmateriaal en code openbaar gemaakt, zodat iedereen dit kan blijven testen en verbeteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →