← Nieuwste papers
🤖 AI

EvolveTool-Bench: Evaluating the Quality of LLM-Generated Tool Libraries as Software Artifacts

Dit paper introduceert EvolveTool-Bench, een diagnostisch benchmark dat de kwaliteit van door LLM's gegenereerde toolbibliotheken evalueert aan de hand van softwarekwaliteitsmetrieken zoals hergebruik en veiligheid, in plaats van alleen de taakvoltooiing te beoordelen.

Oorspronkelijke auteurs: Alibek T. Kaliyev, Artem Maryanskyy

Gepubliceerd 2026-04-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Alibek T. Kaliyev, Artem Maryanskyy

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een kok hebt die voor je kookt. Tot nu toe keken we alleen of het eten op het bord smaakte (de taak was voltooid). Maar wat als die kok elke keer een nieuw recept uitvond, maar vergeetde om de keuken schoon te maken? Wat als hij vijf keer hetzelfde recept schreef, of gerechten maakte die giftig waren, of gerechten die de vorige maaltijden verpestten?

Dat is precies het probleem dat dit nieuwe onderzoek, EvolveTool-Bench, aanpakt.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het Probleem: Alleen kijken of het werkt

Moderne kunstmatige intelligentie (LLM's) wordt steeds slimmer. Ze kunnen niet alleen vragen beantwoorden, maar ook eigen software tools (zoals kleine programmaatjes) schrijven om taken te doen.

Tot nu toe keken onderzoekers alleen naar het resultaat: "Werkt de taak?"

  • De analogie: Het is alsof je een architect beoordeelt alleen door te kijken of het gebouw niet instort. Je kijkt niet of het gebouw vol staat met dubbele muren, of dat de ramen niet dicht gaan, of dat de elektra-installatie gevaarlijk is.

In de wereld van AI betekent dit: een systeem kan 100% van de taken "slagen", maar tegelijkertijd een rommelige, onveilige en inefficiënte verzameling code achterlaten.

2. De Oplossing: EvolveTool-Bench

De onderzoekers hebben een nieuwe test ontwikkeld, EvolveTool-Bench. In plaats van alleen naar het eindresultaat te kijken, kijken ze naar de kwaliteit van de gereedschapskist die de AI heeft gemaakt.

Ze meten dingen als:

  • Hergebruik: Gebruikt de AI bestaande gereedschappen of maakt hij telkens nieuwe, identieke versies? (Zoals een timmerman die elke keer een nieuwe hamer maakt in plaats van dezelfde te gebruiken).
  • Veiligheid: Breken de nieuwe gereedschappen oude, werkende functies? (Zoals een verbouwing waarbij je per ongeluk de watertoevoer van de buren afsluit).
  • Kwaliteit: Is de code schoon, goed geschreven en veilig?

3. De Experimenten: Wie is de beste kok?

Ze hebben verschillende AI-systemen getest in drie moeilijke werelden (geheime dataformaten, complexe internetverbindingen en wiskundige berekeningen). Ze vergeleken:

  • De "Eén-slag" AI: Schrijft code, maar test het niet.
  • De "Strategie" AI: Leert van fouten, maar schrijft geen nieuwe code.
  • ARISE (De "Zelf-evoluerende" AI): Schrijft code, test het streng in een veilige omgeving, en houdt alleen de beste tools over.

4. De Verbluffende Resultaten

Hier wordt het interessant. Als je alleen kijkt naar "taak voltooid", doen alle systemen ongeveer even goed (rond de 65%). Maar als je kijkt naar de kwaliteit van de software (de gereedschapskist), valt het verschil enorm op:

  • De "Eén-slag" AI: Deze maakt veel code, maar het is vaak rommelig en onveilig. Hun "gezondheidsscore" is lager dan een systeem dat geen nieuwe code maakt.
    • Vergelijking: Het is alsof je een rommelige garage bouwt die je eigen auto blokkeert. Beter dan niets doen, maar slechter dan een lege garage.
  • ARISE (De winnaar): Dit systeem maakt minder taken "perfect" (omdat het veel tijd spendeert aan testen en verbeteren), maar de gereedschapskist die het achterlaat is van topkwaliteit.
    • Het hergebruikt bestaande code (70%!).
    • Het breekt niets wat al werkte.
    • Het is veiliger.

De grote les: Een systeem dat "slimmer" lijkt omdat het sneller taken afrondt, kan eigenlijk een enorme "technische schuld" (een rommelige codebasis) achterlaten die later tot grote problemen leidt.

5. Conclusie: Kwaliteit boven snelheid

De onderzoekers concluderen dat we AI-systemen niet meer moeten behandelen als een zwarte doos die alleen maar antwoorden geeft. We moeten ze behandelen als software-engineers.

Als een AI code schrijft, moeten we kijken naar:

  1. Is het code schoon?
  2. Is het veilig?
  3. Is het onderhoudbaar?

Kort samengevat:
Het is beter om een AI te hebben die iets trager werkt, maar een schone, veilige en slimme gereedschapskist achterlaat, dan een AI die alles snel doet, maar een rommelige, gevaarlijke en dubbelzinnige codebasis achterlaat die later de hele boel laat crashen.

Deze nieuwe test (EvolveTool-Bench) zorgt ervoor dat we die kwaliteit gaan meten, zodat we in de toekomst betere en veiligere AI-systemen bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →