← Nieuwste papers
🤖 AI

DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle

Dit artikel introduceert DevOps-Gym, de eerste end-to-end benchmark bestaande uit meer dan 700 werkelijke taken verspreid over meer dan 30 Java- en Go-projecten om AI-agenten in volledige DevOps-workflows te evalueren, wat onthult dat huidige state-of-the-art modellen aanzienlijk moeite hebben met complexe taken zoals het oplossen van issues, het genereren van tests, monitoring en buildconfiguratie.

Oorspronkelijke auteurs: Yuheng Tang, Kaijie Zhu, Bonan Ruan, Chuqi Zhang, Michael Yang, Hongwei Li, Suyue Guo, Tianneng Shi, Zekun Li, Christopher Kruegel, Giovanni Vigna, Dawn Song, William Yang Wang, Lun Wang, Yangruibo Di
Gepubliceerd 2026-01-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuheng Tang, Kaijie Zhu, Bonan Ruan, Chuqi Zhang, Michael Yang, Hongwei Li, Suyue Guo, Tianneng Shi, Zekun Li, Christopher Kruegel, Giovanni Vigna, Dawn Song, William Yang Wang, Lun Wang, Yangruibo Ding, Zhenkai Liang, Wenbo Guo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante nieuwe leerling hebt die ongelooflijk goed is in het schrijven van individuele zinnen en paragrafen. Je vraagt de leerling om een verhaal te schrijven, en hij doet een fantastisch werk. Maar nu wil je zien of hij een hele uitgeverij kan runnen. Dit houdt niet alleen in dat hij het verhaal schrijft, maar ook dat hij de drukpers opzet, de machines in de gaten houdt om te zien of ze oververhit raken, de machine repareert wanneer deze vastlopt, en een checklist schrijft om ervoor te zorgen dat het volgende boek niet dezelfde blokkade heeft.

Dit is precies wat het papier DEVOPS-GYM test.

Het Grote Idee: Van "Schrijver" naar "Fabrieksmanager"

Een tijdje lang was AI geweldig in het schrijven van code (zoals de leerling die zinnen schrijft). Maar echte software gaat niet alleen over schrijven; het gaat over de hele levenscyclus, bekend als DevOps. Dit omvat:

  1. Bouwen (Building): De code laten compileren en draaien.
  2. Monitoren (Monitoring): Het draaiende programma in de gaten houden om te zien of het vreemd gedrag vertoont (zoals een machine die oververhit raakt).
  3. Repareren (Fixing): Fouten opsporen en patches aanbrengen.
  4. Testen (Testing): Controleren of de oplossing daadwerkelijk werkt en niet iets anders kapotmaakt.

De onderzoekers hebben DEVOPS-GYM gebouwd, een enorme "gym" of trainingsgrond met meer dan 700 echte werelduitdagingen. Ze wilden zien of AI-agenten als een fulltime Fabrieksmanager kunnen optreden die al deze vier stappen afhandelt, en niet alleen het schrijfgedeelte.

De "Gym" Opzet

De onderzoekers creëerden een realistische omgeving met behulp van echte softwareprojecten geschreven in Java en Go (twee talen die veel voorkomen in grote bedrijven, in tegenstelling tot Python dat vaak voor AI-training wordt gebruikt).

Ze ontwierpen vier soorten trainingen voor de AI:

  • De "Setup" Training (Build & Config): De AI moet een rommelig project nemen en het correct laten bouwen. Dit is als het proberen te assembleren van een complex meubelstuk zonder de instructies, of het overstappen van het ene merk gereedschap naar een ander.
  • De "Surveillance" Training (Monitoring): De AI moet een draaiend programma observeren en subtiele problemen ontdekken, zoals een geheugenlek (waarbij het programma langzaam al het geheugen van de computer opeet) of een trage netwerkverbinding. Het is als een beveiliger die een kleine lekkage in een pijp moet opmerken voordat de kelder onder water staat.
  • De "Repair" Training (Issue Resolving): De AI moet een bug vinden die in een rapport wordt beschreven en de code repareren.
  • De "Quality Check" Training (Test Generation): De AI moet een test schrijven om te bewijzen dat de bug is opgelost.

Ze maakten zelfs End-to-End Pipeline taken, die lijken op een estafette. De AI moet de Setup voltooien, dan de Surveillance, dan de Repair, en tot slot de Quality Check, allemaal in één keer zonder de stok te laten vallen.

De Resultaten: De Leerling is Nog een Novice Manager

De onderzoekers testten de slimste AI-agenten die vandaag de dag beschikbaar zijn (met behulp van modellen zoals Claude, OpenAI's o4-mini, en anderen). Dit is wat ze vonden:

  1. De "Setup" is Moeilijk: Zelfs de beste AI had moeite om projecten correct te laten bouwen. Ze raakten vaak in de war door de complexe regels van hoe je code compileert. De beste agent slaagde slechts ongeveer 52% van de tijd.
  2. "Surveillance" is een Nachtmerrie: Dit was de grootste mislukking. De AI was verschrikkelijk in het in de gaten houden van een draaiend systeem. Ze merkten problemen vaak niet op of raakten afgeleid. Het succespercentage was schokkend laag, vaak 0% tot 20%. Het is als een beveiliger die in slaap valt of naar de verkeerde camera kijkt.
  3. "Repair" is Taalafhankelijk: De AI was goed in het repareren van bugs in Python (waar het veel van heeft gezien tijdens de training), maar toen ze overstapten naar Java en Go, daalde de prestatie aanzienlijk. Het is als een vertaler die perfect Frans spreekt, maar struikelt wanneer hij gevraagd wordt een technische handleiding in het Duits te vertalen.
  4. De Estafette Faalde Volledig: Wanneer de AI werd gevraagd om alle vier de stappen achter elkaar uit te voeren, slaagde 0% van de AI-agenten. Ze konden het grote plaatje niet in hun hoofd houden. Ze zouden misschien de build repareren, maar dan vergeten de monitoring te controleren, of de bug repareren maar falen bij het schrijven van de test.

Waarom Faalden Ze?

Het papier suggereert een paar redenen waarom deze "Fabrieksmanagers" er nog niet zijn:

  • Ze kennen de tools niet: De AI is niet genoeg getraind op het gebruik van specifieke systeemtools (zoals het controleren van het geheugengebruik of het beheren van build-bestanden).
  • Ze raken afgeleid: Bij het observeren van een systeem over een langere tijd verliest de AI de focus op waar hij naar kijkt. De AI kan het "lange verhaal" van een systeem dat urenlang draait, niet aan.
  • Ze missen diepe kennis: Ze kunnen een eenvoudige typefout repareren, maar ze begrijpen de diepe, complexe regels van hoe grote softwaresystemen worden gebouwd en uitgevoerd niet.

De Conclusie

DEVOPS-GYM is een reality check. Hoewel AI geweldig is in het schrijven van codefragmenten, is het momenteel niet klaar om de volledige softwarefabriek zelfstandig te runnen. Het worstelt met de rommelige, complexe en langdurige taken van het bouwen, bewaken, repareren en testen van echte wereldsoftware. De onderzoekers zeggen dat we nog veel werk moeten verzetten voordat AI de volledige softwareontwikkelingscyclus echt kan automatiseren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →