← Nieuwste papers
🤖 AI

MEnvAgent: Scalable Polyglot Environment Construction for Verifiable Software Engineering

Dit artikel introduceert MEnvAgent, een schaalbaar meertalig framework dat de constructie van verifieerbare software engineering-omgevingen automatiseert via een multi-agent architectuur en een mechanisme voor omgevingshergebruik, waardoor datasetschaarste wordt overwonnen en de creatie van de grootste open-source polyglote dataset voor LLM-agents wordt mogelijk gemaakt.

Oorspronkelijke auteurs: Chuanzhe Guo, Jingjing Wu, Sijun He, Yang Chen, Zhaoqi Kuang, Shilong Fan, Bingjin Chen, Siqi Bao, Jing Liu, Hua Wu, Qingfu Zhu, Wanxiang Che, Haifeng Wang

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chuanzhe Guo, Jingjing Wu, Sijun He, Yang Chen, Zhaoqi Kuang, Shilong Fan, Bingjin Chen, Siqi Bao, Jing Liu, Hua Wu, Qingfu Zhu, Wanxiang Che, Haifeng Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een meesterkok bent (een AI) die probeert een beroemd gerecht uit een receptenboek te recreëren. Het recept zegt: "Voeg zout, peper en een specifiek type zeldzame kruid toe." Maar hier is de crux: voordat je zelfs maar kunt beginnen met koken, moet je eerst een keuken bouwen vanaf de grond af aan. Je moet de juiste kookplaat vinden, de juiste gasleidingen installeren, het exacte merk zout kopen en ervoor zorgen dat het zeldzame kruid in je tuin groeit.

Als je de verkeerde kookplaat kiest, verbrandt het eten. Als je het verkeerde zout koopt, smaakt het gerecht verschrikkelijk. In de wereld van software engineering wordt dit "bouw van de keuken" Environment Construction genoemd.

Lange tijd was het aanleren van softwarebugs repareren aan AI als het vragen aan een chef om te koken zonder keuken. We hadden de recepten (de code), maar we konden niet gemakkelijk de keukens (de software-omgevingen) bouwen om te testen of de fixes van de AI daadwerkelijk werkten. Het bouwen van deze keukens was traag, duur en werkte alleen voor een paar soorten "keukens" (programmeertalen).

Ontmoet MEnvAgent: De Ultieme Keukenbouwer

Het paper introduceert MEnvAgent, een nieuw systeem ontworpen om automatisch deze software-keukens te bouwen voor 10 verschillende programmeertalen (zoals Python, Java, C++, etc.). Het is also[t] een team van gespecialiseerde bouwvakkers die een keuken kunnen bouwen voor elk recept, ongeacht hoe complex het is.

Hier is hoe MEnvAgent werkt, met behulp van eenvoudige analogieën:

1. De Drie-Stappen Bouwploeg

In plaats van één persoon die alles probeert te doen, gebruikt MEnvAgent een team van drie "agents" (AI-specialisten) die in een loop werken:

  • De Architect (Planning): Deze agent leest het recept en de blauwdruk. Het bepaalt welke kookplaat, leidingen en ingrediënten nodig zijn.
  • De Bouwer (Executie): Deze agent begint daadwerkelijk te bouossen. Het installeert de software en voert de tests uit. Als een leiding lekt of een onderdeel niet past, probeert deze agent dit ter plekke op te lossen.
  • De Inspecteur (Verificatie): Zodra de keuken is gebouwd, probeert deze agent het gerecht te koken. Als het gerecht goed smaakt (de code slaagt voor de test), is de klus geklaard. Als het mislukt, vertelt de Inspecteur de Architect precies wat er misging, zodat deze het opnieuw kan proberen.

2. De "Reuse" Truc (Tijd en Geld Besparen)

Elke keer een keuken vanaf de grond af aan bouwen is een verspilling van tijd. Stel je voor dat je elke keer een nieuw huis moet bouwen als je een taart wilt bakken.

MEnvAgent heeft een slimme truc genaamd de Environment Reuse Mechanism.

  • De Analogie: Stel dat je een keuken nodig hebt voor een nieuw pizzarecept. In plaats van te beginnen op een braakliggend terrein, kijkt MEnvAgent naar zijn bibliotheek van eerder gebouwde keukens. Het vindt er een die al voor 90% gebouwd is voor een soortgelijke pizza.
  • De Patch: Vervolgens stuurt het een "patch-ploeg" (de EnvPatchAgent) om kleine, snelle aanpassingen aan die bestaande keuken te maken zodat deze past bij het nieuwe recept. Dit is veel sner dan alles vanaf de grond af aan opbouwen.
  • Het Resultaat: Het paper beweert dat dit 43% van de tijd bespaart vergeleken met het bouwen vanaf de grond af aan.

3. Het Bewijs: MEnvBench en MEnvData

Om te bewijzen dat hun systeem werkt, hebben de auteurs niet alleen gegokt; ze bouwden een enorme testomgeving genaamd MEnvBench.

  • Denk aan dit als een enorme "Kookolympiade" met 1.000 uitdagingen verspreid over 10 verschillende talen.
  • Ze hebben MEnvAgent getest tegen andere systemen en vonden dat het de winnaar was. Het repareerde meer "defecte keukens" (verbeterde de succesratio met 8,6%) en deed dit veel sneller.

4. De Grote Beloning: Een Bibliotheek van Perfecte Keukens

Omdat MEnvAgent zo goed is in het bouwen van deze omgevingen, hebben de auteurs het gebruikt om MEnvData-SWE te creëren.

  • De Analogie: Dit is als een enorme bibliotheek van meer dan 3.000 perfect gebouwde keukens, elk met een werkend recept en een testresultaat.
  • De Impact: Ze hebben deze bibliotheek gebruikt om andere AI-chefs te trainen. Het resultaat? De AI-chefs werden aanzienlijk beter in het repareren van softwarebugs. Het paper laat zien dat modellen die op deze data zijn getraind, veel beter presteerden op echte softwaretaken dan modellen die zonder deze data zijn getraind.

Samenvatting

Kortom, MEnvAgent lost het probleem op van "hoe testen we of een AI code kan repareren?" door automatisch de noodzakelijke testomgevingen te bouwen voor vele verschillende programmeertalen. Dit doet het door een team van AI-agents te gebruiken om te plannen, te bouwen en te controleren, en door slim gebruik te maken van oude omgevingen om tijd te besparen. Het resultaat is een snellere, betrouwbaardere manier om AI te trainen om een betere software engineer te worden.

Wat het paper NIET beweert:

  • Het beweert niet dat dit systeem elk bug in de wereld direct kan oplossen.
  • Het beweert niet dat dit menselijke engineers volledig vervangt; het is een hulpmiddel om betere testomgevingen voor AI te bouwen.
  • Het bespreekt niet het gebruik hiervan voor medische software of kritieke veiligheidssystemen specifiek, behalve het vermelden van de noodzaak voor veiligheidssandboxes (geïsoleerde keukens) om te voorkomen dat kwaadaardige code wordt uitgevoerd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →