← Nieuwste papers
🤖 AI

AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering

Het paper introduceert AgentForge, een multi-agent framework voor autonome softwareontwikkeling dat gebruikmaakt van verplichte, gesandboxde uitvoering voor verificatie en daarmee een resolutie van 40,0% bereikt op SWE-BENCH Lite, wat een aanzienlijke verbetering is ten opzichte van bestaande single-agent baselines.

Oorspronkelijke auteurs: Rajesh Kumar, Waqar Ali, Junaid Ahmed, Najma Imtiaz Ali, Shaban Usman

Gepubliceerd 2026-04-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Rajesh Kumar, Waqar Ali, Junaid Ahmed, Najma Imtiaz Ali, Shaban Usman

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, complexe machine moet repareren, maar je hebt geen gereedschapskist en geen handleiding. Je hebt alleen een zeer slimme, maar soms wat dromerige assistent die heel goed kan praten en schrijven. Als je deze assistent vraagt om de machine te repareren, schrijft hij een prachtig verhaal over hoe hij het zou doen. Maar als hij de schroeven echt vastdraait, blijkt dat de machine nog steeds niet werkt. Hij heeft namelijk nooit echt geprobeerd of het werkt; hij heeft alleen geraden dat het zou werken.

Dit is precies het probleem met de huidige kunstmatige intelligentie (AI) als het gaat om het schrijven van computercode. Ze kunnen prachtige code genereren, maar ze weten niet zeker of die code ook echt werkt.

AgentForge is een nieuw systeem dat dit probleem oplost. Het is als het inhuren van een gespecialiseerd reparatieteam in plaats van één enkele dromerige assistent. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het Team: Geen Solisten, maar een Orkest

In plaats van één AI die alles probeert te doen, heeft AgentForge vijf verschillende specialisten. Denk aan een filmset of een bouwteam:

  • De Planner: Dit is de regisseur. Hij kijkt naar het probleem en maakt een stappenplan. Hij zegt: "Eerst moeten we de motor controleren, dan de banden, en pas daarna de verf."
  • De Coder: Dit is de timmerman. Hij bouwt precies wat de planner heeft gezegd, maar hij doet het slim: hij vervangt alleen de stukken die kapot zijn, in plaats van het hele huis af te breken en opnieuw te bouwen.
  • De Tester: Dit is de kwaliteitscontroleur. Hij neemt het nieuwe onderdeel en probeert het op alle mogelijke manieren kapot te maken. "Wat gebeurt er als ik hier hard op sla? Wat als ik geen olie gebruik?"
  • De Debugger: Dit is de detective. Als de tester iets kapot maakt, komt de debugger. Hij kijkt naar de foutmelding en zegt: "Ah, je hebt de verkeerde schroef gebruikt. Laten we die vervangen." Hij blijft dit doen tot het werkt.
  • De Critic: Dit is de directeur. Hij kijkt naar het hele resultaat en zegt: "Ja, dit is goed, we kunnen het leveren" of "Nee, nog niet, er zit nog een fout in."

2. De Gouden Regel: "Bouw het, Test het, Werk het"

Het belangrijkste verschil tussen AgentForge en andere systemen is hun gouden regel: Niets mag worden afgeleverd zonder dat het eerst is getest in een veilige, gesloten ruimte.

Stel je voor dat je een nieuw recept probeert. De meeste AI's zouden zeggen: "Ik denk dat dit taart lekker smaakt," en je het recept geven. AgentForge daarentegen zegt: "We gaan dit taartrecept in een gesloten keuken (een 'Docker-sandbox') bakken. We proeven het echt. Als het niet smaken, gooien we het weg en proberen we het opnieuw met de Debugger."

Deze "gesloten keuken" is cruciaal. Het zorgt ervoor dat de AI niet kan liegen over of het werkt. Of het werkt écht, of het werkt niet. Geen gissen, alleen feiten.

3. Het Geheugen: Leren van het Verleden

Het systeem heeft ook een slim geheugen.

  • Episodisch geheugen: Het onthoudt eerdere reparaties. "Oh, we hebben dit probleem bij een andere machine al eens opgelost door die ene kabel te verplaatsen."
  • Live bibliotheek: Het heeft direct toegang tot de blauwdrukken van de machine waar het aan werkt, zodat het niet uit de lucht moet gaan halen hoe de onderdelen eruitzien.

4. Wat levert dit op?

In tests (waarbij ze echte problemen oplossingen moesten vinden in grote software-projecten) slaagde AgentForge in 40% van de gevallen. Vergelijk dit met een enkele AI-assistent, die maar in ongeveer 14% van de gevallen slaagde.

Het is alsof je met één persoon een muur probeert te bouwen en maar één baksteen per keer goed zet. Met AgentForge heb je een team dat samenwerkt, controleert en corrigeert, waardoor je veel sneller en beter een stevige muur bouwt.

Samenvatting

AgentForge is een slimme manier om AI te gebruiken voor het bouwen van software. In plaats van te vertrouwen op de "gok" van één slimme robot, laat je een team van specialisten werken die elkaar controleren. Ze bouwen iets, testen het in een veilige ruimte, en als het niet werkt, maken ze het direct goed. Het is de overgang van "Ik denk dat dit werkt" naar "We hebben gecontroleerd, en ja, het werkt."

Dit maakt het mogelijk om AI in te zetten voor echte, complexe klussen in de softwarewereld, zonder bang te hoeven zijn dat de code in het echt crasht.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →