← Nieuwste papers
🤖 AI

Can Coding Agents Be General Agents?

Hoewel coderingsagenten betrouwbare eenvoudige taken kunnen uitvoeren, blijken ze nog niet geschikt te zijn voor complexe bedrijfsprocessen omdat het verbinden van domeinlogica met code-uitvoering een belangrijke beperking vormt voor hun algemene toepasbaarheid.

Oorspronkelijke auteurs: Maksim Ivanov, Abhijay Rana, Gokul Prabhakaran

Gepubliceerd 2026-04-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Maksim Ivanov, Abhijay Rana, Gokul Prabhakaran

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🤖 De Droom: Kan een "Coder" ook een "Alles-kunner" worden?

Stel je voor dat je een zeer slimme rekenmachine hebt die niet alleen getallen kan optellen, maar ook zelf programma's kan schrijven om die berekeningen te doen. Dit is wat we nu hebben: Coderende Agents. Ze zijn fantastisch in het bouwen van software, het oplossen van fouten in code en het automatiseren van technische taken.

Maar nu beginnen mensen ze te gebruiken voor iets heel anders: zakelijke taken. Denk aan: "Regel mijn belastingaangifte," "Organiseer mijn vakantie," of "Beheer de voorraad van mijn bedrijf."

De vraag die dit onderzoek stelt is simpel: Is deze slimme rekenmachine ook een goede manager? Kan hij niet alleen code schrijven, maar ook begrijpen wat een bedrijf echt nodig heeft?

🧩 Het Probleem: De Vertaaltaak

Om een goede "Alles-kunner" te zijn, moet de agent twee werelden met elkaar verbinden:

  1. De Zakelijke Wereld: Wat wil de baas? (Bijv. "Koop goedkope stoelen, maar houd de winstmarge hoog.")
  2. De Technische Wereld: Hoe vertaal je dat naar instructies voor de computer? (Bijv. SQL-query's schrijven, API's aanroepen.)

Het onderzoek vergelijkt dit met een tolk die twee talen spreekt. De huidige agents zijn geweldige vertalers van "Mens naar Computer" (ze schrijven code), maar ze hebben moeite met het vertalen van "Zakelijke logica naar Code".

🧪 De Proef: Een Digitale Supermarkt

Om dit te testen, hebben de onderzoekers een virtuele supermarkt (een ERP-systeem genaamd Odoo) gebouwd. Dit is een complex systeem waar alles in zit: verkoop, personeel, voorraad en inkoop.

Ze gaven de agent taken, zoals:

  • "Koop 40 stoelen voor twee verschillende klanten binnen een bepaald budget, maar zorg dat we niet te veel betalen en dat de winstmarge hoog blijft."

De agent moest zelf beslissen welke leveranciers hij kiest, welke bestellingen hij plaatst en hoe hij de voorraad regelt, allemaal door zelf code te schrijven om met het systeem te praten.

📉 Wat Vonden Ze? (De Resultaten)

De resultaten waren een mix van "Wauw" en "Oeps".

1. Simpele taken: ✅ Top!
Bij simpele dingen (bijv. "Maak een factuur voor klant A") deed de agent het fantastisch. Hij schreef de juiste code, deed de juiste oproepen en het werk was klaar. Hij was net zo snel als een mens.

2. Complexe taken: ❌ De valkuilen
Zodra de taken moeilijker werden (meer regels, meer keuzes), begon de agent te struikelen. Het onderzoek identificeerde vier specifieke manieren waarop hij faalde:

  • De "Lome" Shortcut (Lazy Heuristics):

    • De situatie: De regel was: "Koop alleen bij Amerikaanse leveranciers."
    • De fout: In plaats van te kijken naar het land in het adres, keek de agent naar de naam van het bedrijf. Als er "American" of "Northern" in de naam stond, dacht hij: "Oké, dat is Amerikaans."
    • De metafoor: Het is alsof je zegt: "Koop alleen rode appels." En de agent koopt een appel met een etiket dat "Rood" zegt, maar die is eigenlijk groen. Hij begrijpt de bedoeling, maar de uitvoering is slordig.
  • Hallucinaties (Verzonnen Werelden):

    • De situatie: De agent moest defecte LED-bordjes weggooien.
    • De fout: De agent bedacht zich dat defecte bordjes in een koelkast bewaard moeten worden. Omdat er geen koelkast in het systeem was, dacht hij: "Ah, ze zijn al weggegooid!" en gaf hij het op.
    • De metafoor: De agent schrijft een perfect verhaal over een koelkast, maar in de echte wereld staat er geen koelkast. Hij is zo zeker van zijn verhaal dat hij de realiteit negeert.
  • Vergeten Regels:

    • Soms zag de agent een regel (bijv. "Vakantiedagen moeten aaneengesloten zijn") en negeerde hij die gewoon. Hij deed zijn werk, maar vergat de belangrijkste instructie.
  • Overmoed (De "Ik heb het gedaan"-valstrik):

    • Dit is het gevaarlijkste punt. Als de code zonder fouten liep (geen rode foutmeldingen in het scherm), dacht de agent: "Taak voltooid!"
    • Maar de zakelijke uitkomst was misschien volledig verkeerd.
    • De metafoor: Stel je voor dat je een chef-kok bent. Je maakt een soep. De pan staat op het vuur, het water kookt en er brandt niets aan. De agent zegt: "Perfect!" Maar hij vergeet zout toe te voegen. De soep is technisch "gekookt", maar smaakt vreselijk. De agent ziet alleen dat de pan niet brandt, niet dat de soep onsmakelijk is.

💡 De Conclusie

Deze "Coderende Agents" zijn wonderkinderen in het schrijven van code, maar nog geen wijze managers.

Ze zijn geweldig in het uitvoeren van instructies, maar ze missen het vermogen om de geest van de regel te begrijpen in plaats van alleen de letterlijke uitvoering. Ze zijn te snel tevreden met "de code werkt" en vergeten te controleren of "het resultaat goed is".

Kortom: We kunnen ze nu al gebruiken voor simpele klusjes, maar voor complexe bedrijfsprocessen moeten we nog wachten tot ze leren om niet alleen naar de code te kijken, maar ook naar de echte wereld die die code bestuurt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →