← Nieuwste papers
🤖 AI

Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning

Dit artikel presenteert een op toernooien gebaseerde benchmark die Large Language Models evalueert tegenover promovendi op een complex marktgestuurd logistiek probleem, waarbij wordt onthuld dat door mensen gecodeerde agenten de door LLM gegenereerde oplossingen significant overtreffen, waarbij de meeste LLM-agenten er niet in slagen eenvoudige baselines te overtreffen en zelfs optimale menselijke strategieën verslechteren wanneer zij worden gevraagd deze te verbeteren.

Oorspronkelijke auteurs: Panayiotis Danassis, Naman Goel

Gepubliceerd 2026-06-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Panayiotis Danassis, Naman Goel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Vraag: Kan "Vibe Coding" een Promovendus Verslaan?

Stel je voor dat je een superintelligente robotassistent hebt (een Large Language Model, of LLM) die code kan schrijven door er simpelweg tegen te praten. Je zegt: "Bouw een bezorg-app voor me," en het typt binnen enkele seconden de code uit. Dit wordt "Vibe Coding" genoemd.

De grote vraag die dit paper stelt is: Is deze robot eigenlijk slim genoeg om echte, complexe, risicovolle zakelijke problemen op te lossen, of is hij alleen goed in het schrijven van code die er juist uitziet maar faalt zodra de zaken ingewikkeld worden?

Om dit te ontdekken, zetten de onderzoekers een enorme codeerwedstrijd op.

De Arena: Het "Auction, Pickup, and Delivery"-spel

In plaats van de robots te vragen om eenvoudige wiskundige problemen op te lossen (zoals "wat is 2+2?"), plaatsten ze ze in een complexe simulatie genaamd het Auction, Pickup, and Delivery Problem (APDP).

Denk hierbij aan een hoogwaardig spel van Logistiek Schaken:

  1. De Veiling (The Auction): Verschillende bedrijven (agenten) bieden op bezorgopdrachten. De banen worden één voor één verkocht. Je moet raden hoeveel je moet bieden. Als je te hoog biedt, verlies je geld. Als je te laag biedt, win je misschien de opdracht, maar maak je verlies op de bezorging. Je moet raden wat je concurrenten zullen doen.
  2. De Planning (The Planning): Zodra je een opdracht wint, moet je de beste route bepalen voor je vrachtwagens om pakketten op te halen en af te leveren. Je hebt beperkte ruimte in je vrachtwagens en je mag de regels niet overtreden.
  3. Het Doel: De winnaar is het bedrijf dat de meeste winst maakt (Inkomsten uit biedingen minus de kosten van het rijden).

Dit gaat niet alleen over het schrijven van code die niet crasht; het gaat over het schrijven van code die strategisch nadenkt, de toekomst voorspelt en tegenstanders te slim af is.

De Deelnemers

De onderzoekers lieten twee teams tegen elkaar strijden:

  • Team Mens: 17 agenten geschreven door promotieonderzoekers (graduate students) aan een universiteit (EPFL) voordat AI-coderingstools bestonden. Deze studenten besteedden weken aan het nadenken, plannen en handmatig coderen.
  • Team AI: 40 agenten geschreven door de meest geavanceerde AI-modellen ter wereld (zoals GPT-5, Claude, Gemini) met behulp van "Vibe Coding". De onderzoekers gaven de AI exact dezelfde instructies als de studenten kregen.

De Resultaten: De Mensen Winnen, Enkel en Alleen

De resultaten waren verrassend en duidelijk:

  1. De Top 5 zijn Mensen: In elk toernooi werden de top 5 plekken ingenomen door de menselijke studenten. De AI-agenten konden de top 5 niet bereiken.
  2. AI vs. de "Geen Brein"-Baseline: De onderzoekers creëerden een zeer eenvoudige, domme AI-agent (eigenlijk een willekeurige gokker). 33 van de 40 AI-agenten verloren van deze simpele agent. De AI was zo slecht in strategie dat een basisrekenmachine het won.
  3. De "Fix-it"-Disaster: In een laatste test namen de onderzoekers de winnende menselijke code en vroegen de beste AI om deze te "verbeteren". De AI probeerde de code aan te passen, maar in plaats van het beter te maken, maakte het de code slechter. De verbeterde versie zakte van de 1e naar de 10e plaats.

Waarom Faalde de AI?

Het paper legt uit dat hoewel de AI uitstekend is in syntax (code schrijven zonder spelfouten), het moeite heeft met redeneren (het begrijpen van het "waarom" en "hoe" van complexe strategieën).

  • De "Admissible Heuristic" Fout: In een eenvoudigere test werd de AI gevraagd een specifieke wiskundige truc (A*-zoekalgoritme) te gebruiken om de beste route te vinden. De AI vergat steeds de meest basale regel van deze truc, zelfs toen de onderzoekers dit expliciet vertelden. Het is also': een kok vragen een taart te bakken, maar de kok vergeet dat eieren een essentieel ingrediënt zijn, zelfs nadat dat is gezegd.
  • De "Time-Out" Bug: De AI-agenten raakten vaak in loops vast of deden er te lang over om na te denken, waardoor ze de veiling verloren omdat de tijd op was. De menselijke code deed dit niet.
  • Gebrek aan Strategie: De AI-agenten boden vaak blindelings of planden routes die brandstof verspillen. Ze konden de "vibe" van de kamer niet aanvoelen of niet voorspellen wat hun concurrenten zouden doen.

De Conclusie

Het paper concludeert dat LLM's nog geen "Promovendus-niveau Coders" zijn.

Ze zijn uitstekend in het schrijven van code die werkt (geen syntaxfouten), maar ze zijn momenteel erg slecht in het schrijven van code die kan concurreren in complexe, realistische scenario's die langetermijnplanning en strategie vereisen.

De Analogie:
Stel je een robot voor die een perfect recept voor een taart kan schrijven. De robot weet precies hoeveel kopjes bloem er nodig zijn. Maar als je de robot vraagt om een bakkerij te runnen in een stad waar de prijzen elke minuut veranderen, concurrenten proberen je klanten te stelen en je een beperkt budget hebt, zal de robot waarschijnlijk failliet gaan. De robot kan het recept schrijven, maar het kan de zaak niet runnen.

De onderzoekers zeggen dat het tijd is om niet alleen te controleren of code "werkt" (een test haalt), maar om te controleren of code daadwerkelijk kan winnen in de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →