← Nieuwste papers
💻 computer science

VIBEPASS: Can Vibe Coders Really Pass the Vibe Check?

Het onderzoek VIBEPASS onthult dat hoewel grote taalmodellen syntactisch correcte tests kunnen genereren, hun vermogen om subtiele bugs te diagnosticeren en te repareren beperkt blijft door een tekort aan fault-target redenering, wat een kritieke bottleneck vormt voor autonoom software-engineering.

Oorspronkelijke auteurs: Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty, Semih Yavuz

Gepubliceerd 2026-03-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty, Semih Yavuz

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat overmoedige assistent hebt die code schrijft (computerprogramma's). Deze assistent, een "AI", is zo goed dat hij vaak 90% van de taken perfect doet. Maar er is een groot probleem: als de assistent een klein, sluipend foutje maakt dat niet direct zichtbaar is, denkt hij vaak dat alles perfect is.

Dit artikel introduceert VIBEPASS, een nieuwe manier om te testen of deze slimme assistenten echt kunnen "nadenken" over fouten, in plaats van alleen maar code te kopiëren.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Vibe Check"

Vandaag de dag schrijven AI's steeds meer software met weinig menselijk toezicht. Dit noemen ze "vibe coding". Het werkt goed zolang de instructies duidelijk zijn. Maar in de echte wereld moet een AI ook zelf kunnen zeggen: "Hé, hier zit een fout in, en ik weet precies waar en waarom."

Tot nu toe hebben we geen goede manier om dit te testen. De meeste tests kijken alleen of de code werkt op de standaard voorbeelden. Maar wat als de code faalt op een heel rare, specifieke situatie die niemand had bedacht?

2. De Oplossing: VIBEPASS (De "Fout-Detectie Test")

De onderzoekers hebben VIBEPASS bedacht. Dit is geen gewone test, maar een drie-delige uitdaging voor de AI, alsof je een detectiveopleiding geeft:

  • Stap 1: De "Vind de Fout" Test (Het Foutje Zoeken)
    De AI krijgt een stuk code dat bijna perfect is, maar een verborgen fout heeft. De AI moet een specifiek voorbeeld bedenken (een "test") dat laat zien waar de fout zit.

    • Vergelijking: Stel je voor dat je een auto hebt die normaal rijdt, maar op een heel specifieke helling met een bepaalde snelheid uitvalt. De AI moet precies die helling en snelheid kunnen bedenken om de motor te laten staken. Als de AI alleen maar zegt "rijden" (standaard test), ziet hij de fout niet. Hij moet de "zwakke plek" vinden.
  • Stap 2: De "Reparatie" Test (Het Oplossen)
    Als de AI de fout heeft gevonden, moet hij de code repareren.

    • Vergelijking: De AI moet niet alleen zeggen "de motor stopt op deze helling", hij moet ook de sleutel vinden om de motor zo te repareren dat hij ook op die helling blijft rijden.

3. Wat Vond de Studie? (De Verassende Resultaten)

De onderzoekers keken naar 12 van de slimste AI's ter wereld (zoals GPT-5, Gemini, Claude). Wat bleek?

  • Slim zijn in coderen ≠ Slim zijn in fouten vinden.
    De AI's zijn fantastisch in het schrijven van code die er goed uitziet (90% slaagt). Maar zodra ze zelf een fout moeten ontdekken, zakken ze dramatisch.

    • Vergelijking: Het is alsof een chef-kok perfect een taart kan bakken die er prachtig uitziet. Maar als je hem vraagt: "Probeer eens een taart te bakken die niet lukt, zodat we de fout kunnen zien", dan faalt hij. Hij kan de taart maken, maar hij begrijpt niet waarom hij zou mislukken.
  • Het echte probleem is het "Gissen" naar de fout.
    De grootste drempel was niet het schrijven van de test, maar het bedenken van het idee voor de test.

    • Vergelijking: De AI kan perfect een sleutel maken (de test), maar hij weet niet welke sleutel in welk slot past. Hij moet eerst raden welk slot kapot is. Dat "raden" (de hypothese) is waar de meeste AI's vastlopen.
  • Eigen tests werken beter dan externe tests.
    Als de AI zelf een fout heeft gevonden en die test gebruikt om te repareren, gaat het vaak beter dan als iemand anders de test aanlevert.

    • Vergelijking: Als jij zelf merkt dat je fiets een lekke band heeft, weet jij precies waar je moet kijken om het te plakken. Als iemand anders zegt "kijk hier", kijk je misschien op de verkeerde plek. De AI werkt het beste als hij zijn eigen diagnose stelt.

4. De Conclusie: Waarom is dit belangrijk?

De studie laat zien dat we nog niet klaar zijn voor volledig autonome software-engineering. De AI's zijn geweldige "schrijvers", maar nog geen goede "detectives".

Ze kunnen de code schrijven, maar ze kunnen de oorzaak van een probleem nog niet goed doorgronden. Zolang ze niet kunnen "nadenken" over waarom iets fout gaat (in plaats van alleen maar te proberen het te fixen), zullen we mensen nodig blijven om de "vibe check" te doen.

Kortom: VIBEPASS is de eerste echte "vrijheidsproef" voor AI's om te zien of ze echt begrijpen wat ze schrijven, of dat ze alleen maar slim lijken. En tot nu toe: ze lijken slim, maar ze zijn nog geen echte detectives.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →