← Nieuwste papers
🤖 AI

Code Review Agent Benchmark

Dit paper introduceert c-CRAB, een nieuw dataset en evaluatiekader voor het beoordelen van AI-agenten op code-reviewtaken, waarbij wordt vastgesteld dat huidige systemen slechts ongeveer 40% van de taken succesvol voltooien en vaak andere aspecten benadrukken dan menselijke reviewers.

Oorspronkelijke auteurs: Yuntong Zhang, Zhiyuan Pan, Imam Nur Bani Yusuf, Haifeng Ruan, Ridwan Shariffdeen, Abhik Roychoudhury

Gepubliceerd 2026-03-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuntong Zhang, Zhiyuan Pan, Imam Nur Bani Yusuf, Haifeng Ruan, Ridwan Shariffdeen, Abhik Roychoudhury

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De "See-Crab" (c-CRAB): Een Nieuwe Manier om AI-Code te Controleren

Stel je voor dat je een gigantische bibliotheek bouwt. Vroeger schreven mensen elk boek zelf. Maar nu hebben we slimme robots (AI-agenten) die duizenden boeken in een seconde kunnen schrijven. Het probleem? Deze robots schrijven snel, maar ze maken soms rare fouten of schrijven verhalen die niet helemaal kloppen.

Vroeger waren het de menselijke bibliothecarissen die elk nieuw boek handmatig controleerden voordat het op de plank kwam. Maar nu schrijven de robots zoveel boeken, dat de menselijke bibliothecarissen het niet meer kunnen bijhouden. Ze raken overbelast.

Dus, hebben we geprobeerd om andere robots te bouwen die de boeken van de eerste robots controleren. Maar hoe weet je of die controle-robot goed werkt?

Het Oude Probleem: "Klinkt het hetzelfde?"

Tot nu toe keken onderzoekers naar de opmerkingen van de controle-robot en vergeleken ze met de opmerkingen van de mens.

  • De mens zegt: "Hé, deze zin is grammaticaal verkeerd."
  • De robot zegt: "Deze zin bevat een taalfout."

Als je kijkt naar de woorden, lijken ze op elkaar. Maar wat als de robot een heel ander probleem ziet, of juist een fout over het hoofd ziet? Soms zeggen ze iets heel anders, maar bedoelen ze hetzelfde. Soms zeggen ze iets dat klinkt als een mens, maar is volledig onzin.

Het is alsof je twee mensen vraagt of een taart goed is. Als ze allebei zeggen "Mmm, lekker", is dat goed. Maar als de één zegt "De taart is te zoet" en de ander zegt "De taart is te droog", dan is het lastig om te weten wie gelijk heeft als je alleen naar de woorden kijkt.

De Oplossing: c-CRAB (De "See-Crab")

De auteurs van dit paper hebben een nieuw systeem bedacht, genaamd c-CRAB (uitgesproken als See-Crab, of "Kijk-Krab"). In plaats van te kijken naar wat de robot zegt, kijken ze naar wat de robot doet.

Hier is hoe het werkt, met een simpele analogie:

  1. De Menselijke Controleur: Een mens kijkt naar een stuk code (een "pull request") en zegt: "Hier zit een fout. Als je dit invoert, crasht het programma."
  2. De Test (De Krab): In plaats van te vertrouwen op de woorden van de mens, bouwen we een test. Dit is als een kleine, ondeugende krab die probeert het programma te bijten. Als het programma goed is, bijt de krab niet. Als er een fout is, bijt de krab en crasht het programma.
    • De mens zegt: "Dit moet niet gebeuren."
    • De test (de krab): "Ik ga proberen dit te laten gebeuren. Als het lukt, heb je een fout."
  3. De AI-Controleur: Nu laten we de AI-robot (zoals Devin, Claude Code of Codex) naar de code kijken.
  4. De Code-Boer: Als de AI-robot een fout ziet, krijgt hij een andere robot (een "code-boer") die de code probeert te repareren op basis van de opmerkingen van de AI.
  5. De Proef: We laten de "ondeugende krab" (de test) weer los op de gerepareerde code.
    • Als de krab stopt met bijten (de test slaagt): De AI-robot had gelijk! Hij zag het probleem en wist hoe het op te lossen.
    • Als de krab blijft bijten (de test faalt): De AI-robot miste het probleem, of gaf een verkeerd advies.

Wat hebben ze ontdekt?

Toen ze dit systeem gebruikten om de beste AI-controleurs van vandaag te testen, zagen ze een paar interessante dingen:

  • De AI is nog niet zo slim als de mens: Menselijke controleurs slaagden bijna 100% van de tests. De slimste AI-robots haalden maar ongeveer 40%. Dat betekent dat er nog veel ruimte is voor verbetering.
  • Ze kijken naar verschillende dingen: Mensen en AI kijken vaak naar andere aspecten.
    • AI is heel goed in het vinden van technische valkuilen (bijvoorbeeld: "Dit kan crashen als je een heel groot getal invoert").
    • Mensen zijn beter in het zien van de "sfeer" van de code (bijvoorbeeld: "Dit is moeilijk te lezen voor de volgende developer" of "Dit past niet bij de regels van ons bedrijf").
  • Samenwerking is de toekomst: Omdat AI en mensen naar verschillende dingen kijken, zijn ze misschien wel perfecte teamgenoten. De AI kan de technische valkuilen vinden, en de mens kan zorgen dat de code netjes en begrijpelijk blijft.

Waarom is dit belangrijk?

Dit paper is belangrijk omdat het ons leert dat we niet moeten kijken naar hoe goed een AI praat (de woorden die hij gebruikt), maar naar hoe goed hij werkt (of hij echt de problemen oplost).

Het is alsof je niet vraagt aan een kok of hij een goede taart kan bakken door naar zijn woorden te luisteren ("Ik maak een heerlijke taart"), maar door de taart daadwerkelijk te proeven.

Kortom: We hebben een nieuwe "test-krab" (c-CRAB) bedacht om AI-robots te testen. Ze doen het momenteel nog niet perfect, maar ze vullen de menselijke controleurs goed aan. In de toekomst werken ze waarschijnlijk samen: de robot doet het zware, technische werk, en de mens zorgt voor de kwaliteit en de stijl.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →