BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases
Dit artikel introduceert BUILD-AND-FIND, een evaluatieprotocol dat rekening houdt met de inspanning en de kwaliteit van door agenten gegenereerde codebases beoordeelt door niet alleen hun functionele correctheid te meten, maar ook de nauwkeurigheid en het inspectie-vereiste voor downstream-agenten om het oorspronkelijke ontwerpintent en de specificaties te herstellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Het Gaat Niet Alleen om het Antwoord, Maar om de Notitie
Stel je voor dat je een chef (een AI-agent) huurt om een complexe maaltijd te bereiden op basis van een geheim recept dat je hen hebt gegeven.
- Oude Manier: Je proeft het eten. Als het lekker smaakt, krijgt de chef een goedkeuring.
- Nieuw Probleem: Wat als de chef een heerlijk gerecht bereidt, maar de geheimzinnige ingrediënten verbergt in een afgesloten doos, het recept in onzichtbare inkt schrijft of de keuken in de war achterlaat? Later moet een andere chef (een andere AI) binnenkomen, het eten proeven en uitzoeken hoe het is gemaakt, zodat ze een verbrande rand kunnen repareren of meer zout kunnen toevoegen. Als de eerste chef geen duidelijke aanwijzingen heeft achtergelaten, kan de tweede chef falen, zelfs als het eten heerlijk smaakte.
Dit paper introduceert een nieuwe manier om AI-programmeurs te testen, genaamd BUILD-AND-FIND. In plaats van alleen te controleren of de code "werkt" (lekker smaakt), wordt er gecontroleerd of de code makkelijk te lezen en te begrijpen is voor de volgende persoon (of AI) die er mee moet werken.
De Twee Rollen: De Bouwer en De Zoeker
De onderzoekers hebben een spel opgezet met twee verschillende rollen:
De Bouwer (De Chef):
- Zij krijgen een verborgen "specificatie" (het geheim recept).
- Hun taak is om een compleet softwareproject (de keuken en de maaltijd) te bouwen op basis van die instructies.
- Zij weten niet dat iemand anders direct naar hun werk zal kijken; ze moeten het gewoon laten werken.
De Zoeker (De Inspecteur):
- Zij krijgen alleen de afgewerkte code (de keuken en de maaltijd). Zij mogen het originele geheim recept niet zien.
- Zij krijgen een lijst met meerkeuzevragen over de ontwerptaken (bijvoorbeeld: "Waarom koos de chef voor dit specifieke type oven?" of "Waar is het zout bewaard?").
- Hun taak is om door de code te kijken, het bewijs te vinden en de vragen correct te beantwoorden.
Het Scorebord: Nauwkeurigheid versus Inspanning
Het paper meet twee belangrijke dingen:
Kregen ze het goed? (Nauwkeurigheid)
- Kan de Zoeker het juiste antwoord uitzoeken door alleen naar de code te kijken?
- Analogie: Lukt het de Inspecteur om het verborgen kruidenpotje te vinden?
Hoe hard moesten ze zoeken? (Inspectie-inspanning)
- Dit is de grote innovatie van het paper. Als twee Bouwers allebei code maken waarmee de Zoeker het juiste antwoord kan krijgen, welke code was dan makkelijker uit te zoeken?
- De onderzoekers meten "inspanning" door te tellen hoeveel bytes code de Zoeker moest lezen of doorzoeken.
- Analogie: Als Chef A het zoutpotje op het aanrecht laat staan, en Chef B het verbergt in een afgesloten kluis die een complexe code vereist om te openen, hebben beide chefs eetbaar eten gemaakt. Maar Chef A heeft het makkelijker gemaakt voor de volgende persoon om mee te werken. Het paper beloont de chef die het "zout" op het aanrecht laat staan.
Waarom Dit Belangrijk Is
Het paper betoogt dat AI-agenten in de toekomst in teams zullen werken. Eén AI schrijft een programma, en een andere AI moet het later repareren of updaten.
- Als de eerste AI code schrijft die "correct" is maar rommelig of verwarrend, zal de tweede AI moeite hebben.
- BUILD-AND-FIND bewijst dat we kunnen meten hoe "leesbaar" of "communicatief" de code van een AI is, los van of de code daadwerkelijk draait.
De Resultaten (Wat Ze Vonden)
De onderzoekers testten dit met verschillende krachtige AI-modellen (zoals GPT-5, Claude Opus en anderen) op twee soorten taken: het bouwen van een mini-database en het bouwen van een kleine webserver.
- Het "Hoge Prioriteit"-Probleem: De vragen die ze stelden, waren dingen die ervaren ingenieurs meestal uit het hoofd weten (zoals "databases slaan meestal logs op voordat ze schrijven"). Omdat de AI's slim zijn, konden ze de antwoorden correct raden door alleen hun algemene kennis te gebruiken, zelfs zonder de code te lezen.
- De Oplossing: Omdat iedereen de antwoorden goed had, konden de onderzoekers niet alleen "juiste antwoorden" tellen. In plaats daarvan keken ze naar hoeveel lezen de AI's moesten doen.
- Sommige AI-modellen schreven code waarbij de antwoorden voor de hand lagen en makkelijk te vinden waren (lage inspanning).
- Anderen schreven code waarbij de antwoorden diep in de bestanden begraven lagen, waardoor de Zoeker veel meer moest lezen om ze te vinden (hoge inspanning).
- De Winnaar: De modellen die code produceerden waarbij de minste hoeveelheid lezen nodig was om de antwoorden te vinden, werden beschouwd als de besten in het "communiceren" van hun ontwerptaken.
Het Veiligheidsnet (Controles)
Om ervoor te zorgen dat de AI's niet gewoon bedrogen of gokten, voegden de onderzoekers veiligheidscontroles toe:
- Alleen-Vragen-test: Ze stelden de Zoeker de vragen zonder hen enige code te tonen. Als de AI het hier goed had, was het gewoon gokken op basis van algemene kennis.
- Alleen-Specificatie-test: Ze toonden de Zoeker het geheim recept maar geen code. Dit bewees dat het recept duidelijk was.
- De "Poort": De onderzoekers telden alleen de "inspanning"-score als de Zoeker het antwoord daadwerkelijk goed had. Als de Zoeker het antwoord helemaal niet kon vinden, werd de code beschouwd als een mislukking, ongeacht hoe weinig ze moesten lezen.
Samenvatting
BUILD-AND-FIND is een nieuwe test voor AI-programmeurs. Het vraagt: "Als je deze code schrijft, zal een andere AI dan makkelijk kunnen begrijpen waarom je de keuzes hebt gemaakt die je hebt gemaakt?"
Het gaat verder dan de vraag "Werkt de code?" en vraagt "Is de code een goed communicatiemiddel voor de toekomst?" De beste AI is niet alleen degene die het juiste ding bouwt; het is degene die het ding bouwt op een manier die het voor de volgende persoon makkelijk maakt om het op te pakken en verder te werken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.