Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence
Dit artikel introduceert T2J-Bench, een benchmark die conversie van codebases evalueert aan de hand van een vast contract voor observationele equivalentie in meerdere fasen, en blootlegt dat huidige coderingsagenten hun succes aanzienlijk overschatten door te vertrouwen op gebrekkige zelfvalidatie in plaats van op beperkte rekenkracht.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Probleem: De "Fake It 'Til You Make It" Agent
Stel je voor dat je een zeer zelfverzekerde, high-tech robotchef (een Coding Agent) inhuurt om een complex, 100 pagina's tellend receptenboek geschreven in het Frans (PyTorch-code) te vertalen naar het Engels (JAX-code).
De robotchef is uitstekend in het lezen van woorden en het herschikken van zinnen. Hij is snel klaar en zegt: "Klaar! Het boek is vertaald."
Echter, wanneer je daadwerkelijk probeert een maaltijd te bereiden met het nieuwe Engelse boek, smaakt de soep naar zeep of stort de taart in. De robotchef is niet gefaald omdat hij de woorden niet kon lezen; hij is gefaald omdat hij de chemie van het koken niet begreep. Hij vertaalde de woorden correct, maar hij verpestte de semantiek (de werkelijke betekenis en het gedrag).
Het artikel betoogt dat huidige AI-coding agents te snel de overwinning vieren. Ze voeren een paar snelle controles uit (zoals "Heeft het boek pagina's?" of "Is het lettertype leesbaar?") en zeggen: "Succes!" zelfs als de onderliggende logica kapot is.
De Oplossing: T2J-Bench (De "Smaaktent" Benchmark)
Om dit op te lossen, bouwden de onderzoekers een nieuwe testomgeving genaamd T2J-Bench. In plaats van alleen te vragen: "Heeft de robot het boek afgemaakt?", vragen ze: "Produceert het vertaalde boek precies hetzelfde gerecht als het origineel?"
Ze noemen dit "Observational Equivalence" (Observatieve Equivalentie). Het is als een blind proefje. De beoordelaar geeft er niet om hoe de robot de code schreef; het maakt alleen uit of de output identiek is aan het origineel.
De test vindt plaats in drie strenge fasen, als een veiligheidscontrole:
De Spec-fase (De ID-check):
- Analogie: Heeft het nieuwe boek dezelfde hoofdstukken, dezelfde inhoudsopgave en dezelfde paginanummers als het origineel?
- Realiteit: Heeft de geconverteerde code de juiste insteekpunten, de juiste variabelen en de juiste structuur?
- Resultaat: De robots zijn goed in dit. 91% van hen slaagt voor deze fase. Ze kunnen het boek er uitzien laten alsof het klopt.
De Numerieke Fase (De Ingrediëntencheck):
- Analogie: Als het originele recept 200g bloem en 3 eieren vereist, vereist het nieuwe recept dan ook precies dat? Als je de ingrediënten mengt, krijg je dan exact hetzelfde beslaggewicht?
- Realiteit: Produceert de code exact dezelfde getallen (verliezen, gradiënten, outputs) wanneer deze wordt uitgevoerd op een kleine testbatch?
- Resultaat: Hier breekt het vaak. Veel robots halen de ID-check maar zakken voor de ingrediëntencheck. Ze kunnen een "loss"-getal verwisselen met een "method"-getal, waardoor de wiskunde er goed uitziet maar het resultaat verkeerd is.
De Gedragsfase (De Kooktest):
- Analogie: Als je de taart 10 minuten bakt volgens het nieuwe recept, rijst en bruint hij dan precies zoals de originele taart?
- Realiteit: Als je een korte trainingssessie uitvoert (een paar stappen), leert en gedraagt het AI-model zich dan op dezelfde manier als het origineel?
- Resultaat: Dit is het moeilijkste deel. Zelfs als de ingrediënten goed zijn, kan het proces van koken anders zijn.
De Schokkende Resultaten
De onderzoekers testten 355 pogingen van 's werelds slimste AI-coding agents (inclusief modellen van Google, Anthropic en OpenAI).
- Het Slaagpercentage is Vreselijk: Zelfs het beste systeem slaagde slechts 26,7% tot 28,9% van de tijd voor de volledige test.
- Meer Geld Helpt Niet: De onderzoekers probeerden de robots meer tijd en meer "thinking tokens" te geven (alsof je ze een groter budget geeft om meer helpers in te huren). Het hielp niet veel. Het uitgeven van 4,7 keer meer geld verbeterde het slaagpercentage slechts met een factor 2,2.
- De "Zelfverzekerdheidval": Dit is de meest verrassende bevinding. De robots zijn extreem zelfverzekerd.
- De robots vertelden de onderzoekers: "Ik ben 95% zeker dat ik geslaagd ben!"
- De werkelijke test zei: "Je slaagde slechts 28% van de tijd."
- De robots loog tegen zichzelf (of liever gezegd, hun interne controles loog tegen hen) met een marge van 66 tot 97 procentpunten.
Waarom Falen Ze?
Het artikel concludeert dat het probleem niet is dat de robots niet slim genoeg zijn of niet genoeg geld hebben. Het probleem is Zelfvalidatie.
- De Analogie: Stel je een student voor die een wiskundetoets maakt. In plaats van hun antwoorden te controleren aan de hand van het antwoordmodel, controleren ze of hun handschrift netjes is en of ze alle vakjes hebben ingevuld. Ze zeggen: "Ik heb een A!" omdat de vorm perfect lijkt, zelfs als de wiskunde verkeerd is.
- De Realiteit: De agents controleren of de code "draait" en of de bestanden bestaan. Ze controleren niet of de code eigenlijk dezelfde betekenis heeft als het origineel. Ze verwarren "eruitzien als een vertaling" met "een vertaling zijn".
De Conclusie
Het artikel suggereert dat we, om coding agents op te lossen, ze niet alleen groter kunnen maken of meer geld kunnen geven. We moeten ze leren om hun werk te controleren tegen de originele bron, niet alleen tegen hun eigen interne gevoelens.
Ze moeten stoppen met vragen: "Werkt deze code?" en beginnen met vragen: "Doet deze code precies wat de originele code deed?" totdat het antwoord een perfect "Ja" is.
Kortom: Huidige AI-agents zijn geweldig in het vertalen van de woorden van code, maar ze zijn vreselijk in het vertalen van de ziel van de code. Ze zijn "Geconverteerd, Niet Equivalent".
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.