WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis
Dit artikel introduceert WorldCoder-Bench, een uitgebreide benchmark met 2.026 door experts gecureerde taken en het StateProbe execution-gebaseerde protocol om het vermogen van grote taalmodellen te evalueren en te verifiëren om fysiek gegronde, interactieve 3D-werelden in browser-native omgevingen te synthetiseren, waarbij wordt onthuld dat huidige grensmodellen aanzienlijk moeite hebben met het behouden van staatconsistentie en interactieketens.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robotarchitect inhuurt om een virtuele speeltuin te bouwen op basis van een eenvoudige beschrijving die je geeft, zoals: "Maak een basketbalspel waarbij de bal realistisch stuiteren moet."
In het verleden, als je een AI vroeg om een website te bouwen, kon je gewoon naar het scherm kijken. Als de knoppen er goed uitzagen en de kleuren mooi waren, ging je ervan uit dat het werkte. Maar het bouwen van een 3D-wereld (zoals een videogame of een natuurkundige simulator) binnen een webbrowser is anders. Het is alsof je een huis bouwt waarvan de muren van onzichtbaar glas zijn gemaakt. Je kunt de buitenkant zien, maar je kunt niet zeggen of het fundament stevig is, of de deuren daadwerkelijk opengaan, of dat de zwaartekracht correct werkt, enkel door naar een plaatje te kijken.
Dit artikel introduceert WorldCoder-Bench, een nieuwe manier om te testen of AI daadwerkelijk deze werkende 3D-werelden kan bouwen, en niet alleen mooie plaatjes ervan.
Hier is de onderverdeling van hun aanpak met behulp van eenvoudige analogieën:
1. Het Probleen: Het "Black Box" Canvas
Wanneer een AI een 3D-wereld bouwt, schrijft het code die draait in een verborgen gebied van de browser dat een <canvas> wordt genoemd.
- De Oude Manier: Eerdere tests waren als het inhuren van een criticus die alleen naar een foto van de speeltuin kijkt. Die zou kunnen zeggen: "De glijbaan ziet er blauw uit, dus het is goed!" Maar ze kunnen niet zien of de glijbaan ook echt aan de grond vastzit of dat de bal van de rand afrolt.
- De Realiteit: De AI kan een perfect uitziende basketbalring tekenen, maar als de code fout is, kan de bal dwars door de ring zweven zonder te scoren, of kan de ring verdwijnen wanneer je hem aanraakt. De oude tests misten deze "onzichtbare" fouten.
2. De Oplossing: De "State Probe" (De Onzichtbare Inspecteur)
De auteurs hebben een nieuwe tool ontwikkeld genaamd StateProbe. In plaats van alleen een foto te maken, is deze tool als een onzichtbare inspecteur die in de virtuele wereld rondloopt.
- Hoe het werkt: De inspecteur heeft een geheime checklist (een "contract") die door menselijke experts is geschreven. De inspecteer kijkt niet alleen naar de scène; de inspecteur kijkt dieper in de code om de "vitale functies" van de wereld te controleren.
- Wat het controleert:
- Natuurkunde: Valt de bal daadwerkelijk met de juiste snelheid?
- Interactie: Wanneer ik op de knop klik, registreert de game de klik dan echt, of is de knop slechts een tekening?
- Status (State): Als ik een punt scoor, loopt de scoreteller dan daadwerkelijk op, of blijft deze op nul staan?
Om ervoor te zorgen dat de inspecteur streng is, gebruikten ze een truc genaamd Mutation Testing. Ze braken de code van de AI doelbewust op kleine manieren af (zoals de zwaartekracht super zwak maken of de scoreknop verbergen) om te zien of de inspecteur de fout zou ontdekken. Als de inspecteur de fout miste, werd de inspecteur aangepast. Dit zorgt ervoor dat de test strikt en eerlijk is.
3. De Test: WorldCoder-Bench
Ze hebben een enorme testsuite gebouwd met 2.026 verschillende uitdagingen.
- De Taken: Deze variëren van eenvoudige zaken (een stuiterende bal maken) tot complexe zaken (het simuleren van chemische reacties of het bouwen van een spel waarbij je moet mikken met een basketbal).
- De Regels: De AI krijgt een instructie in natuurlijke taal (bijv. "Bouw een spel...") en moet een enkele webpagina produceren. De AI krijgt de geheime checklist of de regels van de inspecteur niet te zien.
4. De Resultaten: De AI is nog aan het leren
Ze hebben de 9 beste AI-modellen ter wereld getest. De resultaten waren verrassend:
- De Score: Zelfs de beste AI slaagde voor ongeveer 28% van de tests.
- De Illusie: Veel AI's produceerden werelden die er op een screenshot perfect uitzagen, maar faalden voor de "onzichtbare inspecteur"-test. Ze bouwden het decor, maar vergaten de regels van de natuurkunde of hoe de knoppen met de logica van het spel verbonden moesten worden.
- De Belangrijkste Fouten: De AI kreeg meestal de "look" goed, maar faalde bij:
- Schema Drift: De AI veranderde de regels van het spel zonder dit aan de inspecteur te melden (bijv. de bal hoort rood te zijn, maar de AI maakte hem blauw en heeft de score niet bijgewerkt).
- Broken Chains: De AI bouwde een deur, maar verbond de klink niet met de deur, waardoor deze niet opengaat.
5. De "Waarde"-Check: Is het het geld waard?
De auteurs hebben ook berekend of het gebruik van deze AI's geld bespaart in vergelijking met het inhuren van een menselijke ontwikkelaar.
- De Twist: Ondanks dat de AI's vaak falen, zijn ze zo goedkoop en snel dat ze voor eenvoudige taken nog steeds veel geld besparen. Het is als het hebben van een zeer goedkope, zeer snelle leerling die de makkelijke klusjes snel afhandelt, maar een mens nodig heeft om de complexe zaken te repareren.
- De Metriek: Ze creëerden een "Return on Automation"-score. Voor eenvoudige taken (zoals het maken van een gaaf visueel effect) is de AI een goede deal. Voor moeilijke taken (zoals complexe natuurkunde) is de AI nog steeds te onbetrouwbaar om een mens te vervangen.
Samenvatting
WorldCoder-Bench is een reality check voor AI. Het voorkomt dat we worden misleid door mooie plaatjes en dwingt de AI om te bewijzen dat zijn 3D-werelden onder de motorkap ook daadwerkelijk werken. Op dit moment zijn de beste AI-modellen als getalenteerde kunstenaars die een perfect plaatje van een auto kunnen schilderen, maar nog niet hebben geleerd hoe ze een motor moeten bouwen die daadwerkelijk loopt. We komen dichterbij, maar er is nog een lange weg te gaan voordat ze uit zichzelf volledig functionele, interactieve werelden kunnen bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.