← Nieuwste papers
💬 NLP

GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

Dit artikel introduceert GameCraft-Bench, een benchmark van 140 op Godot gebaseerde taken die ontworpen zijn om het vermogen van coding agents te evalueren om volledige, speelbare spellen end-to-end te genereren, wat onthult dat huidige frontier modellen aanzienlijk moeite hebben met het bereiken van artefact-volledigheid en interactieve coherentie ondanks het implementeren van herkenbare mechanieken.

Oorspronkelijke auteurs: Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao Du, Fan Bu, Wenyu Du, Xiaotong Zhang, Kyle Li, Shaobo Wang, Linfeng Zhang, Yuxuan
Gepubliceerd 2026-06-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao Du, Fan Bu, Wenyu Du, Xiaotong Zhang, Kyle Li, Shaobo Wang, Linfeng Zhang, Yuxuan Liu, Xin Lai, Chenxin Li, Yiduo Guo, Zhexin Zhang, Xinyuan Wang, Tianyi Bai, Ziniu Li, Benyou Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robotkok inhuurt en hem een recept geeft voor een complex, meergangenmenu. Je wilt niet alleen dat de robot het recept op een stuk papier schrijft; je wilt dat hij de maaltijd ook daadwerkelijk kookt, presenteert en serveert, zodat je een hap kunt nemen en kunt proeven.

Dat is in essentie waar dit artikel, GameCraft-Bench, over gaat. Het is een test om te zien of AI-code-agenten daadwerkelijk een speelbare videogame kunnen "koken" vanaf nul, in plaats van alleen de code ervoor te schrijven.

Hier is een uitsplitsing van de belangrijkste ideeën uit het artikel met behulp van eenvoudige analogieën:

1. Het Probleem: "Het Recept versus de Maaltijd"

In het verleden, wanneer we AI op codering testten, controleerden we vooral of de code er op papier correct uitzag (zoals controleren of de ingrediënten van een recept juist zijn opgelijst). Maar voor videogames is het bekijken van de code niet genoeg. Een game moet draaien, de graphics moeten verschijnen, en de speler moet een personage kunnen bewegen en kunnen zien wat er gebeurt.

De auteurs stellen dat om het vermogen van een AI om een game te maken echt te testen, we drie dingen nodig hebben:

  • De Echte Keuken (Engine Grounding): De AI moet werken in een echte game-engine (ze gebruikten Godot, een populaire gratis tool), niet in een nep of vereenvoudigde versie. Het is alsof je de chef vraagt om een echt fornuis te gebruiken, en geen speelgoedfornuis.
  • De Volledige Maaltijd (Artifact Completeness): De AI kan je niet alleen één ingrediënt geven (zoals een script voor een springend personage). Het moet een hele, verpakte game leveren die klaar is om te lanceren. Geen ontbrekende onderdelen.
  • De Proeverij (Interactive Verification): Je kunt niet alleen naar het voltooide gerecht kijken; je moet het eten. De game moet gespeeld worden. Het succes van de AI wordt beoordeeld door de game daadwerkelijk te draaien, op knoppen te drukken en te zien of de wereld correct reageert.

2. De Test: GameCraft-Bench

De onderzoekers bouwden een enorme testkeuken genaamd GameCraft-Bench.

  • Het Menu: Ze creëerden 140 verschillende uitdagingen verspreid over 15 soorten games (zoals platformers, racegames, strategische games en horror games).
  • Het Proces:
    1. Ze geven de AI een beschrijving in natuurlijke taal (bijv. "Maak een 2D-platformer waarbij je munten verzamelt en vijanden ontwijkt").
    2. De AI bouwt de game in de Godot-engine.
    3. De AI moet ook een "demo trace" opnemen—een videoscript dat precies laat zien hoe je de game speelt om te bewijzen dat deze werkt.
    4. Een computersysteem "speelt" de game met behulp van dat script, neemt de video op, en een slimme AI-rechter kijkt vervolgens naar de video om de score te bepalen.

3. De Resultaten: "Goed in Schrijven, Slecht in Koken"

De resultaten waren verrassend en een beetje nederig voor de AI-gemeenschap. Zelfs de slimste, meest geavanceerde AI-modellen (zoals Opus-4.7 en GPT-5.5) hadden moeite.

  • De Score: De beste AI haalde slechts ongeveer 41% op de test. De meeste scoorden onder de 40%.
  • Wat ze goed deden: De AI's waren redelijk goed in het bouwen van de "core loop". Als je vroeg om een game waarbij een personage springt, kon het personage meestal springen. Ze konden de onderdelen van de engine bouwen.
  • Waar ze faalden: Ze hadden moeite om alles samen te voegen tot een volledige ervaring.
    • Ontbrekende Content: Ze maakten vaak een game die te kort was of geen levels had om doorheen te progresseren.
    • Defecte Visuals: De graphics waren er misschien wel, maar ze maakten geen zin (bijv. de speler kan de vijand niet zien, of de UI is kapot).
    • De "Demo" Kloof: Veel AI's bouwden een game, maar vergaten de "demo trace" op te nemen die nodig is om te bewijzen dat het werkte. Het is alsoat de chef de maaltijd kookt maar vergeet deze op te presenteren voor de rechter.

4. Belangrijke Ontdekkingen (Het "Waarom")

Het artikel onderzocht waarom de AI's faalden:

  • Zien is Geloven: De AI's die het beste presteerden, waren degenen die naar het gamescherm keken terwijl ze de game bouwden. Ze gebruikten de visuele output als een debugging-tool. Als het personage er vreemd uitzag, pasten ze de code aan. AI's die alleen code schreven zonder naar het scherm te kijken, maakten meer fouten.
  • Druk is niet Beter: Eén AI-model (MiMo) schreef veel code en voerde veel commando's uit, maar behaalde geen hogere score. Het was alsof een chef koortsachtig groenten hakte maar de maaltijd nooit daadwerkelijk kookte. Meer werk verrichten garandeert geen beter resultaat als je de laatste stap mist.
  • Verschillende Vaardigheden: Het werkend krijgen van de "spring"-mechaniek (Mechanics) is iets anders dan de game er mooi uit laten zien (Art) of genoeg levels hebben (Content). Een AI kan goed zijn in het ene, maar slecht in het andere. Ze zijn niet allemaal aan elkaar gekoppeld.

5. De Conclusie

Het artikel concludeert dat hoewel AI erg goed wordt in het schrijven van code, end-to-end gamecreatie nog steeds een enorme uitdaging is.

Huidige AI kan "fragmenten" van games of eenvoudige prototypes bouwen, maar kan nog niet betrouwbaar een creatief idee van een mens nemen en dit zelfstandig omzetten in een gepolijste, speelbare, complete game-package. De kloof tussen "code schrijven die er goed uitziet" en "een systeem leveren dat werkt" is nog steeds erg groot.

Kortom: AI kan het recept schrijven, maar het leert nog steeds hoe het de volledige maaltijd moet koken en deze aan de klant moet serveren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →