← Nieuwste papers
🤖 AI

PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning

Dit artikel introduceert PRISM, een grootschalige, meertalige benchmark en een uitgebreid evaluatiekader dat is ontworpen om de ruimtelijk-temporele redeneercapaciteiten van taalmodellen in programmatische videogeneratie rigoureus te beoordelen, waarbij een aanzienlijke kloof wordt blootgelegd tussen code-uitvoerbaarheid en visuele ruimtelijke coherentie.

Oorspronkelijke auteurs: Qiran Zhang, Yuheng Wang, Runde Yang, Lin Wu, Jingru Fan, Shu Yao, Jie Zhang, Tianle Zhou, Huatao Li, Ruijie Shi, Yihan Li, Chen Qian

Gepubliceerd 2026-05-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Qiran Zhang, Yuheng Wang, Runde Yang, Lin Wu, Jingru Fan, Shu Yao, Jie Zhang, Tianle Zhou, Huatao Li, Ruijie Shi, Yihan Li, Chen Qian

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot-architect inhuurt om een bewegende, geanimeerde film over wiskunde of geschiedenis te maken. Je geeft de robot een script (de prompt), en het schrijft de code om de scène te bouwen.

Lange tijd hebben we gevraagd: "Heeft de robot het huis afgebouwd?" Als de code draaide zonder te crashen, zeiden we: "Goed gedaan!"

Maar het artikel PRISM betoogt dat dat niet genoeg is. Alleen omdat het huis gebouwd is, betekent niet dat de kamers op de juiste plek staan, dat het meubilair niet in de lucht zweeft, of dat de muren niet op de acteurs instorten.

Hier is het artikel uitgelegd in eenvoudige bewoordingen:

1. Het Probleem: "Draaien" versus "Er Goed Uitzien"

Denk aan Pixel-level AI (zoals standaard videogenerators) als een schilder die probeert een film frame per frame te schilderen. Ze zijn geweldig in het realistisch maken van dingen, maar ze verstoren vaak de logica. Een personage kan door een muur lopen, of tekst kan ondersteboven verschijnen.

Programmatic AI (wat dit artikel bestudeert) is anders. Het is als een robot die een nauwkeurige reeks instructies (code) schrijft om de film te bouwen. Het zou perfect moeten zijn omdat het regels volgt.

  • De Oude Test: Heeft de robot de instructies afgeschreven? (Ja/Nee)
  • Het Nieuwe Probleem: De robot kan de instructies perfect afmaken, maar de instructies kunnen de robot vertellen om een gigantische boom in een klein huis te plaatsen. De code draait, maar de film ziet er kapot uit.

2. De Oplossing: PRISM (De "Stress Test")

De auteurs hebben een enorme nieuwe test ontwikkeld genaamd PRISM.

  • De Schaal: Ze verzamelden meer dan 10.000 voorbeelden (20 keer groter dan eerdere tests). Deze bestrijken 437 verschillende onderwerpen, van "Hoe los je een algebra-probleem op" tot "De geschiedenis van lychees".
  • De Tweetalige Twist: Ze testten dit zowel in het Engels als in het Chinees.
  • De Menselijke Aanraking: Ze lieten niet alleen computers het werk beoordelen. Mensen controleerden de "blauwdrukken" om ervoor te zorgen dat de code daadwerkelijk zin had voor het verhaal dat werd verteld.

3. Het Nieuwe Beoordelingssysteem: De "Trechter"

In plaats van alleen een geslaagd/niet-geslaagd cijfer te geven, gebruikt PRISM een trechter met vier lagen om verschillende soorten fouten op te vangen:

  1. De Poortwachter (Code Betrouwbaarheid): Draait de code überhaupt? Als het crasht, is het uit.
  2. De Architect (Ruimtelijk Redeneren): Dit is de grote. Is de indeling logisch?
    • Overlap: Stoten twee objecten tegen elkaar?
    • Buiten de Grenzen: Zweeft een object uit het scherm?
    • Uitlekken: Spat een woord uit zijn kader?
  3. De Regisseur (Dynamische Complexiteit): Is de video te saai (zoals een statische dia-presentatie) of te chaotisch (te veel draaien en springen)? De test controleert of de beweging overeenkomt met het verhaal.
  4. De Editor (Temporele Dichtheid): Beweegt de video op een goed tempo, of flitst het te snel?

4. De Schokkende Ontdekking: De "Uitvoering-Ruimtelijke Kloof"

De auteurs testten 7 van de slimste beschikbare AI-modellen (inclusief grote namen zoals GPT, Gemini en Claude).

Het Resultaat:

  • Het Goede Nieuws: De AI's worden erg goed in het schrijven van code die draait. De meeste keren crasht de code niet.
  • Het Slechte Nieuws: Er is een enorme kloof tussen "draaien" en "er goed uitzien".
    • Gemiddeld waren 41% van de video's die succesvol draaiden ruimtelijk gebroken.
    • Stel je een robot voor die perfect een auto-motor kan bouwen, maar de wielen vervolgens op het dak plaatst. De motor draait, maar de auto rijdt niet.

Belangrijkste Bevindingen:

  • Langer Denken Helpt Niet: De auteurs probeerden de AI langer te laten "nadenken" voordat het antwoordde (een functie genaamd "Thinking Mode"). Dit loste de ruimtelijke problemen niet op. De AI werd gewoon zelfverzekerder in de verkeerde antwoorden.
  • Te Veel Actie is Slecht: Toen de AI probeerde de video te spannend te maken met veel beweging, viel de indeling uit elkaar.
  • Taal Maakt Uit: De AI had moeite op verschillende manieren met Engels versus Chinees, en maakte vaak meer indelingsfouten met Chinese tekst.

5. De Conclusie

Het artikel concludeert dat we niet langer alleen kunnen vragen: "Draait de code?" We moeten vragen: "Creëert de code een logische, georganiseerde wereld?"

Momenteel zijn zelfs de slimste AI's als getalenteerde maar onhandige toneelarbeiders. Ze kunnen het script volgen om de lichten aan te doen en de rekwisieten te verplaatsen, maar ze vergeten vaak te controleren of de rekwisieten de gezichten van de acteurs blokkeren of of het decor omvalt. PRISM is het nieuwe reglement om hen te dwingen te leren hoe ze betere toneelmeesters moeten worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →