Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
Dit paper introduceert het "Thinking with Video"-paradigma, waarbij videogenereermodellen zoals Sora-2 worden gebruikt als een unificerend medium voor multimodaal redeneren, en onderbouwt de effectiviteit ervan via de VideoThinkBench-benchmark die aantoont dat deze modellen zowel visuele als tekstuele taken met hoge nauwkeurigheid kunnen oplossen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Denken met Video: Waarom een filmje slimmer kan zijn dan een foto of een tekst
Stel je voor dat je een groot, slim brein hebt dat gewend is om te denken in twee manieren:
- Denken met tekst: Net als jij en ik, die een probleem oplossen door het stap voor stap op te schrijven.
- Denken met beelden: Een camera die een foto maakt van een situatie.
Maar deze twee manieren hebben een groot nadeel. Een foto is statisch; het is een momentopname. Het kan niet laten zien hoe iets beweegt, hoe een bal rolt of hoe een puzzelstukje in elkaar schuift. En tekst en beelden zijn vaak gescheiden: je leest een uitleg, en daarna zie je een plaatje. Ze praten niet echt met elkaar.
De onderzoekers van OpenMOSS (een team van onder andere de Universiteit van Fudan) hebben een nieuw idee bedacht: "Denken met Video".
Het idee: De "Witte Bord"-film
In plaats van een statisch plaatje of een lange tekst, laten ze een AI-model (genaamd Sora-2) een filmpje maken om een probleem op te lossen.
Stel je voor dat je een wiskundig probleem hebt. Een gewone AI schrijft de oplossing op. Maar Sora-2 doet het anders:
- Het filmt een hand die een witte bord tekent.
- Je ziet de lijnen worden getrokken, de hoeken worden gemeten en de stappen worden uitgeschreven, precies zoals een leraar dat zou doen.
- Tegelijkertijd hoort je een stem die de oplossing uitlegt.
Het model "denkt" dus terwijl het tekent. Het simuleert het proces van het oplossen van het probleem, net zoals wij dat in onze gedachten doen, maar dan zichtbaar in een video.
De "VideoThinkBench": De examenhal
Om te testen of dit idee werkt, hebben de onderzoekers een nieuwe examenhal gebouwd, de VideoThinkBench. Dit is een verzameling van verschillende soorten puzzels:
Visuele puzzels (De "Oogmeet"-test):
Denk aan een puzzel waarbij je moet raden waar twee lijnen elkaar kruisen, of hoe een lichtstraal reflecteert in een spiegel.- Hoe werkt het? De AI moet in het filmpje de lijnen precies trekken en het juiste punt markeren.
- Het resultaat: Sora-2 was hier verrassend goed in. Het deed het zelfs beter dan de beste "foto-bekijkende" AI's. Het kon de beweging van licht en lijnen beter begrijpen door het te tekenen in plaats van alleen te kijken.
Tekst-puzzels (De "Wiskunde"-test):
Dit zijn moeilijke reken- en logica-vragen (zoals uit de schoolboeken).- Hoe werkt het? De AI moet het probleem oplossen en de uitkomst in het filmpje uitschrijven en uitspreken.
- Het resultaat: Ook hier deed Sora-2 het verrassend goed. Op sommige wiskundetoetsen haalde het bijna 90% van de juiste antwoorden.
Waarom is dit zo speciaal?
De onderzoekers ontdekken drie belangrijke dingen:
- Het is een alles-in-één model: Sora-2 is niet alleen een "tekenaar" of een "rekenaar". Het is een model dat tekst, beeld en beweging samenvoegt. Het kan een wiskundeprobleem oplossen door het visueel te simuleren.
- Het leert van voorbeelden: Als je de AI meer voorbeelden geeft (bijvoorbeeld: "Kijk eerst naar hoe dit probleem opgelost wordt, en doe dan hetzelfde"), wordt het veel slimmer. Dit noemen ze "in-context learning".
- Het "zichzelf controleren" werkt: Als je de AI vraagt om vijf keer hetzelfde probleem op te lossen en je kiest het antwoord dat het vaakst terugkomt, wordt het nog accurater. Dit is net als wanneer je zelf twijfelt en het nog een keer uitrekent om zeker te zijn.
De "Magische Vertaler" (Een klein geheim)
De onderzoekers hebben ook gekeken waarom Sora-2 zo goed is in wiskunde. Ze ontdekten dat het model een soort interne "vertaler" heeft.
Stel je voor dat Sora-2 een regisseur is. De regisseur krijgt een moeilijke vraag. In plaats van zelf te rekenen, geeft de regisseur een heel duidelijk script aan de acteur (het videogedeelte): "Teken eerst dit, schrijf dan dat, en zeg deze zin."
Het lijkt erop dat de "regisseur" (een onderdeel van het model dat de prompt herschrijft) het moeilijke denkwerk al heeft gedaan, en de "acteur" (het videogedeelte) voert het alleen maar uit. Zonder deze "regisseur" zou het videogedeelte niets kunnen.
Conclusie: De toekomst van AI
Deze studie laat zien dat video misschien wel de beste manier is om AI's te laten denken.
- Foto's zijn te stil.
- Tekst is te abstract.
- Video combineert beweging, beeld en taal. Het laat zien hoe iets werkt, niet alleen wat het is.
Het idee van "Denken met Video" zou kunnen leiden tot AI's die niet alleen antwoorden geven, maar die je kunnen laten zien hoe ze tot dat antwoord komen, net als een mens die aan een witte bord werkt. Dit maakt hen misschien wel de eerste echte "universele" slimme systemen die alles kunnen begrijpen en maken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.