← Nieuwste papers
💬 NLP

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Mage-VL is een efficiënt, codec-native streaming foundation model dat een bewegingsbewuste tokenizer en een duaal systeemarchitectuur benut om realtime multimodale begrip te bereiken met aanzienlijk verminderd tokenverbruik en snellere inferentie, terwijl het grotere state-of-the-art modellen op zowel statische als dynamische redeneertaken evenaart of overtreft.

Oorspronkelijke auteurs: Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, J
Gepubliceerd 2026-07-29
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een live voetbalwedstrijd op je telefoon kijkt. De camera zwenkt over het veld, het publiek brult, en spelers rennen heen en weer. Stel je nu een superintelligente robot voor die die wedstrijd in realtime probeert te begrijpen. De meeste huidige robots zijn als een student die erop staat om elk woord van een tekstboek van 500 pagina's te lezen, zelfs de delen waar honderd keer staat "het gras is groen". Ze blijven hangen in de saaie, statische delen van de video en verspillen daarmee al hun hersencapaciteit en tijd, terwijl ze de eigenlijke score van een doelpunt missen. Dit is een beetje een paradox: ze zijn genieën in het oplossen van complexe puzzels, maar verschrikkelijk in het efficiënt bekijken van een bewegende scène.

Dit artikel, geschreven door het Microsoft Mage Team, introduceert een nieuw soort robotbrein genaamd Mage-VL. Het is ontworpen om deze regel te breken door te werken als een menselijk oog. In plaats van elke frame van een video aan te staren, let Mage-VL alleen op de delen die daadwerkelijk veranderen of bewegen. Denk aan een beveiliger die alleen naar de bewegingssensoren kijkt; als er niets beweegt, verspilt hij geen energie aan het kijken naar een lege gang. Door dit te doen, kan de robot video's veel sneller begrijpen en met minder rekenkracht, waardoor hij met je kan chatten over een live wedstrijd terwijl deze plaatsvindt, in plaats van pas een samenvatting te geven wanneer de wedstrijd voorbij is.

De Magie van "Codec-Native" Kijken

Het geheime ingrediënt van Mage-VL is iets wat de auteurs een codec-native benadering noemen. In de wereld van videostreaming (zoals wanneer je Netflix of YouTube kijkt), gebruiken computers een trucje genaamd "compressie" om ruimte te besparen. Ze sturen niet elke frame van een video; ze sturen een volledig beeld (een "I-frame") en sturen vervolgens alleen de kleine stukjes die de volgende paar seconden veranderen (de "P-frames"). Dit is hoe je telefoon een film kan streamen zonder al je data op te eten.

Mage-VL is gebouwd om deze taal van nature te spreken. In plaats van de video in een rigide raster van statische beelden te dwingen, gebruikt het dezelfde bewegingssignalen die videocompressie gebruikt om te bepalen wat belangrijk is. Als een speler rent, zoomt de robot in op de speler. Als het publiek op de achtergrond gewoon stilstaat, negeert de robot het volledig. Dit is als een fotograaf die alleen een foto maakt wanneer er iets interessants gebeurt, in plaats van 30 foto's per seconde te maken van een stilleven.

Het resultaat is een enorme efficiëntieboost. Het artikel laat zien dat Mage-VL het aantal "visuele tokens" (de kleine stukjes van het beeld die de computer moet verwerken) met meer dan 75% kan verminderen. Het is alsoal een boek lezen waarbij je alleen de spannende hoofdstukken hoeft te lezen en de saaie opvulling overslaat, terwijl je toch het hele verhaal perfect begrijpt.

Een Brein met Twee Systemen

Om deze streamingvideo te verwerken, gebruikt Mage-VL een slim twee-delig brein dat geïnspireerd is door hoe mensen denken.

  1. Systeem 1 (De Reflex): Dit is een supersnelle, lichte poortwachter. Het kijkt naar de videostream en vraagt: "Gebeurt er op dit moment iets interessants?" Als het antwoord "nee" is, blijft het stil. Als het antwoord "ja" is (zoals bij een doelpunt), wordt het tweede deel van het brein direct wakker.
  2. Systeem 2 (De Redeneerder): Dit is het zware denkgedeelte. Zodra de poort opengaat, duikt het diep in de materie om precies te begrijpen wat er is gebeurd en genereert het een reactie.

Dit betekent dat de robot geen tijd verspilt aan het nadenken over de saaie delen van de video. Hij blijft stil tijdens de rust van de wedstrijd of wanneer de camera slechts over het stadion zwenkt, en hij springt er direct bij zodewegs een speler de bal trapt met een opmerking.

Wat Ze Vonden (en Wat Ze Niet Vonden)

Het team heeft dit model vanaf nul getraind met ongeveer 560 miljoen ongelabelde afbeeldingen en 100 miljoen ongelabelde videoframes. Dat klinkt als veel, maar vergeleken met andere gigantische modellen die miljarden beeld-tekst paren nodig hebben, is het eigenlijk vrij klein. Verrassend genoeg ontdekten ze dat je geen massaal, web-schaal dataset nodig hebt om een geweldig visueel brein te bouwen. De aangepaste trainingsmethode van Mage-VL stelde het model in staat om veel grotere modellen te evenaren of zelfs te verslaan op taken van video-begrip.

Hier zijn enkele van de belangrijkste ontdekkingen die ze hebben gedaan:

  • Snelheid: Mage-VL is ongelooflijk snel. Het kan video tot 3,5 keer sneller verwerken in real-time vergeleken met standaardmodellen, terwijl het nog steeds de juiste antwoorden geeft.
  • Geen behoefte aan "Lange Video" Training: Ze ontdekten dat ze het model niet specifiek op lange video's hoefden te trainen om goed te worden in het beantwoorden van vragen over deze. Door het te trainen op gedetailleerde beschrijvingen van korte clips en door hun slimme "codec"-methode te gebruiken, leerde het model vanzelf lange video's te begrijpen.
  • Beweging Helpt bij Ruimtelijk Redeneren: Ze ontdekten dat het trainen van het model op bewegende video's het ook beter maakte in het begrijpen van statische 3D-vormen en ruimtelijke relaties. Het lijkt erop dat het zien hoe dingen bewegen, de robot helpt begrijpen hoe ze in de ruimte in elkaar passen.
  • AI Helpt AI: Het team gebruep een AI-systeem om te helpen bij het schrijven van betere trainingsdata. Ze lieten een AI de gegenereerde bijschriften controleren, fouten herstellen en de prompts verbeteren, wat een lus creëerde die de kwaliteit van de data enorm verbeterde.

De Kern van het Verhaal

Mage-VL is een belangrijke stap voorwaarts in het maken van AI die daadwerkelijk de wereld in realtime kan "bekijken" en "beluisteren". Het bewijst dat je niet met brute kracht door elke pixel van een video hoeft te gaan om deze te begrijpen. Door slim te zijn over waar het naar kijkt — door de manier waarop videocompressie werkt en hoe het menselijk oog zich op beweging concentreert na te bootsen — wordt het model sneller, goedkoper in gebruik en responsiever.

Hoewel het artikel opmerkt dat het model nog werk te doen heeft op het gebied van complexe redeneertaken en wiskundige problemen, laat het succesvol zien dat een kleiner, efficiënter model de grotere, tragere reuzen kan overtreffen als het gaat om het begrijpen van de dynamische, bewegende wereld om ons heen. Het is een beweging weg van "alles lezen" naar "kijken naar wat ertoe doet".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →