← Nieuwste papers
💻 computer science

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

InternVideo-Next introduceert een twee-traps vooropleidingsmethode zonder video-tekst supervisie die, door een nieuw Encoder-Predictor-Decoder-architectuur en een conditionele diffusie-decoder, de kloof tussen pixelreconstructie en semantische abstractie overbrugt om state-of-the-art resultaten te behalen voor algemene videofundatiemodellen.

Oorspronkelijke auteurs: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

Gepubliceerd 2026-03-31
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🎬 De Droom van de "Alwetende Videomachine"

Stel je voor dat je een robot wilt bouwen die niet alleen kijkt naar wat er op een video gebeurt, maar het echt begrijpt. Hij moet weten dat een bal naar beneden valt door zwaartekracht, dat een auto sneller is dan een fiets, en dat als iemand een glas omstoot, het water op de grond komt.

Tot nu toe hadden we twee soorten robots die video's leerden:

  1. De "Verteller" (Text-Supervised): Deze robot leert door te kijken naar video's met ondertitels. Hij is goed in het herkennen van "een man die loopt" of "een hond die blaft". Maar hij is vaak dom over de fysieke wereld. Hij weet niet hoe diepte werkt of hoe objecten bewegen, omdat de ondertitels dat niet vertellen. Het is alsof hij een boek leest over zwemmen, maar nooit in het water is geweest.
  2. De "Kijker" (Self-Supervised/Masked Video Modeling): Deze robot krijgt een video, maar een groot deel is zwartgemaakt (gemaskerd). Hij moet raden wat er achter dat zwarte vlak zit. Dit is goed voor details, maar vaak raakt hij de grote lijn kwijt. Hij kan raden dat er een auto is, maar begrijpt niet waarom die auto rijdt of hoe de weg eronderuit ziet.

InternVideo-Next is de nieuwe robot die de beste van beide werelden combineert. De onderzoekers noemen hun methode een "Tweestaps-Plan" om een wereldmodel te bouwen.


🏗️ Stap 1: De Bouwvakker met een Geweldige Schets (Stage 1)

In de eerste stap bouwen ze een basis voor de robot.

  • Het Probleem: Eerdere robots probeerden het zwartgemaakte deel van de video direct weer in pixels (kleine vierkantjes) te tekenen. Dat is als proberen een meesterlijk schilderij te maken door alleen te kijken naar de verfkleurtjes. Het resultaat is vaak wazig of saai.
  • De Oplossing: Ze gebruiken een slimme truc. In plaats van direct te tekenen, laten ze de robot eerst een schets maken van wat er zou moeten zijn.
    • Ze gebruiken een Diffusie-decoder (een soort slimme kunstenaar die van een vage schets naar een scherp beeld werkt) in plaats van een simpele lijntekening.
    • Ze geven de robot ook hulp van een "Schilder" (SigLIP). Dit is een model dat al heel veel foto's heeft gezien en weet hoe dingen eruitzien. De robot kijkt naar deze "Schilder" om te leren hoe de betekenis van een scène eruit moet zien, zonder dat ze zelf video's met tekst nodig hebben.

De Analogie:
Stel je voor dat je een puzzle maakt.

  • De oude methode probeerde direct de randjes van de puzzelstukjes te matchen (pixels).
  • InternVideo-Next kijkt eerst naar de foto op de doos (de "Schilder" en de schets) om te begrijpen wat er op de puzzel moet staan, en tekent dan pas de stukjes in. Hierdoor begrijpt de robot niet alleen de kleuren, maar ook het verhaal.

🧠 Stap 2: De Dromer die de Wereld Voorspelt (Stage 2)

Nu de robot een goede schets kan maken, gaan ze hem leren denken over de tijd en oorzaak-gevolg.

  • Het Probleem: Als je een robot vraagt om de toekomst te voorspellen, kan hij "cheaten". Hij kan bijvoorbeeld zeggen: "Als er een bal is, is er waarschijnlijk ook een vloer." Dat is een makkelijk antwoord, maar het is geen echt inzicht.
  • De Oplossing: Ze gebruiken een Vaststaande Meester (Frozen Teacher).
    • De robot (de leerling) moet raden wat er gebeurt in een zwartgemaakte video.
    • De "Meester" (die al in Stap 1 is getraind) kijkt toe en geeft het juiste antwoord.
    • Omdat de Meester al weet hoe de wereld eruitziet (zowel de details als de betekenis), kan de leerling niet meer "cheaten". Hij moet echt leren hoe dingen bewegen en waarom.

De Analogie:
Stel je voor dat je een pianist bent die een stuk moet spelen met een blinde vlek in de bladmuziek.

  • De oude robots luisterden naar een simpele opname en probeerden de nootjes na te spelen (vaak fout).
  • Bij InternVideo-Next staat er een virtuoos pianist (de Meester) naast je die de hele muziek al kent. Hij fluistert je niet de nootjes toe, maar hij laat je voelen hoe het stuk moet klinken. Jij moet de muziek in je hoofd horen en de ontbrekende delen invullen op basis van dat gevoel, niet op basis van een simpele regel. Zo leer je echt muziek maken, niet alleen nootjes herhalen.

🚀 Wat is het Resultaat?

Deze nieuwe robot, InternVideo-Next, is een doorbraak:

  1. Hij is slimmer: Hij presteert beter dan robots die met miljoenen ondertitels zijn getraind, terwijl hij geen ondertitels heeft gebruikt. Hij leerde puur door naar de video te kijken.
  2. Hij begrijpt de fysieke wereld: Hij is goed in het schatten van diepte (hoe ver is dat gebouw?) en het volgen van bewegende objecten (waar gaat die auto naartoe?).
  3. Hij is veelzijdig: Of het nu gaat om het herkennen van acties, het voorspellen van wat er als volgende gebeurt, of het praten over video's (chatbots), deze robot is een sterke basis voor de toekomst.

🌟 Samenvattend

De onderzoekers hebben een manier bedacht om een robot te leren de wereld te begrijpen in plaats van alleen woorden te koppelen aan beelden.

  • Stap 1: Leer de robot om een goede "mentale schets" te maken van de wereld, met hulp van een slimme "schilder".
  • Stap 2: Laat de robot oefenen met het voorspellen van de toekomst, terwijl een "wijze meester" toekijkt om te zorgen dat hij echt nadenkt en niet cheat.

Het resultaat is een AI die niet alleen kijkt, maar ziet en begrijpt hoe onze wereld werkt. En het mooiste? Dit is allemaal gebaseerd op openbare video's, zonder dure menselijke labels.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →