← Nieuwste papers
💻 computer science

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

Het artikel introduceert LLaVA-OneVision-2, een vision-language model van de volgende generatie dat state-of-the-art prestaties behaalt op taken voor video-, ruimtelijke en temporele grounding door gebruik te maken van een nieuwe codec-stream-tokenisatiestrategie, een verenigd 3D RoPE-coördinatenstelsel en grootschalige open supervisie.

Oorspronkelijke auteurs: Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhan
Gepubliceerd 2026-05-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een 30 minuten durende film aan een vriend te beschrijven, maar je hebt slechts tijd genoeg om ze 30 afbeeldingen te laten zien.

De meeste huidige AI-modellen (zoals de modellen voor deze nieuwe versie) spelen op safe: ze kiezen 30 afbeeldingen die gelijkmatig over de tijd zijn verdeeld. Één afbeelding per minuut. Als er iets spannends gebeurt tussen minuut 10 en minuut 11, mist de AI dit volledig omdat het niet naar dat exacte seconde keek. Het is alsof je probeert een snelle voetbalwedstrijd te begrijpen door alleen elke minuut naar het scorebord te kijken; je zou het doelpunt missen.

LLaVA-OneVision-2 is een nieuw soort "superwaarnemer" dat de regels verandert. In plaats van de film te bekijken als een reeks statische momentopnames, behandelt het de video als een gecomprimeerd digitaal bestand (het soort dat je telefoon gebruikt om ruimte te besparen).

Hier is hoe het werkt, met eenvoudige analogieën:

1. De "Bit-kost" Kompas

Wanneer je een video comprimeert (zoals het omzetten van een ruwe film in een MP4), moet de computer harder werken om delen van de video te beschrijven waar dingen snel bewegen of wild veranderen (zoals een auto-ongeluk of een danser die draait). Het besteedt meer "digitale energie" (bits) aan die delen. Het besteedt zeer weinig energie aan saaie delen waar niets gebeurt (zoals een statische muur).

LLaVA-OneVision-2 leest deze "energiekaart".

  • De Oude Manier: "Ik zal 1 seconde naar de video kijken, dan 1 seconde overslaan, en dan weer kijken."
  • De Nieuwe Manier: "Ik zie dat het videobestand nu veel energie gebruikt omdat de actie intens is! Ik zal daar mijn aandacht op richten. Ik zie dat de energie hier laag is; ik zal dit deel overslaan."

Het concentreert zijn "hersencapaciteit" (tokens) precies daar waar de actie plaatsvindt, in plaats van het gelijkmatig te verspreiden.

2. De "Bewegingsdetective"

Het model zoekt ook naar "residuen". Stel je voor dat je een video bekijkt van iemand die loopt. De achtergrond (de kamer) blijft hetzelfde. Het model beseft: "Ik hoef de kamer niet in elk enkel frame opnieuw uit te leggen." Het besteedt alleen aandacht aan de delen die veranderden (de bewegende persoon).

Het creëert een "visueel doek" dat een collage is van de belangrijkste bewegende delen, efficiënt aan elkaar genaaid. Dit stelt het in staat om een 15 minuten durende video te bekijken zonder overweldigd te raken, omdat het de saaie, repetitieve delen negeert en inzoomt op het "verhaal".

3. De "Jump Rope" Test

Om te bewijzen dat dit werkt, creëerden de onderzoekers een nieuwe test genaamd JumpScore. Stel je een video voor van iemand die touwtje springt. Ze springen honderden keren op en neer. Voor een normale AI ziet elke sprong er precies hetzelfde uit. Het is moeilijk om te zeggen welke specifieke sprong de gebruiker bedoelt.

  • De Oude AI raakte in de war en gokte willekeurig, met een score van ongeveer 30 van de 100.
  • LLaVA-OneVision-2 ontdekte de kleine, split-second momenten waarop het touw de grond raakte of de voeten van de persoon van positie veranderden. Het scoorde 75 van de 100.

Het zag niet alleen "springen"; het zag het exacte moment waarop de sprong plaatsvond.

4. De "Ruimtelijke Navigator"

Het model werd ook erg goed in het begrijpen van ruimte. Als je het vraagt: "Wijs naar de lege ruimte tussen het koffiekopje en de laptop", kan het dat met hoge precisie doen. Het kan zelfs objecten volgen die door een video bewegen (zoals een kat die over een kamer rent) en ze in de gaten houden zonder ze uit het oog te verliezen, zelfs als de kat gedeeltelijk wordt verborgen.

Het Grote Plaatje

De onderzoekers bouwden niet alleen een groter brein; ze bouwden een slimmere manier van kijken.

  • Vroeger: De AI was als een toerist die elke minuut van een wandeling een foto maakte, in de hoop dat ze het uitzicht niet zouden missen.
  • Nu: De AI is als een gids die precies weet waar het uitzicht is, dus stopt het alleen om een foto te maken wanneer het landschap daadwerkelijk verandert.

Het resultaat is een model dat lange video's begrijpt, specifieke momenten in snelle actie vindt en veel beter redeneert over ruimte dan eerdere modellen, allemaal terwijl het dezelfde hoeveelheid computerkracht gebruikt. Ze hebben al hun code, data en het model zelf beschikbaar gesteld voor iedereen om gratis te gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →