← Nieuwste papers
💻 computer science

LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?

LLaVA-UHD v4 introduceert een visuele coderingsschema met hoge resolutie dat slice-gebaseerde codering combineert met vroege compressie binnen de ViT om de FLOPs voor visuele codering met 55,8% te verminderen terwijl de prestaties van bestaande multimodale grote taalmodellen worden behouden of overtroffen.

Oorspronkelijke auteurs: Kechen Fang, Yihua Qin, Chongyi Wang, Wenshuo Ma, Tianyu Yu, Yuan Yao

Gepubliceerd 2026-05-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Kechen Fang, Yihua Qin, Chongyi Wang, Wenshuo Ma, Tianyu Yu, Yuan Yao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, ultrahoge-resolutiefoto van een drukke stadsstraat hebt. Je wilt dat een superslimme AI-assistent (een Multimodaal Groot Taalmodel, of MLLM) naar deze foto kijkt en vragen erover beantwoordt, zoals "Wat staat er op het bord van de bakker?" of "Hoeveel mensen steken de straat over?"

Het probleem is dat deze foto zo groot is dat deze miljoenen kleine details (pixels) bevat. Als je de hele foto in één keer aan de AI voert, raakt deze overweldigd. Het is alsof je probeert een bibliotheek aan boeken in één seconde te lezen. De AI blijft steken in het proberen te verwerken van alle informatie tegelijk, wat het traag en duur maakt om te draaien.

De auteurs van dit artikel, LLaVA-UHD v4, hebben besloten om na te denken over hoe we deze gigantische afbeeldingen aan de AI voeren. Ze vonden twee slimme trucs om het proces sneller te maken zonder belangrijke details te verliezen.

1. De "Snijden en Delen"-strategie (in plaats van de hele taart)

De oude manier: Traditioneel probeerden mensen de hele gigantische afbeelding in één keer aan het "visuele brein" van de AI (een Vision Transformer) te voeren. De AI moest naar elke enkele pixel kijken en uitzoeken hoe deze zich verhoudt tot elke andere pixel in de hele afbeelding. Dit is rekenkundig zwaar, alsof je probeert een puzzel van 10.000 stukjes op te lossen terwijl je blinddoek hebt, en dan de blinddoek afneemt om je werk te controleren.

De nieuwe manier (op basis van snijstroken codering): De auteurs realiseerden zich dat het beter is om de gigantische afbeelding in kleinere, hanteerbare stukken te snijden (zoals het snijden van een grote pizza in individuele stukken) en ze één voor één te bekijken.

  • De analogie: Stel je voor dat je probeert een enorme, gedetailleerde kaart te lezen. In plaats van naar de hele kaart te staren en te proberen elke straat tegelijk te onthouden, gebruik je een vergrootglas om één wijk per keer te bekijken.
  • Het resultaat: Verrassend genoeg begreep de AI de details beter wanneer het naar stukken keek. Door zich te focussen op kleine, lokale gebieden, kon de AI kleine dingen (zoals tekst op een bord of een specifiek object) scherper zien dan toen het probeerde de hele chaotische afbeelding in één keer te verwerken.

2. De "Vroege Exit"-strategie (Comprimeren voordat het zware werk begint)

De oude manier: Zelfs na het snijden van de afbeelding waren er nog steeds te veel stukken voor de AI om efficiënt te verwerken. De oude methode was om de AI eerst alle stukken volledig te laten verwerken, en dan pas te proberen de informatie helemaal aan het einde te verkleinen.

  • De analogie: Dit is alsof je een team van 100 verhuizers huurt om elke enkele doos in een huis naar de vrachtwagen te dragen, en dan pas beseft: "Oh, we hebben alleen 25 dozen nodig", en 75 van hen weggooit. Je hebt veel moeite verspild met het verplaatsen van dozen die je niet nodig had.

De nieuwe manier (Intra-ViT vroege compressie): De auteurs bouwden een speciale "compressor"-module die in het visuele brein van de AI zit, direct aan het begin.

  • De analogie: In plaats van alle 100 dozen te verplaatsen, fungeert deze nieuwe compressor als een slimme sorteerder bij de voordeur. Het groepeert onmiddellijk vergelijkbare dozen en gooit de duplicaten weg voordat het zware verhuizerteam zelfs maar begint.
  • Het geheime wapen: Om dit te laten werken zonder het brein van de AI te breken, gooiden ze niet zomaar willekeurige stukken weg. Ze gebruikten een "warm start"-techniek. Ze namen de kennis die de AI al had over het bekijken van afbeeldingen en gebruikten deze om de nieuwe compressor te leren hoe het data moet verkleinen. Het is alsof je een nieuwe werknemer leert door hen een senior expert te laten shadowen, in plaats van vanaf nul te beginnen.

Het eindresultaat: LLaVA-UHD v4

Door snijden (naar de afbeelding kijken in delen) en vroege compressie (data verkleinen voordat het zware verwerken begint) te combineren, creëerden ze een nieuw systeem genaamd LLaVA-UHD v4.

  • Snelheid: Het vermindert het rekenwerk (energie en tijd) met ongeveer 56%.
  • Slimheid: Ondanks dat het minder werk doet, beantwoordt het vragen net zo goed, of soms zelfs beter dan, de oude, langzamere systemen. Het is bijzonder goed in het lezen van tekst en het opsporen van fijne details in afbeeldingen met hoge resolutie.

Kortom: Het artikel laat zien dat je een AI niet hoeft te dwingen om naar een gigantische afbeelding te staren om deze te begrijpen. Door de afbeelding in stukken te breken en de informatie slim vroeg te samenvatten, kun je de AI sneller en goedkoper maken zonder het "dommer" te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →