← Nieuwste papers
💻 computer science

OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models

OmniSelect is een trainingsvrij, modaal adaptief token-pruningkader dat dynamisch compressiestrategieën selecteert en toepast op basis van cross-modale relevantie om multimodale tokenreeksen in OmniLLMs efficiënt te reduceren terwijl de prestaties behouden blijven.

Oorspronkelijke auteurs: Morunliu Yang, Ruotao Xu, Le Li, Yue Wang, Jianxin Zhang, Juntao Li, Yihang Lou, Siwei Feng, Peifeng Li

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Morunliu Yang, Ruotao Xu, Le Li, Yue Wang, Jianxin Zhang, Juntao Li, Yihang Lou, Siwei Feng, Peifeng Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Te Veel Informatie" File

Stel je voor dat je een superslimme robotassistent hebt (een Omni-LLM) die tegelijkertijd video's kan bekijken en audio kan beluisteren. Om een video te begrijpen, ziet deze robot niet zomaar "een auto"; hij breekt de video op in duizenden kleine digitale puzzelstukjes die tokens worden genoemd. Hij doet hetzelfde voor het geluid.

Als je de robot een lange video met geluid voert, raakt hij overweldigd. Het is alsof je probeert een boek van 1.000 pagina's te lezen terwijl je tegelijkertijd naar een podcast van 10 uur luistert. De robot komt vast te zitten in een "file" van data, waarbij hij al zijn geheugen opgebruikt en eeuwenlang doet om een simpele vraag te beantwoorden, zoals: "Wat was de kleur van de vrachtwagen?"

Om dit op te lossen, proberen onderzoekers meestal wat van de puzzelstukjes (tokens) weg te gooien om het werk sneller te maken. Maar hier zit de adder onder het gras: De meeste bestaande methoden zijn als een onhandige conciërge. Ze gooien stukjes willekeurig weg of gebruiken een "één maat past iedereen"-regel. Ze kunnen het belangrijkste frame van een auto-ongeluk weggooien, alleen omdat het op hetzelfde moment gebeurde als een saai geluid, of ze houden een stille, lege kamer vast, alleen omdat de achtergrondmuziek luid was.

De Oplossing: OmniSelect (De Slimme Redacteur)

De auteurs stellen een nieuwe methode voor die OmniSelect heet. Denk aan OmniSelect niet als een conciërge, maar als een slimme, adaptieve filmredacteur die precies weet wat de kijker vraagt, nog voordat hij begint met knippen.

OmniSelect is "training-vrij", wat betekent dat het niet terug naar school hoeft om te leren hoe dit moet; het gebruikt een slimme set regels om ter plekke uit te zoeken wat bewaard moet blijven en wat weg kan.

Hoe Het Werkt: Het Drie-Stappenproces

1. De "Relevantiecontrole" (Wie is de Ster?)

Voordat er iets wordt geknipt, stelt OmniSelect een simpele vraag: "Voor deze specifieke vraag, zit het antwoord verborgen in de video of in de audio?"

Het gebruikt een lichtgewicht hulpmiddel (genaamd AudioCLIP) om de vraag en de video/audio te scannen.

  • Scenario A: Je vraagt: "Hoe is het weer?" Het hulpmiddel ziet dat de video de ster is. OmniSelect besluit Video-Centrum te zijn. Het behoudt de visuele frames en knipt de audio weg.
  • Scenario B: Je vraagt: "Welk nummer wordt er gespeeld?" Het hulpmiddel ziet dat de audio de ster is. OmniSelect wordt Audio-Centrum. Het behoudt het geluid en knipt de video weg.
  • Scenario C: Je vraagt: "Beschrijf de hele scène." Beide zijn belangrijk. OmniSelect kiest voor Uniforme Versnijding, waarbij beide evenredig worden geknipt.

Analogie: Stel je voor dat je een koffer inpakt voor een reis. Als je naar het strand gaat, pak je zwemkleding en een zonnebril in (Video-Centrum). Als je naar een concert gaat, pak je kaarten en oordoppen in (Audio-Centrum). OmniSelect bedenkt de bestemming voordat je begint met inpakken, zodat je geen ruimte verspilt aan de verkeerde spullen.

2. De "Dynamische Begroting" (Toewijzen van Ruimte)

Zodra het weet welke "ster" (video of audio) belangrijker is, knipt het niet zomaar willekeurig. Het creëert een dynamische begroting.

Als de video de ster is, zegt het: "Oké, we hebben een krappe begroting. We houden 90% van de videoframes, maar slechts 30% van de audio." Als de audio de ster is, draait het de boel om. Het zorgt ervoor dat de meest informatieve delen van de video of audio de meeste "ruimte" krijgen in het geheugen van de robot.

3. De "Fijnmazige Knip" (De Bottom-K Strategie)

Binnen elk tijdsblok (zoals een clip van 5 seconden) moet OmniSelect beslissen welke specifieke puzzelstukjes weggegooid moeten worden.

  • De Oude Manier (Top-K): Sommige methoden houden de "luidste" of "meest actieve" stukjes vast. Dit is alsof je de meest kleurrijke pixels in een foto bewaart, zelfs als ze alleen maar ruis zijn.
  • De OmniSelect Manier (Bottom-K): Dit is de slimme draai van het artikel. In plaats van de "luidste" stukjes te houden, bewaart het de stukjes die het minst op elkaar lijken.
    • Analogie: Stel je een kamer vol mensen voor die praten. Als iedereen precies hetzelfde zegt, hoef je maar naar één persoon te luisteren. OmniSelect identificeert de "echo's" (redundante tokens) en maakt ze stil, waarbij alleen de unieke stemmen worden bewaard die nieuwe informatie toevoegen. Dit zorgt ervoor dat de robot het hele plaatje ziet, niet alleen het luidste deel ervan.

De Resultaten: Snel, Slank en Slim

Het artikel testte dit op twee verschillende maten robots (3B en 7B parameters) met behulp van real-world video- en audiobenchmarks.

  • Snelheid: OmniSelect maakte de robot 1,19x tot 1,33x sneller. Het is alsof je upgradet van een fiets naar een step.
  • Geheugen: Het bespaarde ongeveer 2,6GB tot 2,8GB geheugen. Dat is alsof je een hele kast vol rommel opruimt zodat de robot meer belangrijke dingen kan passen.
  • Nauwkeurigheid: Ondanks dat 70% van de data werd weggegooid, gaf de robot nog steeds 94% tot 99% van de antwoorden goed, vergeleken met het bekijken van de hele video. In sommige gevallen werd de robot, door het "ruis" (redundante data) te verwijderen, zelfs beter in het beantwoorden van vragen dan toen hij alle data had.

Samenvatting

OmniSelect is een slim systeem dat stopt met het behandelen van alle video- en audiodata als gelijk. In plaats daarvan treedt het op als een detective:

  1. Het bedenkt of het antwoord ligt in de ogen (video) of de oren (audio).
  2. Het wijst zijn geheugenbegroting dienovereenkomstig toe.
  3. Het knipt de saaie, herhalende delen er genadeloos uit, terwijl het de unieke, belangrijke details behoudt.

Het resultaat is een super-efficiënte AI die lange video's en complexe geluiden kan begrijpen zonder vast te lopen, en dit alles zonder opnieuw getraind te hoeven worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →