OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance
OmniDrop is een trainingsvrij, laagsgewijs token-pruningframework voor omni-modale LLM's dat tekstqueries en een temporele diversiteitsscore gebruikt om redundant audiovisuele tokens progressief te verwijderen binnen decoderlagen, waardoor aanzienlijke reducties in latentie en geheugengebruik worden bereikt terwijl het in prestaties bestaande baselines overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een super slimme robotassistent hebt (een "Omni-LLM") die tegelijkertijd video's kan bekijken en audio kan beluisteren. Je stelt het een vraag, zoals "Wie zingt op de achtergrond?" of "Welke kleur heeft de auto?"
Het probleem is dat hoogwaardige video en audio lijken op een enorme vloedgolf aan data. Voor slechts één minuut video moet de robot meer dan 10.000 kleine stukjes informatie (zogenaamde "tokens") verwerken. Proberen om allemaal tegelijk na te denken over ze is als proberen uit een brandblusapparaat te drinken: het is traag, kost veel energie en maakt de robot traag.
Om dit op te lossen, proberen wetenschappers meestal de "saaiere" delen van de video en audio weg te gooien voordat de robot überhaupt begint na te denken. Ze gaan ervan uit dat als een geluid en een beeld tegelijkertijd plaatsvinden, ze gerelateerd moeten zijn.
Het grote idee van het artikel: "OmniDrop"
De auteurs van dit artikel zeggen: "Wacht even, die aanname is verkeerd." Alleen omdat een geluid en een beeld samen plaatsvinden, betekent niet dat ze belangrijk zijn voor je specifieke vraag.
In plaats van dingen direct weg te gooien, hebben ze een nieuw systeem gebouwd dat OmniDrop heet. Hier is hoe het werkt, met behulp van enkele eenvoudige analogieën:
1. De "Langzaam-Start"-strategie (Laag-voor-laag snoeien)
Stel je voor dat het brein van de robot een meerdelig gebouw is.
- Oude methode: Je staat bij de voordeur (de invoer) en schopt direct 50% van de mensen (data) eruit op basis van wie op wie lijkt. Dit is riskant omdat je misschien de ene persoon eruit schopt die het antwoord eigenlijk weet.
- OmniDrop-methode: Je laat iedereen het gebouw binnen. Op de eerste paar verdiepingen (vroege lagen) mengen en praten iedereen met elkaar. Dit zorgt ervoor dat audio en video samen de scène kunnen mixen en begrijpen.
- De draai: Naarmate de groep naar de hogere verdiepingen beweegt (diepere lagen), begint de robot te beseffen: "Oh, ik hoef alleen met deze specifieke mensen te praten om de vraag te beantwoorden." Het begint dan zachtjes, en vervolgens agressiever, de onbelangrijke mensen te vragen om te vertrekken. Dit zorgt ervoor dat de robot het "grote plaatje" niet verliest voordat het weet waar het naar op zoek is.
2. De "Vraag als een zaklamp" (Vraag-gestuurde aansturing)
Hoe weet de robot wie hij moet houden?
- Oude methode: Het kijkt naar de audio en video en probeert te raden welke bij elkaar passen.
- OmniDrop-methode: Het schijnt een zaklamp op basis van je tekstvraag.
- Als je vraagt: "Wat voor geluid is dat?", verlicht de zaklamp de audiotokens en dimt de videotokens.
- Als je vraagt: "Welke kleur heeft het shirt?", verlicht de zaklamp de videotokens.
- De robot houdt de tokens die de "zaklamp" verlicht en gooit die in het donker weg. Dit maakt het snoeien slim en specifiek voor je taak.
3. De "Sla het midden niet over"-regel (Temporele diversiteit)
Er is een gevaar: Als de robot alleen de tokens houdt die de zaklamp raakt, kan het zijn dat hij alles andere vergeet, waardoor er een "gat" in het verhaal ontstaat.
- De oplossing: OmniDrop voegt een regel toe genaamd Temporele Diversiteit. Zelfs als een specifiek moment niet het meest belangrijke is, als het ver weg in de tijd ligt van het hoofd-evenement, geeft de robot het een kleine "bonus score" om te blijven.
- Analogie: Stel je voor dat je een boek leest. Als je alleen de zinnen bewaart waar de held spreekt, mis je de setting. OmniDrop zegt: "Houd de lijnen van de held, maar houd ook een paar zinnen uit de rustige delen ertussen vast, zodat het verhaal niet gebroken voelt."
De resultaten
De auteurs hebben dit getest op Qwen2.5-Omni (een populair model) met diverse video- en audiotests.
- Snelheid: Het liet de robot 40% sneller denken (minder wachttijd).
- Geheugen: Het gebruikte 14,7% minder geheugen.
- Slimheid: Verrassend genoeg, door slimmer te zijn over wat weggegooid moet worden, werd de robot eigenlijk beter in het beantwoorden van vragen (tot 3,58 punten hoger in tests) vergeleken met andere methoden die gewoon willekeurige brokken data weggooiden.
Samenvattend:
OmniDrop is als een slimme redacteur voor een film. In plaats van de film in tweeën te snijden voordat je het zelfs maar hebt bekeken, laat het je de hele film bekijken, bedenkt het precies welke scènes belangrijk zijn voor je specifieke vraag, en snijdt dan de rest weg terwijl je kijkt, zodat je snel het antwoord krijgt zonder het plot te verliezen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.