← Nieuwste papers
🤖 AI

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus is een trainingsvrije, query-gestuurde methode voor tokcompressie voor Omni-Modale Large Language Models die onafhankelijk de belangrijkheid van audio- en videotokens inschat om modale-symmetrische compressie te bereiken, waardoor de inferentiekosten worden verminderd terwijl de cross-modale uitlijning behouden blijft en de bestaande baselines overtreft in nauwkeurigheid-efficiëntie-afruil.

Oorspronkelijke auteurs: Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

Gepubliceerd 2026-07-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super-slimme robotassistent hebt (een Omni-Modal Large Language Model) die tegelijkertijd video's kan bekijken en naar audio kan luisteren. Deze robot is ongelooflijk getalenteerd, maar heeft een probleem: wanneer je het een lange video met geluid laat zien, probeert hij elk enkel woord van het transcript te lezen en elk enkel frame van de video te bekijken. Het is alsof je een hele encyclopedie probeert te lezen om een simpele vraag te beantwoorden over welke kleur de lucht had in één specifieke scène. Dit maakt de robot traag, duur in gebruik en raakt hij overweldigd door te veel informatie.

Het artikel introduceert een nieuwe methie genaamd OmniFocus om deze robot sneller en slimmer te maken zonder dat hij opnieuw getraind hoeft te worden. Zo werkt het, met behulp van eenvoudige analogieën:

Het Probleem: De "Ongebalanceerde" Gids

Voorheen probeerden onderzoekers deze robots te versnellen door ze de "saaie" delen van de video of audio te laten negeren. Echter, ze gebruikten meestal één zintuig om te beslissen wat er genegeerd moest worden.

  • De Fout: Stel je voor dat je naar een kookprogramma kijkt. Als je alleen naar de stem van de chef luistert om te bepalen welke delen van de video belangrijk zijn, mis je misschien een cruciale visuele stap (zoals "de pan is aan het koken") omdat de chef er nog niet over heeft gesproken. Omgekeerd, als je alleen naar de video kijkt, mis je misschien een subtiel geluid (zoals het sissen van een pan) dat je vertelt dat het eten aanbrandt.
  • Het Resultaat: De robot zou goed worden in het beantwoorden van audio-vragen, maar slecht in visuele vragen, of andersom. Hij was "bevooroordeeld" naar het zintuig dat hij als gids gebruikte.

De Oplossing: OmniFocus (De "Query Detective")

OmniFocus lost dit op door te fungeren als een detective die eerst naar je specifieke vraag (de "query") luistert voordat hij besluit wat hij bewaart.

  1. Eerst Luisteren naar de Vraag:
    In plaats van te gokken wat belangrijk is, kijkt OmniFocus eerst naar je vraag. Als je vraagt: "Wat zei de spreker over het budget?", weet de detective dat hij zich op de audio moet concentreren. Als je vraagt: "Welke kleur had de auto?", weet hij dat hij zich op de video moet concentreren.

  2. Twee Afzonderlijke Teams (Modality-Balanced):
    De methode behandelt de video en de audio als twee afzonderlijke teams. Het vraagt aan Team Video: "Welke delen van deze video passen bij de vraag?" en vra je aan Team Audio: "Welke delen van deze audio passen bij de vraag?"

    • De Analogie: Stel je voor dat je een koffer inpakt voor een reis. In plaats van gewoon alles uit de "kleding" lade (video) of de "schoenen" lade (audio) erin te gooien, kijk je naar je reisprogramma (de vraag). Je pakt de specifieke schoenen in die je nodig hebt voor wandelen en de specifieke jas die je nodig hebt voor de regen. Je pakt niet de hele lade in; je pakt alleen wat de reis vereist.
  3. De "Dual-Score" Selectie:
    Zodra de detective weet welke tijdblokken belangrijk zijn, kiest hij de specifieke "tokens" (stukjes data) om te bewaren met behulp van twee regels:

    • Regel A (De Handdruk): Bewaar de delen waar de video en de audio overeenkomen of met elkaar matchen (bijv. het geluid van een dichtslaande deur komt overeen met het visuele beeld van een dichtslaande deur).
    • Regel B (De Opvallende): Bewaar de delen die uniek of luid zijn binnen hun eigen categorie (bijv. een zeer specifiek geluid in de audio, of een felle flits in de video), zelfs als het andere zintuig geen bijbehorend signaal heeft.

De Resultaten: Sneller en Slimmer

De onderzoekers hebben deze methode getest op de Qwen2.5-Omni familie van modellen (de "robots").

  • Efficiëntie: Door de "saaie" delen die niet bij de vraag passen weg te gooien, werkt de robot 1,38 keer sneller en gebruikt hij minder geheugen.
  • Nauwkeurigheid: Ondanks dat ze 75% van de data hebben weggegooid (ze hielden slechts 25% over), beantwoordde de robot vragen zelfs beter dan eerdere methoden. Hij verloor zijn "gezond verstand" niet omdat hij de belangrijkste aanwijzingen uit zowel de video als de audio heeft behouden.

Samenvattend

OmniFocus is als een slim filter dat voor de robot staat. In plaats van blindelings data te verwijderen op basis van één zintuig, luistert het naar je vraag, controleert zowel de video als de audio afzonderlijk, en houdt alleen de meest relevante "aanwijzingen" van beide over. Dit maakt de robot sneller, goedkoper in gebruik en verrassend nauwkeuriger omdat hij niet wordt afgeleid door irrelevante ruis.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →