← Neueste Arbeiten
🤖 AI

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus ist eine trainingsfreie, abfragegesteuerte Token-Kompressionsmethode für Omni-Modale Large Language Models, die unabhängig die Wichtigkeit von Audio- und Video-Token schätzt, um eine modalitätssymmetrische Kompression zu erreichen, wodurch die Inferenzkosten gesenkt werden, während die kreuzmodale Ausrichtung bewahrt wird und bestehende Baselines im Genauigkeits-Effizienz-Verhältnis übertroffen werden.

Ursprüngliche Autoren: Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

Veröffentlicht 2026-07-07
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen superintelligenten Roboter-Assistenten (ein Omni-modales Large Language Model), der Videos ansehen und gleichzeitig Audio hören kann. Dieser Robbot ist unglaublich talentiert, aber er hat ein Problem: Wenn Sie ihm ein langes Video mit Ton zeigen, versucht er, jedes einzelne Wort des Transkripts zu lesen und jeden einzelnen Frame des Videos anzusehen. Es ist, als würde man versuchen, ein ganzes Lexikon zu lesen, um eine einfache Frage darüber zu beantworten, welche Farbe der Himmel in einer bestimmten Szene hatte. Das macht den Roboter langsam, teuer im Betrieb und er wird von zu vielen Informationen überwältigt.

Das Paper stellt eine neue Methode namens OmniFocus vor, die diesem Roboter hilft, schneller und intelligenter zu werden, ohne dass er neu trainiert werden muss. So funktioniert es, unter Verwendung einfacher Analogien:

Das Problem: Der „unausgewogene“ Führer

Bisher versuchten Forscher, diese Roboter zu beschleunigen, indem sie sie dazu brachten, „langweilige“ Teile des Videos oder Audios zu ignorieren. Sie nutzten jedoch meistens nur einen Sinn, um zu entscheiden, welche Teile ignoriert werden sollten.

  • Der Fehler: Stellen Sie sich vor, Sie schauen eine Kochshow. Wenn Sie nur auf die Stimme des Kochs achten, um zu entscheiden, welche Teile des Videos wichtig sind, übersehen Sie vielleicht einen entscheidenden visuellen Schritt (wie „der Topf kocht gerade“), weil der Koch ihn noch nicht erwähnt hat. Umgekehrt könnten Sie, wenn Sie nur das Video betrachten, ein subtiles Geräusch (wie das Zischen einer Pfanne) übersehen, das Ihnen sagt, dass das Essen verbrennt.
  • Das Ergebnis: Der Roboter wäre gut darin, Audio-Fragen zu beantworten, aber schlecht bei visuellen Fragen oder umgekehrt. Er wäre „voreingenommen“ gegenüber dem Sinn, den er als Leitfaden verwendete.

Die Lösung: OmniFocus (Der „Abfrage-Detektiv“)

OmniFocus löst dies, indem es wie ein Detektiv agiert, der zuerst auf Ihre spezifische Frage (die „Query“) hört, bevor er entscheidet, was er behält.

  1. Zuerst auf die Frage hören:
    Anstatt zu raten, was wichtig ist, schaut OmniFocus zuerst auf Ihre Frage. Wenn Sie fragen: „Was hat der Sprecher über das Budget gesagt?“, weiß der Detektiv, dass er sich auf das Audio konzentrieren muss. Wenn Sie fragen: „Welche Farbe hatte das Auto?“, weiß er, dass er sich auf das Video konzentrieren muss.

  2. Zwei separate Teams (Modalitäts-balanciert):
    Die Methode behandelt das Video und das Audio als zwei separate Teams. Sie fragt Team Video: „Welche Teile dieses Videos passen zur Frage?“ und fragt Team Audio: „Welche Teile dieses Audios passen zur Frage?“

    • Die Analogie: Stellen Sie sich vor, Sie packen einen Koffer für eine Reise. Anstatt einfach alles aus der „Kleidungsschublade“ (Video) oder der „Schuhschublade“ (Audio) hineinzuwerfen, schauen Sie auf Ihren Reiseplan (die Frage). Sie packen die spezifischen Schuhe, die Sie zum Wandern brauchen, und die spezifische Jacke, die Sie für den Regen benötigen. Sie packen nicht die ganze Schublade; Sie packen nur das, was die Reise erfordert.
  3. Die „Dual-Score“-Auswahl:
    Sob nachdem der Detektiv weiß, welche Zeitabschnitte wichtig sind, wählt er die spezifischen „Tokens“ (Datenbits), die er behalten soll, anhand von zwei Regeln aus:

    • Regel A (Der Handschlag): Behalten Sie die Teile, in denen sich Video und Audio einig sind oder übereinstimmen (z. B. das Geräusch einer zuschlagenden Tür passt zum visuellen Bild einer sich schließenden Tür).
    • Regel B (Der Herausragende): Behalten Sie die Teile, die innerhalb ihrer eigenen Kategorie einzigartig oder laut sind (z. B. ein sehr markantes Geräusch im Audio oder ein heller Blitz im Video), selbst wenn der andere Sinn kein passendes Signal hat.

Die Ergebnisse: Schneller und Schlauer

Die Forscher haben diese Methoden an der Qwen2.5-Omni Familie von Modellen (den „Robotern“) getestet.

  • Effizienz: Indem sie die „langweiligen“ Teile, die nicht zur Frage passen, wegwerfen, läuft der Roboter 1,38-mal schneller und verbraucht weniger Speicher.
  • Genauigkeit: Obwohl sie 75 % der Daten weggeworfen haben (und nur 25 % behielten), antwortete der Roboter auf Fragen sogar besser als bisherige Methoden. Er hat seinen „gesunden Menschenverstand“ nicht verloren, weil er die wichtigsten Hinweise aus sowohl dem Video als auch dem Audio behalten hat.

Zusammenfassend

OmniFocus ist wie ein intelligenter Filter, der vor dem Roboter sitzt. Anstatt blind Daten basierend auf einem einzigen Sinn zu löschen, hört er auf Ihre Frage, prüft sowohl das Video als auch das Audio separat und behält nur die relevantesten „Hinweise“ aus beiden Quellen. Dies macht den Roboter schneller, kostengünstiger im Betrieb und überraschend genauer, da er nicht durch irrelevante Störgeräusche abgelenkt wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →