← Neueste Arbeiten
💻 computer science

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

OmniPack ist ein trainingsfreies Framework, das die Effizienz von omnimodalen großen Sprachmodellen steigert, indem es die strukturelle Redundanzentfernung vor dem LLM mit semantischer Verfeinerung nach der Interaktion kombiniert und so über mehrere Benchmarks hinweg überlegene Leistungs-Effizienz-Abwägungen bei signifikanter Reduzierung der Rechenkosten erzielt.

Ursprüngliche Autoren: Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

Veröffentlicht 2026-08-05
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem superintelligenten Roboter beizubringen, die Welt zu verstehen. Sie geben ihm nicht einfach nur ein Buch zum Lesen; Sie zeigen ihm einen Film und spielen gleichzeitig eine Tonspur ab. Dies ist die aufregende Welt der „omnimodalen“ KI, in der Computer lernen, gleichzeitig zu sehen, zu hören und zu lesen. Aber hier ist der Haken: Filme und Soundtracks sind riesig. Eine einzige Sekunde Video oder Audio kann in tausende winzige digitale „Ziegelsteine“ namens Token zerlegt werden. Wenn man versucht, dem Roboter einen ganzen Film zu füttern, wird er überfordert, wie ein Schüler, der versucht, eine ganze Bibliothek in einer Minute zu lesen. Es dauert ewig, die Informationen zu verarbeiten, kostet ein Vermögen an Elektrizität und führt oft zu Verwirrung durch das schiere Volumen der Informationen. Wissenschaftler haben versucht, dieses Problem zu lösen, indem sie die „langweiligen“ Ziegelsteine wegwerfen, noch bevor der Roboter überhaupt anfängt zu lesen, in der Hoffnung, nur die wichtigen übrig zu behalten. Die alten Methoden des Wegwerfens waren jedoch etwas ungeschickt – sie warfen manchmal entscheidende Hinweise weg, nur weil sie anders aussah als ihre Nachbarn, oder sie versuchten zu erraten, was wichtig war, bevor der Roboter überhaupt die Chance hatte, die Geschichte tatsächlich zu verstehen.

Hier kommt OmniPack ins Spiel, eine neue, clevere Strategie, die darauf ausgelegt ist, diesen alles sehenden und alles hörenden Robotern zu helfen, schneller zu arbeiten, ohne den Verstand zu verlieren. Stellen Sie sich OmniPack wie einen zweistufigen Bearbeitungsprozess für ein chaotisches Filmskript vor. Zuer erst, bevor der Roboter das Skript überhaupt liest, fungiert OmniPack wie ein strenger Editor, der das Rohmaterial scannt. Er löscht nicht einfach nur die leisen Passagen; er sucht nach den „lauten“ Momenten (wie einem plötzlichen Aufprall oder einem hellen Blitz) und stellt zudem sicher, dass er nicht über die leise, aber wichtige Hintergrundkulisse übergeht, die zeitlich weit entfernt stattfindet. Er gruppiert ähnliche Ziegelsteine zusammen, damit sie keinen zusätzlichen Platz beanspruchen, und erstellt so einen „Highlight-Reel“, der die Struktur der Geschichte intakt hält.

Aber die eigentliche Magie geschieht im zweiten Schritt. Sobald der Roboter begonnen hat, das Skript zu lesen und mit sich selbst zu sprechen, greift OmniPack erneut ein. Dieses Mal hört es auf die Fragen des Roboters. Wenn der Robot fragt: „Welche Farbe hatte das Auto?“, weiß OmniPack, dass es die Token behalten muss, die mit dem Auto und der Farbe zusammenhängen, selbst wenn diese leise oder klein waren. Es nutzt die eigene Neugier des Roboters, um die Informationen zu verfeinern und die nützlichsten Details zusammenzuführen. Das Ergebnis ist eine massive Reduzierung der Arbeit, die der Roboter leisten muss. Bei einem speziellen Modell namens Qwen2.5-Omni-7B schaffte es OmniPack, die erforderliche Arbeit auf nur 16,7 % des ursprünglichen Aufwands zu schrumpfen, während es gleichzeitig 98,0 % der ursprünglichen Intelligenz des Roboters beibehielt. Selbst als sie die Grenzen ausreizten und die Arbeit auf winzige 6,8 % reduzierten, erinnerte sich der Roboter immer noch an 92,9 % dessen, was er wissen sollte. Es ist, als würde man eine massive Enzyklopädie auf ein einziges Pamphlet schrumpfen, aber das Pamphlet enthält dennoch alle Antworten, die man braucht.

Die Forscher fanden heraus, dass die alten Methoden oft scheiterten, weil sie versuchten, alles zu früh oder zu simpel zu komprimieren. Sie argumentierten, dass das Wegwerfen von Token basierend auf reiner „Lautstärke“ oder „Ähnlichkeit“ oft wichtige, verstreute Hinweise übersah. Sie zeigten auch, dass der Versuch, Audio zur Komprimierung von Video (oder umgekehrt) zu verwenden, bevor der Roboter die Chance hatte, die beiden Sinne miteinander zu vermischen, nicht gut funktionierte. Stattdessen schlägt OmniPack einen „studienspezifischen“ Ansatz vor: Erstens die Struktur basierend auf der spezifischen Art der Medien (Video oder Audio) bereinigen, und dann, nachdem der Roboter die Chance hatte, sie miteinander zu vermischen, die spezifische Aufgabe oder Frage nutzen, um die endgültige, intelligente Kompression durchzuführen.

In ihren Tests über fünf verschiedene Herausforderungssätze hinweg schlug OmniPack jede andere Methode, mit der sie verglichen wurden, konsequent. Ob sie nun kurze Clips oder lange Videos testeten, die neue Methode bot immer die beste Balance zwischen Geschwindigkeit und Intelligenz. Die Autoren legen nahe, dass durch die Koordination dieser zwei Phasen – zuerst die strukturelle Bereinigung, dann die intelligente, aufgabenbezogene Verfeinerung – diese leistungsstarken KI-Modelle viel effizienter gemacht werden können, ohne sie von Grund auf neu trainieren zu müssen. Es ist ein Weg, die superintelligenten Roboter schneller und kostengünstiger zu machen und sie gleichzeitig scharfsinning zu halten, selbst wenn die Flut an Informationen ungebremst hereinbricht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →