AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression
Das Papier schlägt AVOC vor, ein von Retrieval inspiriertes Token-Kompression-Framework, das das Verständnis von Audio-Video-Inhalten auf Stundenbasis in Omni-Modalen LLMs verbessert, indem es die Token-Selektion als ein Top--Retrieval-Problem basierend auf Relevanz, Wichtigkeit und Diversität neu formuliert und dadurch eine State-of-the-Art-Leistung bei Long-Form-Benchmarks unter Beibehaltung der Robustheit in stundenlangen Kontexten erzielt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie besitzen eine riesige Bibliothek mit Filmen und Aufzeichnungen von Meetings, die Stunden gehen. Sie möchten einer superintelligenten KI-Assistentin eine spezifische Frage zu einem dieser langen Videos stellen, wie zum Beispiel: „Wie viele Personen sind nach dieser speziellen Dialogzeile in den Keller gelaufen?“
Das Problem ist, dass das „Gehirn“ (das Gedächtnisfenster) der KI zu klein ist, um das gesamte Video auf einmal aufzunehmen. Wenn Sie versuchen, das gesamte Video einzuspeisen, bekommt sie keine Luft. Wenn Sie versuchen, es zu verkleinern, indem Sie einfach zufällige Frames auswählen, übersehen Sie vielleicht den entscheidenden Moment. Wenn Sie versuchen, jedes einzelne Detail beizubehalten, geht Ihnen der Platz aus.
AVOC: Der kluge Bibliothekar
Die Autoren dieses Papers haben ein neues System namens AVOC entwickelt. Stellen Sie sich AVOC wie einen hochqualifizierten Bibliothekar vor, der eine Zusammenfassung eines einstündigen Films in Form eines winzigen, 10-seitigen Spickzettels erstellen muss – mit dem ganz spezifischen Ziel: Dieser Spickzettel muss nur die Informationen enthalten, die benötigt werden, um Ihre Frage zu beantworten.
So funktioniert AVOC, unter Verwendung von drei einfachen Regeln, die davon inspiriert sind, wie Suchmaschinen die besten Ergebnisse finden:
1. Relevanz: „Passt das zur Frage?“
Stellen Sie sich vor, Sie fragen den Bibliothekar: „Wer ist in den Keller gelaufen?“
- Der alte Weg: Der Bibliothekar zeigt Ihnen vielleicht eine Seite über die Küche oder das Wetter draußen, weil diese Szenen laut oder farbenfroh waren.
- AVOCs Weg: AVOC schaut sich zuerst Ihre Frage an. Es scannt das Video und das Audio und sagt: „Okay, ich muss den Teil finden, in dem Menschen über den Keller sprechen.“ Es hebt die spezifischen Momente im Video und die spezifischen Wörter im Audio hervor, die sich direkt auf Ihre Frage beziehen. Dies wird als Text-Guided Scoring bezeichnet.
2. Wichtigkeit: „Ist das auch ohne die Frage interessant?“
Manchmal ist Ihre Frage vage, oder die Antwort hängt von etwas ab, das das Video zeigt, aber nicht explizit ausspricht.
- Die Analogie: Stellen Sie sich vor, Sie suchen eine bestimmte Person in einer Menge. Selbst wenn Sie deren Namen nicht kennen, könnten Sie sie entdecken, weil sie einen leuchtend roten Hut trägt (ein einzigartiges visuelles Merkensehen) oder weil sie die Einzige ist, die tanzt (ein einzigartiges akustisches Merkensehen).
- AVOCs Weg: AVOC prüft, ob ein Moment an sich schon „wichtig“ ist. Es schaut nach, wie Video und Audio miteinander interagieren. Wenn ein Gesicht (Video) zu einem bestimmten Geräusch (Audio) passt, erhält dieser Moment einen hohen „Wichtigkeitsscore“, selbst wenn Ihre Frage dies nicht erwähnt hat. Dies stellt sicher, dass die KI keine verborgenen Hinweise übersieht.
3. Diversität: „Zeig mir nicht dasselbe zweimal!“
Dies ist der schwierigste Teil. Wenn Sie eine Szene haben, in der eine Figur in einen Raum geht, dann wieder hinausgeht und dann wieder hineingeht, würde ein dummes System vielleicht alle drei Momente auswählen, weil sie alle sehr ähnlich aussehen. Das verschwendet Platz.
- Die Analogie: Stellen Sie sich vor, Sie packen einen Koffer für eine Reise. Sie brauchen nicht drei Paar exakt dieselbe rote Socke. Sie brauchen ein rotes Paar, ein blaues Paar und ein grünes Paar, um verschiedene Bedürfnisse abzudecken.
- AVOCs Weg: AVOC verwendet eine spezielle Regel namens Temporal-Aware Diversity. Es sagt: „Wenn ich bereits einen Moment ausgewählt habe, in dem jemand in einen Raum geht, werde ich die nächste Sekunde, in der er genau dasselbe tut, nicht noch einmal auswählen.“ Wenn jedoch dasselbe Ereignis eine Stunde später im Film passiert, wird AVOC dieses trotzdem auswählen, da es ein anderes Ereignis in der Zeit ist. Dies hält die Zusammenfassung frisch und deckt die gesamte Zeitlinie ab, ohne sich zu wiederholen.
Das Ergebnis: Eine superintelligente Zusammenfassung
Durch die Kombination dieser drei Regeln nimmt AVOC einen massiven, einstündigen Video- und Audiostream und komprimiert ihn in eine winzige, hocheffiziente „Token“-Sequenz. Es wirft die langweiligen, repetitiven oder irrelevanten Teile weg und behält nur die „Goldstücke“ der Information.
Was haben sie herausgefunden?
- Es arbeitet besser als alles andere: In Tests mit langen Videos (bis zu 90 Minuten) beantwortete AVOC Fragen viel genauer als andere Top-Modelle. Es übertraf das zweitbeste Modell um eine deutliche Marge (im Durchschnitt um etwa 5 Punkte höher).
- Es findet die „Nadel im Heuhaufen“: Sie testeten, ob die KI eine spezifische geheime Zahl finden kann, die irgendwo in einem einstündigen Video versteckt ist. AVOC konnte sie fast perfekt finden, selbst in Videos, die eine Stunde lang waren, während andere Modelle bei längeren Videos anfingen, zu scheitern.
- Es ist schnell: Obwohl es diese komplexe Sortierung durchführt, verlangsamt es die KI kaum. Tatsächlich kann die KI das Video dank AVOC sogar schneller verarbeiten, weil so viele unnütze Daten weggeworfen werden.
Kurz gesagt: AVOC lehrt die KI, wie man ein besserer Leser wird: Die KI liest nicht einfach jedes Wort eines 500-seitigen Buches; sie lernt, zu überfliegen, die wichtigen Teile hervorzuheben und den unwichtigen Ballast zu ignorieren, damit sie Ihre Frage perfekt beantworten kann.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.