← Nieuwste papers
💬 NLP

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

Het artikel stelt AVOC voor, een op retrieval geïnspireerd framework voor tokencompressie dat het begrip van audio-video op uurniveau in Omni-Modale LLM's verbetert door tokenselectie te herformuleren als een top-KK retrieval-probleem gebaseerd op relevantie, belang en diversiteit, waardoor het een state-of-the-art prestatie levert op long-form benchmarks terwijl de robuustheid in contexten van een uur behouden blijft.

Oorspronkelijke auteurs: Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

Gepubliceerd 2026-06-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische bibliotheek hebt met films en vergaderopnames die urenlang duren. Je wilt een intelligente AI-assistent een specifieke vraag stellen over wat er in een van die lange video's is gebeurd, zoals: "Hoeveel mensen liepen de kelder in na die specifieke zin?"

Het probleem is dat de "hersenen" (het geheugenvenster) van de AI te klein zijn om de hele video in één keer vast te houden. Als je probeelt de hele video te voeren, raakt hij overbelast. Als je probeert het te verkleinen door simpelweg willekeurige frames te kiezen, mis je misschien het cruciale moment. Als je probeert elk detail te behouden, raak je uit je geheugenruimte.

Ontmoet AVOC: De Slimme Bibliothecaris

De auteurs van dit paper hebben een nieuw systeem ontwikkeld genaamd AVOC. Zie AVOC als een zeer bekwame bibliothecaris die een film van 1 uur moet samenvatten tot een compacte "spiekbrief" van 10 pagina's voor de AI, maar met een heel specifiek doel: de spiekbrief moet alleen de informatie bevatten die nodig is om jouw vraag te beantwoorden.

Zo werkt AVOC, met drie eenvoudige regels geleend van hoe zoekmachines de beste resultaten vinden:

1. Relevantie: "Komt dit overeen met de vraag?"

Stel je voor dat je de bibliothecaris vraagt: "Wie liep de kelder in?"

  • De oude manier: De bibliothecaris laat je misschien een pagina zien over de keuken of het weer buiten, omdat die scènes luid of kleurrijk waren.
  • AVOC's manier: AVOC kijkt eerst naar je vraag. Het scant de video en audio en zegt: "Oké, ik moet het deel vinden waar mensen praten over de kelder." Het markeert de specifieke momenten in de video en de specifieke woorden in de audio die direct verband houden met je vraag. Dit wordt Text-Guided Scoring genoemd.

2. Belang: "Is dit interessant, zelfs zonder de vraag?"

Soms is je vraag vaag, of hangt het antwoord af van iets wat de video laat zien maar niet expliciet bespreekt.

  • De analogie: Stel je voor dat je een specifiek persoon zoekt in een menigte. Zelfs als je hun naam niet weet, kun je hen misschien spotten omdat ze een opvallende rode hoed dragen (een unieke visuele aanwijzing) of omdat zij de enige zijn die danst (een unieke audio-aanwijzing).
  • AVOC's manier: AVOC controleert of een moment op zichzelf "belangrijk" is. Het kijkt naar hoe de video en audio met elkaar communiceren. Als iemands gezicht (video) overeenkomt met een specifiek geluid (audio), krijgt dat moment een hoge "belangrijkheidsscore", zelfs als je vraag dat niet expliciet vermeldde. Dit zorgt ervoor dat de AI geen verborgen aanwijzingen mist.

3. Diversiteit: "Laat me niet twee keer hetzelfde zien!"

Dit is het lastigste deel. Als je een scène hebt waarin een personage een kamer binnenloopt, dan weer naar buiten loopt, en dan weer terug naar binnen gaat, zou een dom systeem misschien alle drie de momenten kiezen omdat ze allemaal op elkaar lijken. Dit verspilt ruimte.

  • De analogie: Stel je voor dat je een koffer inpakt voor een reis. Je hebt geen drie paar exact dezelfde rode sokken nodig. Je hebt één paar rood, één paar blauw en één paar groen nodig om verschillende behoeften te dekken.
  • AVOC's manier: AVOC gebruikt een speciale regel genaamd Temporal-Aware Diversity. Het zegt: "Als ik al een moment heb gekozen waarop iemand een kamer binnenloopt, kies ik niet het volgende seconde waarin ze precies hetzelfde doen." Echter, als hetzelfde gebeurt een uur later in de film, zal AVOC dat wel kiezen, omdat het een ander evenement in de tijd is. Dit houdt de samenvatting fris en dekt de hele tijdlijn zonder zichzelf te herhalen.

Het Resultaat: Een Super-Slimme Samenvatting

Door deze drie regels te combineren, comprimeert AVOC een enorme, uur durende video- en audiostroom tot een kleine, uiterst efficiënte "token"-sequentie. Het gooit de saaie, repetitieve of irrelevante delen weg en houdt alleen de "gouden brokken" informatie over.

Wat hebben ze ontdekt?

  • Het werkt beter dan ieder ander: Bij tests op lange video's (tot 90 minuten) beantwoordde AVOC vragen veel nauwkeuriger dan andere topmodellen. Het versloeg het op één na beste model met een aanzienlijke marge (gemiddeld ongeveer 5 punten hoger).
  • Het vindt de "naald in de hooiberg": Ze testten of de AI een specifiek geheim nummer kon vinden dat ergens verborgen zat in een video van 1 uur. AVOC kon dit bijna perfect vinden, zelfs in video's van een uur lang, terwijl andere modellen begonnen te falen naarmate de video's langer werden.
  • Het is snel: Ondanks dat het deze complexe sortering uitvoert, vertraagt het de AI niet veel. Sterker nog, omdat het zoveel nutteloze data weggooit, kan de AI de video zelfs sneller verwerken dan voorheen.

Kortom, AVOC leert de AI hoe het een betere lezer kan zijn: het leest niet alleen elk woord van een boek van 500 pagina's; het leert te scannen, de belangrijke delen te markeren en de onzin te negeren, zodat het jouw vraag perfect kan beantwoorden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →