Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation
Het artikel introduceert Aero Realtime, een 4B streaming multimodaal model dat volledig uitgelijnde, duplex input-output interactie bereikt op een gedeeld tijdsraster, wat zorgt voor lage latentie, proactieve generatie met efficiënt KV-cache hergebruik en een verwerkingsvertraging van minder dan 200 ms.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een gesprek probeert te voeren met een vriend die ook met je naar een film kijkt. In een normaal gesprek wacht je tot de ander zijn zin heeft afgemaakt voordat je zelf spreekt. Maar in een echt natuurlijk gesprek kun je de ander misschien onderbreken met een snelle "Wauw!" terwijl hij nog aan het praten is, of je blijft stil terwijl hij een complex plotpunt uitlegt, om vervolgens op het exacte moment dat je iets nieuws begrijpt, direct in te springen. Dit is de heilige graal van "real-time" interactie: het vermogen om te luisteren en te spreken op hetzelfde moment zonder een slag te missen.
Een lange tijd waren computers hier erg slecht in. De meeste AI-modellen werken als een zeer beleefd, maar ietwat traag spelletje "heet partij". Ze wachten tot je je hele verhaal (de input) hebt afgerond, verwerken het allemaal in één keer, en beginnen dan pas te praten (de output). Ze kunnen niet echt "luisteren" terwijl ze "spreken". Als je nieuwe informatie aan hen voert terwijl ze midden in een zin zitten, raken ze in de war of moeten ze stoppen en opnieuw beginnen. Dit artikel behandelt het probleem van het boulen van een AI die echt "duplex" kan zijn — in staat om nieuwe dingen te horen en nieuwe dingen te zeggen tegelijkertijd, net zoals een mens dat doet, terwijl het een snel bewegende videostroom bijhoudt.
De onderzoekers achter dit artikel, van de Universiteit van Hong Kong en andere instellingen, hebben een nieuw AI-model gebouwd genaamd Aero Realtime. Denk aan een model dat niet alleen in zinnen praat, maar in kleine, ritmische "slagen" van tijd. In plaats van te wachten tot een hele video is afgelopen, breekt Aero Realtime de tijd af in kleine brokjes van 80 milliseconden. Voor elk enkel brokje audio dat het hoort, moet het een beslissing van een fractie van een seconde nemen: "Zal ik nu een woord zeggen, of zal ik stil blijven?"
Dit is een enorme verschuiving ten opzichte van hoe andere modellen werken. Meestal moet een AI zijn "denkfase" voltooien voordat hij begint aan zijn "praatfase". Aero Realtime doet beide tegelijkertijd. Het brengt de video, de audio en zijn eigen woorden samen op één enkele, gedeelde tijdlijn. Stel je een lopende band voor waarbij elke 80 milliseconden een nieuw stukje video en audio arriveert. Op dat exacte moment beslist de AI of hij een woord op de band laat vallen of een "stilte-token" (een tijdelijke aanduiding voor stil zijn) laat vallen. Dit stelt de AI in staat om naar nieuwe delen van de video te blijven luisteren, zelfs terwijl hij midden in het genereren van een zin zit. Hij stopt nooit de stroom om "bij te komen".
Het artikel betoogt dat eerdere pogingen om AI "proactief" (klaar om te spreken) te maken, lomp waren. Sommige systemen gebruikten een "micro-turn"-methode, waarbij de AI zichzelf constant de vraag stelde: "Moet ik nu spreken?" Dit is als een bestuurder die bij elke kruising stopt om een kaart te checken voordat hij verder rijdt. Anderen gebruikten externe "poorten" of schakelaars om te beslissen wanneer ze praatten, wat het systeem ingewikkelder en trager maakte. Aero Realtime wijst deze methoden af. In plaats daarvan leert het model de timing op een natuurlijke manier. Het model is getraind om "stilte" te behandelen als een geldig woord, net zoals "hallo" of "kat". Dit betekent dat de AI geen aparte schakelaar nodig heeft om te beslissen wanneer hij praat; de beslissing om te spreken of stil te zijn, zit direct verankerd in hetzelfde proces dat de woorden kiest.
Om dit werkend te krijgen, moesten het team complexe technische puzzels oplossen. Ze creëerden een speciale manier om het model te trainen met een mix van real-time videodata en standaard video-vragen. Ze ontwierpen ook een nieuwe manier om het model op computers te draaien die geheugen en snelheid bespaart. In plaats van de hele video telkens opnieuw te lezen wanneer er een nieuw frame arriveert, onthoudt het model wat het al heeft verwerkt en voegt alleen de nieuwe "slice" van informatie toe. Dit is als het lezen van een boek waarbij je niet het eerste hoofdstuk steeds opnieuw hoeft te lezen elke keer dat je een pagina omslaat; je onthoudt gewoon waar je gebleven was en gaat zo door.
De resultaten zijn indrukwekkend voor een model van deze omvang. De onderzoekers testten Aero Realtime op een continue videostream van 20 minuten. Zelfs terwijl de video doorging, slaagde het model erin om zijn "lag" — de vertraging tussen wat er in de video gebeurt en wat de AI zegt — op een mediaan van 84 milliseconden te houden. Dat is minder dan een knipoog. Zelfs bij het 95e percentiel (wat betekent dat 95% van de tijd) was de vertraging slechts 173 milliseconden. Dit betekent dat de AI binnen 200 milliseconden van de "echte" tijdlijn blijft, wat effectief betekent dat de AI in real-time luistert en spreekt.
Het artikel is echter voorzichtig om niet te beweren dat dit de absoluut beste AI ter wereld is op het gebied van het begrijpen van video. Bij het testen op een standaard benchmark genaamd OVOBench, scoorde het 4-miljard-parameters model (dat relatief klein is) goed, maar versloeg het niet de grootste, krachtigste 7-miljard-parameters modellen die zijn ontworpen voor offline, niet-real-time taken. De auteurs suggereren dat dit gat bestaat omdat het model moest leren op een compleet nieuwe manier van interageren (de "duplex"-stijl) en niet zoveel specifieke trainingsdata had voor dit exacte type real-time conversatie als de oudere modellen hadden voor traditionele vragen.
Kortom, Aero Realtime bewijst dat het mogelijk is om een AI te bouwen die niet alleen op zijn beurt wacht om te spreken, maar die echt in real-time kan converseren, door tegelijkertijd te luisteren en te spreken zonder moeite te hebben. Het is een stap richting AI die minder aanvoelt als een robot die op instructies wacht en meer als een vriend die daadwerkelijk met je aandacht naar de wereld kijkt. Hoewel het nog niet de slimste video-expert in de kamer is, is het de eerste die de kunst echt beheerst om het tempo van de tijd bij te houden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.