Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
Het artikel introduceert Audio-Visual Flamingo (AV-Flamingo), een volledig open, state-of-the-art groot taalmodel dat is ontworpen voor gezamenlijk begrip en redeneren over lange, complexe video's uit de echte wereld door gebruik te maken van een enorme nieuwe dataset, een progressief driefasig trainingscurriculum en een nieuw temporeel geïnterleavd chain-of-thought framework.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je naar een film kijkt. Je ziet de gezichten van de acteurs, de omgeving en de actie, maar je hoort ook de dialogen, de achtergrondmuziek, het geluid van voetstappen en het geritsel van bladeren. Een lange tijd waren computers als mensen die een film bekeken met hun ogen dichtgeplakt, waarbij ze alleen naar het audiospoor luisterden, of andersom. Ze waren geweldig in het herkennen van een kat in een afbeelding of het transcriberen van een toespraak, maar ze hadden moeite met het begrijpen van de volledige scène waarin een kat miauwt terwijl hij over het scherm rent. Dit studieveld wordt "multimodale" intelligentie genoemd, waarbij machines proberen verschillende zintuigen te combineren — zoals zicht en geluid — om de wereld te begrijpen zoals mensen dat doen. De grote vraag die onderzoekers zich hebben gesteld is: Kunnen we een AI bouwen die niet alleen naar een video kijkt of naar een podcast luistert, maar die ook echt nadenkt over hoe het geluid en het beeld samenwerken, vooral wanneer het verhaal lang en ingewikkeld is?
Maak kennis met Nemotron-Labs-Audio-Visual Flamingo (of AV-Flamingo voor kort), een nieuw soort AI-brein ontworpen door onderzoekers van NVIDIA en de University of Maryland. Zie eerdere video-AI's als studenten die slechts één pagina van een tekstboek kunnen lezen en een snelle vraag daarover kunnen beantwoorden. Als je hen zou vragen om een hele film samen te vatten of een complexe scène uit te leggen die over 15 minuten verandert, zouden ze de draad kwijtraken, het begin vergeten of de personages door elkaar halen. AV-Flamingo is anders. Het is als een superattentieve student die een hele film kan kijken, naar de soundtrack kan luisteren, en vervolgens kan gaan zitten om een gedetailleerd essay te schrijven over hoe de muziek de stemming veranderde, waarom een personage op een bepaalde manier reageerde, of precies wanneer een specifiek geluid plaatsvond in relatie tot een visuele gebeurtenis.
De onderzoekers ontdekten dat ze dit niet konden bereiken door de AI simpelweg meer van dezelfde oude data te voeren. Ze moesten de AI drie nieuwe trucjes aanleren. Ten eerste creëerden ze een enorme bibliotheek van ongeveer 7 miljoen echte video-voorbeelden (inclusief 4,8 miljoen vraag-en-antwoordparen) die specifiek zijn ontworpen om het vermogen van de AI te testen om geluid en beeld over een bepaalde tijd met elkaar te verbinden. Ze noemden dit Audio-Visual-Skills. Ten tweede gooiden ze de AI niet zomaar in het diepe water; ze gebruikten een "curriculum" dat begon met korte fragmenten om basisvaardigheden aan te leren, om vervolgens langzaam over te gaan naar langere, complexere video's om de AI te leren hoe het een verhaal over een langere tijd kan volgen. Ten derde, en misschien wel het meest slim, leerden ze de AI een "denkproces" genaamd Temporal Audio-Visual Interleaved Chain-of-Thought. Stel je voor dat de AI een video bekijkt en elke paar seconden pauzeert om te zeggen: "Oké, op dit exacte moment sloeg de trommel, en daarna sprong het personage." Dit helpt de AI om zijn gedachten te verankeren in de tijd, zodat hij niet in de war raakt over wat eerst of als laatste gebeurde.
De resultaten zijn behoorlijk indrukwekkend. Bij tests op meer dan 15 verschillende uitdagingen — variërend van het begrijpen van muziek en spraak tot het analyseren van lange video's en het beantwoorden van lastige vragen — versloeg AV-Flamingo andere open-source modellen van vergelijkbare grootte met een duidelijke marge. Sterker nog, het slaagde er zelfs in om te concurreren met, en soms zelfs te verslaan, veel grotere en duurdere "closed" modellen (de modellen waarvan je de code niet kunt zien) die momenteel de beste ter wereld zijn. Het artikel suggereert dat dit model bijzonder goed is in het afhandelen van lange, complexe video's uit de echte wereld waarbij de aanwijzingen verspreid zijn over de tijd, wat bewijst dat met de juiste data en trainingsmethoden open-source AI de reuzen kan inhalen. Het is een grote stap naar het geven van het vermogen aan computers om de wereld echt te "zien en horen", in plaats van er alleen maar naar te staren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.