LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
Het artikel introduceert LAION-BVD, een enorme open dataset bestaande uit 80 miljoen video's (10 miljoen uur) met synthetisch gegenereerde bijschriften, wat state-of-the-art multimodale pre-training mogelijk maakt over video-, audio- en beeld-teksttaken heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het moderne tijdperk van kunstmatige intelligentie leren computers de wereld te zien en te horen, niet door regels te leren, maar door enorme hoeveelheden voorbeelden op te zuigen. Jarenlang hebben onderzoekers massieve bibliotheken gebouwd van afbeeldingen gekoppeld aan tekstbeschrijvingen, waarmee machines leerden begrijpen dat een foto van een hond vaak gepaard gaat met het woord "hond". Dit proces, bekend als multimodale leerprocessen, stelt computers in staat om te verbinden wat ze zien met wat ze lezen, wat de basis vormt voor systemen die afbeeldingen kunnen beschrijven, vragen erover kunnen beantwoorden of zelfs nieuwe afbeeldingen kunnen genereren vanuit tekst. Echter, terwijl deze bibliotheken van statische afbeeldingen zijn gegroeid tot miljarden vermeldingen, zijn de gelijkwaardige collecties voor bewegende beelden en geluid verrassend klein gebleven. Video's zijn veel complexer dan stilstaande foto's; ze bevatten beweging, veranderende scènes en vaak een soundtrack die samen met de beelden een verhaal vertelt. De uitdaging was dat het verzamelen van voldoende videodata om deze krachtige systemen te trainen extreem moeilijk is, aangezien video's vaak achter de muren van commerciële platforms verborgen zitten en enorme rekenkracht vereisen om te verwerken.
Een team van onderzoekers heeft nu deze barrière doorbroken door een dataset van ongekende schaal vrij te geven genaamd LAION-BVD. Deze collectie vertegenwoordigt een enorme sprong voorwaarts in de open wetenschap, en biedt een bibliotheek van 10 miljoen uur aan video. Om dit in perspectief te plaatsen: als men elke uur van deze beelden zou bekijken zonder te stoppen, zou het meer dan duizend jaar duren om het af te maken. De dataset werd opgebouwd door eerst 1,3 miljard links naar video's van het publieke web te verzamelen, specifiek van grote platforms zoals YouTube, Vimeo en Dailymotion. Vanuit deze enorme lijst hebben de onderzoekers succesvol 80 miljoen verschillende video's gedownload. Vervolgens gebruikten ze geautomatiseerde tools om deze lange video's op te knippen in kortere, betekenisvolle clips op basis van scèneveranderingen, om ervoor te zorgen dat elk segment een samenhangend moment vastlegde in plaats van een rommelige verzameling ongerelateerde shots.
De ware innovatie van dit werk ligt in de manier waarop de onderzoekers de computer leerden deze clips te begrijpen. Omdat geen enkel mens mogelijk 10 miljoen uur aan video kan bekijken en voor elke seconde een beschrijving kan schrijven, gebruikte het team kunstmatige intelligentie om automatisch tekstlabels te genereren. Ze trainden gespecialiseerde modellen om de videoclips te bekijken en korte, synthetische bijschriften te schrijven die de actie beschrijven, terwijl aparte modellen de audiotracks beluisterden om de geluiden te beschrijven, van muziek tot spraak tot omgevingsgeluiden. Ze extraheerden ook individuele frames uit de video's om een enorme collectie van 300 miljoen afbeeldingen te creëren, elk met een eigen beschrijving. Dit proces creëerde een rijke, gelaagde dataset waarin de computer kan leren om video aan tekst te koppelen, audio aan tekst, en zelfs enkele afbeeldingen aan tekst, allemaal vanuit dezelfde bronmaterialen.
Toen de onderzoekers deze nieuwe data testten door computermodellen erop te trainen, waren de resultaten opmerkelijk. De modellen leerden video en audio net zo goed, en in sommige gevallen zelfs beter, te begrijpen dan modellen die getraind zijn op bestaande, kleinere datasets. De prestaties verbeterden consistent naarmate de onderzoekers de modellen meer data voedden en grotere computerarchitecturen gebruikten, wat suggereert dat deze enorme bibliotheek een hoogwaardige bron is voor het onderwijzen van machines. De op video getrainde modellen werden beter in het herkennen van menselijke handelingen, zoals het identificeren van iemand die basketbal speelt of een specifieke dans uitvoert, en ze werden vaardiger in het vinden van de juiste video bij een tekstuele beschrijving. Op dezelfde manier toonden de op audio getrainde modellen een sterke bekwaamheid om gesproken woorden of geschreven beschrijvingen te koppelen aan de juiste geluiden, of het nu ging om een vogel die fluit of een auto die start.
Misschien verrassend genoeg bleken de uit deze video's geëxtraheerde afbeeldingen ook een krachtige nieuwe bron van leren te zijn. Hoewel de modellen die getraind waren op deze uit video afgeleide afbeeldingen niet de absolute beste waren in het identificeren van specifieke objecten op een rigide, tekstboekachtige manier, blonken ze uit in een andere taak: het vinden van de juiste afbeelding bij een gegeven beschrijving. Dit suggereert dat de visuele wereld vastgelegd in video's een andere soort variëteit biedt dan standaard webafbeeldingen, wat een uniek perspectief biedt dat computers helpt de wereld breder te begrijpen. De onderzoekers stelden vast dat de bijschriften gegenereerd door hun geautomatiseerde systeem accuraat genoeg waren om nuttig te zijn, waarbij de overgrote meerderheid de inhoud van de clips correct beschreef.
Dit werk doet meer dan alleen een nieuwe dataset leveren; het demonstreert dat de flessenhals voor het trainen van geavanceerde video- en audio-AI niet langer een gebrek aan beschikbare data is, maar eerder de technische inspanning die nodig is om het te verwerken. Door aan te tonen dat een enorme, openbaar beschikbare collectie webvideo's succesvol gecureerd en gebruikt kan worden om state-of-the-art modellen te trainen, hebben de onderzoekers de deur geopend voor een nieuwe generatie kunstmatige intelligentie. Ze hebben bewezen dat met de juiste instrumenten de enorme, chaotische oceaan van online video getransformeerd kan worden in een gestructureerde, educatieve bron, waardoor machines kunnen leren van het volledige spectrum van de menselijke ervaring zoals die beweegt en klinkt, en niet alleen zoals die stilstaat.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.