← Nieuwste papers
🤖 machine learning

BRIDLE: Generalized Self-supervised Learning with Quantization

BRIDLE is een gegeneraliseerd zelfgesuperviseerd leerframework dat de kwaliteit van representaties over audio-, beeld- en videomodaliteiten heen verbetert door hiërarchische residuele kwantisatie te integreren in een bidirectioneel trainingsproces, waardoor de beperkingen van enkelvoudige codeboek-vectorkwantisatie worden overwonnen en state-of-the-art prestaties op diverse downstream-taken worden bereikt.

Oorspronkelijke auteurs: Hoang M. Nguyen, Satya N. Shukla, Qiang Zhang, Hanchao Yu, Sreya D. Roy, Dipesh Tamboli, Taipeng Tian, Lingjiong Zhu, Yuchen Liu

Gepubliceerd 2026-08-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hoang M. Nguyen, Satya N. Shukla, Qiang Zhang, Hanchao Yu, Sreya D. Roy, Dipesh Tamboli, Taipeng Tian, Lingjiong Zhu, Yuchen Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de moderne wereld van kunstmatige intelligentie worden machines opmerkelijk goed in het herkennen van patronen, maar ze hebben vaak enorme hoeveelheden door mensen gelabelde voorbeelden nodig om te leren. Stel je voor dat je een kind probeert te leren dieren te herkennen door het duizenden afbeeldingen te laten zien, die elk zorgvuldig met de naam van het dier zijn getagd door een geduldige leraar. Hoewel dit werkt, is het traag, duur en beperkt wat de machine kan leren omdat het vastzit in afwachting van menselijke hulp. Een krachtigere aanpak, bekend als zelfgesuperviseerd leren, stelt machines in staat om zichzelf te onderwijzen door de ruwe gegevens te bestuderen die ze krijgen, waarbij ze zoeken naar verborgen structuren en connecties zonder dat iemand de antwoorden hoeft op te schrijven. Deze methode heeft al de manier waarop computers taal begrijpen gerevolutioneerd, waardoor ze de diepe betekenis van zinnen kunnen vatten door miljarden boeken te lezen en de ontbrekende woorden te raden. Nu proberen onderzoekers deze vorm van zelfonderwijzend vermogen naar de wereld van geluid, beelden en video te brengen, in de hoop systemen te creëren die de visuele en auditieve wereld begrijpen zoals ze woorden begrijpen.

De uitdaging bij het toepassen van deze zelfonderwijzende methoden op geluid en video is dat deze signalen continu en complex zijn, in tegenstelling tot de discrete woorden in een zin. Om ze gemakkelijker te maken voor een computer om te verwerken, breken onderzoekers ze vaak af in kleine, afzonderlijke stukjes, vergelijkbaar met het veranderen van een gladde waterstroom in een reeks individuele druppels. Een populaire methode hiervoor maakt gebruik van een "tokenizer", een component die fungeert als een vertaler, die het ruwe signaal omzet in een reeks van deze discrete tokens. Voor een tijdje gebruikten de meest succesvolle systemen een eenvoudige vertaler die één enkele token uit een vaste lijst met opties koos om een deel van het signaal te vertegenwoordigen. Echter, deze aanpak heeft een beperking: het dwingt de computer om slechts één optie te kiezen uit een platte lijst, wat de subtiele, gelaagde details kan missen die een complex geluid of een bewegend beeld vormen. Het is alsof je een complex schilderij probeert te beschrijven door slechts één kleur uit een palet te kiezen, in plaats van verschillende tinten te mengen om de diepte en textuur vast te leggen.

Een team van onderzoekers van Florida State University en Meta Platforms Inc. heeft een nieuw systeem ontwikkeld genaamd BRIDLE om dit probleem op te lossen. Hun werk richt zich op het verbeteren van de vertaler, of tokenizer, die wordt gebruikt in deze zelfonderwijzende systemen. In plaats van te vertrouwen op een enkele, platte lijst met tokens, hebben ze een hiërarchisch systeem geïntroduceerd dat in stadia werkt. Stel je voor dat je een locatie probeert te beschrijven, niet door een enkel adres uit een telefoonboek te kiezen, maar door eerst het land te identificeren, dan de staat, dan de stad en tot slot de straat. Elke stap voegt een laag van detail toe aan de beschrijving. In het BRIDLE-systeem breekt de computer het geluid of beeld af in een reeks residuen, of resterende details, en gebruikt een sequentie van codeboeken om elke laag te beschrijven. De eerste fase legt de brede, algemene kenmerken vast, terwijl de daaropvolgende fasen de fijnere, meer specifieke details invullen. Door deze lagen bij elkaar op te tellen, kan het systeem een veel rijkere en preciezere representatie van de gegevens creëren dan een methode met één stap ooit zou kunnen.

De onderzoekers testten deze nieuwe aanpak op drie verschillende soorten gegevens: audio, afbeeldingen en video. Ze trainden hun model op enorme datasets, waaronder miljoenen geluidfragmenten van YouTube, meer dan een miljoen afbeeldingen uit de standaard ImageNet-collectie, en honderdduizenden videoclips die menselijke handelingen laten zien. In elk geval vergeleken ze hun nieuwe hiërarchische methode met de oudere methode met de enkele lijst, waarbij ze ervoor zorgden dat het totale aantal mogelijke tokens gelijk bleef, zodat het enige verschil de manier waarop die tokens georganiseerd waren, was. De resultaten waren duidelijk en consistent. Het nieuwe systeem, dat deze meerfasige, gelaagde aanpak gebruikt, presteerde consequent beter dan de oudere methode. De verbetering was bijzonder merkbaar toen de onderzoekers testten hoe goed de computer nieuwe dingen kon herkennen die hij nog nooit eerder had gezien, een taak die bekend staat als linear probing. Dit suggereert dat het nieuwe systeem een flexibeler en robuuster begrip van de wereld heeft geleerd, waarbij representaties zijn gecreëerd die gemakkelijker voor andere taken te gebruiken zijn.

Buiten de prestatiecijfers onderzochten de onderzoekers ook hoe het systeem effectiever kan leren. Ze ontdekten dat de manier waarop het systeem zijn leerproces start, een aanzienlijk verschil maakt. Door het systeem te initialiseren met een specifieke wiskundige techniek die de startpunten gelijkmatig verspreidt, in plaats van ze willekeurig te laten zijn, leerde het systeem sneller en betrouwbaarder. Ze ontwikkelden ook een methode om ervoor te zorgen dat elk deel van het systeem wordt gebruikt, om te voorkomen dat de computer grote delen van zijn eigen vocabulaire negeert. Deze technische verfijningen, gecombineerd met de nieuwe gelaagde structuur, stelden het systeem in staat om state-of-the-art resultaten te behalen in audio-classificatie, waarbij het bestaande beste modellen op standaard benchmarks evenaarde of versloeg. Het werk demonstreert dat de manier waarop een machine informatie afbreekt en representeert even belangrijk is als het leeralgoritme zelf. Door over te stappen van een plat systeem met één keuze naar een diep, gelaagd systeem, hebben de onderzoekers aangetoond dat machines kunnen leren om de wereld met meer nuance en helderheid te zien en te horen, wat de weg vrijmaakt voor meer capabele en veelzijdige kunstmatige intelligentie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →