← Nieuwste papers
💻 computer science

Label-Efficient Transfer Learning for Human Action Recognition Using Pretrained VideoMAE

Deze studie toont aan dat een bevroren, vooraf getrainde VideoMAE-encoder gecombineerd met een lichtgewicht lineaire classifier zeer label-efficiënte menselijke actieherkenning mogelijk maakt, waarbij sterke prestaties worden behaald op de UCF101- en HMDB51-benchmarks met minimale annotaties, terwijl een stabiele optimalisatie en een constant gebruik van computationele middelen behouden blijven.

Oorspronkelijke auteurs: Nousheen Taj

Gepubliceerd 2026-09-15
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nousheen Taj

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van computer vision is het aanleren van menselijke bewegingen aan machines al lang een puzzel van immense complexiteit. Decennialang hebben onderzoekers geprobeerd systemen te bouwen die een video kunnen bekijken en kunnen identificeren wat een persoon doet, of het nu gaat om een tennisdienst, een handdruk of een val. Vroege pogingen vertrouwden op handmatig ontworpen regels, waarbij ingenieurs handmatig definieerden hoe beweging eruitzag, maar deze systemen faalden vaak wanneer de camerahoek veranderde of de achtergrond rommelig werd. Het veld veranderde toen deep learning arriveerde, waardoor computers deze patronen rechtstreeks uit ruwe videodata konden leren. Deze nieuwe aanpak kwam echter met een hoge prijs: het vereiste enorme hoeveelheden gelabelde video, waarbij mensen urenlang beelden minutieus bekeken en elke actie tagden. Dit proces is traag, duur en vaak onmogelijk voor gespecialiseerde taken waar experts schaars zijn. Om dit op te lossen, richtten wetenschappers zich op self-supervised learning, een methode waarbij een computer leert van enorme oceanen van ongelabelde video door te proberen ontbrekende delen van het beeld te voorspellen, waardoor hij zichzelf effectief de structuur van beweging aanleert zonder menselijke hulp. De vraag die overblijft is of deze zelfgeleerde systemen werkelijk klaar zijn voor de echte wereld, waar gelabelde data vaak beperkt is, of dat ze nog steeds een zware hand van menselijk toezicht nodig hebben om correct te werken.

Een onderzoeker aan het Siddaganga Institute of Technology in India zette zich af om deze vraag te beantwoorden door een specifiek type self-supervised model genaamd VideoMAE te testen. Stel je een student voor die elk boek in een bibliotheek heeft gelezen, maar nog nooit een toets heeft gemaakt; de onderzoeker wilde zien hoe goed deze student examenvragen kon beantwoorden als ze alleen een paar voorbeeldantwoorden zouden krijgen om te bestuderen. In hun studie gebruikten ze een pre-trained VideoMAE-model, dat al had geleerd om video te begrijpen door gemaskeerde secties van duizenden ongelabelde clips te reconstrueren. Ze bevroren de hersenen van dit model zodat het niets nieuws kon leren, en koppelden een eenvoudige, lichtgewicht classifier aan de bovenkant. Deze opstelling stelde hen in staat om het rauwe begrip van menselijke actie van het model te testen door het verschillende hoeveelheden gelabelde trainingsdata te voeren, variërend van een fractie tot de volledige dataset. Ze testten deze aanpak op twee bekende benchmarks voor menselijke actieherkenning: UCF101, dat een diverse set sporten en dagelijkse activiteiten bevat, en HMDB51, een moeilijkere collectie clips uit films en openbare databases die complexe camerabewegingen en gevarieerde achtergronden bevat.

De resultaten onthulden een duidelijk en praktisch pad voorwaarts voor het gebruik van deze geavanceerde modellen. Wanneer de onderzoeker het systeem slechts tien procent van de beschikbare gelabelde data gaf, slaagde het er nog steeds in om acties met opmerkelijke nauwkeurigheid te identificeren. Op de UCF101-dataset bereikte het model een herkenningspercentage van bijna achttentachtig procent met slechts dat kleine deel aan gelabelde voorbeelden. Naarmate ze de hoeveelheid gelabelde data verhoogden naar vijfentwintig procent en vervolgens vijftig procent, steeg de nauwkeurigheid gestaag en bereikte meer dan tweeënnegentig procent wanneer de volledige dataset werd gebruikt. De meest significante bevinding was echter niet alleen dat het model goed werkte met weinig data, maar dat de voordelen van het toevoegen van meer data snel begonnen te vervagen. Zodra het systeem toegang had tot de helft van de gelabelde trainingsvoorbeelden, leverde het toevoegen van de resterende helft slechts een zeer kleine verbetering in prestaties op. Dit suggereigt dat de self-supervised pre-training al het grootste deel van de visuele en temporele informatie had gevangen die nodig is om menselijke beweging te begrijpen, waardoor de eenvoudige classifier heel weinig werk hoefde te doen om zich aan de specifieke taak aan te passen.

Het verhaal was iets anders, maar even onthullend, toen de onderzoeker het moeilijkere HMDB51-dataset testte. Omdat deze video's rommeliger waren, met trillende camera's en complexe achtergronden, begon het model met een lagere nauwkeurigheid van ongeveer tweeënvijftig procent met slechts tien procent van de labels. Echter, naarmate ze meer gelabelde data toevoegden, verbeterde het systeem veel dramatischer dan het deed op de makkelijkere dataset, en bereikte uiteindelijk een nauwkeurigheid van meer dan drieënzesig procent met volledige supervisie. Dit gaf aan dat hoewel de self-supervised basis sterk was, hoe chaotischer en complexer de echte omgeving ook is, de waarde van een paar extra gelabelde voorbeelden groter wordt. Desalniettemin bereikte het systeem nog steeds een hoog prestatieniveau met slechts de helft van de data, wat bewees dat het zelfgeleerde model een robuuste representatie van actie had geleerd die een grote visuele variëteit kon verwerken zonder een volledige handmatige gids nodig te hebben.

Voorbij de uiteindelijke scores keken de onderzoekers nauwgezet naar hoe het systeem leerde en welke middelen het consumeerde. Ze vonden dat het trainingsproces stabiel en voorspelbaar was over alle niveaus van supervisie, waarbij het model soepel convergeerde zonder erratisch gedrag. Wat betreನಗೆ rekenkracht betreft, was de aanpak zeer efficiënt. Omdat het hoofddel van het model bevroren was en alleen de kleine bovenste laag werd getraind, bleef de hoeveelheid computergeheugen die vereist was bijna constant, ongeacht hoeveel gelabelde data er werd gebruikt. De tijd die nodig was om te trainen nam wel toe met meer data, simpelweg omdat de computer meer voorbeelden moest verwerken, maar de geheugenvoetafdruk groeide niet. Dit betekent dat de methode schaalbaar is en geen dure hardware-upgrades vereist om een grotere dataset te kunnen verwerken. De studie onderzocht ook welke acties het model fout deed, waarbij zij ontdekten dat fouten voornamelijk geconcentreerd waren in visueel gelijkaardige bewegingen, een natuurlijke beperking bij het onderscheiden van subtiele variaties in menselijke beweging.

Uiteindelijk demonstreert dit werk dat het tijdperk waarin het nodig is om voor elke nieuwe toepassing enorme, perfect gelabelde videodatasets te hebben, mogelijk ten einde loopt. De onderzoeker toonde aan dat een model dat getraind is op ongelabelde video een krachtige basis kan dienen voor het herkennen van menselijke acties, waarbij slechts een fractie van de handmatige etiketteringsinspanning nodig is om een hoge prestatie te behalen. De bevindingen suggereren dat voor veel praktische toepassingen, zoals het monitoren van de veiligheid in fabrieken of het analyseren van sporttechnieken, organisaties kunnen vertrouwen op deze pre-trained systemen om nauwkeurige resultaten te leveren zonder de prohibitieve kosten van het annoteren van elk enkel videokader. Hoewel de moeilijkste datasets nog steeds baat hebben bij aanvullende gelabelde voorbeelden, is de kerncapaciteit al aanwezig in het self-supervised model, wat een praktische en hulpbron-efficiënte oplossing biedt voor het brengen van intelligente video-interpretatie naar de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →