← Nieuwste papers
💻 computer science

SSRNet: Robust Facial Expression Representation Learning Using Structure Prior and Self-Supervised Regularization

Het artikel stelt SSRNet voor, een robuust framework voor gezichtsuitdrukkingsherkenning dat een met een structuur-prior geleid feature-verbeteringsmodule combineert met zelfgesuperviseerd contrastief leren om effectief real-world uitdagingen zoals ruis en occlusie aan te pakken, waarbij state-of-the-art prestaties worden behaald op de FER2013- en RAF-DB-datasets.

Oorspronkelijke auteurs: Jing Li, Wenjuan Gu, Junxiang Peng, Xingzheng Xiao, Haijin Xu

Gepubliceerd 2026-09-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jing Li, Wenjuan Gu, Junxiang Peng, Xingzheng Xiao, Haijin Xu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de stille hoekjes van computer vision heeft een specifieke uitdaging machines lang op afstand gehouden van het werkelijk begrijpen van menselijke emoties: de rommeligheid van het echte leven. Hoewel computers gemakkelijk een gezicht kunnen herkennen op een perfect verlichte studiophoto, struikelen ze vaak wanneer datzelfde gezicht zijwaarts gedraaid is, gedeeltelijk verborgen door een hand, of verlicht wordt door hard, ongelijkmatig licht. Deze moeilijkheid wordt versterkt door de data die worden gebruikt om deze systemen te onderwijzen. De afbeeldingen die kunstmatige intelligentie trainen, worden vaak gelabeld door mensen, en mensen maken fouten. Ze kunnen het oneens zijn over de vraag of een grimas voortkomt uit boosheid of walging, of ze kunnen een foto geheel verkeerd labelen. Wanneer een computer leert van deze imperfecte instructies, heeft hij de neiging om de fouten te memoriseren in plaats van de waarheid, wat leidt tot modellen die broos en onbetrouwbaar zijn buiten het laboratorium. Het doel van gezichtsuitdrukkingherkenning is niet alleen om een glimlach of een frons te identificeren, maar om een systeem te bouwen dat de subtiele, vluchtige verschuivingen in spierbewegingen kan zien die onze gevoelens definiëren, zelfs wanneer de afbeelding ruis bevat en de labels fout zijn.

Om dit probleem aan te pakken, hebben onderzoeker Jing Li en haar team aan de Kunming University of Science and Technology een nieuwe aanpak ontwikkeld genaamd SSRNet. In plaats van te proberen een computer alles vanaf nul te laten leren, bouwden zij een systeem dat twee verschillende strategieën combineert: één die de machine leert om naar de juiste delen van het gezicht te kijken, en een andere die de machine leert om te vertrouwen op de visuele patronen die het ziet, zelfs wanneer de labels verwarrend zijn. Het team begon met een standaard, betrouwbare computer vision-backbone en voegde een laag toe van begeleiding gebaseerd op de menselijke anatomie. Ze wisten dat bepaalde gebieden van het gezicht — de ogen, wenkbrauwen, neus en mond — de plekken zijn waar emoties het duidelijkst in geschreven staan. Daarom creëerden ze een module die deze regio's expliciet benadrukt, waardoor het netwerk wordt verteld om extra aandacht te besteden aan de specifieke huidpartijen waar een frons ontstaat of een glimlach zich verspreidt. Dit is geen complexe, verschuivende kaart; het is een vaste gids die ervoor zorgt dat het systeem het meest expressieve kenmerken nooit uit het oog verliest, ongeacht hoe het gezicht gepositioneerd is of hoeveel de achtergrond afleidt.

Het focussen op de juiste plekken is echter slechts de helft van de strijd. De onderzoekers moesten ook ervoor zorgen dat het systeem de verwarring kon opvangen die wordt veroorzaakt door onjuiste labels. Hiervoor introduceerden ze een zelfgesuperviseerde regularisatie-tak. Stel je een student voor die studeert voor een toets, maar een tekstboek vol typefouten heeft. Als de student alleen de antwoorden achter in het boek leest, zal hij de fouten leren. Maar als de student ook oefent door verschillende afbeeldingen van hetzelfde concept met elkaar te vergelijken om te zien wat hetzelfde blijft, kan hij de onderliggende waarheid leren, ongeacht de typefouten. Op een vergelijkbare manier kijkt dit deel van het systeem naar verschillende versies van hetzelfde gezicht en leert het te herkennen dat dit dezelfde persoon is die dezelfde emotie uit, zelfs als het label dat aan de afbeelding is gekoppeld onjuist is. Door de computer te dwingen om consistentie binnen de afbeeldingen zelf te vinden, wordt het systeem minder afhankelijk van de potentieel gebrekkige menselijke labels en meer gericht op het feitelijke visuele bewijs.

De resultaten van deze tweeledige aanpak werden getest op twee grote, real-world datasets die bekend staan om hun complexiteit en ruis. Op de FER2013-dataset, die duizenden afbeeldingen bevat genomen in ongecontroleerde omgevingen, behaalde het nieuwe systeem een nauwkeurigheid van 72,51 procent. Op de RAF-DB-dataset, een andere collectie internetbronnen met diverse belichting en hoeken, bereikte het 85,09 procent. Deze cijfers waren hoger dan die van verschillende andere leidende methoden, wat suggereert dat de combinatie van anatomische begeleiding en zelfcorrectie goed werkt. De onderzoekers testten ook hoe het systeem standhield wanneer ze opzettelijk meer fouten aan de trainingsdata toevoegden. Zelfs toen 40 procent van de labels fout was, behield het nieuwe systeem een duidelijk voordeel ten opzichte van oudere modellen, wat bewees dat het had geleerd de ruis te negeren en zich op het signaal te concentreren.

Wanneer het team visualiseerde hoe de computer de wereld zag, was het verschil treffend. De oudere modellen hadden de neiging om verschillende emoties bij elkaar te groeperen in een rommelige wolk, waarbij ze moeite hadden om het verschil te zien tussen angst en verbazing of verdriet en neutraliteit. Het nieuwe systeem organiseerde deze emoties echter in duidelijke, compacte clusters. Het leerde de subtiele variaties die een specifieke emotie definiëren te scheiden, waardoor er duidelijke grenzen tussen ontstonden. Dit suggereert dat door de computer te leren naar de juiste plaatsen te kijken en zijn eigen observaties te verifiëren, het systeem een stabieler en nauwkeuriger begrip van menselijke emotie kan opbouwen. Het werk beweert niet elk probleem te hebben opgelost; het systeem vertrouwt nog steeds op vooraf gedefinieerde kaarten van het gezicht, die moeite kunnen hebben als een persoon ernstig wordt gehinderd of onder een extreme hoek gedraaid is. Toch biedt het een veelbelovend pad vooruit voor het bouwen van machines die ons gezicht kunnen lezen met dezelfde veerkracht en nuance waarmee wij elkaar lezen, zelfs in het imperfecte licht van de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →