← Nieuwste papers
💻 computer science

CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition

Dit artikel introduceert CF-Net, een diep multimodaal netwerk dat gebruikmaakt van spreker-normalisatie, expliciete conflictfusie voor cross-modale incongruentie en zekerheid-gewogen training om de staat-van-de-kunst prestaties te behalen bij het detecteren van ambivalentie en aarzeling in ongecontroleerde video's.

Oorspronkelijke auteurs: Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh

Gepubliceerd 2026-07-16
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een kamer probeert te lezen, niet door te kijken naar wat mensen zeggen, maar door de kleine barstjes op te sporen waar hun woorden, hun stem en hun gezicht niet helemaal met elkaar overeenstemmen. Dit is de fascinerende wereld van multimodale affectherkenning, een tak van kunstmatige intelligentie die probeert menselijke emoties te begrijpen door te luisteren naar hoe we spreken, te kijken naar hoe we bewegen en te lezen wat we typen. Meestal, wanneer mensen gelukkig zijn, komen hun glimlach, hun lach en hun "yay!" perfect overeen. Maar er is een lastiger, menselijker gevoel dat ambivalentie en aarzeling wordt genoemd. Dit is dat ongemakkelijke moment waarop je "ja" wilt zeggen, maar je stem wankelt, of wanneer je zelfverzekerd kijkt terwijl je woorden onzeker klinken. Het is als een muzikaal trio waarbij de drummer jazz speelt, de gitarist rock speelt en de zanger een slaapliedje neuriet; het "gevoel" zit niet in een enkel instrument, maar in de rommelige, verwarrende botsing tussen hen. Het detecteren hiervan is extreem moeilijk voor computers omdat de meeste AI getraind is om duidelijke, blije glimlachen te herkennen, en niet deze subtiele, tegenstrijdige signalen.

Maak kennis met CF-Net, een nieuwe digitale detective gebouwd door onderzoekers Tung Hung Bui, Hong Hai Nguyen en Van Thong Huynh om dit specifieke puzzelstukje op te lossen. Zij namen deel aan de 3e editie van de Ambivalence/Hesitancy Video Recognition Challenge (onderdeel van de ABAW 11e competitie) met een systeem dat ontworpen is om te stoppen met gokken en te beginnen met luisteren naar de discussies tussen de verschillende "zintuigen" van een persoon.

Het Probleem: De "Identiteitsval" en het "Verwarringssignaal"

De onderzoekers stonden voor een lastige situatie. Ze hadden een dataset genaamd BAH, die videoclips bevat van mensen die worden geïnterviewd. Het doel was om te spotten wanneer een spreker ambivalent was. Echter, er waren drie grote hindernissen:

  1. Het Signaal is een Mismatch: In tegen tegenstelling tot een duidelijke "blije" gezichtsuitdrukking, wordt ambivalentie gedefinieerd door incongruentie. Als iemand iets positiefs zegt maar de stem wankel klinkt, moet de computer die onenigheid opmerken, en niet alleen de woorden of de stem alleen.
  2. Het "Vreemdeling"-probleem: De testvideo's bevatten mensen die de computer nog nooit eerder had gezien. Als de AI leerde om een specifiek gezicht of een specifieke stemkleur van een persoon te herkennen (zoals het onthouden van de lach van een vriend), zou het volledig falen wanneer het geconfronteerd werd met een vreemde. Het moest de identiteit van de spreker negeren en zich alleen richten op hoe zij spraken.
  3. De "Misschien"-labels: Soms konden zelfs menselijke experts het er niet over eens worden of een clip ambivalentie vertoonde of niet. De dataset bevatte een "zekerheidsscore" voor elke clip, die aangaf in ho welke mate de menselijke annotatoren het met elkaar eens waren. De AI moest weten wanneer hij een label moest vertrouwen en wanneer hij voorzichtig moest zijn.

De Oplossing: CF-Nets Drie-Stappen Magische Truc

Het team bouwde CF-Net, een systeem dat fungeert als een superintelligente bemiddelaar in een drievoudige discussie tussen Visie (wat we zien), Audio (wat we horen) en Tekst (wat er gezegd wordt).

Stap 1: Het "Geest"-filter (Speaker Normalisation)
Eerst kijkt het systeem naar de video en de audio. Maar hier is de truc: voordat de emotie wordt geanalyseerd, voert het een "speaker normalisation" uit. Stel je voor dat je de prestatie van een zanger beoordeelt, maar dat je eerst de unieke, permanente stemtextuur van die persoon aftrekt, zodat je alleen de veranderingen in hun toon voor dat specereke liedje hoort. CF-Net doet dit wiskundig. Het berekent het gemiddelde "gezicht" en de gemiddelde "stem" van elke spreker en trekt deze er vanaf. Dit verwijdert de "identity leakage"—het risico dat de AI simpelweg onthoudt dat "Persoon A nerveus kijkt"—en dwingt het systeem om zich alleen te concentreren op de momentane aarzeling of het conflict.

Stap 2: De "Conflict"-detector (ConflictFusion)
Vervolgens neemt het systeem de schoongemaakte signalen van de ogen, oren en tekst. In plaats van ze gewoon op één hoop te gooien (wat ervan uitgaat dat ze het met elkaar eens zijn), gebruikt CF-Net een speciale module genaamd ConflictFusion. Zie dit als een scheidsrechter die niet alleen naar de spelers luistert, maar specifiek meet hoe ver hun meningen uit elkaar liggen. Het berekent de "afstand" tussen de tekst en de stem, de tekst en het gezicht, en de stem en het gezicht. Als de tekst zegt "Ik voel me geweldig" maar de stem wankel klinkt, ziet het systeem een enorme kloof. Het zet die kloof om in een kenmerk (feature), en leert de AI expliciet dat onenigheid het signaal is waar het naar op zoek is.

Stap 3: De "Eerlijkheids"-check (Certainty Weighting)
Ten slotte is het systeem getraind om bescheiden te zijn. De onderzoekers gaven de AI een "certainty head"—een extra hersencel die probeert te raden hoe zeker de menselijke annotatoren waren over een clip. Als de mensen onzeker waren (lage zekerheid), krijgt de AI de instructie: "Wees niet te zelfverzekerd over je antwoord; dit is een lastige." Dit gebeurt met een speciale wiskundige truc genaamd certainty-weighted focal loss, die de AI vertelt om extra aandacht te besteden aan de duidelijke, voor de hand liggende voorbeelden en milder te zijn met de verwarrende gevallen.

De Resultaten: Een Lichte Aanraking, Een Zware Overwinning

Het team testte CF-Net op de BAH-dataset. Ze probeerden niet de enorme, vooraf getrainde breinen (backbones) die afbeeldingen en geluiden lezen opnieuw te trainen; ze hielden deze bevroren om tijd te besparen en overfitting te voorkomen. Ze trainden alleen de kleine "lijm"-onderdelen die hen verbinden.

De resultaten waren indrukwekkend. Op de validatieset (een oefentoets) behaalde CF-Net een Macro F1-score van 0,7155. Maar de echte magie gebeurde op de private testset, die volledig nieuwe sprekers bevatte die de AI nog nooit had gezien. Daar sprong de score naar 0,7364 (met een Average Precision van 0,7392).

Dit is significant omdat veel andere systemen beter presteerden op de oefentoets, maar slechter op de echte test (een teken dat ze simpelweg de gezichten uit de oefenperiode hadden onthouden). CF-Net deed het tegenovergestelde: het werd beter wanneer het geconfronteerd werd met vreemden. Dit bewijst dat de "Ghost Filter" (speaker normalisation) en de "Honesty Check" (certainty weighting) daadwerkelijk werkten, waardoor de AI kon generaliseren naar nieuwe mensen in plaats van te valsspelen door de oude mensen te onthouden.

In een veld waar andere teams urenlang bezig waren met het finetunen van enorme modellen en nog steeds worstelden met het "vreemdeling"-probleem, slaagde CF-Net erin om de beste eerdere testscores te verslaan met een lichtgewicht benadering die in minder dan 15 minuten trainde op een enkele consumenten-grafische kaart. Het toonde aan dat om menselijke aarzeling te begrijpen, je niet hoeft te weten wie de persoon is; je moet alleen goed luisteren naar waar de woorden, de stem en het gezicht het oneens zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →