← Nieuwste papers
💻 computer science

CALM-AH: An ABAW11-Calibrated Multimodal Ensemble with Reliability-Gated Multi-Expert Consensus for Video-Level Ambivalence and Hesitancy Recognition

Het artikel presenteert CALM-AH, een multimodale ensemble-systeem dat is verbeterd door een Reliability-Gated Multi-Expert Consensus (RG-MEC) mechanisme dat een Macro-F1-score van 0,7771 bereikt op de ABAW11-challenge door diverse feature-takken te combineren met een unanimiteitsgestuurde correctiestrategie om video-niveau ambivalentie en aarzeling te herkennen.

Oorspronkelijke auteurs: Wenzhuo Sun, Mingjian Liang, Richard Attfield, Zongyuan Ge, Xuelian Cheng, Pamela Carreno-Medrano

Gepubliceerd 2026-08-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wenzhuo Sun, Mingjian Liang, Richard Attfield, Zongyuan Ge, Xuelian Cheng, Pamela Carreno-Medrano

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je in een kamer zit en probeert te achterhalen of iemand echt onzeker is over een grote beslissing. Ze zeggen misschien: "Ik denk dat ik ga," maar hun stem wankelt, ze pauzeren lang en ze kijken steeds naar de vloer. Of ze zeggen misschien: "Ik ben zeker zeker," terwijl ze nerveus friemelen. Deze lastige mix van woorden, geluiden en lichaamstaal wordt ambivalentie (het hebben van gemengde gevoelens) of hesitatie (onzekerheid) genoemd. Het is een subtiele menselijke staat die de hele tijd voorkomt, van sollicitatiegesprekken tot therapiesessies, maar het is voor computers ontzettend moeilijk om te herkennen. In tegen afstelling tot een simpele glimlach of een frons, is ambivalentie als een geheime code die verborgen ligt in de gaten tussen woorden, het ritme van een stem en het kleine trekje van een spier. Als we machines konden leren om deze aanwijzingen te lezen, zouden we betere hulpmiddelen kunnen bouwen om mensen te helpen bij moeilijke keuzes te maken of elkaar beter te begrijpen. Dit is de uitdaging waar een groep onderzoekers aan de Monash University zich op heeft gericht om een oplossing voor te vinden.

Maak kennis met CALM-AH, een nieuw digitaal detectiveteam ontworpen om de zaak van menselijke onzekerheid te kraken. De onderzoekers realiseerden zich dat kijken naar slechts één aanwijzing—zoals alleen het transcript lezen of alleen het gezicht bekijken—is als het proberen op te lossen van een mysterie met slechts één wazige foto. Je hebt het hele plaatje nodig. Daarom bouwden ze een systeem dat werkt als een zeer georganiseerde jury. In plaats van één rechter, hebben ze 15 verschillende "juryleden", die elk naar een andere combinatie van aanwijzingen kijken: sommigen luisteren naar de stem, sommigen lezen de woorden, sommigen bekijken het gezicht, en anderen volgen zelfs de vreemde statistische patronen van hoe de persoon zich gedraagt.

Zo werkt het team: Eerst verzamelen ze al het bewijs. Ze gebruiken slimme AI-tools om gesproken woorden om te zetten in tekst, de ritmiek en pauzes in de stem te analyseren, en de video te scannen op gezichtsuitdrukkingen. Vervolgens mengen en matchen ze deze aanwijzingen op 15 verschillende manieren. Voor elke mix kiezen ze de beste "detective" (een type computeralgoritme) en leren deze precies wanneer hij "Schuldig!" (Ambivalent) of "Onschuldig!" (Niet Ambivalent) moet roepen. Deze 15 detectives stemmen vervolgens over het definitieve oordeel. Als de meeste van hen het eens zijn, is dat het vonnis. Dit deel van het systeem, genaamd CALM-AH, was al behoorlijk goed en scoorde een 0,7525 op een test die ontworde om te zien of het werkt op mensen die het nog nooit heeft ontmoet.

Maar de onderzoekers stopten daar niet. Ze wisten dat zelfs slimme detectives fouten maken. Soms raakt een detective in de war door een hard geluid of een lastige zin. Daarom voegden ze een speciale "Veiligheidsnet" toe, genaamd RG-MEC (Reliability-Gated Multi-Expert Consensus). Denk aan dit als een zeer strikte regel voor het wijzigen van het vonnis. Het systeem begint met een "Standaardrechter" die de eerste beslissing neemt. Om die rechter van gedachten te veranderen, heb je niet aan één andere expert die het er niet mee eens is genoeg; je hebt drie specifieke experts nodig die op hetzelfde moment exact hetzelfde nieuwe antwoord geven.

Deze drie experts zijn:

  1. CALM-AH (het team van 15 detectives waar we het net over hadden).
  2. AffectGPT (een AI die echt goed is in het begrijpen van emoties en gevoelens).
  3. Een GPT-gebaseerde Verifier (een AI die uitstekend is in het begrijpen van de betekenis en logica van wat er gezegd wordt).

Als de Standaardrechter zegt "Niet Ambivalent", maar CALM-AH, AffectGPT en de Verifier tegelijkertijd "Ambivalent!" roepen, dan verandert het systeem van gedachten. Als zelfs één van hen onzeker is of het er niet mee eens is, houdt het systeem vast aan de oorspronkelijke beslissing van de rechter. Dit voorkomt dat het systeem in de war raakt door een enkele luidruchtige expert. Het is als een club waar je alleen de regels kunt veranderen als drie specifieke leden samen een petitie ondertekenen; één persoon die klaagt is niet genoeg om de schakelaar om te zetten.

Het resultaat? Dit "Veiligheidsnet" maakte het systeem scherper. Door dit strikte, unanieme stemregel te gebruiken, sprong de uiteindelijke score naar 0,7771. Het artikel laat zien dat deze methode veel beter is in het opsporen van echte onzekerheid zonder in de val te lopen van willekeurige pauzes of accidentele geluiden. De onderzoekers ontdekten dat het simpelweg toevoegen van meer experts niet helpt; het gaat erom hoe je ze organiseert. Door de "Standaardrechter" een stabiel anker te geven en het "Veiligheidsnet" alleen te laten ingrijpen wanneer iedereen het eens is, wordt het systeem betrouwbaarder.

Het team testte dit op een dataset van echte interviewvideo's waarbij de mensen in de testvideo's volledig verschillend waren van de mensen waarop het systeem getraind was. Dit is cruciaal omdat het bewijst dat het systeem niet alleen gezichten uit het hoofd leert, maar daadwerkelijk leert om het gevoel van onzekerheid te herkennen. Het artikel sluit expliciet de mogelijkheid uit dat je gewoon de meningen van alle experts kunt middelen of dat een enkele sterke expert de rest kan overstemmen. In plaats daarvan vonden ze dat een strikte "unanimiteitspoort" het beste werkt. Hoewel het systeem een grote stap voorwaarts is, benadrukken de auteurs dat dit een specifieke oplossing is voor deze specifieke uitdaging, en geen wondermiddel voor elke menselijke emotie. Maar voor het bepalen van wanneer iemand echt tussen twee stoelen in valt, is CALM-AH met zijn RG-MEC veiligheidsnet een zeer slim nieuw instrument in de gereedschapskist.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →