← Últimos artigos
💻 computer science

CALM-AH: An ABAW11-Calibrated Multimodal Ensemble with Reliability-Gated Multi-Expert Consensus for Video-Level Ambivalence and Hesitancy Recognition

O artigo apresenta o CALM-AH, um sistema de ensemble multimodal aprimorado por um mecanismo de Consenso de Múltiplos Especialistas com Portão de Confiabilidade (RG-MEC) que alcança uma pontuação Macro-F1 de 0,7771 no desafio ABAW11 ao combinar ramos de características diversos com uma estratégia de correção com portão de unanimidade para reconhecer ambivalência e hesitação em nível de vídeo.

Autores originais: Wenzhuo Sun, Mingjian Liang, Richard Attfield, Zongyuan Ge, Xuelian Cheng, Pamela Carreno-Medrano

Publicado 2026-08-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Wenzhuo Sun, Mingjian Liang, Richard Attfield, Zongyuan Ge, Xuelian Cheng, Pamela Carreno-Medrano

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está sentado em uma sala, tentando descobrir se alguém está verdadeiramente incerto sobre uma grande decisão. A pessoa pode dizer: "Acho que vou", mas sua voz vacila, ela faz uma longa pausa e continua olhando para o chão. Ou talvez diga: "Tenho certeza absoluta", enquanto se agita nervosamente. Essa mistura complexa de palavras, sons e linguagem corporal é chamada de ambivalência (ter sentimentos mistos) ou hesitação (estar incerto). É um estado humano sutil que acontece o tempo todo, de entrevistas de emprego a sessões de terapia, mas é incrivelmente difícil para os computadores detectarem. Diferente de um simples sorriso ou uma careta, a ambivalência é como um código secreto escondido nas lacunas entre as palavras, no ritmo de uma voz e no minúsculo tremor de um músculo. Se pudéssemos ensinar as máquinas a ler essas pistas, poderíamos construir ferramentas melhores para ajudar as pessoas a tomarem decisões difíceis ou a se entenderem melhor. Este é o desafio que um grupo de pesquisadores da Universidade Monash se propôs a resolver.

Conheça o CALM-AH, uma nova equipe de detetives digitais projetada para decifrar o caso da incerteza humana. Os pesquisadores perceberam que olhar para apenas uma pista — como ler apenas a transcrição ou apenas observar o rosto — é como tentar resolver um mistério com uma única foto borrada. Você precisa da imagem completa. Então, eles construíram um sistema que atua como um júri super organizado. Em vez de um único juiz, eles têm 15 "jurados" diferentes, cada um observando uma combinação diferente de pistas: alguns ouvem a voz, outros leem as palavras, outros observam o rosto e alguns até rastreiam os padrões estatísticos estranhos de como a pessoa está se comportando.

Veja como a equipe trabalha: Primeiro, eles reúnem todas as evidências. Eles usam ferramentas inteligentes de IA para transformar palavras faladas em texto, analisar o ritmo e as pausas na voz e escanear o vídeo em busca de expressões faciais. Em seguida, eles misturam e combinam essas pistas de 15 maneiras diferentes. Para cada mistura, eles escolhem o melhor "detetive" (um tipo de algoritmo de computador) e o ensinam exatamente quando gritar "Culpado!" (Ambivalente) ou "Não Culpado!" (Não Ambivalente). Esses 15 detetives então votam na resposta final. Se a maioria deles concordar, esse é o veredito. Esta parte do sistema, chamada CALM-AH, já era muito boa, pontuando 0,7525 em um teste projetado para ver se funciona com pessoas que ela nunca conheceu antes.

Mas os pesquisadores não pararam por aí. Eles sabiam que mesmo detetives inteligentes cometem erros. Às vezes, um detetive pode ficar confuso por um ruído alto ou uma frase complicada. Por isso, eles adicionaram uma "Rede de Segurança" especial chamada RG-MEC (Reliability-Gated Multi-Expert Consensus - Consenso de Múltiplos Especialistas com Portão de Confiabilidade). Pense nisso como uma regra muito rigorosa para mudar o veredito. O sistema começa com um "Juiz Padrão" que faz a primeira chamada. Para mudar a opinião desse juiz, você não precisa apenas de um outro especialista que discorde; você precisa que três especialistas específicos concordem com a mesma nova resposta ao mesmo tempo.

Esses três especialistas são:

  1. CALM-AH (a equipe de 15 detetives que acabamos de conhecer).
  2. AffectGPT (uma IA que é muito boa em entender emoções e sentimentos).
  3. Um Verificador baseado em GPT (uma IA que é ótima em entender o significado e a lógica do que está sendo dito).

Se o Juiz Padrão disser "Não Ambivalente", mas o CALM-AH, o AffectGPT e o Verificador gritarem "Ambivalente!" juntos, então o sistema muda de ideia. Se apenas um deles estiver incerto ou discordar, o sistema mantém a decisão do juiz original. Isso evita que o sistema se confunda com um especialista barulhento. É como um clube onde você só pode mudar as regras se três membros específicos assinarem a petição juntos; uma pessoa reclamando não é suficiente para virar a chave.

O resultado? Essa "Rede de Segurança" tornou o sistema mais afiado. Ao usar essa regra rigorosa de unanimidade, a pontuação final saltou para 0,7771. O artigo mostra que este método é muito melhor em detectar a incerteza real sem ser enganado por pausas aleatórias ou ruídos acidentais. Os pesquisadores descobriram que simplesmente adicionar mais especialistas não ajuda; trata-se de como você os organiza. Ao dar ao "Juiz Padrão" uma âncora estável e permitir que a "Reda de Segurança" substitua a decisão apenas quando todos concordarem, o sistema torna-se mais confiável.

A equipe testou isso em um conjunto de dados de vídeos de entrevistas reais, onde as pessoas nos vídeos de teste eram completamente diferentes das pessoas para as quais o sistema foi treinado. Isso é crucial porque prova que o sistema não está apenas memorizando rostos; ele está realmente aprendendo a detectar o sentimento da incerteza. O artigo descarta explicitamente a ideia de que você possa apenas tirar a média das opiniões dos especialistas ou deixar um único especialista forte sobrepor os demais. Em vez disso, descobriram que um "portão de unanimidade" rigoroso funciona melhor. Embora o sistema seja um grande passo à frente, os autores são cuidadosos ao dizer que esta é uma solução específica para este desafio particular, não uma solução mágica para toda e qualquer emoção humana. Mas para descobrir quando alguém está verdadeiramente em cima do muro, o CALM-AH com sua rede de segurança RG-MEC é uma ferramenta muito inteligente na caixa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →