The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge
O Workshop e Desafio de Conversas Diádicas (DaiKon) da ACII 2026 apresenta uma avaliação abrangente e um conjunto de dados com 945 interações diádicas naturalistas e multilíngues para avançar a modelagem do afeto interpessoal e das dinâmicas sociais por meio de três sub-desafios focados na influência direcional, na troca de turnos e na previsão da trajetória de rapport.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine duas pessoas sentadas uma de frente para a outra, tendo uma conversa. Elas não estão apenas se revezando para falar; estão dançando. A piada de uma pessoa faz a outra rir; a hesitação de uma faz a outra pausar; elas constroem um senso de conexão (ou "rapport") conforme os minutos passam.
Por muito tempo, os computadores têm sido bons em analisar uma pessoa em uma sala — como um cantor solo atingindo uma nota alta. Mas eles têm lutado para entender o dueto: como o humor da Pessoa A altera o da Pessoa B, como eles coordenam seu tempo e como seu relacionamento evolui.
Este artigo apresenta uma nova "academia" para cientistas da computação chamada Desafio ACII-DaiKon. É uma competição projetada para ensinar computadores a entender essas danças de duas pessoas.
Aqui está uma explicação do que eles estão fazendo, usando analogias simples:
1. O Conjunto de Dados: Uma Gigantesca Biblioteca de Conversas Reais
Os organizadores construíram uma biblioteca massiva chamada conjunto de dados Hume-DaiKon.
- A Coleção: Contém 945 conversas (mais de 743 horas de vídeo e áudio) entre pares de pessoas.
- A Variedade: Não são peças encenadas. São conversas reais e naturais entre estranhos que foram emparelhados online. Eles falam cinco idiomas diferentes (inglês, alemão, espanhol, holandês e polonês).
- A Configuração: Imagine uma chamada de vídeo onde duas pessoas são convidadas a conversar sobre seus fins de semana ou férias. O sistema grava ambas separadamente (para que o computador possa ver o rosto da Pessoa A enquanto ouve a voz da Pessoa B) e captura tudo, desde o tom de voz até as expressões faciais.
2. Os Três Desafios (Os "Eventos")
A competição pede aos participantes que construam modelos de IA capazes de resolver três quebra-cabeças específicos baseados nessas conversas:
Quebra-Cabeça A: O "Eco Emocional" (Influência)
- O Objetivo: Prever como a Pessoa B está se sentindo agora, com base no que a Pessoa A acabou de dizer ou fazer.
- A Metáfora: Imagine que a Pessoa A é um cata-vento. Se a Pessoa A parece irritada, o humor da Pessoa B muda para corresponder? A IA precisa adivinhar se a Pessoa B está sentindo "alegria", "ansiedade" ou "tédio" com base no comportamento da outra pessoa.
- O Pulo do Gato: Não é apenas adivinhar o que a Pessoa B sente no vácuo; é adivinhar como a Pessoa A influenciou esse sentimento.
Quebra-Cabeça B: A "Passagem do Palco" (Revezamento de Turnos)
- O Objetivo: Prever duas coisas: Quem falará a seguir e quando eles começarão a falar.
- A Metáfora: Pense em um jogo de batata quente. A IA precisa observar os jogadores e adivinhar: "O falante atual está prestes a soltar a batata (parar de falar) ou vai segurá-la com firmeza? E se soltarem, quantos segundos levará para a outra pessoa pegá-la?"
- Por que é difícil: Às vezes as pessoas falam ao mesmo tempo (sobreposição), às vezes interrompem e às vezes há um longo silêncio. A IA precisa detectar os sinais sutis (como uma respiração profunda ou um olhar) que indicam uma mudança.
Quebra-Cabeça C: O "Termômetro do Relacionamento" (Rapport)
- O Objetivo: Rastrear como a "conexão" entre as duas pessoas muda do início ao fim da conversa.
- A Metáfora: Imagine um termômetro que mede o quão bem duas pessoas estão se dando. A temperatura sobe (eles estão se ligando) ou desce (estão embaraçados ou discutindo) à medida que a conversa progride?
- O Desafio: A IA precisa olhar para a conversa inteira, não apenas para uma frase, para ver se o relacionamento está esquentando ou esfriando.
3. As Ferramentas: O Que os Computadores Estão Usando
Para resolver esses quebra-cabeças, os pesquisadores forneceram aos participantes um conjunto de "olhos" e "ouvidos":
- Os Ouvidos (Áudio): O computador ouve a voz usando uma ferramenta chamada Whisper. Ele transforma a fala em uma lista de números que capturam o tom, a velocidade e a emoção da voz.
- Os Olhos (Vídeo): O computador observa os rostos usando uma ferramenta chamada FaceNet. Ele transforma as expressões faciais em números que capturam sorrisos, carrancas e movimentos da cabeça.
- O Resultado: O computador recebe um fluxo de números para ambas as pessoas, lado a lado, tentando encontrar padrões.
4. O Que Eles Encontraram Até Agora (Os Resultados de Referência)
Os organizadores executaram alguns modelos de IA "iniciais" simples para ver o quão difíceis são os quebra-cabeças. Aqui está o que descobriram:
- A Voz é o Rei: Para os três quebra-cabeças, o computador teve um desempenho muito melhor quando apenas ouviu as vozes do que quando apenas observou os rostos.
- Analogia: É como tentar entender uma música olhando para os lábios do cantor versus ouvindo a música. A música (voz) contou a história muito melhor do que o visual (rosto) nestes testes específicos.
- Combiná-los Não Ajudou (Ainda): Quando tentaram combinar os olhos e os ouvidos, os modelos simples não melhoraram muito. Na verdade, para o quebra-cabeça de "Rapport", adicionar o vídeo tornou a pontuação ligeiramente pior.
- Por quê? É como tentar resolver um quebra-cabeça usando óculos embaçados. Os modelos simples ficaram confusos com os dados visuais extras. O artigo sugere que precisamos de maneiras mais inteligentes de combinar os dois sentidos no futuro.
- A Pontuação: Os melhores modelos simples alcançaram cerca de 40% a 70% de precisão, dependendo da tarefa. Isso significa que os computadores estão começando a captar a "essência" da conversa, mas ainda estão longe de entender a dança profunda e complexa da interação humana.
Resumo
Este artigo é um convite aos cientistas da computação mais inteligentes do mundo para parar de olhar para as pessoas isoladamente e começar a vê-las como pares.
Eles forneceram os materiais brutos (a biblioteca de vídeo), as regras (os três quebra-cabeças) e um ponto de partida (os modelos simples). O objetivo é construir uma IA que não apenas ouça palavras, mas entenda o ritmo, a influência e a conexão entre duas pessoas conversando entre si.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.