The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge
El Taller y Desafío de Conversaciones Diádicas (DaiKon) de la ACII 2026 presenta un conjunto de datos y una evaluación integral de 945 interacciones diádicas naturalistas y multilingües para avanzar en la modelización del afecto interpersonal y la dinámica social mediante tres subdesafíos centrados en la influencia direccional, el turno de palabra y la predicción de la trayectoria de la complicidad.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina a dos personas sentadas frente a frente, manteniendo una conversación. No se limitan a turnarse para hablar; están bailando. La broma de una persona hace reír a la otra; la vacilación de una hace que la otra haga una pausa; construyen un sentido de conexión (o "rapport") a medida que pasan los minutos.
Durante mucho tiempo, las computadoras han sido buenas analizando a una sola persona en una habitación, como un cantante solista que alcanza una nota alta. Pero han luchado por entender el dueto: cómo el estado de ánimo de la Persona A cambia el de la Persona B, cómo coordinan su timing y cómo evoluciona su relación.
Este artículo presenta un nuevo "gimnasio" para científicos de la computación llamado el Desafío ACII-DaiKon. Es una competencia diseñada para enseñar a las computadoras a entender estos bailes entre dos personas.
Aquí tienes un desglose de lo que están haciendo, utilizando analogías simples:
1. El Conjunto de Datos: Una Biblioteca Gigante de Conversaciones Reales
Los organizadores construyeron una biblioteca masiva llamada el conjunto de datos Hume-DaiKon.
- La Colección: Contiene 945 conversaciones (más de 743 horas de video y audio) entre pares de personas.
- La Variedad: No son obras de teatro guionizadas. Son charlas reales y naturales entre extraños que fueron emparejados en línea. Hablan cinco idiomas diferentes (inglés, alemán, español, neerlandés y polaco).
- La Configuración: Imagina una videollamada donde se le pide a dos personas que charlen sobre sus fines de semana o vacaciones. El sistema graba a ambas por separado (para que la computadora pueda ver el rostro de la Persona A mientras escucha la voz de la Persona B) y captura todo, desde el tono de voz hasta las expresiones faciales.
2. Los Tres Desafíos (Los "Eventos")
La competencia pide a los participantes que construyan modelos de IA que puedan resolver tres acertijos específicos basados en estas conversaciones:
Acertijo A: El "Eco Emocional" (Influencia)
- El Objetivo: Predecir cómo se siente la Persona B ahora mismo, basándose en lo que la Persona A acaba de decir o hacer.
- La Metáfora: Imagina que la Persona A es un veleta. Si la Persona A parece enojada, ¿cambia el estado de ánimo de la Persona B para igualarla? La IA tiene que adivinar si la Persona B siente "alegría", "ansiedad" o "aburrimiento" basándose en el comportamiento de la otra persona.
- El Truco: No se trata solo de adivinar lo que siente la Persona B en el vacío; se trata de adivinar cómo la Persona A influyó en ese sentimiento.
Acertijo B: El "Pase del Suelo" (Turnos de Habla)
- El Objetivo: Predecir dos cosas: Quién hablará a continuación y cuándo comenzará a hablar.
- La Metáfora: Piensa en un juego de la patata caliente. La IA tiene que observar a los jugadores y adivinar: "¿Está el hablante actual a punto de soltar la patata (dejar de hablar) o va a agarrarla con fuerza? Y si la sueltan, ¿cuántos segundos tardará la otra persona en atraparla?"
- Por qué es difícil: A veces las personas hablan al mismo tiempo (superposición), a veces interrumpen y a veces hay un largo silencio. La IA tiene que detectar las señales sutiles (como una respiración profunda o una mirada) que indican un cambio.
Acertijo C: El "Termómetro de la Relación" (Rapport)
- El Objetivo: Rastrear cómo cambia la "conexión" entre las dos personas desde el inicio del chat hasta el final.
- La Metáfora: Imagina un termómetro que mide qué tan bien se llevan dos personas. ¿Sube la temperatura (se están vinculando) o baja (están incómodos o discutiendo) a medida que avanza la conversación?
- El Desafío: La IA tiene que observar toda la conversación, no solo una frase, para ver si la relación se está calentando o enfriando.
3. Las Herramientas: Qué Están Usando las Computadoras
Para resolver estos acertijos, los investigadores proporcionaron a los participantes un conjunto de "ojos" y "oídos":
- Los Oídos (Audio): La computadora escucha la voz utilizando una herramienta llamada Whisper. Convierte el habla en una lista de números que capturan el tono, la velocidad y la emoción de la voz.
- Los Ojos (Video): La computadora observa los rostros utilizando una herramienta llamada FaceNet. Convierte las expresiones faciales en números que capturan sonrisas, ceñimientos de cejas y movimientos de cabeza.
- El Resultado: La computadora recibe un flujo de números para ambas personas, lado a lado, tratando de encontrar patrones.
4. Lo Que Han Encontrado Hasta Ahora (Los Resultados de Línea Base)
Los organizadores ejecutaron algunos modelos de IA "iniciales" simples para ver qué tan difíciles son los acertijos. Esto es lo que descubrieron:
- La Voz es el Rey: Para los tres acertijos, la computadora funcionó mucho mejor cuando solo escuchaba las voces que cuando solo observaba los rostros.
- Analogía: Es como intentar entender una canción mirando los labios del cantante versus escuchar la música. La música (voz) contó la historia mucho mejor que lo visual (rostro) en estas pruebas específicas.
- Combinarlos No Ayudó (Aún): Cuando intentaron combinar los ojos y los oídos, los modelos simples no mejoraron mucho. De hecho, para el acertijo de "Rapport", agregar el video hizo que la puntuación fuera ligeramente peor.
- ¿Por qué? Es como intentar resolver un acertijo mientras llevas gafas empañadas. Los modelos simples se confundieron con los datos visuales adicionales. El artículo sugiere que necesitamos formas más inteligentes de combinar los dos sentidos en el futuro.
- La Puntuación: Los mejores modelos simples obtuvieron una precisión de aproximadamente 40% a 70% dependiendo de la tarea. Esto significa que las computadoras están empezando a captar la "esencia" de la conversación, pero aún están muy lejos de entender el baile profundo y complejo de la interacción humana.
Resumen
Este artículo es una invitación a los científicos de la computación más inteligentes del mundo para dejar de mirar a las personas de forma aislada y comenzar a verlas como pares.
Han proporcionado las materias primas (la biblioteca de video), las reglas (los tres acertijos) y un punto de partida (los modelos simples). El objetivo es construir una IA que no solo escuche palabras, sino que entienda el ritmo, la influencia y la conexión entre dos personas que hablan entre sí.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.