← Nieuwste papers
🤖 AI

The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge

De ACII Dyadic Conversations (DaiKon) Workshop & Challenge 2026 introduceert een uitgebreide benchmark en dataset van 945 naturalistische, meertalige dyadische interacties om de modellering van interpersoonlijke affectie en sociale dynamiek te bevorderen via drie sub-uitdagingen die gericht zijn op directionele invloed, beurtwisseling en voorspelling van de rapporttraject.

Oorspronkelijke auteurs: Panagiotis Tzirakis, Alice Baird, Jeffrey Brooks, Emilia Parada-Cabaleiro, Lukas Stappen, Sharath Rao, Theo Lebryk, Jakub Piotr Clapa, Jens Madsen

Gepubliceerd 2026-05-06
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Panagiotis Tzirakis, Alice Baird, Jeffrey Brooks, Emilia Parada-Cabaleiro, Lukas Stappen, Sharath Rao, Theo Lebryk, Jakub Piotr Clapa, Jens Madsen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je twee mensen voor die tegenover elkaar zitten en een gesprek voeren. Ze nemen niet alleen om de beurt het woord; ze dansen. De grap van de ene persoon laat de ander lachen; de aarzeling van de ene persoon laat de ander pauzeren; naarmate de minuten verstrijken, bouwen ze een gevoel van verbinding (of "rapport") op.

Al geruime tijd zijn computers goed in het analyseren van één persoon in een kamer—zoals een solozanger die een hoge noot slaat. Maar ze hebben moeite gehad om het duet te begrijpen: hoe de stemming van Persoon A de stemming van Persoon B verandert, hoe ze hun timing coördineren en hoe hun relatie evolueert.

Dit artikel introduceert een nieuwe "sportschool" voor computerwetenschappers, genaamd de ACII-DaiKon Challenge. Het is een competitie die is ontworpen om computers te leren hoe ze deze tweepersoonsdansen moeten begrijpen.

Hier is een uiteenzetting van wat ze doen, met gebruikmaking van eenvoudige analogieën:

1. De Dataset: Een Enorme Bibliotheek met Echte Conversaties

De organisatoren hebben een enorme bibliotheek gebouwd, de Hume-DaiKon dataset.

  • De Collectie: Het bevat 945 conversaties (ruim 743 uur video en audio) tussen paren mensen.
  • De Variatie: Dit zijn geen geschreven toneelstukken. Het zijn echte, natuurlijke chats tussen vreemden die online aan elkaar gekoppeld werden. Ze spreken vijf verschillende talen (Engels, Duits, Spaans, Nederlands en Pools).
  • De Opstelling: Stel je een videogesprek voor waarbij twee mensen worden gevraagd om te chatten over hun weekend of vakantie. Het systeem neemt hen beiden apart op (zodat de computer het gezicht van Persoon A kan zien terwijl hij naar de stem van Persoon B luistert) en vangt alles op, van de toon van hun stem tot hun gezichtsuitdrukkingen.

2. De Drie Uitdagingen (De "Evenementen")

De competitie vraagt deelnemers om AI-modellen te bouwen die drie specifieke puzzels kunnen oplossen op basis van deze conversaties:

Puzzel A: De "Emotionele Echo" (Invloed)

  • Het Doel: Voorspellen hoe Persoon B zich op dit moment voelt, gebaseerd op wat Persoon A zojuist heeft gezegd of gedaan.
  • De Metafoor: Stel je voor dat Persoon A een windvaan is. Als Persoon A boos lijkt, verschuift de stemming van Persoon B dan om mee te gaan? De AI moet raden of Persoon B "vreugde", "angst" of "saaiheid" voelt, gebaseerd op het gedrag van de ander.
  • De Haken: Het is niet alleen raden wat Persoon B voelt in een vacuüm; het is raden hoe Persoon A dat gevoel heeft beïnvloed.

Puzzel B: De "Floor Overdracht" (Beurtwisseling)

  • Het Doel: Twee dingen voorspellen: Wie als volgende zal spreken en wanneer ze zullen beginnen met spreken.
  • De Metafoor: Denk aan een spelletje hete aardappel. De AI moet de spelers observeren en raden: "Is de huidige spreker op het punt de aardappel te laten vallen (stoppen met praten), of gaan ze hem stevig vasthouden? En als ze hem laten vallen, hoeveel seconden duurt het voordat de ander hem oppikt?"
  • Waarom het moeilijk is: Soms praten mensen over elkaar heen (overlap), soms onderbreken ze elkaar en soms is er een lange stilte. De AI moet de subtiele signalen (zoals een diepe ademhaling of een blik) opsporen die een verandering aankondigen.

Puzzel C: De "Relatiethermometer" (Rapport)

  • Het Doel: Bijhouden hoe de "verbinding" tussen de twee mensen verandert van het begin tot het einde van de chat.
  • De Metafoor: Stel je een thermometer voor die meet hoe goed twee mensen met elkaar overweg kunnen. Gaat de temperatuur omhoog (ze raken bevriend) of omlaag (ze zijn ongemakkelijk of ruziën) naarmate het gesprek vordert?
  • De Uitdaging: De AI moet naar het hele gesprek kijken, niet alleen naar één zin, om te zien of de relatie opwarmt of afkoelt.

3. De Hulpmiddelen: Wat de Computers Gebruiken

Om deze puzzels op te lossen, hebben de onderzoekers de deelnemers een set "ogen" en "oren" gegeven:

  • De Oren (Audio): De computer luistert naar de stem met een hulpmiddel genaamd Whisper. Het zet spraak om in een lijst met getallen die de toon, snelheid en emotie van de stem vastleggen.
  • De Ogen (Video): De computer bekijkt de gezichten met een hulpmiddel genaamd FaceNet. Het zet gezichtsuitdrukkingen om in getallen die glimlachen, fronsen en hoofdbewegingen vastleggen.
  • Het Resultaat: De computer krijgt een stroom van getallen voor beide personen, naast elkaar, en probeert patronen te vinden.

4. Wat Ze Tot Nu Toe Hebben Gevonden (De Baseline Resultaten)

De organisatoren hebben enkele simpele "starter"-AI-modellen uitgevoerd om te zien hoe moeilijk de puzzels zijn. Hier is wat ze ontdekten:

  • De Stem is Koning: Voor alle drie de puzzels deed de computer het veel beter wanneer het alleen naar de stemmen luisterde dan wanneer het alleen naar de gezichten keek.
    • Analogie: Het is alsof je probeert een lied te begrijpen door naar de lippen van de zanger te kijken versus naar de muziek te luisteren. De muziek (stem) vertelde in deze specifieke tests veel beter het verhaal dan het visuele (gezicht).
  • Het Combineren Hielp (Nog) Niet: Toen ze probeerden de ogen en oren te combineren, werden de simpele modellen niet veel beter. Sterker nog, voor de "Rapport"-puzzel maakte het toevoegen van video de score zelfs iets slechter.
    • Waarom? Het is alsof je probeert een puzzel op te lossen terwijl je een wazige bril draagt. De simpele modellen raakten in de war door de extra visuele data. Het artikel suggereert dat we in de toekomst slimme manieren nodig hebben om de twee zintuigen te combineren.
  • De Score: De beste simpele modellen behaalden ongeveer 40% tot 70% nauwkeurigheid, afhankelijk van de taak. Dit betekent dat computers beginnen met het "grijpen" van de essentie van het gesprek, maar ze staan nog ver verwijderd van het begrijpen van de diepe, complexe dans van menselijke interactie.

Samenvatting

Dit artikel is een uitnodiging aan 's werelds slimste computerwetenschappers om te stoppen met het bekijken van mensen in isolatie en ze te gaan bekijken als paren.

Ze hebben de grondstoffen (de videobibliotheek), de regels (de drie puzzels) en een startpunt (de simpele modellen) geleverd. Het doel is om AI te bouwen die niet alleen woorden hoort, maar de ritme, invloed en verbinding begrijpt tussen twee mensen die met elkaar praten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →