The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge
2026 年 ACII 双対会話(DaiKon)ワークショップおよびチャレンジは、双方向の影響、ターンテイキング、ラポール推移予測に焦点を当てた 3 つのサブチャレンジを通じて、対人感情および社会的ダイナミクスのモデリングを促進するため、945 の自然主義的かつ多言語の双対相互作用からなる包括的なベンチマークおよびデータセットを導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
二人の人が向かい合って会話をしている様子を想像してください。彼らは単に順番に話しているのではなく、まるで踊っているかのようです。一人の冗談がもう一人を笑わせ、一人の沈黙がもう一人の一時停止を生み、時間が経過するにつれて、彼らは相互理解(ラポール)を築いていきます。
長年、コンピューターは部屋にいる一人の人を分析することには長けていました。まるでソロ歌手が高音を決めるようなものです。しかし、彼らはデュエット、つまりAさんの気分がBさんの気分をどう変えるか、彼らがタイミングをどう合わせるか、そして彼らの関係性がどう発展するかを理解することには苦労してきました。
この論文は、コンピューターサイエンティストのための新しい「ジム」であるACII-DaiKon チャレンジを紹介するものです。これは、コンピューターにこうした二人の踊りを理解させるように設計されたコンペティションです。
彼らが何をしているかを、簡単な比喩を用いて解説します。
1. データセット:リアルな会話の巨大な図書館
主催者はHume-DaiKon データセットと呼ばれる大規模な図書館を構築しました。
- 収集物: オンラインでペアを組んだ見知らぬ人同士による945 の会話(743 時間以上の動画と音声)が含まれています。
- 多様性: これらは脚本化された芝居ではありません。オンラインでペアを組んだ見知らぬ人同士の、リアルで自然な会話です。英語、ドイツ語、スペイン語、オランダ語、ポーランド語の 5 つの言語で話されています。
- 設定: 週末や休暇について話すように頼まれた二人がビデオ通話をする様子を想像してください。システムは二人を別々に記録します(コンピューターがAさんの顔を見ながらBさんの声を聞けるようにするため)し、声のトーンから表情に至るまで全てを捉えます。
2. 3 つの課題(「イベント」)
このコンペティションでは、参加者にこれらの会話に基づいて 3 つの特定の謎を解く AI モデルを構築することが求められます。
謎 A: 「感情のエコー」(影響)
- 目標: Aさんが直前に言ったことや行ったことに基づいて、Bさんが今どう感じているかを予測する。
- 比喩: Aさんが風見鶏だと想像してください。Aさんが怒っているように見えれば、Bさんの気分もそれに合わせて変化するでしょうか?AI は、相手の行動に基づいて、Bさんが「喜び」「不安」または「退屈」を感じているかどうかを推測しなければなりません。
- ポイント: 単に真空状態でBさんが何を思っているかを推測するのではなく、Aさんがその感情をどのように影響させたかを推測することです。
謎 B: 「フロアの引き継ぎ」(ターンテイク)
- 目標: 誰が次に話すか、そしていつ話し始めるかを予測する。
- 比喩: ホットポテトゲームだと考えてください。AI はプレイヤーを見て、推測しなければなりません。「現在の話し手はポテトを落とす(話しを止める)直前なのか、それともしっかり握りしめているのか?そして、もし落とすなら、相手が受け取るまで何秒かかるか?」
- なぜ難しいか: 時には人々が重なり合って話し(オーバーラップ)、時には割り込み、時には長い沈黙があります。AI は、変化を知らせる微妙な合図(深い息継ぎや視線など)を見極めなければなりません。
謎 C: 「関係性の温度計」(ラポール)
- 目標: 会話の初めから終わりまで、二人の間の「つながり」がどのように変化するかを追跡する。
- 比喩: 二人がどの程度仲良くなっているかを測る温度計を想像してください。会話が進むにつれて、温度は上がりますか(絆が深まる)、それとも下がりますか(ぎこちない、または議論している)?
- 課題: AI は、関係性が熱くなっているのか冷めているのかを見るために、一文だけでなく、会話全体を見なければなりません。
3. ツール:コンピューターが何を使っているか
これらの謎を解くために、研究者は参加者に「目」と「耳」のセットを提供しました。
- 耳(音声): コンピューターはWhisperというツールを使って声を聞きます。これは、声のトーン、速度、感情を捉える数値のリストに変換します。
- 目(動画): コンピューターはFaceNetというツールを使って顔を見ます。これは、笑顔、しかめっ面、頭の動きを捉える数値に変換します。
- 結果: コンピューターは、二人分の数値のストリームを並列して受け取り、パターンを見つけようとします。
4. これまでの発見(ベースライン結果)
主催者は、これらの謎がどれほど難しいかを確認するために、いくつかの単純な「スタート」AI モデルを実行しました。彼らが発見したことは以下の通りです。
- 声は王者: 3 つのすべての課題において、コンピューターは顔を見るよりも声を聞くだけで、はるかに良い結果を出しました。
- 比喩: 歌を理解しようとして、歌手の唇を見るのと、音楽を聞くのとを比較するようなものです。これらの特定のテストでは、音楽(声)の方が、視覚(顔)よりもはるかに良く物語を伝えていました。
- 組み合わせは(まだ)役立たなかった: 彼らが目と耳を組み合わせようと試みたとき、単純なモデルはあまり改善しませんでした。実際、「ラポール」の謎については、動画を追加したことでスコアがわずかに悪くなりました。
- なぜ?: 霧のかかったメガネをかけながらパズルを解こうとするようなものです。単純なモデルは、追加の視覚データに混乱しました。この論文は、将来、両方の感覚を組み合わせるより賢い方法が必要であると示唆しています。
- スコア: 最も優れた単純なモデルは、タスクによって約**40% から 70%**の精度を達成しました。これは、コンピューターが会話の「大まかな要点」を理解し始めていることを意味しますが、人間同士の相互作用という深く複雑なダンスを理解するには、まだ程遠い状態です。
まとめ
この論文は、世界中の最も賢いコンピューターサイエンティストに対して、個人を孤立して見るのをやめ、ペアとして見るようにと呼びかけるものです。
彼らは、原材料(動画ライブラリ)、ルール(3 つの謎)、そして出発点(単純なモデル)を提供しました。目標は、単に言葉を聞くだけでなく、二人の人が互いに話す際のリズム、影響、そしてつながりを理解する AI を構築することです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。