← 最新论文
🤖 AI

The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge

2026 年 ACII 双人对话(DaiKon)研讨会与挑战赛推出了一项包含 945 个自然主义多语言双人交互的综合基准与数据集,旨在通过聚焦方向性影响、话轮转换和融洽关系轨迹预测的三个子挑战,推动人际情感与社会动态建模的发展。

原作者: Panagiotis Tzirakis, Alice Baird, Jeffrey Brooks, Emilia Parada-Cabaleiro, Lukas Stappen, Sharath Rao, Theo Lebryk, Jakub Piotr Clapa, Jens Madsen

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Panagiotis Tzirakis, Alice Baird, Jeffrey Brooks, Emilia Parada-Cabaleiro, Lukas Stappen, Sharath Rao, Theo Lebryk, Jakub Piotr Clapa, Jens Madsen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象两个人相对而坐,正在进行对话。他们并非简单地轮流发言,而是在共舞。一个人的笑话引得另一个人发笑;一个人的犹豫让另一个人停顿;随着时间流逝,他们建立起一种联结感(或称“融洽关系”)。

长期以来,计算机擅长分析房间里的个人——就像独唱歌手唱出一个高音。但它们难以理解这场二重奏:A 的情绪如何影响 B 的情绪,他们如何协调彼此的时机,以及他们的关系如何演变。

本文介绍了一个为计算机科学家设立的全新“健身房”,名为ACII-DaiKon 挑战赛。这是一项旨在教会计算机理解这种双人舞蹈的竞赛。

以下是他们所做工作的分解,辅以简单的类比:

1. 数据集:一个真实对话的巨型图书馆

组织者构建了一个名为Hume-DaiKon 数据集的庞大图书馆。

  • 收录内容:包含945 段对话(超过 743 小时的视频和音频),涉及成对的人。
  • 多样性:这些并非剧本化的表演,而是网上随机配对的两名陌生人之间真实、自然的聊天。他们使用五种不同的语言(英语、德语、西班牙语、荷兰语和波兰语)。
  • 设置:想象一个视频通话,两个人被要求聊聊他们的周末或假期。系统分别录制两人的画面(以便计算机在听 B 的声音时能看到 A 的脸),并捕捉从语调到面部表情的所有细节。

2. 三项挑战(“赛事”)

该竞赛要求参与者构建能够基于这些对话解决三个特定谜题的 AI 模型:

谜题 A:“情感回声”(影响)

  • 目标:根据 A 刚刚所说的话或所做的动作,预测 B此刻的感受。
  • 比喻:想象 A 是一个风向标。如果 A 看起来生气,B 的情绪是否会随之转变?AI 必须根据对方的行为,猜测 B 是在感到“喜悦”、“焦虑”还是“无聊”。
  • 关键点:这不仅仅是凭空猜测 B 的感受,而是要猜测 A 如何影响了这种感受。

谜题 B:“话语权交接”(轮流发言)

  • 目标:预测两件事:将下一个发言,以及他们何时开始发言。
  • 比喻:想象一个“烫手山芋”游戏。AI 必须观察玩家并猜测:“当前的说话者即将放下山芋(停止说话),还是会紧紧抓住不放?如果他们放下,需要多少秒另一个人才能接住?”
  • 难点:有时人们会互相重叠说话,有时会有打断,有时则会有长时间的沉默。AI 必须识别出那些暗示转换的微妙线索(如深呼吸或眼神)。

谜题 C:“关系温度计”(融洽度)

  • 目标:追踪两人之间的“联结”从聊天开始到结束是如何变化的。
  • 比喻:想象一支温度计,测量两人相处得有多融洽。随着对话的推进,温度是上升(他们在建立联结)还是下降(他们感到尴尬或正在争吵)?
  • 挑战:AI 必须审视整个对话,而不仅仅是某一句话,以判断关系是在升温还是降温。

3. 工具:计算机正在使用什么

为了解决这些谜题,研究人员为参与者提供了一套“眼睛”和“耳朵”:

  • 耳朵(音频):计算机使用名为Whisper的工具聆听声音。它将语音转化为一系列数字,捕捉声音的语调速度情绪
  • 眼睛(视频):计算机使用名为FaceNet的工具观察面部。它将面部表情转化为数字,捕捉微笑、皱眉和头部动作。
  • 结果:计算机获得两人并排的连续数字流,试图从中寻找模式。

4. 目前的发现(基线结果)

组织者运行了一些简单的“入门”AI 模型,以测试这些谜题的难度。以下是他们的发现:

  • 声音为王:对于所有三个谜题,当计算机仅聆听声音时,其表现远优于仅观察面部
    • 类比:这就像试图通过看歌手的嘴唇来理解一首歌,与聆听音乐本身相比。在这些特定测试中,音乐(声音)比视觉(面部)更好地讲述了故事。
  • 混合使用尚未奏效:当他们尝试结合“眼睛”和“耳朵”时,简单模型并未获得显著提升。事实上,对于“融洽度”谜题,添加视频数据甚至使得分略有下降。
    • 原因?这就像戴着雾蒙蒙的眼镜试图解谜。简单模型被额外的视觉数据搞糊涂了。论文指出,未来我们需要更聪明的方法来融合这两种感官。
  • 得分:最好的简单模型根据任务不同,准确率约为40% 到 70%。这意味着计算机开始把握对话的“大意”,但它们距离理解人类互动中那种深邃、复杂的舞蹈还有很长的路要走。

总结

本文是向全球最聪明的计算机科学家发出的一份邀请:停止孤立地观察个人,转而将他们视为成对的个体。

他们提供了原材料(视频库)、规则(三个谜题)以及起点(简单模型)。其目标是构建一种 AI,它不仅能听到词语,更能理解两个人交谈时的节奏、影响和联结

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →