← 최신 논문
🤖 AI

The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge

2026 ACII 이원적 대화 (DaiKon) 워크숍 및 챌린지는 방향성 영향, 턴테이킹, 그리고 라포 궤적 예측에 초점을 맞춘 세 가지 하위 챌린지를 통해 대인 정서 및 사회적 역동성 모델링을 발전시키기 위해 945 개의 자연스러운 다국어 이원적 상호작용에 대한 포괄적인 벤치마크와 데이터셋을 소개합니다.

원저자: Panagiotis Tzirakis, Alice Baird, Jeffrey Brooks, Emilia Parada-Cabaleiro, Lukas Stappen, Sharath Rao, Theo Lebryk, Jakub Piotr Clapa, Jens Madsen

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Panagiotis Tzirakis, Alice Baird, Jeffrey Brooks, Emilia Parada-Cabaleiro, Lukas Stappen, Sharath Rao, Theo Lebryk, Jakub Piotr Clapa, Jens Madsen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 사람이 마주 앉아 대화를 나누는 모습을 상상해 보세요. 그들은 단순히 차례를 바꿔가며 말을 하는 것이 아니라, 춤을 추고 있습니다. 한 사람의 농담이 다른 사람을 웃게 만들고, 한 사람의 망설임이 다른 사람을 멈추게 하죠. 시간이 흐르면서 그들은 유대감 (또는 '라포') 을 쌓아갑니다.

오랫동안 컴퓨터는 방 안의 사람을 분석하는 데는 능숙했습니다. 마치 솔로 가수가 높은 음을 내는 것과 같죠. 하지만 그들은 이중주를 이해하는 데는 어려움을 겪어 왔습니다. 즉, A 의 기분이 B 의 기분에 어떻게 영향을 미치는지, 그들이 어떻게 타이밍을 조율하는지, 그리고 그들의 관계가 어떻게 진화하는지 말입니다.

이 논문은 컴퓨터 과학자들을 위한 새로운 '체육관'인 ACII-DaiKon 챌린지를 소개합니다. 이는 컴퓨터가 이러한 두 사람 간의 춤을 이해하도록 가르치기 위해 고안된 대회입니다.

다음은 간단한 비유를 사용하여 그들이 무엇을 하고 있는지 설명한 것입니다:

1. 데이터셋: 실제 대화의 거대한 도서관

주최자들은 Hume-DaiKon 데이터셋이라는 거대한 도서관을 구축했습니다.

  • 수집물: 온라인에서 짝을 이룬 낯선 사람들 사이의 945 개의 대화(743 시간 이상의 비디오 및 오디오) 가 포함되어 있습니다.
  • 다양성: 이는 대본이 있는 연극이 아닙니다. 온라인에서 짝을 이룬 낯선 사람들 사이의 실제 자연스러운 대화입니다. 그들은 다섯 가지 언어 (영어, 독일어, 스페인어, 네덜란드어, 폴란드어) 로 말합니다.
  • 설정: 두 사람이 주말이나 휴가에 대해 이야기하도록 요청받는 화상 통화 상황을 상상해 보세요. 시스템은 두 사람을 별도로 기록합니다 (컴퓨터가 B 의 목소리를 듣는 동안 A 의 얼굴을 볼 수 있도록). 그리고 목소리 톤부터 표정까지 모든 것을 포착합니다.

2. 세 가지 챌린지 (이벤트)

이 대회는 참가자들에게 이러한 대화를 기반으로 세 가지 특정 퍼즐을 해결할 수 있는 AI 모델을 구축하도록 요청합니다.

퍼즐 A: "감정 메아리" (영향)

  • 목표: A 가 방금 말하거나 행동한 것을 바탕으로 B 가 지금 어떻게 느끼고 있는지 예측합니다.
  • 비유: A 를 풍향계라고 상상해 보세요. A 가 화난 것처럼 보인다면, B 의 기분이 이에 맞춰 변할까요? AI 는 상대방의 행동을 바탕으로 B 가 "기쁨", "불안", 또는 "지루함"을 느끼고 있는지 추측해야 합니다.
  • 주의할 점: 이는 단순히 B 가 무엇을 느끼는지 추측하는 것이 아니라, A 가 그 감정에 어떻게 영향을 미쳤는지 추측하는 것입니다.

퍼즐 B: "말하기 권한 넘기기" (턴테이킹)

  • 목표: 누가 다음에 말할지, 그리고 언제 말하기 시작할지 두 가지를 예측합니다.
  • 비유: 뜨거운 감자 게임을 생각해 보세요. AI 는 플레이어들을 지켜보며 추측해야 합니다. "현재 말하는 사람이 감자를 떨어뜨릴 (말을 멈출) 것인가요, 아니면 꽉 잡을 것인가요? 그리고 감자를 떨어뜨린다면, 다른 사람이 잡기까지 몇 초가 걸릴까요?"
  • 어려운 점: 때로는 사람들이 서로 말을 겹쳐서 하고 (오버랩), 때로는 방해하고, 때로는 긴 침묵이 있습니다. AI 는 말의 변화를 알리는 미묘한 신호 (깊은 숨이나 눈빛 등) 를 포착해야 합니다.

퍼즐 C: "관계 온도계" (라포)

  • 목표: 대화 시작부터 끝까지 두 사람 사이의 "연결"이 어떻게 변하는지 추적합니다.
  • 비유: 두 사람이 얼마나 잘 지내는지 측정하는 온도계를 상상해 보세요. 대화가 진행됨에 따라 온도가 올라갈까요 (유대감 형성), 아니면 내려갈까요 (어색함이나 논쟁)?
  • 도전 과제: AI 는 관계가 뜨거워지거나 식어가는지 보려면 한 문장이 아니라 대화 전체를 살펴봐야 합니다.

3. 도구: 컴퓨터가 사용하는 것

이 퍼즐들을 해결하기 위해 연구자들은 참가자들에게 "눈"과 "귀" 세트를 제공했습니다:

  • 귀 (오디오): 컴퓨터는 Whisper라는 도구를 사용하여 목소리를 듣습니다. 이는 음성을 , 속도, 감정을 포착하는 숫자 목록으로 변환합니다.
  • 눈 (비디오): 컴퓨터는 FaceNet이라는 도구를 사용하여 얼굴을 봅니다. 이는 표정을 미소, 찡그림, 고개 움직임 등을 포착하는 숫자로 변환합니다.
  • 결과: 컴퓨터는 두 사람에 대한 숫자 스트림을 나란히 받아들이며 패턴을 찾으려 합니다.

4. 지금까지 발견한 것 (기선 결과)

주최자들은 퍼즐이 얼마나 어려운지 보기 위해 몇 가지 간단한 "시작" AI 모델을 실행했습니다. 그들이 발견한 바는 다음과 같습니다:

  • 목소리가 왕이다: 세 가지 퍼즐 모두에서 컴퓨터는 얼굴만 보는 것보다 목소리만 들었을 때 훨씬 더 잘 수행했습니다.
    • 비유: 가수의 입술을 보며 노래를 이해하려는 것과 음악을 듣는 것의 차이와 같습니다. 이러한 특정 테스트에서 음악 (목소리) 이 시각 (얼굴) 보다 훨씬 더 잘 이야기를 전달했습니다.
  • 혼합은 아직 도움이 되지 않음: 눈과 귀를 결합해 보았을 때, 간단한 모델은 크게 향상되지 않았습니다. 오히려 "라포" 퍼즐의 경우, 비디오를 추가하면 점수가 약간 떨어졌습니다.
    • 이유: 안개가 낀 안경을 쓰고 퍼즐을 푸는 것과 같습니다. 간단한 모델들은 추가적인 시각 데이터에 혼란을 느꼈습니다. 이 논문은 향후 두 감각을 결합하는 더 지능적인 방법이 필요하다고 제안합니다.
  • 점수: 가장 좋은 간단한 모델들은 작업에 따라 약 **40% 에서 70%**의 정확도를 기록했습니다. 이는 컴퓨터가 대화의 "요지"를 이해하기 시작했다는 것을 의미하지만, 인간 상호작용의 깊고 복잡한 춤을 이해하는 데는 아직 멀었습니다.

요약

이 논문은 세계의 가장 똑똑한 컴퓨터 과학자들에게 사람들을 고립된 상태로 보는 것을 멈추고, 으로 보기 시작하라는 초대장입니다.

그들은 원자재 (비디오 도서관), 규칙 (세 가지 퍼즐), 그리고 시작점 (간단한 모델) 을 제공했습니다. 목표는 단순히 단어를 듣는 것이 아니라, 서로 대화하는 두 사람 사이의 리듬, 영향, 그리고 연결을 이해하는 AI 를 구축하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →