Multimodal Rapport Estimation in Real-World HRI
이 연구는 제로샷 LLM(구체적으로 Gemini 2.5 Flash)과 사전 학습된 오디오 및 비주얼 모델(HuBERT 및 V-JEPA)의 멀티모달 융합이 실제 HRI 환경에서 제삼자가 평가한 라포를 효과적으로 추정하며, 개별 모델보다 뛰어난 성능을 보이고 상호작용 지속 시간 및 그룹 크기와 같은 맥락적 가변성을 고려하는 것의 필요성을 강조한다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인간과 로봇의 상호작용이 활발히 이루어지는 세상에서, 연구자들은 오랫동안 사람과 기계를 연결하는 보이지 않는 실을 측정할 방법을 모색해 왔습니다. 라포(rapport)라고 불리는 이 연결은 정적인 성격 특성이 아니라, 두 당사자가 서로에게 주의를 기울이고, 행동을 조율하며, 온기를 공유할 때 나타나는 역동적인 감정입니다. 과학자들이 모든 변수가 통제된 조용하고 통제된 실험실에서는 이 유대감을 성공적으로 연구해 왔지만, 현실 세계는 훨씬 더 무질서합니다. 북적이는 상점이나 공공 광장에서 사람들은 각자의 속도에 맞춰 대화에 참여하거나 빠져나가며, 친구 무리가 동시에 로봇 주변에 모일 수도 있고, 아무도 머물도록 강요받지 않습니다. 현대 로봇 공학의 핵심 질문은 실험실에서 연결을 측정하기 위해 사용되는 도구들이 환경이 통제되지 않고 참가자들이 원할 때 언제든 떠날 수 있는 상황에서도 여전히 작동할 수 있는가 하는 점입니다.
이를 확인하기 위해 연구팀은 일본의 한 드럭스토어에 소셜 로봇을 설치했습니다. 이곳은 고객이 사전 지시 없이도 자유롭게 접근할 수 있는 환경입니다. 6일 동안, '소타(Sota)'라는 이름의 작은 탁상형 피규어 로봇은 방문객들과 일상적인 대화를 나누었으며, 인간 운영자는 멀리서 로봇의 말과 몸짓을 안내했습니다. 연구팀은 이 62건의 상호작용을 기록하며, 혼자 쇼핑하는 사람부터 작은 친구 무리에 이르기까지 다양한 사람들의 영상과 음성을 포착했습니다. 그 후, 세 명의 독립적인 인간 심사위원에게 녹화 영상을 시청하게 하고, 표준화된 척도를 사용하여 각 개인과 로봇 사이의 관계의 질을 평가하도록 요청했습니다. 이 척도는 상호작용이 얼마나 주의 깊고 조율되었는지를 측정하여, 각 순간에 달성된 라포의 신뢰할 수 있는 점수를 제공했습니다.
이러한 실제 데이터를 손에 넣은 연구진은 컴퓨터가 이러한 인간의 평가를 자동으로 예측하는 법을 배울 수 있는지 테스트했습니다. 그들은 두 가지 다른 접근 방식을 비교했습니다. 첫 번째 접근 방식은 방대한 양의 텍스트, 오디오, 비디오 데이터를 학습하여 녹화본에서 특정 특징을 추출하도록 훈련된 전문 컴퓨터 모델을 사용했습니다. 두 번째 접근 방식은 강력한 범용 인공지능 시스템인 거대 언어 모델을 활용했습니다. 이 시스템들에는 대화 전사본(transcripts)이 제공되었고, 경우에 따라 오디오와 비디오 파일도 함께 제공되어, 마치 전문가처럼 제3자 심사위원 역할을 수행하며 라포를 평가하도록 요청되었습니다.
결과는 범용 인공지능의 놀라운 강점을 드러냈습니다. 대화의 텍스트만 제공되었을 때, 이 거대 모델 중 하나는 매우 뛰어난 성능을 보였으며, 오디오나 시각 데이터에만 의존하는 전문 모델보다 상호작용의 미묘한 차이를 더 잘 포착해 냈습니다. 텍스트 전용 버전의 이 모델은 높은 정확도로 라포 점수를 예측할 수 있었는데, 이는 사람들이 사용하는 단어와 대화의 흐름이 로봇과의 연결에 대한 가장 중요한 단서를 담고 있음을 시사합니다. 그러나 전문 모델이 쓸모없는 것은 아니었습니다. 연구진은 텍스트 기반 모델이 강력하긴 하지만, 오디오 및 시각 모델이 포착할 수 있는 특정 세부 사항을 놓친다는 것을 발견했습니다. 연구진이 텍스트 기반 모델의 예측값과 오디오 및 시각 모델의 예측값을 결합했을 때, 그 결과가 가장 정확한 시스템이 되었습니다. 이 결합된 접근 방식은 단일 방법보다 뛰어난 성능을 보였으며, 이는 서로 다른 유형의 데이터가 경쟁 관계가 아닌 상호 보완적인 통찰력을 제공한다는 것을 나타냅니다.
또한 이 연구는 상호작용의 길이와 참여 인원수가 라포를 측정하는 능력에 어떤 영향을 미치는지 강조했습니다. 통제된 실험실 환경에서의 상호작용은 대개 길고 단 두 명의 인원으로 이루어집니다. 반면 드럭스토어에서의 상호작용은 짧았으며, 평균 54초를 조금 넘겼고, 종종 여러 명이 참여하기도 했습니다. 연구진은 전문 모델이 참여자 수가 증가함에 따라 더 어려움을 겪는다는 것을 발견했는데, 이는 그룹 대화의 복잡한 역학 관계 때문에 개별 신호를 분리해 내기가 더 어렵기 때문인 것으로 보입니다. 이와 대조적으로, 범용 인공지능 모델은 세 사람이 동시에 로봇에게 말을 거는 상황에서도 높은 정확도를 유지하며 견고한 모습을 보였습니다. 이는 이러한 첨단 시스템이 전통적인 실험실 개발 방식보다 실제 세상의 혼란스럽고 다수 인원이 참여하는 상황을 처리하는 데 더 적합하다는 것을 시사합니다.
궁극적으로 이 연구는 실제 세상에서 인간과 로봇의 관계 품질을 추정하는 것이 가능하지만, 과거에 사용되었던 방식과는 다른 전략이 필요함을 보여줍니다. 연구 결과는 특정 과업을 위해 훈련된 전문 모델에만 의존하는 것만으로는 사용자가 자유롭게 참여하고 이탈하는 상황에서 충분하지 않을 수 있음을 시사합니다. 대신, 일반적인 인공지능의 폭넓은 이해력을 활용하면서 구체적인 오디오 및 시각적 단서를 보완하는 하이브리드 접근 방식이 가장 신뢰할 수 있는 길을 제시합니다. 이러한 통찰은 공공장소에서의 예측 불가능하고 다양한 인간 삶의 본질에 진정으로 적응할 수 있는 시스템을 향한 방향을 제시한다는 점에서, 소셜 로봇의 미래에 매우 중요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.