Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots
본 논문은 화자와 청자의 정서 상태를 모두 동적으로 추적하여 일치하는 언어적 및 체화된 반응을 생성함으로써 정서적 루프를 완성하는 다중 모달 공감형 사회적 로봇 시스템인 AffectLoop를 소개하며, 파일럿 연구 결과 이는 텍스트 전용 베이스라인 모델에 비해 사용자 만족도와 고통 회복을 유의미하게 향상시키는 것으로 나타났다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인간의 연결은 단순히 단어를 주고받는 것 그 이상에 의존합니다. 우리가 누군가와 대화할 때, 우리는 끊임없이 상대의 얼굴을 읽고, 목소리의 톤에 귀를 기울이며, 대화의 리듬을 느낍니다. 또한 우리는 우리 자신의 기분을 대화 속에 가져오며, 이는 우리가 듣고 반응함에 따라 변화하고 바뀝니다. 이러한 감정의 역동적인 흐름이 대화를 살아있게 만드는 요소입니다. 수십 년 동안 연구자들은 기계가 이러한 복잡성을 이해하도록 가르치기 위해 노력해 왔으며, 사람이 슬픈지 혹은 기쁜지를 인식할 수 있는 시스템을 구축해 왔습니다. 하지만 이러한 디지털 리스너들의 대부분은 일방통행식으로 작동합니다. 즉, 사용자의 감정을 감지하여 미리 프로그래밍된 답변을 제공할 뿐, 리스너 자신의 반응 또한 대화의 정서적 풍경을 변화시킨다는 사실은 간과합니다. 그들은 두 사람이 실시간으로 서로의 감정에 영향을 미치는 순환 과정을 놓치고 있습니다.
한 연구팀은 이제 이 간극을 메우려는 로봇을 제작했습니다. 2026년 아시아 태평양 신호 및 정보 처리 협회(Asia Pacific Signal and Information Processing Association) 연례 서밋에서 발표된 연구에서, 그들은 사회적 로봇이 사람의 말뿐만 아니라 그들 사이에서 감정적 교류가 어떻게 진화하는지를 이해하도록 설계된 AFFECTLOOP라는 시스템을 소개했습니다. 연구진은 '미스티 II(Misty II)'라는 이름의 작고 프로그래밍 가능한 로봇에 화자의 목소리와 얼굴 표정을 추적하는 동시에, 로봇 자신의 내부 감정 상태를 모니터링하는 능력을 갖추었습니다. 이 이중 스트림 정보를 대규모 언어 모델(LLM)에 입력함으로써, 로봇은 공감할 뿐만 아니라 신체적으로도 표현력이 풍부한 반응을 생성하여 지속적인 감정적 연결의 순환을 만들어냅니다.
AFFECTLOOP의 핵심 아이디어는 진정한 공감이 양방향 통행이어야 한다는 것입니다. 일반적인 대화에서 사람의 감정은 정지해 있지 않습니다. 그것은 말해지는 내용과 상대방이 어떻게 반응하느냐에 따라 매 순간 변화합니다. 연구진은 기존의 로봇 시스템들이 감정을 문장에 붙은 단일한 라벨로 취급하여, 감정이 시간이 흐름에 따라 어떻게 변하는지에 대한 미묘한 역동성을 놓친다는 것을 발견했습니다. 이를 해결하기 위해, 그들의 시스템은 상호작용을 두 개의 평행한 트랙으로 나눕니다. 첫째, 시스템은 화자를 분석합니다. 소프트웨어를 사용하여 화자의 목소리를 텍스트 전사본으로 변환하고, 얼굴 움직임을 일련의 감정 신호로 변환합니다. 시스템은 화자의 기분이 고조되고 낮아지는 것을 추적하며, 그들의 에너지와 감정적 강도의 변화를 기록합니다. 둘째, 시스템은 로봇 자신의 상태에 대한 기록을 계속 유지합니다. 로봇은 자신이 말하려는 단어의 감정적 톤과 머리 기울임이나 제스처와 같은 신체적 움직임이 전달하는 감정을 계산합니다.
이 두 데이터 스트림은 결합되어 로봇의 다음 행동을 안내합니다. 로봇은 단순히 인간에게 반응하는 것이 아니라, 자신의 이전 행동과 현재의 기분이 진행 중인 대화에 어떻게 부합하는지를 고려합니다. 이 정보는 로봇의 두뇌 역할을 하는 인공지능 엔진으로 전달됩니다. 이 엔진은 주의 깊은 경청자로서 행동하도록 지시받으며, 정서적 맥락에 부합하는 짧은 음성 답변을 생성합니다. 결정적으로, 엔진은 로봇이 수행할 신체적 행동 또한 결정하여, 몸짓이 말과 일치하도록 보장합니다. 예를 들어, 인간이 슬픈 이야기를 나누고 로봇이 고통스러운 변화를 감지하면, 로봇은 부드러운 언어적 위로를 생성하는 동시에 고개를 숙이거나 시선을 부드럽게 할 수 있습니다. 로봇이 말을 하고 움직이면, 시스템은 즉시 상황을 재평가하여 방금 일어난 일을 반영하도록 자신의 감정 상태를 업데이트한 뒤, 인간의 다음 차례를 기다립니다. 이는 로봇의 반응이 대화의 감정적 역동성의 일부가 되는 폐쇄 루프(closed loop)를 형성하며, 이는 마치 인간의 대화에서 일어나는 것과 같습니다.
이 접근 방식이 실제로 효과가 있는지 테스트하기 위해, 연구진은 5명의 참가자를 대상으로 소규모 연구를 수행했습니다. 각 참가자는 두 가지 서로 다른 시나리오에서 로봇과 5분 동안 대화를 나누었습니다. 첫 번째 시나리오에서 로봇은 로봇 자신의 감정 상태와 대화의 역동적인 흐름을 무시한 채, 오직 인간의 말만을 보고 반응을 생성하는 표준 시스템을 사용했습니다. 두 번째 시나리오에서 로봇은 새로운 AFFECTLOOP 시스템을 사용했습니다. 이후 참가자들은 대화가 얼마나 자연스러웠는지, 로봇이 얼마나 잘 경청하는 것처럼 느껴졌는지, 로봇의 반응이 얼마나 지지적이었는지 등 여러 요인에 대해 경험을 평가했습니다.
결과는 새로운 시스템이 눈에 띄는 차이를 만든다는 것을 시사했습니다. 참가자들은 AFFECTLOOP 로봇에 대해 전반적으로 더 높은 점수를 주었으며, 가장 큰 개선은 로봇의 반응이 얼마나 지지적이고 공감적으로 느껴지는가 하는 부분에서 나타났습니다. 사람들은 폐쇄 루프 시스템을 사용할 때 로봇으로부터 더 많은 격려와 칭찬을 받는다고 느꼈습니다. 또한 그들은 대화 후에 기분이 더 좋아졌다고 보고했는데, AFFECTLOOP 로봇을 사용했을 때 스트레스 수준이 표준 시스템보다 더 효과적으로 감소하는 것으로 나타났습니다. 연구진은 또한 표면 아래에서 어떤 일이 일어나고 있는지 확인하기 위해 상호작용 로그를 분석했습니다. 그들은 AFFECTLOOP를 사용하는 로봇이 인간의 감정 변화와 정렬하는 능력이 더 뛰어나다는 것을 발견했습니다. 인간의 기분이 특정 방향으로 움직일 때, 로봇의 반응은 단순히 무작위로 반응하는 대신 그 경로를 더 밀접하게 따르는 경향이 있었습니다. 더욱이, 데이터는 대화를 시작할 때 부정적인 상태였던 인간이 AFFECTLOOP 로봇과 대화한 후에는 덜 부정적인 상태가 될 가능성이 더 높다는 것을 보여주었습니다.
이 연구는 참가자 수가 적고 예비 테스트의 성격을 띠고 있지만, 그 결과는 사회적 로봇 공학의 유망한 방향을 제시합니다. 연구진은 로봇이 화자의 변화하는 감정과 리스너 자신의 정서적 상태를 명시적으로 모델링함으로써, 단순한 텍텍스트 기반의 응답을 넘어 더 진실하고 체화된 형태의 공감을 만들어낼 수 있다고 제안합니다. 이 시스템이 로봇을 모든 면에서 더 인간처럼 보이게 만든 것은 아니었습니다. 어떤 척도에서는 표준 시스템이 인지된 자연스러움 측면에서 여전히 약간 더 높은 점수를 받았습니다. 그러나 정서적 지원과 사용자 만족도에서의 명확한 이득은, 폐쇄 루프를 닫는 것이 로봇을 더 지지적인 동료처럼 느끼게 하는 데 도움이 된다는 것을 입증합니다. 이 연구는 로봇이 인간과 진정으로 연결되기 위해서는 상대방의 말을 듣는 것뿐만 아니라, 대화의 감정적 춤 속에서 자신의 위치를 인식해야 한다는 것을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.