← 최신 논문
🤖 AI

Hybrid Attention Estimation Pipeline for Adaptive HRI Using an Expressive Robotic Head

본 논문은 적응형 인간-로봇 상호작용 행동을 유도하기 위해 고주파 기하학적 인지와 의미론적 시각-언어 모델링을 통합한, 표현력이 풍부한 InMoov 기반 로봇 헤드를 위한 하이브리드 주의 집중 추정 파이프라인을 제시하며, 이는 신뢰할 수 있는 상호작용 관리와 비중복적 신호 처리를 보여주는 실험을 통해 검증되었다.

원저자: Pablo Moraes, Monica Rodriguez, Christopher Peters, Hiago Sodre, Tobias Doernbach, Bruna Guterres, Ricardo Grando

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pablo Moraes, Monica Rodriguez, Christopher Peters, Hiago Sodre, Tobias Doernbach, Bruna Guterres, Ricardo Grando

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 단순히 경직된 스크립트를 따르는 투박한 기계가 아니라, 실제로 "분위기를 읽을" 수 있는 사회적 파트너가 되는 세상을 상상해 보십시오. 이것이 바로 인간-로봇 상호작용(HRI)의 핵심입니다. 이 분야는 기계에게 예의 바르고 주의 깊은 친구처럼 행동하는 법을 가르치는 데 전념하는 과학 분야입니다. 로봇이 좋은 대화 상대가 되기 위해서는 **시각적 주의(visual attention)**라는 개념을 이해해야 합니다. 즉, 당신이 자신을 보고 있는지, 휴대폰 때문에 정신이 팔려 있는지, 혹은 다른 곳을 보고 있는지를 아는 것입니다. 이것은 마치 춤과 같습니다. 한 파트너가 상대방을 보지 않으면 춤은 어색해집니다. 만약 로봇이 당신이 자신을 무시하는 것인지, 아니면 단지 문자 메시지를 확인하느라 잠시 눈길을 돌린 것인지 구별할 수 있다면, 대화를 일시 중단할지, 인내심 있게 기다릴지, 아니면 계속 말을 이어갈지를 결정할 수 있습니다. 이 논문은 빠른 수학과 스마트한 AI를 결합하여, 단순히 당신의 얼굴을 보는 것을 넘어 당신이 고개를 돌렸는지 이해하는 로봇을 만드는 방법을 탐구합니다. 이를 통해 상호작용이 자연스럽게 흐르도록 유지합니다.


당신이 지루해하는지(혹은 그저 휴대폰을 확인하는 중인지)를 아는 로봇

"InMoov" 헤드를 만나보십시오. 이것은 눈썹, 눈꺼와 턱을 움직여 감정을 표현할 수 있는 3D 프린팅된 표정 있는 로봇 얼굴로, 마치 매우 정교한 하이테크 인형와 같습니다. 하지만 로봇 내부의 지능이 주변에서 무슨 일이 일어나고 있는지 모른다면, 예쁜 얼굴은 아무런 소용이 없습니다. 이 연구의 연구자들은 까다로운 문제를 해결하고자 했습니다. 어떻게 하면 사용자가 하늘을 보는지 아니면 휴대폰을 보는지 구분하여, 사용자가 시선을 돌렸을 때 혼란 없이 즉각적으로 반응하게 만들 것인가 하는 문제입니다.

이를 위해 그들은 서로 매우 다른 역할을 수행하는 두 명의 팀처럼 작동하는 "하이브리드" 뇌를 구축했습니다.

빠른 주자(The Fast Runner)와 현명한 관찰자(The Wise Observer)
로봇에게 두 개의 뇌가 동시에 작동한다고 상상해 보십시오.

  1. 빠른 주자 (기하학적 계층): 이 부분은 매우 빠릅니다. 단순한 수학을 사용하여 당신의 머리 각도를 추적합니다. 머리가 로봇을 향하고 있으면 주자는 "주의 집중됨!"이라고 외칩니다. 머리를 돌리면 "주의 상실!"이라고 외칩니다. 이는 선수가 경기장 밖으로 나가는 순간 즉시 휘슬을 부는 심판와 같습니다. 타이밍 측면에서는 빠르고 신뢰할 수 있지만, 무엇을 보고 있는지는 모르며 오직 머리가 어디를 향하고 있는지만 알 수 있습니다.
  2. 현명한 관찰자 (의미론적 계층): 이 부분은 더 느리지만 훨씬 더 똑똑합니다. 시각-언어 모델(VLM)이라는 강력한 AI를 사용합니다. 단순히 각도를 측정하는 대신, 전체적인 장면을 보고 "아, 이 사람이 휴대폰을 보고 있구나" 또는 "나무에 있는 새를 보고 있구나"라고 말합니다. 이는 당신이 문자를 보내고 있다는 것을 알아차리고 맥락을 이해하는 친구와 같습니다.

마법은 이 두 존재가 서로 대화할 때 일어납니다. "빠른 주자"는 로봇의 즉각적인 행동(예: 이야기 잠시 멈추기)을 제어하고, "현명한 관찰자"는 로봇이 실수를 하지 않도록 지켜보며 맥락을 보완합니다.

실험: 10명의 사람, 40번의 대화
연구팀은 10명의 자원봉사자를 대상으로 이 시스템을 테스트했습니다. 각 참가자는 네 가지 다른 시나리오를 거쳤습니다. 어떤 테스트에서는 로봇이 평범하게 대화를 나누었고, 다른 테스트에서는 로봇이 "적응형(adaptive)" 모드로 작동하여, 사람이 주의가 분산되었을 때(즉, 다시 로봇을 볼 때까지) 대화를 멈추도록 설계되었습니다.

결과는 놀라울 정도로 매끄러웠습니다. 40번의 모든 시행에서 로봇은 성공적으로 사람을 포착했고, 사람이 주의를 기울이고 있음을 인지했으며, 대화를 시작했습니다. 로봇이 사람을 포착하는 데는 약 1.73초, 대화를 시작하기 전 상대가 로봇을 보고 있음을 확정하는 데는 4.74초가 걸렸습니다.

로봇이 "적응형 모드"에 있고 사람이 주의가 분산된 척했을 때(예: 휴대폰을 보는 경우), 로봇은 완벽하게 반응했습니다. 계획된 주의 분산 테스트에서 로봇은 10번 중 10번 모두 대화를 일시 중단했으며, 10번 중 9번의 경우 성공적으로 대화를 재개했습니다. 로봇은 단순히 멈춰 서 있는 것이 아니라, 인내심 있게 기다렸다가 사람이 다시 바라보는 순간 대화에 다시 뛰어들었습니다.

왜 두 개의 뇌가 하나보다 나은가
여기서 가장 흥ientes한 부분은 "빠른 주자"와 "현명한 관찰자"가 항상 의견이 일치하지는 않았다는 점입니다. 그들이 상황을 확인한 순간 중 약 절반 정도에서 서로 다른 설명을 내놓았습니다. 예를 들어, 빠른 주자는 "머리가 돌아감, 주의 상실!"이라고 말하는 반면, 현명한 관찰자는 "그들이 휴대폰을 보고 있음"이라고 말할 수 있습니다.

연구진은 이 두 계층이 **비중복적(non-redundant)**인 정보를 제공한다는 것을 발견했습니다. 즉, "현명한 관찰자"는 단순히 "빠른 주자"가 말한 내용을 반복하는 것이 아니라, 수학만으로는 볼 수 없는 새롭고 유용한 세부 사항을 추가하고 있었습니다. 이는 인간의 주의력을 이해하기 위해 단 한 종류의 센서에만 의존해서는 안 된다는 것을 증명합니다. 타이밍을 맞추기 위한 기하학적 속도와 맥락을 이해하기 위한 AI의 지능이 모두 필요합니다.

로봇이 하지 못한 것
이 연구가 무엇을 입증하지 못했는지 주목하는 것도 중요합니다. 연구진은 이 로봇이 완벽한 인간 이해의 문제를 해결한 것은 아니라고 인정했습니다. 연구진은 매 초마다 사람이 무엇을 생각하고 있는지에 대한 완벽한 기록(인간이 직접 주석을 단 '그라운드 트루스')을 가지고 있지 않았습니다. 따라서 로봇이 잘 작동한 것처럼 보이긴 했지만, 모든 일시 중단이 인간의 정확한 주의 분산 순간에 완벽하게 맞춰졌는지는 확실히 말할 수 없습니다. 또한 로봇의 행동이 인간에게 어떤 느낌을 주었는지(예: 기괴하게 느껴졌는지 혹은 매력적으로 느껴졌는지)도 테스트하지 않았습니다. 그것은 다음 단계의 실험 과제입니다.

시사점
이 연구는 최고의 사회적 로봇을 만드는 방법은 빠른 수학과 스마트한 AI 중 하나를 선택하는 것이 아니라, 둘 다 사용하는 것임을 시사합니다. 빠른 시스템이 타이밍을 담당하고 스마트한 시스템이 맥락을 담당하게 함으로써, 로봇은 더 자연스러운 대화 파트너처럼 행동할 수 있습니다. 즉, 언제 멈춰야 할지, 언제 기다려야 할지, 그리고 언제 이야기를 계속 이어가야 할지를 아는 파트너 말입니다. 이는 로봇이 단순히 우리를 보는 것을 넘어, 진정으로 우리를 이해하게 되는 작은 발걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →