← 최신 논문
💻 computer science

Human-robot conversation with multiple participants in noisy public spaces

이 논문은 안드로이드 ERICA의 주의 깊은 청취와 Teleco 로봇을 통한 원격 아바타 상호작용 모두를 위해 음성을 향상시키는 동시에, 다자간 대화에서의 몰입감을 높이기 위한 공간 오디오를 제공함으로써 소음이 많은 공공장소를 위해 설계된 다채널 마이크 어레이 오디오 시스템을 제시한다.

원저자: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya
게시일 2026-09-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya Kawahara

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

북적이는 기차역 한복판에서 진지한 대화를 시도한다고 상상해 보십시오. 엔진의 굉음, 사람들의 웅성거림, 그리고 건축물의 울림이 당신의 주의력을 끌기 위해 서로 경쟁하는 곳입니다. 인간은 이 기술을 아주 자연스럽게 해내며, 과학자들은 이를 '칵테일 파티 효과'라고 부릅니다. 우리 뇌가 배경 소음을 걸러내고 단 하나의 목소리에 집중하는 능력입니다. 하지만 로봇에게 이것은 엄청난 도전입니다. 인공지능이 텍스트 기반의 대화를 나누는 데는 매우 능숙해졌지만, 로봇이 시끄럽고 붐비는 공공장소에서 자연스럽게 듣고 말할 수 있는 능력을 갖추는 것은 여전히 큰 장벽으로 남아 있습니다. 특히 여러 사람이 동시에 말을 하거나, 로봇 자체가 환경 속을 움직이고 있을 때는 더욱 그렇습니다. 인간의 음성을 혼돈 속에서 분리해낼 방법이 없다면, 로봇의 이해 및 응답 능력은 무너져 버리고, 결국 자신이 섬겨야 할 사람들에게 귀를 닫게 되는 셈입니다.

일본과 싱가포르의 여러 대학 연구진은 로봇이 현실 세계에서 명확하게 들을 수 있는 시스템을 구축함으로써 이 문제를 해결하고자 했습니다. 그들은 이 작업의 테스트 장소로 2025년 오사카 엑스포를 선택했는데, 이곳은 시끄럽고 예측 불가능하며 수천 명의 방문객으로 가득 찬 환경이기 때문입니다. 연구팀은 여러 사람의 목소리를 동시에 포착하고, 심지어 서로 말을 가로채는 상황에서도 소리를 정화하여 로봇과 원격지의 인간 운영자 모두가 이해할 수 있도록 하는 특수 오디오 시스템을 개발했습니다. 그 결과, 로봇이 소음이 심한 파빌리온 내에서 사람들과 성공적으로 대화를 나누는 시연을 선보였으며, 이는 기계도 붐비는 방 안의 인간처럼 집중해서 들을 수 있도록 학습될 수 있음을 증명했습니다.

이 성과의 핵심은 로봇이 듣는 방식에 있습니다. 모든 소음을 동일하게 잡아내는 단일 마이크에 의존하는 대신, 연구진은 4개의 마이크로 구성된 원형 배열(circular array)을 사용했습니다. 이 장치는 전자적으로 방향을 조절하여 특정 방향에 집중할 수 있는 일련의 귀 역할을 합니다. 누군가 말을 하면, 시스템은 그 사람의 위치를 식별하고 목소리를 강화하는 동시에 다른 방향에서 들려오는 배경 소음을 억제합니다. 이 과정은 두 가지 뚜렷한 목적을 위한 깨끗한 오디오 신호를 생성합니다. 하나는 로봇의 내부 컴퓨터가 말해지는 단어를 인식하게 하는 것이고, 다른 하나는 멀리 떨어진 곳에서 로봇을 제어하는 인간 운영자가 대화를 명확하고 고품질로 들을 수 있게 하는 것입니다.

연구팀은 각각 고유한 과제를 가진 두 가지 시나리오에서 이 기술을 시연했습니다. 첫 번째 설정에서는 에리카(ERICA)라는 이름의 안드로이드 로봇이 두 명의 인간 참가자와 함께 앉아 있었습니다. 목표는 로봇이 주의 깊은 경청자로서 역할을 수행하며 대화를 따라가고, 고개를 끄덕이거나 짧은 언어적 신호를 보내는 모습을 보여주는 것이었습니다. 사람들이 고정된 위치에 앉아 있었기 때문에, 마이크 배열을 두 사람 사이의 삼각대에 설치하여 안정적인 청취 환경을 조성할 수 있었습니다. 시스템은 두 사람의 목소리를 성공적으로 분리하여, 에리카가 누가 말하고 있는지 이해하고 방금 한 말에 기초해 후속 질문을 던지는 등의 적절한 반응을 생성할 수 있게 했습니다. 이 시나리오는 사람들이 대화를 가로막거나 동시에 말하는 복잡한 그룹 대화 상황을 처리할 수 있음을 입증했습니다.

두 번째 시나리오는 움직임이 포함되어 훨씬 더 어려웠습니다. 여기서 연구진은 텔레코(Telecos)라고 불리는 작은 이동형 로봇들을 사용했습니다. 한 대의 로봇은 별도의 방에 앉아 있는 인간 운영자에 의해 제어되어 가상 아바타 역할을 했고, 다른 한 대의 로봇은 대화를 지원하기 위해 스스로 움직였습니다. 이 경우, 마이크 배열은 인간 운영자가 제어하는 로봇의 머리에 장착되었습니다. 로봇이 머리를 돌리거나 바닥을 가로질러 이동함에 따라 '귀'의 방향도 끊임없이 변했습니다. 연구진은 시스템이 인간 참가자의 위치를 지속적으로 추적하고, 대화가 오는 방향으로 마이크의 초점을 즉각적으로 전환하도록 프로그래밍해야 했습니다. 이러한 동적인 조정 덕분에 원격 운영자는 로봇이 움직이는 중에도 인간 참가자의 목소리를 명확히 들을 수 있었고, 마치 현장에 직접 존재하는 것 같은 느낌을 받을 수 있었습니다.

이것이 작동하기 위해서는 단순히 소리를 증폭하는 것을 넘어 공간감을 만들어내야 했습니다. 원격 운영자가 헤드폰을 통해 들을 때, 만약 인간 참가자가 로봇의 왼쪽에 서 있다면 목소리가 운영자의 헤드폰 왼쪽에서 들리도록 오디오를 조정했습니다. 이러한 공간 오디오 효과는 운영자가 대화에 몰입하도록 도왔으며, 화자들 사이의 자연스러운 관계를 유지해 주었습니다. 또한, 시스템에는 로봇의 스피커를 통해 재생되는 운영자 자신의 목소리가 마이크에 다시 들어가 시스템을 혼란스럽게 하는 것을 방지하기 위한 에코 제거 기능이 포함되었습니다.

시연 결과는 고무적이었습니다. 엑스포 기간 6일 동안, 시스템은 다른 전시물의 소음과 간헐적인 빗소리가 들리는 파빌리온 내에서 수백 명의 방문객과 교류했습니다. 로봇들은 일관된 대화를 유지할 수 있었으며, 원격 운영자들은 높은 소음 수준에도 불구하고 대화 상대방의 목소리를 명확하게 들을 수 있었다고 보고했습니다. 행사 전 통제된 테스트에서, 시스템의 음성 인식 능력은 로봇이 움직이거나 상당한 배경 소음이 있는 상황에서도 표준 핸드헬드 마이크를 사용하는 것과 대등한 수준을 보였습니다. 연구진은 시스템이 완벽하지는 않아서, 때때로 작은 목소리를 놓치거나 사람이 마이크를 등지고 돌아서면 어려움을 겪기도 했지만, 이는 로봇이 실제 공공장소에서 기능할 수 있게 만드는 중요한 진전이라고 언급했습니다.

이 연구는 우리가 인간과 로봇의 상호작용을 생각하는 방식의 중대한 변화를 강조합니다. 이는 통제되고 조용한 실험실 환경을 넘어, 일상의 무질서하고 시끄러운 현실로 나아가는 것입니다. 군중 속에서 명확하게 듣는 문제를 해결함으로써, 연구진은 공항, 박물관, 쇼핑센터와 같은 장소에서 안내자나 조력자, 혹은 동반자로 기능할 수 있는 로봇의 길을 열었습니다. 소음을 걸러내고 인간의 목소리에 집중하는 능력은 단순한 기술적 성취를 넘어, 가장 혼란스러운 환경 속에서도 기계가 우리를 진정으로 이해하고 연결될 수 있게 하는 토대입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →