← 최신 논문
💻 computer science

Can People Distinguish Human and AI Agency in Humanoid Teleoperation? A Preliminary Study of Agency Perception

이 예비 연구는 "고스트 인 더 루프(Ghost-in-the-Loop)" 프레임워크를 도입하여, 참가자들이 휴머노이드 원격 제어 상황에서 인간의 에이전시와 AI의 에이전시를 구분하는 데 종종 어려움을 겪으며, 그들의 판단이 실제 제어의 원천보다는 인지된 자연스러움과 다중 모드 일관성에 의해 주로 좌우된다는 점을 입증한다.

원저자: Xiang Li, Koya Dendo, Keigo Minamida, Yuto Nakamura, Per Ola Kristensson, Jun Rekimoto

게시일 2026-09-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiang Li, Koya Dendo, Keigo Minamida, Yuto Nakamura, Per Ola Kristensson, Jun Rekimoto

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 거실에 서 있는 로봇이 단순히 정해진 스크립트를 따르는 기계가 아니라, 미소 짓고 몸짓을 하며 인간처럼 유연하게 반응하며 대화의 파트너가 되는 미래를 상상해 보십시오. 이 비전은 사람이 멀리 떨어진 곳에 앉아 실시간으로 로봇의 움직임과 목소리를 제어하여, 마치 기계를 원격 신체처럼 사용하는 방식인 텔레오퍼레이션(원격 제어)에 기반합니다. 수년 동안 이 방식은 인간 운영자가 항상 존재해야 했기에, 한 사람이 도울 수 있는 사람의 수나 대화의 길이를 제한해 왔습니다. 그러나 인공지능의 급격한 부상은 새로운 가능성을 도입했습니다. 바로 음성, 얼굴 표정, 몸짓을 스스로 생성하여 인간과 매우 흡사하게 모방하는 시스템입니다. 이는 기계와 상호작나하는 누구에게나 매혹적이면서도 약간은 불안한 질문을 던집니다. 만약 로봇이 연기를 하고 있다면, 당신은 실제 사람이 조종하고 있는지 아니면 알고리즘이 작업을 수행하고 있는지 구별할 수 있겠습니까?

소니 컴퓨터 사이언스 랩(Sony Computer Science Laboratories)과 도쿄 대학의 연구진은 이 질문에 답하기 위해 '고스트 인 더 루프(Ghost-in-the-Loop)'라고 불리는 시스템을 구축했습니다. 이 프레임워크는 휴머노이드 로봇이 인간 운영자에 의해 제어되는 상태와 완전히 인공지능에 의해 구동되는 상태 사이를, 외형과 소리가 완전히 동일하게 유지하면서도 매끄럽게 전환할 수 있도록 합니다. 화면으로 된 얼굴과 주변을 볼 수 있는 카메라를 갖춘 유트리 디(Unitree G1) 모델이 무대 역할을 합니다. 인간이 제어할 때, 운영자는 헤드셋을 착용하여 로봇이 보는 것을 보고 모션 센서를 사용하여 로봇의 손과 얼굴을 유도합니다. 시스템이 AI 모드로 전환되면, 로봇은 대화를 듣고 생성형 모델을 사용하여 인간 제어 버전과 동일한 시각적 및 청각적 스타일을 맞추며 자신의 목소리, 얼굴 움직임, 손짓을 만들어냅니다. 목표는 어느 쪽이 더 나은지를 보는 것이 아니라, 인간 관찰자가 그 차이를 식별할 수 있는지 확인하는 것이었습니다.

이를 테스트하기 위해 연구팀은 로봇이 대화하는 모습을 담은 일련의 짧은 영상 클립들을 제작했습니다. 그들은 일상적인 대화부터 과업 중심의 토론에 이르기까지 각각 5초에서 40초 길이의 8가지 서로 다른 상호작용을 기록했습니다. 이 클립 중 절반은 인간 텔레오퍼레이터가 로봇을 제어했습니다. 나머지 절반은 AI 시스템이 행동을 생성했습니다. 결정적으로, 로봇의 목소리, 얼굴, 몸은 모든 클립에서 일관되게 유지되었으므로, 변수는 오직 제어의 출처뿐이었습니다. 연구진은 50명의 사람들을 온라인으로 초대하여 이 영상들을 시청하게 했습니다. 각 클립을 본 후, 참가자들은 로봇이 인간에 의해 구동되는지 컴퓨터에 의해 구동되는지를 결정하고, 확신도를 -10(확실한 AI)에서 +10(확실한 인간) 사이의 척도로 평가했습니다. 또한 그들은 왜 그렇게 느꼈는지 이유를 설명하도록 요청받았습니다.

결과는 이러한 짧은 순간 동안 인간과 기계 사이의 경계가 놀라울 정도로 모호하다는 것을 시사합니다. 참가자들은 두 제어 출처를 구별하는 데 상당한 어려움을 겪었습니다. 평균적으로 그들의 평가는 인간 제어 클립과 AI 제어 클립 사이에서 거의 변화가 없었으며, 그 차이는 통계적으로 무작위 추측과 구별할 수 없을 정도로 작았습니다. 이 연구는 짧은 상호작용의 경우, 사람들이 로봇이 사람에 의해 조종되는지 아니면 알고리즘에 의해 구동되는지 확실히 알 수 없음을 나타냅니다. 연구진이 참가자들이 실제로 무엇을 생각하고 있었는지 살펴보았을 때, 명확한 패턴이 나타났습니다. 판단을 내릴 수 있다고 느낀 이들은 로봇 행동의 전반적인 자연스러움에 크게 의존했습니다. 그들은 대화의 타이밍, 움직임의 리듬, 그리고 목소리와 얼굴 표정, 손짓이 모두 조화롭게 어우러지는지에 주의를 기울였습니다.

로봇의 움직임이 뻣뻣하거나, 타이밍이 어긋나거나, 신체의 각 부분이 목소리와 조화를 이루지 못한다고 느껴질 때 참가자들은 AI라고 추측할 가능성이 높았습니다. 반대로, 제스처와 표정이 언어와 완벽하게 일치하는 일관된 흐름을 보일 때, 사람들은 인간이 뒤에서 조종하고 있다고 믿을 가능성이 높았습니다. 이것은 AI가 완벽했다는 의미가 아니라, AI 성능의 결함이 빠른 눈길로는 놓칠 만큼 미세했다는 것을 의미합니다. 이 연구는 우리가 에이전시(주체성)를 감지하는 능력이 특정 기술에 달려 있다기보다, 성능의 일관성에 달려 있음을 시사합니다. 로봇이 하나의 통합된 전체로서 행동할 때, 뇌는 그것을 단일한 에이전트로 받아들입니다. 그 에이전트가 살과 피인지 코드인지는 상관없이 말입니다.

이 예비 연구는 미래의 로봇을 설계하는 방식에 있어 새로운 장을 엽니다. 이는 가까운 미래에 사용자가 짧은 대화 중에 로봇이 진짜인지 가짜인지 끊임없이 의심할 필요가 없을 수도 있음을 암시합니다. 대신, 초점은 이러한 시스템이 어떻게 인간 지능과 인공 지능을 결합할 수 있는지로 옮겨갈 수 있습니다. 예를 들어, 대화가 복잡해지면 인간이 개입하고, 일상적인 부분은 AI가 처리하도록 하는 방식입니다. 연구진은 이들의 발견이 이러한 짧고 구조화된 클립에 국한된 것이며, 더 길고 복잡한 상호작용은 다른 패턴을 드러낼 수 있다고 언급했습니다. 현재로서는, 로봇이 말하고, 미소 짓고, 충분한 일관성을 가지고 움직일 때 인간의 정신은 그것을 파트너로 기꺼이 받아들인다는 점을 이 연구가 확인해주고 있으며, 그 에이전시의 진정한 본질은 고요한 미스터리로 남겨둡니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →