DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA
DeicticVLA는 언어, 시각-언어, 그리고 시각적 지시 모드를 텍스트 프롬프트와 지시적 마스크(deictic masks)로 정규화함으로써 이를 단일 시각-언어-행동 모델로 통합하며, 언어 전용 베이스라인 모델과 비교하여 보지 못한 객체와 표현에 대해 우수한 일반화 성능을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
주방에 앉아 도움을 줄 준비가 된 로봇 팔을 상상해 보십시오. 인간은 로봇에게 "왼쪽에 있는 빨간 컵을 집어 들어"라고 말하여 할 일을 알려줄 수 있습니다. 이는 단순해 보이지만, 기계에게 세상은 종종 수많은 빨간 컵이나 거의 동일하게 보이는 컵들로 가득 찬 혼란스러운 공간입니다. 만약 인간이 "왼쪽에서 세 번째 빨간 컵, 파란 냅킨 옆에 있는 것을 집어 들어"라고 더 구체적으로 말한다면, 로봇은 여전히 혼란을 겪을 수 있습니다. 현대의 로봇들은 언어를 이해하는 능력이 좋아지고 있지만, 지시가 너무 상세하거나 눈앞의 물체가 학습 과정에서 본 정확한 사진과 일치하지 않을 때 종종 어려움을 겪습니다. 로봇은 방금 인간이 말한 특정 단어를 무시하고, 단지 자신이 더 익숙하게 느끼는 물체를 잡는다는 이유만으로 엉뚱한 아이템을 집을 수도 있습니다.
이를 해결하기 위해, 연구자들은 기계와 소통하는 다른 방법인 '가리키는 제스처(pointing gesture)'를 탐구해 왔습니다. 마치 사람이 손가락으로 물체를 가리키며 "이것을 집어 들어"라고 말하는 것처럼, 로봇도 화면을 클릭하는 것을 직접적인 명령으로 이해하도록 학습될 수 있습니다. '직시적 제스처(deictic gesture)'라고 알려진 이 접근 방식은 대상이 무엇인지 명확히 보여줌으로써 언어가 주는 혼란을 제거합니다. 그러나 지금까지 로봇은 대개 언어에만 귀를 기울이거나, 언어를 들으면서 동시에 가리키는 동작을 결합하여 듣도록 학습되었을 뿐, 이 모든 소통 방식을 한꺼번에 처리하도록 훈련된 경우는 드물었습니다. 새로운 연구는 이러한 방식들을 통합하는 시스템을 소개하며, 하나의 로봇 두뇌가 문장을 듣는 것, 문장을 들으면서 동시에 가리키는 동작을 수행하는 것, 또는 말 없이 단순히 가리키는 동작만을 따르는 것 사이를 매끄럽게 전환할 수 있도록 해줍니다.
연구진은 '비전-언어-행동(Vision-Language-Action)' 모델이라는 유형의 인공지능을 사용하여 'DeicticVLA'라고 명명한 시스템을 개발했습니다. 이러한 모델은 수백만 권의 책을 읽고 수백만 장의 이미지를 본 로봇의 두뇌와 같으며, 자신이 보는 것과 해야 할 행동을 연결하는 법을 배웁니다. 과제는 이 두뇌가 세 가지 다른 유형의 입력을 모두 수용할 수 있을 만큼 유연하게 만드는 것이었습니다: 텍자 명령, '이것'이나 '저것'과 같은 단어가 포함된 텍스트 명령과 가리키는 제스처의 결합, 또는 단지 가리키는 제스처만 있는 경우입니다. 첫 번째 모드에서 사용자는 전체 문장을 입력합니다. 두 번째에서는 '이것'이나 '저기'와 같은 단어가 포함된 문장을 입력하면서 화면을 클릭하여 해당 단어가 무엇을 지칭하는지 정의합니다. 세 번째에서는 아무 말 없이 사용자가 옮기고자 하는 물체를 클릭하고 그것이 갈 위치를 클릭합니다.
이를 구현하기 위해 연구진은 이 세 가지 서로 다른 입력을 모두 동일한 내부 형식으로 변환하는 번역 단계를 만들었습니다. 사용자가 화면을 클릭하면, 시스템은 강력한 이미지 분석 도구를 사용하여 단일 클릭을 정밀한 윤곽선, 즉 인간이 접촉하고 있는 대상을 정확히 강조하는 마스크(mask)로 변환합니다. 이 마스크는 텍스트 프롬프트와 결합됩니다. 만약 사용자가 말을 했다면 텍스트 프롬프트는 그들의 말입니다. 만약 클릭만 했다면, 시스템은 "시각적 지시를 따르라"와 같은 기본 문구를 사용합니다. 이렇게 함으로써 로봇의 두뇌는 항상 일관된 패키지, 즉 텍스트 지시와 대상의 시각적 강조 표시를 받게 됩니다. 연구진은 이 시각적 강조 표시를 로봇의 두뇌에 전달하는 다양한 방법을 테스트했습니다. 그들은 카메라 이미지 위에 물체를 박스로 그리거나, 물체를 돋보이게 하기 위해 나머지 장면을 흐리게 처리하거나, 혹은 윤곽선을 별도의 레이어로 만들어 이미지와 함께 프로세싱하는 방식을 시도했습니다.
연구팀은 먼저 디지털 세계에서 로봇이 아무것도 망가뜨리지 않고 수천 번 연습할 수 있는 시뮬레이션 환경에서 이 아이디어들을 테스트했습니다. 그 결과, 시스템이 세 가지 명령 모드를 동시에 처리하는 법을 성공적으로 학습할 수 있음을 발견했습니다. 로봇에게 가구 배치가 새로운 물체를 집으라는 명령이나 새로운 공간적 설명을 가진 물체를 식별하라는 등 한 번도 본 적 없는 과제를 주었을 때, 가리키는 방식이 언어만 사용하는 것보다 훨씬 효과적이었습니다. 동일한 검은색 그릇들이 있는 상황에서 특정 참조 물체 옆에 있는 것을 집어야 했던 한 테스트에서, 언어 전용 방식은 대부분 실패했습니다. 그러나 사용자가 올바른 그릇을 가리켰을 때, 로봇은 거의 매번 성공했습니다. 이 연구는 2단계 학습법이 결정적이었음을 보여주었습니다. 즉, 로봇은 먼저 텍스트 명령을 따르는 법을 배우고, 그 다음 가리키는 제스처와 명령을 결합하는 법을 배웠습니다. 이 순서 덕분에 로봇은 언어를 이해하는 능력을 유지하면서도 가리키는 동작을 따르는 새로운 기술을 얻을 수 있었습니다.
이것이 실제 세계에서도 작동하는지 확인하기 위해, 연구진은 로봇 팔, 카메라, 태블릿이 갖춰진 물리적 설정을 구축했습니다. 그들은 로봇에게 블록을 집고, 그릇에 담고, 인형을 정리하는 법을 가르쳤습니다. 연구진은 "가장 왼쪽" 블록을 집으라는 명령(오직 "가장 오른쪽" 명령만 학습했을 때)이나, 본 적 없는 특정 종류의 장난감을 옮기라는 명령 등 이전에 들어본 적 없는 지시로 테스트를 진행했습니다. 이러한 어려운 시나리오에서 언어에만 의존하는 로봇은 잘못 예측하거나 행동에 실패하며 고전했습니다. 하지만 사용자가 대상을 가리키면 로봇의 성공률은 급증했습니다. 완전히 새로운 카테고리의 인형을 대상으로 한 테스트에서, 언어 전용 로봇은 약 6분의 1의 성공률을 보였습니다. 반면, 가리키는 기반 방식은 완벽한 성공률을 달양했습니다. 로봇은 그 장난감의 이름이나 카테고리를 알 필요가 없었습니다. 그저 인간이 가리키는 곳을 보기만 하면 되었습니다.
결과는 인간-로봇 상호작용의 미래가 말하기와 가리키기 중 하나를 선택하는 것이 아니라, 두 가지를 동시에 사용할 수 있게 하는 데 있음을 시사합니다. 이 시스템을 통해 사용자는 문장으로 시작했다가, 로봇이 혼란스러워 보이면 단순히 가리켜서 명확히 할 수 있습니다. 또는 빠르고 일상적인 작업을 위해 말 없이 그냥 가리킬 수도 있습니다. 연구는 언어가 복잡한 아이디어를 설명하는 데 강력하지만, 무질서하고 변화하는 세상에서 특정 물체를 식별하는 데는 가리키는 것이 더 신뢰할 수 있는 방법임을 나타냅니다. 이러한 방식들을 단일 시스템으로 통합함으로써, 연구진은 인간이 기계를 안내하는 더 유연하고 견고한 방법을 만들어냈으며, 이를 통해 로봇이 우리가 말하는 것뿐만 아니라 우리가 의미하는 바까지 이해하도록 보장했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.