ReLI: Cross-Lingual Language-to-Action Grounding for Human-Robot Interaction
ReLI는 대규모 파운데이션 모델을 적응시켜 자율 에이전트가 고리소스 언어에만 국한된 기존 시스템의 한계를 극복하고, 저리소스 및 크리올 변체를 포함한 140개 이상의 다양한 언어에 걸쳐 자연어 지침을 이해하고, 의미론적으로 추론하며, 효과적으로 과업을 수행할 수 있도록 하는 교차 언어 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇이 가장 널리 쓰이는 언어부터 작은 공동체에서 사용되는 희귀한 방언에 이르기까지 어떤 언어로 된 명령도 이해할 수 있는 세상을 상상해 보십시오. 수십 년 동안 자연스러운 인간-로봇 협업의 꿈은 단순한 장벽에 가로막혀 왔습니다. 바로 언어입니다. 현대의 로봇들은 주변 환경을 보고 그 안을 움직이는 능력은 점점 더 향상되고 있지만, 영어 나 중국어와 같은 소수의 주요 언어만을 이해하도록 주로 훈련되어 왔습니다. 이러한 한계는 다른 언어, 방언, 또는 크레올(creole)을 사용하는 수십억 명의 잠재적 사용자들을 배제하며, 결과적으로 그들을 자동화의 미래로부터 소외시킵니다. 인간-로봇 상호작용 분야는 말하거나 글로 된 요청을 물리적 행동으로 변환하는 과정인 '그라운딩(grounding)'이라 불리는 능력에 의존합니다. 지금까지 이 변환은 고자원 언어를 사용하는 사람들에게만 잘 작동하는 일방통행이었으며, 나머지 세상은 뒤처지게 만들었습니다.
연구진은 이러한 언어적 장벽을 허물기 위해 설계된 ReLI라는 새로운 시스템을 개발했습니다. ReLI는 자율 에이전트가 언어에 관계없이 자연스럽게 대화하고, 환경에 대해 추론하며, 과업을 수행할 수 있도록 해줍니다. 이 시스템은 사용자의 말을 영어로 먼저 번역하는 것에 의존하지 않으며, 로봇을 매번 새로운 언어에 맞춰 재학습시킬 필요도 없습니다. 대신, 이 시스템은 수백 가지의 서로 다른 언어에 걸쳐 단어 뒤에 숨겨진 의미를 이해하는 대규모 사전 학습된 컴퓨터 모델의 내재적 능력을 활용합니다. 이 언어 모델을 로봇이 사물과 공간을 '볼' 수 있게 해주는 시각 센서와 결합함으로써, ReLI는 희귀한 방언으로 된 "빨간 의자를 찾아줘"와 같은 명령을 받아, 사용자가 기술적인 코드를 알거나 지배적인 세계 언어를 구사할 필요 없이 정밀한 물리적 움직임으로 바꿀 수 있습니다.
연구진은 시뮬레이션 환경과 카메라 및 깊이 센서를 장착한 바퀴형 로봇 및 4족 보행 로봇을 이용한 실제 환경 모두에서 이 시스템을 테스트했습니다. 연구진은 로봇에게 140개 이상의 다양한 언어로 구성된 70,000회 이상의 다회차 대화를 부여하며 도전 과제를 제시했습니다. 이 언어들은 방대한 디지털 데이터를 가진 고자원 언어, 데이터가 제한적인 저자원 언어, 그리고 기술에서 종종 소외되는 취약한 언어나 크레올을 포함하여 세계의 언어적 다양성을 폭넓게 나타낼 수 있도록 신중하게 선정되었습니다. 과업은 "특정 거리만큼 앞으로 이동하라"와 같은 간단한 단일 단계 명령부터, 로봇이 방을 통과해 이동하고, 설명을 바탕으로 물체를 식이고, 찾은 것을 보고하는 복잡한 다단계 미션에 이르기까지 다양했습니다.
결과는 이 광범위한 언어적 지형 전반에 걸쳐 시스템이 놀라운 일관성을 보였음을 입증했습니다. 테스트된 거의 모든 언어에서 로봇은 사용자의 의도를 정확히 이해하고 과업을 수행했으며, 성공률은 83%를 초과했습니다. 많은 주요 언어의 경우 성공률은 97% 이상으로 올라갔습니다. 가장 취약하고 자원이 부족한 언어들에 대해서도 시스템은 높은 수준의 정확도를 유지하며 명령을 성공적으로 파싱하고 로봇을 목표 지점으로 안내했습니다. 명령을 처리하고 로봇이 움직이기 시작할 때까지 걸린 시간은 주요 세계 언어로 명령을 내렸는지 혹은 희귀한 방언으로 내렸는지와 상관없이 평균 2.1초에서 2.6초 사이로 안정적이었습니다. 이러한 속도와 신뢰성은 이 시스템이 단순히 이론적인 개념이 아니라 실시간으로 작동 가능한 실용적인 도구임을 시사합니다.
기술의 진정한 포용성을 보장하기 위해 연구진은 사용자가 모국어로 로봇과 상호작용하는 인간 참여자 연구도 실시했습니다. 13개 언어에 능통한 34명의 평가자가 실제 실험실 환경에서 시스템을 테스트했습니다. 그들은 상호작용이 자연스럽고 반응성이 좋다고 보고했으며, 대다수는 사용하는 언어에 따라 성능 차이를 느끼지 못했다고 언급했습니다. 이 발견은 매우 중요한데, 이는 시스템이 특정 언어를 선호하지 않으며, 특정 언어 사용자가 더 열악한 경험을 하게 되는 숨겨진 격차를 만들지 않는다는 것을 나타내기 때문입니다. 시스템은 사용자가 한 문장에서 두 가지 언어를 혼용하는 코드 스위칭(code-switching)을 성공적으로 처리했으며, "음식이 요리되는 곳"과 같이 기능만으로 묘사된 위치로 항해하는 복잡한 공간 추론도 관리할 수 있었습니다.
이 성취의 핵심은 시스템이 언어를 행동에 연결하는 방식에 있습니다. 사용자가 말하거나 타이핑하여 명령을 내리면, 시스템은 먼저 입력을 정규화하여 필요한 경우 음성을 텍스트로 변환한 다음, 로봇의 두뇌 역할을 하는 대규모 언어 모델로 전달합니다. 이 모델은 명령의 의도를 해석하여 논리적 단계의 순서로 분해합니다. 그런 다음 로봇의 시각 센서를 참조하여 명령에 언급된 사물과 공간을 식별합니다. 만약 사용자가 특정 의자로 가라고 요청하면, 시스템은 컴퓨터 비전을 사용하여 방 안에서 그 의자를 찾고, 3차원 공간에서의 정확한 위치를 결정하며, 로봇이 그곳에 도달하기 위해 가야 할 경로를 계산합니다. 마지막으로, 시스템은 계획을 생성하며, 안전을 위해 복잡하거나 장거리 이동을 수행하기 전에는 종종 사용자의 확인을 요청합니다. 이 모든 과정은 명시적인 번역이나 각 새로운 언어에 대한 특화된 훈련 없이도 인간의 사고와 기계의 행동 사이의 간극을 매끄럽게 메우며 진행됩니다.
연구는 또한 이 기술의 한계를 탐구하여, 시스템이 견고하긴 하지만 결코 완벽하지는 않다는 점을 밝혔습니다. 가장 큰 어려움은 로봇이 매우 유사해 보이는 사물을 식별해야 하거나, 시각적 환경이 복잡하여 목표물을 구별하기 어려운 상황에서 발생했습니다. 또한, 복잡한 다단계 시퀀스를 통해 항해해야 하는 과업은 추론 과정에서 오류가 발생할 기회가 더 많기 때문에 단순하고 직접적인 명령보다 오류가 발생하기 쉬웠습니다. 그러나 이러한 어려운 시나리오에서도 시스템의 성능은 강력하게 유지되었으며, 연구진은 오류가 주로 로봇 센서의 물리적 한계나 환경의 복잡성과 관련이 있으며 언어 이해의 실패 때문은 아니라고 언급했습니다.
단일 프레임워크가 140개 이상의 언어를 높은 정확도로 처리할 수 있음을 보여줌으로써, 이 연구는 인간-로봇 상호작용의 새로운 길을 제시합니다. 이는 로봇이 유용해지기 위해 특정 언어를 배워야 한다는 관념에서 벗어나, 로봇이 사용자의 모국어에 적응하는 모델로 나아가는 것입니다. 연구진은 자신들의 데이터와 코드를 공개하여 다른 이들이 이 토대 위에 구축할 수 있도록 초대했습니다. 궁극적인 목표는 단순히 많은 언어를 말할 수 있는 로봇을 만드는 것이 아니라, 기계를 명령하는 능력이 누구나, 어디서나, 자신이 가장 잘 아는 언어로 누릴 수 있는 보편적 권리가 되는 미래를 만드는 것입니다. 이러한 변화는 자동화에 대한 접근성을 민주화하여, 로봇 공학의 혜택이 디지털 엘리트의 언어를 사용하는 사람들뿐만 아니라 인류 전체와 공유될 수 있도록 보장할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.