← 최신 논문
💻 computer science

ViBe: Visual Behavior Adaptation for Perceptive Humanoid Whole-Body Control

ViBe는 저차원 어댑터(low-rank adapters)를 통해 작업 관련 시각적 피드백을 이식함으로써 인지적 휴머노이드 전신 제어를 위해 모션 트래커를 적응시키는 파라미터 효율적인 사후 학습 프레임워크이며, 이를 통해 다양한 보행 및 조작 작업에 걸쳐 견고한 제로샷 심투리얼(sim-to-real) 전이를 가능하게 한다.

원저자: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

게시일 2026-09-10
📖 5 분 읽기🧠 심층 분석

원저자: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간처럼 걷고 움직이는 로봇은 오랫동안 공학의 목표였으나, 이를 실제 세상에서 구현하는 것은 두 가지 뚜렷한 부분으로 이루어진 난제였습니다. 첫째는 인간의 움직임을 모방하는 능력인데, 연구자들은 방대한 인간 동작 데이터를 복제하도록 기계를 훈련함으로써 이 기술을 숙달해 왔습니다. 이러한 "트래커(trackers)"들은 정해진 대본을 따르는 데 탁월하며, 평평하고 예측 가능한 지면 위에서 팔다리를 자연스럽고 유연하게 움직입니다. 그러나 이들은 의도적으로 주변 환경을 보지 못하도록 설계되었습니다. 즉, 이들은 연석이나 공, 혹은 상자를 보지 못합니다. 둘째는 세상을 인지하고 그에 반응하는 능력입니다. 전통적으로 엔지니어들은 이를 해결하기 위해 별도의 '플래너(planner)' 역할을 하는 시스템을 구축했습니다. 이 시스템은 환경을 관찰하고 로봇이 무엇을 해야 할지 결정한 다음, 눈먼 트래커에게 그 계획을 실행하라고 명령합니다. 이러한 분리 방식은 효과적이긴 하지만, 하나의 간극을 만들어냅니다. 트래커는 돌을 피하기 위해 발을 옮기거나 날아오는 물체를 피하기 위해 몸을 비트는 것과 같은 작고 즉각적인 조정을 할 수 없는데, 이는 위에서 내려오는 지시를 기다려야 하기 때문입니다. 인간이 생각 없이도 비틀거림을 회복하는 것과 같은 시각적 반사 신경이 결량되어 있는 것입니다.

남가주대학교(USC)의 연구팀은 이 간극을 메울 수 있는 새로운 방법을 개발하여, 로봇이 움직이는 동안 직접 보고 반응할 수 있게 했습니다. 그들은 이 시스템을 ViBe라고 부르며, 이는 이미 인간처럼 걷도록 훈련된 로봇에게 처음부터 걷는 법을 다시 배울 필요 없이, 보는 것에 따라 움직임을 적응시킬 수 있는 능력을 부여하는 방법입니다. 새로운 뇌나 새로운 플래너를 만드는 대신, 그들은 로봇의 눈과 근육 사이에 작고 효율적인 인터페이스를 삽입했습니다. 이 인터페이스는 작업에 중요한 특정 시각적 세부 사항(예: 연석의 가장자리나 공의 위치)을 골라내어 그 정보를 로봇의 움직임 시스템에 직접 전달하는 법을 학습합니다. 그 결과, 이 기계는 원래 배웠던 자연스러운 인간형 동작을 유지하면서도, 울퉁불퉁한 지면 위에서 파쿠르를 하거나, 날아오는 공을 피하거나, 손에 든 큐브의 방향을 바꾸는 것과 같은 복잡하고 역동적인 과업을 실제 환경에서 수행할 수 있게 되었습니다.

연구진은 이미 평지에서 인간의 동작을 완벽하게 추적하도록 학습된 로봇에서 시작했습니다. 이 로봇는 걷는 단계를 안내하기 위해 카메라 이미지를 사용하지 않는다는 의미에서 "눈이 먼" 상태였으며, 단순히 미리 설정된 움직임의 순서를 따랐습니다. 이 로봇에게 시각을 부여하기 위해 연구팀은 이미 수백만 장의 이미지로부터 사물과 장면을 인식하도록 학습된 사전 훈련된 시각 시스템을 부착했습니다. 그러나 단순히 로봇에게 카메라 피드를 보여주는 것만으로는 충분하지 않았습니다. 로봇은 이미지의 어느 부분이 중요한지를 알아야 했습니다. 픽셀의 벽은 너무 많은 정보를 담고 있으며, 그중 대부분은 걷거나 피하는 작업과는 무관합니다. 연구팀은 필터처럼 작동하는 작은 모듈인 '추출기(extractor)'를 설계했습니다. 이 추출기는 로봇의 현재 신체 위치와 수행하려는 과업을 살펴본 뒤, 그 맥락을 사용하여 카메라 이미지를 스캔하고 가장 유용한 시각적 단서만을 선택합니다. 만약 로봇이 연석을 뛰어넘으려 한다면 추출기는 연석의 가장자리에 집중합니다. 만약 공을 잡으려 한다면 공의 궤적에 집중합니다.

이렇게 선택된 시각 정보는 로봇의 내부 설정 중 아주 적은 부분만을 변경하는 기술을 통해 로봇의 움직임 시스템에 주입됩니다. 연구진은 원래의 동작 트래커를 고정시켜 자연스러운 인간형 보행을 보존하면서, 새로운 시각 데이터를 전달하는 작은 경로들만을 조정했습니다. 이러한 접근 방식을 통해 연구진은 로봇이 시행착오를 거치며 성공적인 행동에 대해 보상을 받는 '강화 학습(reinforcement learning)'이라는 방법을 사용하여 특정 과업을 훈련할 수 있었습니다. 그들은 네 가지 매우 다른 도전 과제로 이 시스템을 테스트했습니다. 한 가지 과업에서 로봇은 연석과 울퉁불퉁한 지형 위를 걷고 달려야 했으며, 넘어지지 않기 위해 실시간으로 발의 위치를 조정해야 했습니다. 또 다른 과업에서는 틈 사이를 뛰어넘고 좁은 표면에 착지하는 파쿠르를 수행해야 했습니다. 세 번째 과업은 큰 물체를 옮기는 것으로, 로봇은 여행 가방이나 쓰레기통을 들고 있을 때 균형과 움켜쥐는 힘을 조절해야 했습니다. 마지막 과제는 피구였는데, 로봇은 가만히 서서 자신을 향해 날아오는 공을 지켜보며 넘어지지 않고 몸을 움직여 피해야 했습니다.

결과는 이 방법이 매우 효과적임을 보여주었습니다. 실제 환경에서 테스트했을 때, 로봇은 실제 로봇이 가질 수 없는 완벽하고 특권적인 환경 정보를 가진 시스템의 성능과 종종 일치할 정도로 높은 성공률을 보이며 과업을 수행했습니다. 예를 들어, 파쿠르 과업에서 로봇은 시각 정보가 없는 버전의 동일한 로봇이 충돌하여 넘어지게 만든 장애물들을 성공적으로 통과했습니다. 피구 시나리오에서 로봇은 균형을 유지하면서 공을 피하는 법을 배웠으며, 이는 통제된 방식으로 반응하며 표준 서 있는 자세에서 벗어나야 하는 작업이었습니다. 또한 연구진은 이 시스템이 견고하다는 것을 발견했습니다. 밝은 햇빛에서 어두운 실내 조건으로 조명이 바뀌거나 물체의 색상이 변하더라도 잘 작동했습니다. 이는 로봇이 단순히 특정 색상이나 질감을 암기하는 것이 아니라, 사물의 형태와 위치를 이해하도록 학습했음을 시사합니다.

로봇이 정말로 본 것에 반응하는지를 증명하기 위해, 연구진은 시각 기능이 없는 버전과 비교 실험을 진행했습니다. 시각이 없는 로봇은 동일한 기초 동작 훈련을 받았음에도 불구하고 연석을 통과하거나 장애물을 피하는 데 실패하며, 종종 경로를 벗어나거나 물체와 충돌했습니다. 반면 시각을 갖춘 버전은 움직임에 있어 정밀하고 국소적인 수정을 가했습니다. 로봇은 연석 위에 발을 놓기 위해 발의 위치를 조정했고, 무거운 물체를 들기 위해 무게 중심을 옮겼으며, 공을 피하기 위해 몸을 움직였습니다. 이것들은 크고 미리 계획된 기동이 아니라, 로봇이 움직이는 동안 발생하는 작고 즉각적인 조정들이었습니다. 또한 연구팀은 이 시각적 적응이 간단한 상위 수준의 플래너와 결합될 수 있음을 입증했습니다. 로봇이 특정 색상의 면이 위로 오도록 큐브의 방향을 바꾸어야 하는 과업에서, 매우 기본적인 플래너는 단순히 일련의 움직임을 선택했습니다. 그러면 로봇의 시각 시스템이 큐브를 찾고, 잡고, 큐브가 예상과 약간 다른 위치에 있더라도 성공적으로 움직일 수 있도록 움켜쥐는 힘을 조절하는 어려운 작업을 처리했습니다.

이 연구는 로봇이 세상과 상호작용하는 법을 배우는 방식의 중대한 변화를 강조합니다. 매번 새로운 과업을 위해 로봇을 처음부터 다시 훈련시키거나, 복잡하고 분리된 계획 시스템에 의존하는 대신, 이미 움직이는 법을 아는 로봇에게 보고 반응하는 능력을 줄 수 있습니다. 연구진은 핵심적인 움직임 기술을 온전히 유지하면서 시각과 행동 사이의 작은 연결 고리만을 훈련함으로써, 자연스러운 동작을 유지하면서도 실제 세상의 예측 불가능성을 다룰 수 있는 로봇을 만들 수 있음을 보여주었습니다. 이 시스템이 완벽하지는 않으며 빠르게 움직이는 물체나 특이한 시각적 방해 요소에 혼란을 느낄 수도 있지만, 이는 강력한 진전입니다. 이는 로봇이 모든 것을 처음부터 배워야 하는 것이 아니라, 무엇을 보아야 하는지를 배움으로써 기존의 기술을 새로운 상황에 적응시킬 수 있음을 입증합니다. 이 접근 방식은 인간이 기대하는 것과 같은 유연함과 적응력을 가지고 우리 세상 속을 움직이는 휴머노이드를 만들기 위한 실질적인 경로를 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →