← 최신 논문
🤖 AI

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

HIL-UMI는 휴대용 범용 조작 인터페이스(Universal Manipulation Interface)와 정책 가이드 에너지 점수(policy-guided energy score)를 활용하여 표적 데이터를 효율적으로 수집하고 이점 추정치(advantage estimators)를 정교화함으로써, 정적인 지도 미세 조정(supervised fine-tuning)의 한계를 극복하고 물리적 로봇 배치 없이도 확장 가능한 반복적 개선을 가능하게 하는, 사후 훈련 단계의 시각-언어-행동(Vision-Language-Action) 모델을 위한 로봇 없는 인간 참여형(human-in-the-loop) 프레임워크를 도입한다.

원저자: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

게시일 2026-09-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 시각과 언어를 통해 세상을 이해하는 능력이 점점 더 향상되고 있으며, 방대한 양의 데이터를 학습하여 복잡한 과업을 수행할 수 있게 되었습니다. 그러나 이러한 인공지능 시스템이 일반적인 영역에서 학습한 내용과 실제 주방, 작업장 또는 공장에서 실제로 수행할 수 있는 능력 사이에는 여전히 상당한 격차가 존재합니다. 로봇이 실제 환경에 배치되면 이전에 본 적 없는 상황에 직면하는 경우가 많으며, 이는 실수를 유발하고 그 실수가 누적되어 결국 과업 실패로 이어지기도 합니다. 이를 해결하기 위해 연구자들은 전통적으로 "지도 미세 조정(supervised fine-tuning)"에 의존해 왔는데, 이는 인간이 로봇 자체에서 올바른 동작을 시연하면 기계가 이를 모방하도록 학습하는 과정입니다. 이 방식은 도움이 되기는 하지만, 느리고 비용이 많이 들며, 로봇이 문제를 해결하기 위해 스스로 시도하는 과정에서 저지르는 실수로부터 배우는 것이 아니라 주어진 예시로부터만 학습하기 때문에 로봇이 가장 실패하기 쉬운 특정 순간들을 놓치는 경우가 많습니다.

한 연구팀은 로봇이 학습하는 방식에 변화를 주는 HIL-UMI라는 새로운 접근법을 개발하였는데, 이는 훈련 단계에서 로봇이 반드시 존재할 필요성을 없앴습니다. 로봇이 고군분투하는 모습을 지켜보고 수정하는 대신, 이 방법은 로봇의 그리퍼처럼 생겼지만 인간 운영자가 잡고 조작할 수 있는 휴대용 핸드헬드 장치를 사용합니다. 운영자는 이 장치로 과업을 수행하며, 동시에 로봇의 현재 "두뇌"를 실행 중인 컴퓨터 프로그램은 동일한 비디오 피드를 보면서 인간이 다음에 무엇을 할지 예측하려고 시도합니다. 이 시스템은 로봇을 움직이지 않으며, 단지 인간의 실제 움직임과 자신의 예측을 비교할 뿐입니다. 인간이 예상치 못한 행동을 할 때, 시스템은 해당 순간을 학습 기회로 간과하지 않고 기록합니다. 이를 통해 로봇은 과업을 물리적으로 직접 시도하며 실패할 위험을 감수하지 않고도 자신의 사각지대로부터 배울 수 있습니다.

이 방법의 핵심은 관찰과 정교화의 연속적인 루프에 있습니다. 인간이 과업을 시연하는 동안 컴퓨터는 자신의 예측이 인간의 행동과 일치하는지 끊임없이 확인합니다. 만약 컴퓨터의 추측이 인간이 하고 있는 행동과 크게 다르다면, 시스템은 자신이 "사각지대(blind spot)"—즉, 로봇이 잘 이해하지 못하는 상황—에 처해 있음을 인지합니다. 그 시점에서 인간에게 시연을 계속하도록 요청하고, 시스템은 이 특정 세그먼트의 데이터를 저장합니다. 연구진은 또한 지능의 두 번째 층을 추가했습니다. 바로 과업이 얼마나 잘 진행되고 있는지를 판단하는 방법입니다. 만약 시스템이 인간의 움직임은 올바르더라도 과업이 잘못 진행되고 있다고 판단하면, 그 순간을 기록하여 컴퓨터가 성공 여부를 더 잘 판단하는 법을 배우도록 돕습니다. 이 두 가지 유형의 데이터를 결합함으로써, 로봇은 단순히 무엇을 해야 하는지뿐만 아니라 어떤 행동이 일을 끝내는 데 가장 유용한지도 배우게 됩니다.

이 아이디어를 테스트하기 위해 연구진은 표준 로봇 팔을 사용하여 네 가지 서로 다른 실제 과업에 이를 적용했습니다. 과업은 수건 접기, 테이블 정리하기, 큐브 쌓기, 그리고 종이에 정밀하게 도장 찍기 등 다양했습니다. 모든 경우에서 로봇은 기본적인 지침 세트로 시작하여 새로운 핸드헬드 방식을 이용한 여러 차례의 훈련 과정을 거쳤습니다. 결과는 기존 방식보다 명확한 개선을 보여주었습니다. 표준적인 훈련 기법들은 데이터를 더 추가해도 도움이 되지 않는 한계점에 부딪히는 경우가 많았으나, 새로운 방식은 로봇이 매 훈련 회차마다 지속적으로 발전할 수 있게 해주었습니다. 로봇은 이전보다 더 길고 복잡한 일련의 동작과 섬세하고 정밀한 움직임을 더 효과적으로 처리하는 법을 배웠습니다.

이 방법의 가장 놀라운 발견 중 หนึ่ง은 새로운 정보를 수집하는 속도였습니다. 로봇이 물리적으로 움직이고 인간이 이를 교정해주어야 하는 전통적인 방식은 느리고 규모를 키우기 어렵습니다. 반면, 핸드헬드 방식은 필요한 데이터를 수집하는 데 있어 5배 이상 빠른 것으로 나타났습니다. 이는 인간 운영자가 로봇이 리셋되기를 기다리거나 무거운 기계에 인간이 직접 개입할 때까지 기다릴 필요 없이 장치를 자유롭게 움직일 수 있기 때문입니다. 시스템은 로봇에게 도움이 필요한 정확한 순간을 성공적으로 식별해 냈으며, 로봇이 이미 이해하고 있는 부분에 시간을 낭비하는 대신 가장 어려운 부분에 훈련을 집중했습니다.

이 연구는 이 접근법이 다양한 장소와 다양한 사람들에 의해 로봇에게 새로운 기술을 가르칠 수 있는 확장 가능한 경로를 제공함을 시사합니다. 훈련이 핸드헬드 장치에서 이루어지기 때문에, 여러 운영자가 서로 다른 곳에서 동시에 데이터를 수집하여 동일한 로봇의 학습 과정으로 전달할 수 있습니다. 연구진은 로봇의 지식 격차에 집중하고 진척도를 보상하는 시스템을 사용함으로써, 더 신뢰할 수 있고 효율적인 로봇을 만들 수 있다는 것을 발견했습니다. 이 연구는 로봇이 반복적이고 비용이 많이 들며 시간이 오래 걸리는 물리적 실험 없이도 새로운 환경에 빠르게 적응할 수 있는 미래를 향한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →