← 최신 논문
🤖 machine learning

REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

REFACTOR-VLA는 행동적 동등성 커널과 잠재 세계 모델을 통해 행동 파편들을 클러스터링함으로써 재사용 가능한 유형화된 운동 프로그램을 학습하는 웨이크/슬립(wake/sleep) 프레임워크로, 라이브러리 조건부 디코더와 모델 용량보다 클러스터링 품질을 우선시하는 학습 목적 함수를 통해 긴 호흡의 LIBERO 태스크에서 최첨단 성능을 달성합니다.

원저자: Riyaaz Shaik, Chandru Venkataraman

게시일 2026-09-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Riyaaz Shaik, Chandru Venkataraman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 세상을 보고 그 안에서 움직이는 능력은 점점 좋아지고 있지만, 인간이 아주 쉽게 해내는 복잡하고 다단계적인 작업에는 여전히 어려움을 겪고 있습니다. 사람이 샌드위치를 만들 때, 빵을 잡거나 버터를 바르거나 토마토를 썰기 위해 필요한 개별적인 근육의 미세한 움직임 하나하나를 일일이 생각하지는 않습니다. 대신, 그들은 쥐기, 바르기, 자르기와 같이 익숙한 동작들로 이루어진 정신적 라이브러리에 의존하여 이를 다양한 순서로 조합합니다. 현재 로봇을 위한 인공지능 모델들은 이러한 행동을 조직화하는 능력이 부족한 경우가 많습니다. 이들은 재사용 가능하고 잘 정의된 기술로 그룹화하기보다는, 대개 매 순간 발생하는 가공되지 않은 명령들을 생성하는 데 그칩니다. 이로 인해 로봇이 장기적인 작업을 계획하거나 자신이 학습한 내용을 설명하는 데 어려움을 겪게 됩니다. 연구자들은 이제 기계가 스스로의 기술 라이브러리를 구축하도록 가르쳐, 복잡한 업무를 재사용하고 결합할 수 있는 작고 관리 가능한 조각들로 분해할 수 있도록 하는 방법을 연구하고 있습니다.

애플의 연구진은 로봇에게 인간의 라벨 없이도 스스로 기술을 발견하도록 가르침으로써 이 문제를 해결하고자 하는 REFACTOR-VLA라는 새로운 시스템을 개발했습니다. 이 시스템은 마치 인간이 새로운 동작을 연습한 후 뇌가 기억을 정리할 수 있도록 휴식을 취하는 방식과 유사하게, 두 가지 교대로 진행되는 단계로 작동합니다. 첫 번째 단계에서 로봇은 특정 움직임의 시퀀스를 수행했을 때 다음에 어떤 일이 일어날지 예측하는 법을 배웁니다. 즉, 자신의 행동이 환경을 어떻게 변화시키는지 이해하며 세상에 대한 정신적 모델을 구축합니다. 두 번째 단계에서 시스템은 수집된 방대한 움직임 데이터를 살펴보고 패턴을 찾으려고 시듭ness니다. 시스템은 단순하지만 어려운 질문을 던집니다. "두 개의 서로 다른 움직임 시퀀스가 동일한 결과를 만들어내는가?" 만약 로봇이 컵을 집기 위해 팔을 원형으로 움직이든, 혹은 직선으로 움직이든, 시스템은 두 경로 모두 동일한 목표를 달성한다는 것을 인식해야 합니다.

이를 해결하기 위해 연구진은 동작의 외형이 아닌 동작의 결과(outcome)를 측정하는 특별한 도구를 만들었습니다. 시스템은 로봇이 움직이는 가공되지 않은 영상을 보는 대신, 학습된 정신적 모델 내에서 해당 동작을 시뮬레이션하여 로봇이 어디에 도달하고 어떤 보상을 얻는지 확인합니다. 만약 두 가지 서로 다른 움직임 경로가 동일한 최종 상태와 동일한 보상으로 이어진다면, 시스템은 이를 동등한 것으로 간주합니다. 그런 다음 이 유사한 경로들을 하나의 재사용 가능한 기술로 그룹화합니다. 일단 그룹이 형성되면, 시스템은 해당 기술의 공통된 패턴을 설명하는 단순하고 구조화된 프로그램을 작성하려고 시도합니다. 이 프로그램은 라이브러리에 추가됩니다. 로봇은 나중에 이 라이브러리를 사용하여 새로운 작업을 계획할 수 있으며, 모든 미세한 움직임을 처음부터 다시 계산하는 대신 이렇게 미리 패키징된 기술들을 호출하여 사용할 수 있습니다.

연구진은 시뮬레이션된 환경에서 물체를 움직이는 표준적인 로봇 작업들에 이 접근 방식을 테스트했습니다. 그들은 이 시스템이 학습하는 방식에 대해 놀라운 사실을 발견했습니다. 인공지능 분야의 일반적인 믿음은 모델을 더 크고 복잡하게 만들수록 성능이 항상 향상된다는 것입니다. 그러나 연구진이 월드 모델의 크기를 약 1억 8,800만 파라미터에서 4억 3,000만 파라미터로 늘렸을 때, 시스템은 오히려 모든 테스트 스위트에서 더 낮은 성능을 보였습니다. 더 큰 모델이 기술을 올바르게 조직화하는 데 실패한 것인데, 이는 단순히 컴퓨팅 파워를 추가하는 것이 해결책이 아님을 시사합니다.

대신, 성공의 핵심은 모델이 어떻게 훈련되었느냐에 있었습니다. 연구진은 초기 훈련 단계에서 특정 유형의 학습 목적 함수(learning objective)를 추가하는 것이 결과를 극적으로 개선한다는 것을 발견했습니다. 이 목적 함수는 시스템이 서로 다른 작업들을 더 명확하게 구별하도록 도와주어, 유사한 움직임들을 훨씬 더 효과적으로 그룹화할 수 있게 해주었습니다. 이 변화를 통해 시스템은 4개의 주요 테스트 스위트 모두에서 기존의 가장 강력한 방법들을 능가했으며, 평균 점수를 상당한 차이로 높였습니다. 시스템은 특정 작업에 대해 세 가지의 뚜렷하고 재사용 가능한 기술 라이브러리를 성공적으로 구축했으며, 이 라이브러리를 사용하는 로봇은 자신이 보았던 모든 시연(demonstration)을 이 새로운 기술들을 사용하여 다시 작성할 수 있었습니다.

또한 이 연구는 시스템이 기술을 찾는 능력이 분석하는 데이터의 유형에 크게 의존한다는 것을 보여주었습니다. 시스템은 "물체를 집어서 바구니에 놓아라"와 같은 언어 기반 지침의 라이브러리는 성공적으로 생성했지만, 가공되지 않은 운동 명령(motor commands) 자체에서는 재사용 가능한 패턴을 찾아내지 못했습니다. 이는 시스템이 움직이는 방식에 대한 저수준의 물리적 세부 사항보다는 작업의 고수준 목표를 이해하는 데 더 뛰어나다는 것을 시사합니다. 연구진은 많은 훈련 실행 과정 전반에 걸쳐 결과의 일관성을 측정하였으며, 시스템이 유사한 기술 그룹화를 신뢰성 있게 발견하고, 서로 다른 버전의 모델 간에도 높은 일치도를 보인다는 것을 확인했습니다.

이 연구는 로봇이 경험을 조직하는 방식이 뇌의 규모보다 더 중요하다는 것을 입증합니다. 행동의 결과에 집중하고 이를 그룹화하는 구조화된 방법을 사용함으로써, 시스템은 복잡하고 장기적인 작업을 수행하는 데 도움이 되는 기술 라이브러리를 구축할 수 있습니다. 이러한 발견은 '클수록 좋다'는 아이디어에 도전하며, 로봇이 인간처럼 재사용 가능한 행동의 관점에서 생각하는 법을 배울 수 있는 미래를 제시합니다. 연구진은 코드와 데이터를 공개하여 다른 이들이 이 결과를 검증하고 이 새로운 학습 방식 위에서 연구를 발전시킬 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →