← 최신 논문
🤖 machine learning

InSight: Self-Guided Skill Acquisition via Steerable VLAs

InSight는 시연을 조종 가능한 프리미티브 액션으로 분해하고, VLM 가이드 데이터 플라이휠을 활용하여 추가적인 인간의 개입 없이도 새로운 장기 과업을 위해 누락된 프리미티브를 생성, 라벨링 및 통합함으로써 비전-언어-행동(VLA) 모델이 새로운 조작 기술을 자율적으로 습득할 수 있도록 하는 프레임워크입니다.

원저자: Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 요리를 가르치고 있다고 상상해 보세요. 전통적인 방식이라면, 로봇에게 "샌드위치 만들기"와 같은 새로운 요리를 가르치기 위해 당신은 옆에 서서 로봇의 손을 잡고 빵을 집고, 버터를 바르고, 치즈를 넣는 등 모든 단계를 일일이 안내해야 합니다. 이는 느리고 비용이 많이 들며, 나중에 로봇에게 "수프 만들기"를 가르치고 싶을 때 이 과정을 처음부터 다시 반복해야 합니다.

INSIGHT라는 논문은 인간이 새로운 기술을 배우는 방식과 더 유사하게, 로봇에게 더 똑똑하게 가르치는 방법을 제안합니다. 로봇은 전체 레시피를 통째로 암기하는 대신, 개별적인 동작(예: "집기", "들어 올리기", "돌리기", "따르기" 등)을 학습하고, 이를 스스로 조합하는 법을 터득합니다.

시스템의 작동 방식은 다음과 같이 간단한 단계로 나뉩니다.

1. "레고 블록" 접근 방식

로봇의 기술을 하나의 거대하고 깨지지 않는 덩어리가 아니라, 레고 블록이 담긴 상스처럼 생각해보세요.

  • 문제점: 오늘날 대부분의 로봇은 전체 과업(task) 단위로 훈련됩니다. 만약 컵을 집는 법을 보여주면, 로봇은 그 특정 순서를 학습합니다. 하지만 만약 "물을 따르라"고 요청하면, 로로봇은 "따르는" 블록을 본 적이 없기 때문에 실패할 수 있습니다.
  • INSIGHT의 해결책: 이 시스템은 인간의 시연(예: 누군가 컵을 집는 영상)을 가져와서 이를 **프리미티브(primitive)**라고 불리는 작고 라벨이 붙은 "블록"으로 자동 분해합니다.
    • 예시: "컵을 집다"를 하나의 동작으로 보는 대신, 로봇은 "손을 컵으로 이동" + "손가락 닫기" + "위로 들어 올리기"로 인식합니다.
    • 로봇은 이러한 개별 동작들을 매우 잘 학습하여, 명령에 따라 특정 동작 하나만을 수행하도록 "조종"될 수 있습니다.

2. "스마트 어시스턴트" (VLM)

로봇 내부에는 프로젝트 매니저 역할을 하는 "스마트 어시스턴트"(시각-언어 모델, VLM)가 탑재되어 있습니다.

  • 시나리오: 로봇이 "병을 집기"와 "놓기"는 알고 있지만, 당신이 **"병의 내용물을 그릇에 따르라"**고 요청했다고 가정해 봅시다.
  • 공백 발생: 스마트 어시스턴트는 계획을 검토한 후 이렇게 말합니다. "잠깐, 우리에게 '집기' 블록과 '놓기' 블록은 있지만, '기울여 따르기' 블록이 빠져 있어!"
  • 해결책: 스마트 어시스턴트는 인간에게 따르는 법을 보여달라고 요청하는 대신, 해당 동작의 물리적 원리(예: "병을 앞으로 45도 기울이기")를 파악하여 로봇에게 시도하도록 지시합니다.

3. "연습 루프"

여기서 마법이 일어납니다. 로봇은 스스로 그 빠진 동작을 수행하려고 시도합니다.

  • 시행착오: 로봇은 "기울이기" 동작을 시도합니다. 만약 물을 사방에 흘린다면, 약간 다른 각도로 다시 시도합니다.
  • "오라클(Oracle)" 체크: 로봇이 시도한 후, 스마트 어시스턴트는 결과(마치 시험을 채점하는 선생님처럼)를 확인합니다. "물이 그릇에 들어갔는가? 예? 좋습니다! 아니오? 다시 시도하세요."
  • 학습: 로봇이 물을 따르는 데 성공하면, 시스템은 그 특정 "기울이기" 동작을 자신의 라이브러리에 새로운 레고 블록으로 저장합니다. 그 후 이 새로운 블록을 영구적으로 기억하도록 스스로를 재학습시킵니다.

4. 기초부터 새로운 기술 구축하기

로봇이 "따르기" 블록을 학습하고 나면, 더 이상 인간의 가르침이 필요하지 않습니다.

  • 결과: 나중에 당신이 로봇에게 "뚜껑을 돌려 열고 나서 내용을 따라라"고 요청하면, 로봇은 이미 배웠던 "돌리기" 블록과 새로 배운 "따르기" 블록을 결합할 수 있습니다.
  • 비유: 이는 마치 C 메이저 코드를 배우고 F 메이저 코드를 배운 음악가와 같습니다. 새로운 곡을 연주하고 싶을 때, 음악가는 선생님에게 곡 전체를 보여달라고 할 필요 없이 이미 알고 있는 코드들을 조합하기만 하면 됩니다.

실제로 무엇을 증명했는가?

연구진은 컴퓨터 시뮬레이션과 실제 로봇(로봇 팔 사용) 모두에서 이를 테스트했습니다. 연구 결과는 다음과 같습니다:

  • 새로운 인간의 도움 불필요: 로봇에게 특정 동작을 하는 영상을 한 번도 보여주지 않고도 블록 뒤집기, 서랍 닫기, 병 뚜껑 돌리기, 콩 따르기와 같은 복잡한 과업을 수행하도록 가르쳤습니다.
  • 빠른 속도: 로봇은 기존 방식(눈을 가린 채 수천 번 시행착오를 겪으며 배우는 강화 학습과 같은 방식)보다 훨씬 빠르게 새로운 기술을 학습했습니다.
  • 망각 방지: 로봇이 새로운 "따르기" 기술을 배웠을 때, 이전에 배웠던 "병 집기" 동작을 잊어버리지 않았습니다. 기존의 모든 기술을 유지하면서 새로운 기술을 추가했습니다.
  • 실제 세계에서의 성공: 실제 로봇에서 높은 성공률(따르기의 경우 최대 96%)을 달졌으며, 한 번도 본 적 없는 긴 14단계의 과업(뚜껑을 돌려 열고, 그다음 따르기)을 결합하여 수행할 수도 있었습니다.

핵심 요약

INSIGHT는 로봇이 복잡한 과업을 작고 재사용 가능한 동작들로 분해할 수 있게 해주는 프레임워크입니다. 새로운 작업에 직면했을 때, 로봇은 "스마트 어시스턴트"를 사용하여 어떤 동작이 부족한지 파악하고, 스스로 그 동작들을 연습하며, 나중을 위해 저장합니다. 이를 통해 로봇은 매번 인간의 손을 빌릴 필요 없이 지속적으로 새로운 기술을 배울 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →