Action with Visual Primitives
이 논문은 기존 방법인 pi_0.5 와 같은 접근법보다 로봇 피크 앤 플레이스 작업에서 성공률, 데이터 효율성, 그리고 일반화 능력을 크게 향상시키기 위해 비전 - 언어 모델이 시각적 원시 토큰을 생성하여 흐름 매칭 행동 전문가를 조건화함으로써 지시 이해와 공간적 이해를 운동 제어에서 분리하는 엔드 투 엔드 아키텍처인 AVP(Visual Primitives 를 활용한 행동) 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 복잡한 중국 체스 게임을 가르치거나 도미노를 완벽하게 쌓는 방법을 상상해 보세요. 당신은 로봇에게 "빨간 말을 모서리로 옮겨라"라는 명령을 내립니다.
대부분의 현재 로봇 두뇌 (VLA 모델이라고 불림) 에서는 로봇이 모든 것을 한 번에 수행하려고 합니다. 로봇은 당신의 말을 이해하고, 보드 위의 빨간 말이 정확히 어디에 있는지 파악한 다음, 그것을 잡기 위한 정밀한 근육 운동을 계산해야 합니다. 이 모든 것이 단일한 순간의 생각 속에서 이루어집니다. 마치 사람이 차를 몰고 주차를 하면서도 대화하는 동안 지도를 보고 차를 운전하고 주차하는 것을 멈추지 않고 생각하지 않는 것과 같습니다. 이는 종종 혼란을 초래하며, 특히 보드가 약간 다르게 보이거나 말들이 새로운 위치에 있을 때 더욱 그렇습니다.
이 논문의 저자들인 AVP(Visual Primitives 를 사용한 행동) 는 작업을 더 지혜롭게 분할하는 방법을 제안합니다. 그들은 로봇의 두뇌를 두 가지 뚜렷한 역할을 가진 팀처럼 취급합니다. 바로 전략가 (Strategist) 와 수행자 (Doer) 입니다.
새로운 팀워크: 전략가 vs 수행자
1. 전략가 (시각 - 언어 모델)
이 부분은 "눈과 뇌"로 생각하세요. 이 부분의 유일한 임무는 장면과 지시를 보고 무엇을 해야 하며 어디로 해야 하는지 결정하는 것입니다.
- 단순히 말로만 생각하는 대신, 전략가는 이미지 위에 빠르고 보이지 않는 스케치를 그립니다. 체스 말 주변에 작은 상자를 그리거나 목표 칸에 점을 찍을 수 있습니다.
- 이러한 그림들을 "시각적 원시 (Visual Primitives)" 라고 부릅니다. 이는 "여기에 집중해"라고 말하는 단순하고 명확한 표시입니다.
2. 수행자 (행동 전문가)
이 부분은 "손"으로 생각하세요. 수행자는 체스 규칙을 이해하거나 당신의 말의 의미를 파악할 필요가 없습니다.
- 수행자는 단순히 전략가의 스케치 (시각적 원시) 를 보고 "알겠다, 상자를 봤어. 그 상자 안에 있는 것을 잡기 위해 팔을 움직이겠어"라고 말합니다.
- "무엇"과 "어디"가 이미 전략가에 의해 해결되었기 때문에, 수행자는 물리적 움직임에 100% 에너지를 집중할 수 있습니다.
왜 이것이 더 잘 작동하는가
이 논문은 기존 방식이 수행자가 움직일 때마다 세상을 보고 이해하는 방법을 다시 배우도록 강요한다고 주장합니다. 새로운 AVP 방법은 전략가가 사전 훈련된 지식을 사용하여 사고를 처리하게 하고, 수행자는 시각적 단서만 따르도록 합니다.
"제로 주석 (Zero Annotation)"의 초능력
보통 로봇에게 이러한 상자를 그리도록 가르치려면, 인간이 수천 장의 이미지를 수동으로 라벨링해야 합니다 (예: "이것이 체스 말입니다"). 이는 느리고 비용이 많이 듭니다.
- AVP 의 트릭: 로봇은 이미 자신의 손이 어디로 움직이는지 알고 있습니다 (자신의 관절을 제어하기 때문). 시스템은 훈련 중에 로봇의 손 움직임을 자동으로 "시각적 원시" (상자와 점) 로 변환합니다.
- 비유: 이는 바닥에 학생을 위해 화살표를 그릴 필요가 없는 춤 강사와 같습니다. 강사는 단순히 학생의 발을 관찰하고 학생이 이미 밟고 있는 발걸음을 자동으로 강조할 뿐입니다. 추가적인 그림이 필요 없습니다.
결과: 현실 세계의 증명
이 팀은 두 개의 팔을 가진 실제 로봇을 세 가지 도전적인 시나리오에서 테스트했습니다:
- 중국 체스: 많은 유사한 물건들이 있는 붐비는 보드에서 말을 이동시키기.
- 도미노: 매우 구체적인 각도로 도미노를 놓기.
- 일반적인 집기 및 배치: 다양한 모양의 무작위 물건을 집어 올리기.
스코어보드:
- 이전 최고 방법 (π0.5 라고 함) 과 비교했을 때, AVP 는 성공률을 27.61% 향상시켰습니다.
- 일반화: 로봇이 한 종류의 보드에서 훈련되었지만 완전히 다른 보드 (또는 다른 물건) 에서 테스트되었을 때에도 AVP 는 잘 작동했습니다. 기존 방식은 새로운 모습에 혼란을 느껴 종종 실패했습니다.
- 속도: 물체를 찾기 위해 외부 도구를 사용한 일부 구식 방법들은 느렸습니다 (명령당 37 초 소요). 반면 AVP 는 빠릅니다 (0.27 초), 이는 실시간 사용에 실용적입니다.
요약
AVP 는 사고와 행동을 분리하는 로봇 제어 시스템입니다. 지시를 기반으로 간단한 시각적 목표 (원시) 를 그리기 위해 "전략가"를 사용하고, 그 목표를 따르기 위해 "수행자"를 사용합니다. 이러한 노동 분업은 로봇이 인간이 모든 세부 사항을 수동으로 가르치지 않아도 새로운 작업, 새로운 물건, 그리고 붐비는 환경을 훨씬 더 잘 처리하도록 만들어 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.