← 최신 논문
💻 computer science

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

이 논문은 새로운 RoboVoLo 벤치마크와 실세계 실험을 통해 검증된, 강건한 오픈 보캐블러리 장기 조작을 달성하기 위해 중단 가능한 로봇 도구를 동적으로 조종하는 VLM 기반 에이전트를 특징으로 하는 물리적 오케스트레이션 프레임워크인 VoLo를 소개한다.

원저자: Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 지저분한 식탁을 치우는 법을 가르치려 한다고 상상해 보세요. 단순히 "컵을 집어라"라는 명령이 아닙니다. 그것은 복잡한 문장입니다. "식탁 위의 모든 물건을 그릇에 넣되, 빨간 블록과 참치 통조림은 제외해라."

이것은 대부분의 로봇에게 악몽과 같습니다. 로봇은 엉뚱한 것을 잡거나, 떨어뜨리거나, 미끄러운 통을 집으려다 막혀버릴 수 있습니다. 그들은 종종 멈춰서 생각하고 실수를 바로잡는 능력이 부족합니다.

VoLo라는 논문은 이를 해결하기 위한 새로운 방법인 **물리적 오케스트레이션(Physical Orchestration)**을 소개합니다. 다음은 쉬운 용어로 풀이한 내용입니다.

1. 문제점: "정지된 세계" vs "움직이는 세계"

대부분의 AI 에이전트(챗봇 같은)는 "정지된 세계"에 삽니다. 그들은 단어를 입력하기 전까지 원하는 만큼 오래 생각할 수 있습니다. 그들이 생각하는 동안 세상은 변하지 않습니다.

하지만 실제 로봇은 움직이는 세계에 삽니다. 만약 로봇이 무거운 접시를 들고 있는 상태에서 10초 동안 생각하느라 멈춘다면, 접시는 미끄러지거나 떨어질 수 있습니다. 로봇은 세상이 여전히 돌아가고 있는 동안에도 결정을 내려야 합니다.

2. 해결책: "지휘자" (VoLoAgent)

저자들은 VoLoAgent라는 시스템을 만들었습니다. 이 에이전트를 단일 로봇의 뇌가 아니라, 하나의 교향악단 지휘자라고 생각하십시오.

  • 지휘자 (VLM): 이것은 복잡한 지침을 이해하는 똑똑한 "두뇌"(시각-언어 모델)입니다. 직접 물건을 들어 올리는 역할은 하지 않습니다. 대신 악보를 들고 음악가들에게 무엇을 연주할지 알려줍니다.
  • 음악가들 (도구들): 지휘자는 호출할 수 있는 다양한 "음악가"(도구)들을 가지고 있습니다:
    • 무용수 (VLA): 부드럽고 연속적인 움직임(마치 춤을 추는 것과 같은)에 뛰어난 로봇 정책입니다.
    • 눈 (인식 모델): 물체가 정확히 무엇인지 또는 어디에 있는지 포착하는 데 특화된 도구들입니다 (마치 매가 쥐를 찾아내는 것처럼).
    • 손 (행동 프리미티브): "이것을 잡아라" 또는 "저것을 내려놓아라"와 같은 단순하고 신뢰할 수 있는 명령입니다.

3. 작동 방식: "중단 가능한" 춤

기존의 시스템에서는 로봇이 일단 움직이기 시작하면, 멈추지 않고 전체 춤을 끝까지 마쳐야 했습니다. 만약 잘못된 물체를 집었다 하더라도, 로봇은 그냥 계속 진행하다가 실패하게 됩니다.

VoLoAgent는 다릅니다. 이 시스템은 "무용수"(로봇의 움직임)를 중단 가능한 도구로 취급합니다.

  • 지휘자는 항상 듣고 있습니다. 로봇이 움직이는 동안에도 지휘자는 비디오 피드를 지켜보고 있습니다.
  • "정지" 버튼: 만약 지휘자가 로봇이 레몬 대신 엉뚱한 물체(예: 참치 통조림)를 향해 손을 뻗는 것을 본다면, 즉시 "일시정지" 버튼을 누릅니다.
  • 전환: 그러면 지휘자는 이렇게 말합니다. "춤을 멈추세요! '눈'을 사용하여 레몬을 찾은 다음, '손'으로 그것을 잡도록 전환한 뒤, 다시 '무용수'를 불러 동작을 마무리하세요."

이 과정은 계획 → 실행 → 모니터링 → 수정의 연속적인 루프로 일어납니다.

4. 테스트: "RoboVoLo" 벤치마크

이 방식이 효과가 있음을 증명하기 위해, 팀은 RoboVoLo라는 거대한 테스트를 구축했습니다. 126개의 서로 다른 도전 과제가 포함된 비디오 게임 레벨을 상상해 보세요. 여기에는 다음 능력이 필요합니다:

  • 상식: "참치 통조림"은 무겁고 미끄럽다는 것을 아는 것.
  • 기억력: 이미 파란색 블록을 옮겼으므로 다시 옮기지 않는 것.
  • 복잡한 언어: "왼쪽에서 두 번째 아이템"이나 "빨간색을 제외한 나머지 전부"와 같은 명령을 이해하는 것.
  • 세상 지식: "불활성 기체"는 특정 통에, "금속"은 다른 통에 넣어야 한다는 것을 아는 것.

5. 결과: 지휘자의 승리

이 시스템을 다른 로봇들과 비교 테스트했을 때:

  • 단독 로봇 (솔로이스트): 이 로봇들은 스스로 모든 것을 하려고 했습니다. 복잡한 지침에 혼란을 느끼거나 스스로의 실수를 바로잡지 못해 자주 실패했습니다.
  • VoLoAgent (지휘자): 도구를 전환하고 오류를 수정하기 위해 멈춤으로써, VoLoAgent는 **42%**의 성공률을 기록한 반면, 그다음으로 우수한 시스템은 겨우 **12%**의 성공률을 보였습니다.

핵심 요점:
이 논문은 로봇을 똑똑하게 만드는 비결이 단순히 "무용수"(로봇 팔)를 더 좋게 만드는 것이 아님을 보여줍니다. 핵심은 언제 도구를 바꿀지, 언제 멈출지, 그리고 실수가 재앙이 되기 전에 어떻게 수정할지를 아는 똑똑한 "지휘자"를 갖추는 것입니다.

그들은 심지어 이 시스템을 (컴퓨터 시뮬레이션이 아닌) 실제 로봇에 테스트했으며, 표준 로봇보다 3배 더 나은 성능을 보여줌으로써 이 "지휘자" 접근 방식이 복잡하고 무질서한 실제 세상에서도 작동함을 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →