← 최신 논문
💻 computer science

OneVLA: A Unified Framework for Embodied Tasks

OneVLA는 내비게이션과 조작을 하나의 공유된 액션 헤드와 다단계 점진적 학습 전략을 갖춘 단일 아키텍처로 통합하는 통일된 프레임워크를 도입하여, 범용 로봇 에이전트의 발전을 촉진하기 위해 시뮬레이션 및 실제 환경 모두에서 최첨단 성능을 달성합니다.

원저자: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 로봇 비서가 있다고 상상해 보세요. 지금까지 이 로봇을 만드는 것은 두 명의 서로 다른 전문가를 고용하는 것과 같았습니다. 한 명은 걷기(내비게이션)에는 전문가이지만 손을 쓰는 능력은 형편없는 사람이고, 다른 한 명은 요리(조작)의 달인이지만 재료를 가지러 방을 가로질러 걸어갈 수는 없는 사람입니다. 만약 당신이 로봇에게 "주방으로 걸어가서 컵을 전자레인지에 넣어"라고 시키고 싶다면, 이 두 가지 서로 다른 "두뇌"나 두 개의 별도 모델 사이를 전환해야만 했습니다.

이 논문은 OneVLA를 소개합니다. 이는 마치 걷기와 손 사용 모두에 자연스럽게 능숙한 단 하나의 "맥가이버 칼(Swiss Army Knife)" 같은 직원을 고용하는 것과 같습니다.

그들이 어떻게 이를 구현했는지에 대한 간단한 분석은 다음과 같습니다.

1. "만능 리모컨" (통합 액션 헤드)

대부분의 로봇은 작업마다 서로 다른 "리모컨"을 가지고 있습니다. 어떤 리모컨에는 앞으로 이동하거나 왼쪽으로 회전하는 버튼이 있고, 다른 리모컨에는 로봇 팔을 위아도 아래로 움직이거나 비트는 슬라이더가 있습니다.

OneVLA는 단 하나의 만능 리모컨을 만듭니다.

  • 이것은 걷기 버튼과 팔의 슬라이더를 하나의 긴 제어 스트립으로 결합합니다.
  • 로봇이 "문으로 가라"라는 지시를 받으면, 스트립에 있는 "걷기 버튼"만을 누릅니다.
  • 로봇이 "컵을 집어라"라는 지시를 받으면, "팔 슬라이더"만을 움직입니다.
  • 마법 같은 점: 로봇은 자신의 두뇌나 리모컨을 교체할 필요가 없습니다. 그저 작업에 따라 리모컨의 어느 부분을 사용할지만 알면 됩니다.

2. "3단계 훈련 캠프" (다단계 전략)

로봇을 복잡한 세상에 그냥 던져놓는다고 해서 즉시 모든 것을 알게 되지는 않습니다. 저자들은 OneVLA를 학교 과정을 밟아가는 학생처럼 세 가지 구체적인 단계로 훈련시켰습니다.

  • 1단계: 손 사용법 배우기. 먼저, 로봇에게 로봇 팔을 사용하여 물체를 잡고, 들어 올리고, 놓는 법을 가르쳤습니다. 또한 사진을 보고 설명하는 법도 가르쳤습니다(세상을 이해하도록 하기 위해).
  • 2단계: 걷기 배우기. 다음으로, 내비게이션 데이터를 추가했습니다. 이제 로봇은 A 지점에서 B 지점까지 이동하는 법을 배웁니다. 1단계에서 이미 "보고 생각하는 법"을 배웠기 때문에, 더 빠르고 똑똑하게 걷는 법을 배웁니다.
  • 3단계: 생각하며 말하기 배우기 (Chain-of-Thought). 마지막으로, 로봇에게 자신의 사고 과정을 "말하면서 진행하는 법"을 가르쳤습니다. 움직이기 전에 로봇은 스스로 이렇게 말합니다. "나는 복도에 있다. 주방으로 가기 위해 오른쪽으로 꺾어야 한다." 이 단계는 로봇이 자신이 보는 것, 해야 할 일, 그리고 어떻게 움직여야 하는지 사이의 연결 고리를 찾는 데 도움을 줍니다.

3. 결과: 두 가지 기술, 하나의 두뇌

이 논문은 이 두 가지 기술을 함께 훈련함으로써, 이 기술들이 실제로 서로를 더 발전시킨다고 주장합니다.

  • 비유: 농구 선수도 축구를 하는 상황을 생각해 보세요. 농구공을 드리블하는 법(조작)을 배우는 것이 발놀림과 균형 감각을 개선하여, 축구 경기장(내비게이션)에서 더 잘 달릴 수 있게 도와주는 것과 같습니다.
  • 증거: 테스트에서 이 단일 로봇(OneVLA)은 걷기에만 특화되었거나 손 사용에만 특화된 로봇들을 이겼습니다. 또한 두 가지를 모두 수행하려고 시도했지만 여전히 각 작업에 따라 별도의 "모드"나 설정이 필요했던 다른 "하이브리드" 로봇들보다도 뛰어난 성능을 보였습니다.

요약

OneVLA는 걷거나 무언가를 잡으라고 요청할 때 다시 프로그래밍할 필요가 없는 새로운 유형의 로봇 두뇌입니다. 이 로봇은 언어를 이해하고, 세상을 보고, 자신의 발과 손을 모두 제어하기 위해 하나의 통합된 시스템을 사용합니다. 저자들은 이러한 기술들을 함께 가르치는 것이 각각 따로 가르칠 때보다 로봇을 양쪽 모두에서 더 똑똑하게 만든다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →