← 최신 논문
💻 computer science

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

UniviewVLA는 표준적인 두 대의 카메라 관측으로부터 가려진 단서와 미래의 장면 진화를 추론하기 위해 월드 모델을 활용함으로써, 추가적인 하드웨어나 명시적인 3D 재구성을 요구하지 않고도 폐쇄(occlusion) 중심 작업에서 상당한 성능 향상을 달성하는 통합 다중 뷰 시각-언어-행동 모델이다.

원저자: Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

퍼즐을 풀려고 하는데 눈이 가려져서 그림의 절반밖에 보이지 않는 상황을 상상해 보세요. 윗부분은 보이지만, 아랫부분은 상자 뒤에 숨겨져 있습니다. 일반적인 로봇 브레인(Vision-Language-Action 모델)은 눈이 가려진 사람과 같습니다. 보이는 것만을 바탕으로 보이지 않는 부분을 추측하려고 노력합니다. 하지만 중요한 단서들이 숨겨져 있을 때, 이들은 종종 틀린 추측을 합니다.

이 논문은 추가적인 카메라를 구입하거나 복잡한 3D 지도를 구축할 필요 없이 이 문제를 해결하는 새로운 유형의 로봇 브레인인 UniviewVLA를 소개합니다. 작동 방식은 다음과 같이 간단한 개념으로 나누어 설명할 수 있습니다.

1. 문제점: "사각지대"

로봇은 보통 두 개의 카메라를 가지고 있습니다: 하나는 "머리"(agent-view)에, 다른 하나는 "손목"(wrist-view)에 있습니다.

  • 문제점: 만약 로봇이 컵 뒤에 숨겨진 스위치를 잡아야 하거나, 상자에 의해 일부가 가려진 인형을 움직여야 한다면, 표준 카메라로는 이를 볼 수 없습니다.
  • 기존의 해결책들:
    • 카메라 추가하기: 이는 로봇에게 추가적인 눈을 달아주는 것과 같습니다. 하지만 이는 번거로운 일입니다. 로봇을 정확히 그 카메라들에 맞춰 학습시켜야 하며, 만약 로봇을 새로운 방으로 옮기면 카메라 각도가 달라지기 때문에 학습 내용이 무용지물이 됩니다.
    • 3D 지도 구축하기: 이는 움직이는 동안 머릿속으로 방의 완벽한 3D 청사진을 그리려는 것과 같습니다. 이는 엄청난 계산 능력(컴퓨팅 파워)을 소모하며 속도가 느립니다.

2. 해결책: "상상 엔진"

UniviewVLA는 **월드 모델(World Model)**을 사용합니다. 이것은 로봇이 카메라가 없는 각도에서 방이 어떻게 보이는지 상상하고, 다음 몇 초 동안 장면이 어떻게 변할지 예측하는 능력이라고 생각하면 됩니다.

  • 작동 방식: 로봇은 두 개의 표준 카메라를 바라봅니다. 그런 다음 자신의 "상상 엔진"에게 묻습니다: "만약 내가 옆쪽이나 위쪽에서 보고 있다면, 지금 무엇이 보일까? 그리고 1초 뒤에는 무엇이 보일까?"
  • 결과: 로봇은 이러한 "가상의" 뷰를 즉석에서 생성합니다. 별도의 하드웨어가 필요하지 않습니다. 단지 자신의 뇌를 사용하여 빈 공간을 채울 뿐입니다.

3. 속도 해킹: "하이라이트 영상"

문제는 가상의 뷰를 생성하는 것이 엄청난 양의 데이터(매 순간 고화질 영화를 생성하는 것과 같은)를 만들어낸다는 점이었습니다. 이로 인해 로봇은 마치 단순한 동작을 하기 전에 4K 영상을 로딩하려는 컴퓨터처럼 느려집니다.

  • 해결책 (Motion-Informative Token Compression): 연구진은 로봇이 가상의 영화 전체를 볼 필요는 없다는 것을 깨달았습니다. 로봇에게 필요한 것은 오직 무엇이 움직이고 있는가 하는 정보뿐입니다.
  • 비유: 장면을 이해하기 위해 60분짜리 영화를 보는 대신, 로봇은 움직이는 부분(예: 컵을 향해 뻗는 손)만을 보여주는 16초짜리 하이라이트 영상을 만듭니다.
  • 영향: 이를 통해 데이터가 625개의 정보 조각에서 단 16개로 줄어듭니다. 이는 로봇의 사고 시간을 뷰당 67초에서 단 0.20.3초로 단축시킵니다.

4. 스마트 스위처: "최적의 각도 선택"

때로는 작업 초반에는 "측면 뷰"가 가장 좋지만, 물체가 움직임에 따라 나중에는 "상단 뷰"가 더 중요해질 수 있습니다. 고정된 카메라는 생각을 바꿀 수 없습니다.

  • 해결책 (Action-Entropy View Selection): 로봇은 끊임없이 스스로에게 묻습니다: "어떤 가상의 각도가 나의 다음 동작을 수행하는 데 가장 높은 확신을 주는가?"
  • 비유: 게임을 하고 있다고 상상해 보세요. 때로는 미니맵을 봐야 하고, 때로는 정면을 봐야 합니다. UniviewVLA는 매 단계마다 가장 도움이 되는 가상의 각도로 자신의 "초점"을 동적으로 전환하며, 재학습이 필요하지 않습니다.

5. 결과: 보이지 않는 것을 보다

팀은 두 가지 방식으로 테스트를 진행했습니다:

  1. 표준 테스트: 아무것도 숨겨져 있지 않은 일반적인 작업에서, 로봇은 기존의 가장 뛰어난 로봇들과 대등한 성능(성공률 95.8%)을 보였습니다.
  2. "숨겨진" 테스트: 코너 너머나 물체 뒤를 봐야 하는 작업을 만들었습니다.
    • 표준 로봇: 성공률이 **40%**에 불과했습니다.
    • 추가 카메라를 가진 로봇: 성공률이 **66%**였습니다.
    • UniviewVLA (단 2개의 카메라 사용): 성공률이 **73%**였습니다.

실제 환경: 이들은 실제 로봇 팔에서도 테스트했습니다. 로봇이 밥솥 뒤에 숨겨진 오레오를 잡거나 상자에 가려진 인형을 움직여야 할 때, 표준 로봇은 대부분 실패했습니다. 반면, 단 2개의 표준 카메라만을 사용하는 UniviveVLA는 훨씬 더 자주 성공하며, 물리적인 카메라를 추가하는 것보다 "가상의 뷰를 상상하는 것"이 더 효과적임을 증명했습니다.

요약

UniviveVLA는 로봇에게 **슈퍼 비전(초능력 시력)**을 부여하는 것과 같습니다. 로봇은 자신이 가진 물리적인 카메라에 국한되지 않고, "월드 모델"을 사용하여 방의 나머지 부분을 상상하고 미래를 예측합니다. 또한 이를 매우 효율적으로 수행하여 추가 하드웨어가 필요하지 않으며, 늘어난 데이터로 인해 느려지지도 않고, 물체가 가려진 까다로운 작업들도 해결할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →