UniVR: Thinking in Visual Space for Unified Visual Reasoning
이 논문은 텍스트나 작업별 휴리스틱에 의존하지 않고 가공되지 않은 시각 데이터로부터 통합된 시각적 추론, 물리적 역학 이해, 그리고 장기 계획을 가능하게 하는 VR-GRPO 강화 학습 패러다임을 활용하여, 새롭게 구축된 VR-X 벤치마크에서 상당한 성능 향상을 달성하는 새로운 프레임워크인 UniVR을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 신발끈을 묶는 법, 끼워 맞추는 시트(fitted sheet)를 접는 법, 또는 까다로운 미로를 푸는 법을 가르치려 한다고 상상해 보세요. 오랫동안 가장 똑똑한 방법은 영어(또는 다른 언어)로 된 거대하고 상세한 지침서를 작성한 뒤, 로봇이 그것을 읽고 이해하여 단계별 과정을 그려낼 수 있기를 바라는 것이었습니다.
하지만 여기 반전이 있습니다: UniVR는 우리가 너무 과하게 생각하고 있는 것일지도 모른다고 제안합니다. 로봇에게 세상을 먼저 언어로 번역하도록 강요하는 대신, 그냥 그림으로 생각하게 만드는 건 어떨까요?
"말로 생각하기"의 문제점
현재의 초지능 AI 모델들은 세상의 모든 책을 읽은 아주 똑똑한 사서와 같습니다. 그들은 완벽한 문법으로 매듭을 묶는 법을 설명할 수 있습니다. 하지만 실제로 그 일을 하려고 할 때, 그들은 종종 물리 법칙에 걸려 넘어집니다. 그들은 "이제 끈을 팽팽하게 당기세요"라고 말할 수는 있지만, 그들의 머릿속 영화 속에서는 끈이 테이블을 통과해 버리거나 매듭이 마법처럼 저절로 풀려버릴 수도 있습니다.
이 논문은 현실 세계를 텍스트로 묘사하는 것이 수학 방정식만으로 딸기의 맛을 설명하려는 것과 같다고 주장합니다. 데이터는 얻을 수 있겠지만, 무질서하고 역동적인 실체는 놓치게 됩니다. 최고의 모델이라 할지라도 긴 일련의 행동(요리를 하거나 방을 돌아다니는 것과 같은)을 계획하도록 요청받으면, 물리 법칙이 깨지거나 물체가 사라지거나 논리가 유지되지 않는 영상을 만들어내곤 합니다.
해결책: UniVR와 "비주얼 체육관(Visual Gym)"
UniVR를 생각해 보세요. 이것은 AI 학생들을 위한 새로운 훈련 캠프와 같습니다. 이곳에서 학생들은 말을 할 수 없으며, 오직 보고 배우는 것만 허용됩니다.
매뉴얼을 읽는 대신, UniVR는 가공되지 않은 비디오 데모로부터 직접 학습합니다. 로봇은 사람들이 매듭을 묶고, 옷을 접고, 퍼즐을 푸는 수천 개의 클립을 관찰합니다. "1단계: 끈을 잡아라"라고 말해주는 선생님은 필요 없습니다. 그저 시각적 흐름을 관찰함으로써 패턴을 파악해 냅니다.
AI가 단순히 무작위로 추측하지 않도록, 연구진은 VR-GRPO라고 불리는 특별한 훈련 방법을 구축했습니다. 이는 AI가 연습하는 모습을 지켜보는 엄격하지만 공정한 코치를 상상하게 합니다.
- 글로벌 코치(Global Coach): 로봇이 실제로 과제를 완수했는지 확인합니다 (예: "매듭이 제대로 묶였는가?").
- 스텝-포컬 코치(Step-Focal Coach): 이것이 핵심 비법입니다. 글로벌 코치는 손이 미끄러지거나 공이 움직임 중간에 잘못 굴러가는 것과 같은 작은 실수들을 놓칠 수 있습니다. 스텝-포컬 코치는 이러한 까다로운 순간들을 확대해서 봅니다. 만약 AI의 "머릿속 영화"가 중간에 흔들리거나 비논리적이 된다면, 이 코치는 이를 포착하여 "잠깐, 이건 물리적으로 말이 안 돼! 다시 해봐"라고 말합니다.
이러러한 조합은 AI가 단순히 마지막에 운 좋게 성공하는 것이 아니라, 매 단계마다 논리적이고 물리적으로 일관성을 유지하도록 보장합니다.
대규모 테스트: VR-X
이것이 실제로 작동하는지 확인하기 위해, 팀은 VR-X라고 불리는 거대한 장애물 코스를 만들었습니다. 이것은 로봇 팔 조작이나 요리와 같은 길고 복잡한 작업부터, 시각적 퍼즐이나 물체 찾기와 같은 빠른 두뇌 게임까지 16가지 유형의 도전 과제가 담긴 거대한 비디오 게임 레벨과 같습니다.
결과는 어땠을까요? UniVR는 단순히 통과한 수준이 아니라 질주했습니다.
- 이 새로운 벤치마크에서 UniVR은 기존 방식보다 성능이 최대 25% 향상되었습니다.
- 340억 개의 파라미터를 가진 비교적 작은 모델임에도 불구하고, 장기 계획 작업에서 Gemini 3 Pro와 다른 도구들이 결합된 형태의 훨씬 더 큰 텍스트 중심 시스템들을 능가했습니다.
- 단순히 과제 수행 능력이 좋아진 것뿐만 아니라, MMMU나 MME와 같은 표준 시각 테스트에서도 높은 점수를 기록하며 전반적인 이미지 이해 능력도 향 old졌습니다.
이것이 의미하는 바 (그리고 그렇지 않은 것)
이 논문은 이것이 무엇이고 무엇이 아닌지에 대해 매우 명확히 밝히고 있습니다.
- 이것은 모든 AI 문제를 해결하는 마법 지팡이가 아닙니다. 저자들은 현재의 모델들이 텍ral 텍스트에만 의존할 경우 미세한 물리 법칙을 다루는 데 여전히 어려움을 겪는다는 점을 명시했습니다.
- 이것은 AI가 지속적인 텍스트 지침 없이도 시각적 데이터로부터 직접 복잡한 추론을 배울 수 있다는 강력한 증거입니다.
- 결과는 특정 벤치마크(VR-X)와 여러 기존 공개 테스트를 통해 측정되고 입증되었습니다. 저자들은 이러한 "시각적 공간에서의 사고" 접근 방식이 더 나은 월드 모델(world models)을 구축하는 강력한 방법이라고 제안하지만, 이것이 인공지능의 최종 해답이라고 주장하지는 않습니다.
요약하자면, UniVR은 때때로 세상이 어떻게 돌아가는지 배우는 가장 좋은 방법은 책을 읽는 것이 아니라, 직접 뛰어들어 주의 깊게 관찰하고 사물이 어떻게 움직이고 변하는지를 봄으로써 규칙을 찾아내는 것임을 보여줍니다. 이는 AI가 세상을 단순히 말하는 것을 넘어, 진정으로 보는 단계로 나아가는 한 걸음입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.