← 최신 논문
💻 computer science

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models

Mind-VLA는 언어 지시사항에 의해 식별된 대상 물체의 3D 기하학적 구조와 잠재 표현을 구체적으로 정렬함으로써 시각-언어-행동(Vision-Language-Action) 모델을 향상시키는 지시 인지형 공간 표현 정렬 방법으로, 이를 통해 미세 조작 및 가려진 대상 작업에서의 성능을 크게 개선한다.

원저자: Xingyu Ding, Yuzhong Zhao, Yang Wu, Chunhai Zhao, Chaoyang Zhao, Yifan Zhang, Jian Cheng

게시일 2026-08-31
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xingyu Ding, Yuzhong Zhao, Yang Wu, Chunhai Zhao, Chaoyang Zhao, Yifan Zhang, Jian Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 반복의 달인이었으며, 동일한 정밀 동작을 오류 없이 수천 번 수행할 수 있는 능력을 갖추어 왔습니다. 그러나 어수선한 방을 탐색하거나, 유사한 물체들이 쌓여 있는 더미에서 특정 물체를 집어 올리라는 요청을 받으면 로봇은 종종 비틀거립니다. 문제는 단순히 세상을 보는 것이 아니라, 인간이 만지라고 요청한 특정 물체의 3차원 형태와 위치를 이해하는 데 있습니다. 현대의 로봇들은 점차 시각-언어-행동(Vision-Language-Action) 모델에 의해 유도되고 있는데, 이 시스템들은 시각적 장면과 음성 명령을 입력받아 물리적 움직임을 결정합니다. 이러한 시스템들은 일반적인 작업에는 매우 능숙해졌지만, 목표 물체가 부분적으로 가려져 있거나 로봇이 거의 동일하게 생긴 두 물체를 구별해야 할 때 종종 어려움을 겪습니다. 핵심적인 난점은 이 모델들이 전체 시각적 장면을 하나의 균일한 정보 블록으로 취급하며, 인간이 언급한 특정 물체에 대해 기하학적 이해를 집중시키지 못한다는 점에 있습니다.

Mind-VLA라고 불리는 새로운 접근 방식은 로봇에게 명령에 언급된 특정 물체에 주의를 기울이도록 가르침으로써 이러한 한계를 해결합니다. 전체 방의 3D 기하학적 구조를 매핑하려고 시도하는 대신, 이 시스템은 언어 지침에 기술된 목표 물체를 분리하고 그 물체만을 위한 상세한 정신적 모델을 구축하는 법을 배웁니다. 이 방법 덕분에 로봇은 감자가 비슷하게 생긴 사과 옆에 놓여 있더라도 감자의 형태와 위치를 이해할 수 있으며, 바나나가 천에 의해 부분적으로 덮여 있는 경우에도 이를 잡을 수 있습니다. 초점을 전체 장면에서 특정 목표물로 전환함으로써, 로봇은 어디로 손을 뻗어야 할지, 물체를 어떻게 잡아야 할지에 대해 더 날카로운 감각을 얻게 되어 복잡한 실제 상황에서 더 신뢰할 수 있는 성능을 보여줍니다.

이 연구를 진행한 연구진은 현재의 3D 인식 로봇들이 학습하는 방식에서 근본적인 결함을 발견했습니다. 기존 방식은 인간이 무엇을 요청하든 상관없이 로봇의 내부 이해를 전체 장면의 기하학적 구조와 일치시키곤 합니다. 만약 사람이 "감자를 집어라"라고 말한다면, 로봇의 학습 데이터는 감자와 함께 테이블, 배경 벽, 그리고 카운터 위의 다른 과일들의 3D 구조까지 함께 인코딩하도록 강제할 수 있습니다. 이는 가장 중요한 정보인 감자 자체의 형태가 주변 환경의 소음에 섞여 흐릿한 신호가 되게 만듭니다. 이 문제는 목표 물체가 부분적으로 가려지거나 시야에서 숨겨질 때 결정적인 문제가 되는데, 왜냐하면 로봇이 조작해야 할 특정 물체의 3D 구조를 보존하도록 명시적으로 학습되지 않았기 때문입니다.

이를 해결하기 위해 연구팀은 관심 있는 물체만을 비추는 스포트라이트와 같은 학습 과정을 개발했습니다. 로봇이 명령을 받으면, 시스템은 먼저 언어를 분석하여 목표 물체와 의도된 상호작용 순서를 식별합니다. 그런 다음 해당 특정 물체의 표준적이거나 정형적인(canonical) 뷰들을 구성하여, 사실상 해당 물체만을 고립시킨 깨끗한 3D 청사진을 만듭니다. 학습 단계에서 로봇은 이러한 고립된 뷰들을 보여주며, 주변의 나머지 장면은 무시하고 목표물의 기하학적 구조와 자신의 내부 이해를 일치시키도록 요구받습니다. 이 과정은 두 가지 주요 단계로 이루어집니다. 시각적 외형으로부터 목표물의 숨겨진 3D 구조를 예측하는 것과, 로봇의 중간 처리 계층을 해당 특정 물체의 상세한 기하학적 특징과 정렬하는 것입니다. 결정적으로, 이 추가적인 학습 감독은 로봇이 학습하는 동안에만 사용되며, 학습이 완료된 후 로봇은 추가적인 3D 센서나 복잡한 처리 과정 없이 이전과 동일하게 작동합니다.

이 접근 방식의 결과는 시뮬레이션 환경과 실제 물리적 로봇 모두에서 테스트되었습니다. 로봇 조작을 테스트하기 위해 설계된 일련의 표준 벤치마크에서, 이 새로운 방법은 동일한 기본 아키텍처를 사용하는 이전 모델들을 능가하는 94.4%의 성공률을 달연했습니다. 개선은 특히 로봇이 유사한 물체들 사이에서 선택을 해야 하는 미세한 구별이 필요한 작업에서 두드러졌습니다. 로봇이 다섯 가지 서로 다른 작업을 연속적으로 완수하는 능력을 테스트하는 CALVIN 벤치마크에서, 이 시스템은 평균 4.47개의 작업을 완료하며 이전의 최고 기록보다 약간이지만 의미 있는 향상을 보였습니다. 이러한 수치들은 목표물에 집중함으로써 로봇이 더 정밀해지고 혼란에 빠질 가능성이 낮아졌음을 시사합니다.

그러나 이 방법의 진정한 시험대는 연구진이 목표 물체가 부분적으로 가려진 실제 환경에 로봇을 배치했을 때 찾아왔습니다. 연구진은 듀얼 암 로봇을 설치하고 감자나 바나나 같은 물체를 집어 옮기도록 요청했는데, 이때 목표물의 약 25%를 가리개로 덮었습니다. 이러한 까다로운 조건에서 새로운 시스템은 54%의 성공률을 기록했습니다. 이는 전통적인 장면 전체 접근 방식을 사용한 동일한 로봇의 제어 버전이 28%의 성공률을 보인 것에 비해 비약적인 도약입니다. 26%포인트의 차이는 지침 인식형 공간 이해의 가치를 강조합니다. 목표물이 부분적으로 가려졌을 때, 무엇을 찾아야 하는지 정확히 아는 로봇은 여전히 그 형태와 위치를 추론할 수 있는 반면, 전체 장면을 바라보는 로봇은 목표물의 누락된 부분을 재구성하는 데 실패하곤 합니다.

수치적인 성과를 넘어, 본 연구는 로봇이 실제로 특정 물체의 기하학적 구조를 표현하는 법을 배우고 있음을 밝혀냈습니다. 연구진이 모델의 내부 계층을 분석했을 때, 시스템이 이전 모델들보다 목표물의 형태에 대해 훨씬 더 상세한 정보를 인코딩하고 있다는 것을 발견했습니다. 또한, 로봇은 언어 지침에 따라 정확한 물체를 안정적으로 검색할 수 있었으며, 이는 내부 지도가 들리는 단어와 직접 연결되어 있음을 증명했습니다. 이는 로봇이 단순히 패턴을 암기하는 것이 아니라, 언어가 3D 공간과 어떻게 연관되는지에 대한 유연한 이해를 발전시키고 있음을 시사합니다. 기계에게 중요한 물체에 기하학적 주의를 집중하도록 가르침으로써, 연구진은 로봇이 인간 환경의 무질서하고 어수선하며 종종 가려져 있는 현실을 더 큰 자신감과 숙련도로 다룰 수 있도록 만드는 한 걸음을 내디뎠습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →