← 최신 논문
🤖 AI

VGGT-DP: Generalizable Robot Control via Vision Foundation Models

VGGT-DP는 사전 학습된 3D 인지 모델의 기하학적 사전 지식과 고유 수용성 피드백을 통합하는 동시에, 공간적 접지력, 강건성 및 추론 효율성을 향상시키기 위해 프레임 단위의 토큰 재사용과 무작위 토큰 가지치기를 채택함으로써 시각-운동 정책의 성능을 강화하는 일반화 가능한 로봇 제어 프레임워크이다.

원저자: Shijia Ge, Yijun Liu, Yinxin Zhang, Shuzhao Xie, Weixiang Zhang, Mingcai Zhou, Zhi Wang

게시일 2026-08-26
📖 5 분 읽기🧠 심층 분석

원저자: Shijia Ge, Yijun Liu, Yinxin Zhang, Shuzhao Xie, Weixiang Zhang, Mingcai Zhou, Zhi Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 생명체가 가진 유연한 자신감 있게 움직이는 데 어려움을 겪어왔습니다. 수십 년 동안 엔지니어들은 기계에 경직된 수동 프로그래밍 규칙을 입력하여, 발생 가능한 모든 상황에 대해 팔을 어떻게 움직여야 하는지 정확하게 지시했습니다. 이러한 방식은 통제된 공장에서는 효과적이었으나, 세상이 조금이라도 변하면 처참하게 실패했습니다. 최근 몇 년 사이 새로운 접근 방식이 자리 잡았습니다. 바로 아이가 부모를 관찰하며 배우는 것처럼, 로봇에게 예시를 보여주며 가르치는 방식입니다. 로봇은 인간이 과업을 수행하는 것을 지켜보고 그 움직임을 모방하려고 시도합니다. 그러나 이러한 학습 시스템은 종종 공간에 대한 깊은 이해가 부족합니다. 로봇은 물체를 인식할 수는 있지만, 그 물체가 로봇의 본체와 관련하여 3차원 공간 내에 어떻게 놓여 있는지 파악하는 데 자주 실패합니다. 이러한 공간 이해의 간극은 복잡한 작업을 처리하거나 카메라 각도가 바뀌거나 환경이 변할 때 적응하는 로봇의 능력을 제한합니다.

한 연구팀은 생물학적 시각이 작동하는 방식에서 영감을 얻어 이 간극을 메우기 위해 설계된 새로운 시스템을 개발했습니다. 자연계에서 동물은 항해를 위해 단 하나의 감각에만 의존하지 않습니다. 그들은 자신이 보고 있는 것과 자신의 신체 위치에 대한 지속적인 내부 감각인 고유 수용성 감각(proprioception)을 결합합니다. 이 내부 피드백 덕분에 파리는 움직이는 잎사귀 위에 내려앉을 수 있고, 고양이는 좁은 난간을 따라 떨어지지 않고 걸을 수 있습니다. 칭화 대학교와 다른 기관들의 시지아 게(Shijia Ge)와 동료들이 이끄는 연구진은 이러한 생물학적 전략을 모방한 VGGT-DP라는 프레임워크를 만들었습니다. 언어 지시나 단순한 시각적 신호에 의존하는 대신, 이 시스템은 강력한 사전 학습된 시각 모델과 로봇의 내부 상태 센서를 융합합니다. 이 결합을 통해 로봇은 주변 환경에 대한 견고한 3차원 지도를 구축하고, 그 공간 안에서 자신의 팔다리가 정확히 어디에 있는지 이해할 수 있게 됩니다.

이 새로운 시스템의 핵심은 방대한 양의 3D 재구성 데이터를 통해 학습된 시각 엔진입니다. 표준적인 로봇 비전 모델은 대개 속도를 위해 세부 사항을 희생하며 작고 빠르게 설계되지만, 이 시스템은 깊이, 카메라 각도, 그리고 장면 내 모든 점의 정밀한 위치를 예측할 수 있는 대규모 모델을 사용합니다. 연구진은 이 고성능 시각 모델을 사용함으로써 로봇이 훨씬 더 강력한 기하학적 감각을 얻게 된다는 것을 발견했습니다. 하지만 이러한 대규모 모델을 실시간으로 실행하는 것은 계산 비용이 많이 들고 느립니다. 이를 해결하기 위해 팀은 '프레임별 토큰 재사용(frame-wise token reuse)'이라는 영리한 기술을 발명했습니다. 전형적인 비디오 피드에서 많은 프레임은 상당 부분 겹칩니다. 배경과 대부분의 물체는 1밀리초 단위로 변하지 않습니다. 새로운 시스템은 이를 인식하여 변화가 없는 이미지 부분에 대해서는 시각적 특징을 다시 계산하지 않습니다. 대신 최신 프레임에 들어오는 새로운 정보만을 처리하고, 이전 순간의 캐시된 데이터를 재사용합니다. 이 접근 방식은 로봇이 생각하는 데 걸리는 시간을 획기적으로 줄여, 강력한 시각 모델을 실제 환경에서 사용할 수 있도록 만들었습니다.

로봇의 시각이 물리적 현실과 일치하도록 보장하기 위해, 연구진은 내부적인 감독 레이어를 추가했습니다. 그들은 시각 시스템이 오직 눈에 보이는 것만을 바탕으로 로봇의 관절 각도와 손의 위치를 예측하도록 가르쳤습니다. 만약 로봇의 눈이 컵을 향해 손을 뻗는 것을 보았다면, 시스템은 그 손이 공간의 어디에 위치해 있는지 정확히 추측할 수 있어야 했습니다. 이는 시각 모델이 로봇의 내부 상태와 완벽하게 정렬되도록 강제하여 긴밀한 피드백 루프를 생성했습니다. 이 퍼즐의 마지막 조각은 '무작위 토큰 가지치기(random token pruning)'라고 불리는 방법으로, 시스템이 훈련 중에 의도적으로 시각 데이터의 작고 무작위적인 부분들을 무시하게 만드는 것입니다. 이 기술은 일종의 스트레스 테스트 역할을 하여, 로봇이 특정 세부 사항을 암기하는 대신 장면의 전체적인 형태와 구조를 학습하도록 강제함으로써, 누락된 정보나 노이즈에 더 탄력적으로 대응할 수 있게 합니다.

구멍에서 물체를 집어 올리거나, 물건을 바구니로 쓸어 담거나, 막대를 당기는 것과 같은 도전적인 조작 작업 세트에서 테스트했을 때, 이 새로운 시스템은 기존 방식들에 비해 놀라운 개선을 보여주었습니다. 정밀한 공간 추론이 필요한 어려운 시나리오에서, 이 새로운 접근 방식은 기존의 최고 성능 모델들보다 현저히 높은 성공률을 달eli 달성했습니다. 예를 들어, 깊은 구멍에서 물체를 집어 올리는 작업에서 새 시스템은 55%의 성공률을 보인 반면, 이전의 최고 방법인 DP3는 14%에 그쳤습니다. 또한 이 시스템은 물건을 한데 모으기 위해 쓰는 작업에서도 매우 효과적이었는데, 여기서 새 시스템은 44%의 성공률을 기록하여 차순위 경쟁 모델의 15%보다 높은 성과를 냈습니다. 이러한 결과는 로봇에게 언어 능력을 추가하는 것보다 깊이 있는 기하학적 공간 이해력을 부여하는 것이 복잡한 조작을 위해 훨씬 더 중요하다는 것을 시사합니다.

하지만 연구진은 시스템이 여전히 부족한 부분에 대해서도 주의 깊게 언급했습니다. 이 시스템은 복잡한 공간 추론이 필요한 작업에는 뛰어난 성능을 보였지만, 근처의 물체를 향해 손을 뻗는 것과 같은 매우 기본적인 작업에서는 오래된 단순 모델보다 항상 더 나은 성능을 보이지는 않았습니다. 이러한 단순한 시나리오에서 무거운 시각 모델은 때때로 불필요한 복잡성을 초래했습니다. 더 심각하게는, 카메라 각도가 아주 미세하게 변했을 때 시스템은 어려움을 겪었습니다. 연구진이 카메라를 단 5도만 회전시켜 테스트했을 때, 성공률은 거의 40%에서 거의 0%로 급격히 떨어졌습니다. 이는 시스템이 3차원 공간을 잘 이해하도록 학습되었지만, 훈련 데이터에 존재하지 않았던 새로운 관점에 유연하게 대처하는 법은 아직 배우지 못했음을 나타냅니다. 연구진은 향후 연구가 시각적 표현을 더욱 견고하게 만드는 데 집중해야 한다고 제안했습니다.

연구는 더 유능한 로봇으로 가는 길이 언어로 더 똑똑하게 만드는 것이 아니라, 시각을 물리적 현실에 더 밀착시키는 데 있다고 결론짓습니다. 3D 기하학을 이해하는 대규모 시각 모델과 로봇 자신의 신체에 대한 내부 감각을 결합함으로써, 연구진은 이전의 모방 학습에서는 볼 수 없었던 수준의 정밀도로 세상을 탐색하고 조작할 수 있는 시스템을 만들었습니다. 이 연구는 일반화 가능한 로봇 제어의 핵심이 환경에 대한 깊은 공간적 이해와 로봇 자신의 상태에 대한 내부적 인식을 바탕으로 한다는 것을 입증합니다. 비록 예상치 못한 카메라 각도 변화를 다루는 문제 등 과제가 남아있지만, 이 결과는 로봇 제어의 미래를 향한 명확한 방향을 제시합니다. 즉, 언어적 복잡성보다 공간적 접지(spatial grounding)와 생물학적 영감을 우선시하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →