← 최신 논문
💻 computer science

SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation

SWIM은 확산 기반 VLA 정책과 시각적 소프트 고유 수용 감각(Visual Soft Proprioception)을 통합하여, 강건한 물리적 실행을 위해 내재적 순응성을 활용하는 실행 가능한 구동 시퀀스를 생성함으로써 소프트 연속체 로봇이 복잡한 전신 상호작용 조작을 수행할 수 있도록 하는 시각-언어 접지 프레임워크이다.

원저자: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

게시일 2026-09-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 공학의 세계에는 단단한 금속 프레임으로 제작된 기계와 부드럽고 유연한 재료로 만들어진 기계 사이에 뚜렷한 구분이 존재합니다. 자동차 공장에서 볼 수 있는 로봇 팔과 같은 강체 로봇은 정해진 프로그램에 따라 확실하게 움직이지만, 좁은 공간으로 비집고 들어가거나 물체를 찌그러뜨리지 않고 섬세하고 불규칙한 물체를 다루는 데 어려움을 겪습니다. 반면, 소프트 로봇은 생체 조직처럼 구부러지고, 늘어나고, 뒤틀릴 수 있는 순응형 재료로 만들어집니다. 이러한 유연성 덕분에 물체를 감싸거나 주변 환경에 맞춰 형태를 바꿀 수 있어, 좁은 공간에서의 작업이나 인간과의 안전한 상호작용을 위한 잠재적인 해결책을 제공합니다. 그러나 바로 이 유연성이 새로운 문제를 야기합니다. 무수히 많은 방식으로 변형될 수 있는 신체를 제어하는 것은 매우 어렵다는 점입니다. 인간이 "저것 좀 집어 올려"와 같은 단순한 명령을 내릴 때, 강체 로봇은 손을 움직이기 위한 단 하나의 경로를 계산할 수 있습니다. 하지만 몸 전체가 형태를 바꿀 수 있는 소프트 로봇은 동일한 목표를 달성하기 위해 자신의 전체 형태를 어떻게 뒤틀어야 할지 파악해야 하며, 이는 단순히 물체뿐만 아니라 로봇 자신의 복잡한 기하학적 구조를 실시간으로 이해해야 하는 작업입니다.

연구진은 최근 이러한 특정 과제를 해결하기 위해, 소프트 로봇이 언어와 시각적 장면을 이해하여 전신 조작(whole-body manipulation)을 수행할 수 있도록 가르치는 SWIM이라는 새로운 시스템을 개발했습니다. 연구팀은 근육이 뼈를 당기는 것과 유사하게 케이블에 의해 구동되는 나선형 로봇에 집중했는데, 이는 로봇이 물체를 굽히고, 뻗고, 감쌀 수 있게 해줍니다. 그들이 해결한 핵심적인 어려움은 기존 방식들이 종종 로봇의 팔 끝부분에만 집중하여 제어하려 했고, 나머지 몸체의 복잡한 형태를 무시했다는 점입니다. 이러한 접근 방식은 끝부분의 위치만으로는 로봇의 나머지 부분이 어떻게 굽어 있는지, 혹은 세상과 어떻게 접촉하고 있는지를 온전히 설명할 수 없기 때문에 실패했습니다. 이를 해결하기 위해 연구진은 로봇의 전체 몸 형태, 시각적 장면, 그리고 음성 명령을 동시에 살펴보는 학습 시스템을 만들었습니다. 그들은 로봇이 수천 번 연습할 수 있는 시뮬레이션 환경에서 이 시스템을 훈련시켰으며, 시스템은 물체를 집어넣거나, 목표물을 향해 뻗거나, 물체를 움켜쥐는 것과 같은 목표를 달성하기 위한 일련의 케이블 움직임 시퀀스를 예측하는 법을 배웠습니다.

그들의 방법론에서 핵심적인 혁신은 "시각적 소프트 고유 수용 감각(visual soft proprioception)"이라고 부르는 기술입니다. 간단히 말해, 이는 로봇이 카메라 이미지를 통해 자신의 몸 형태를 "보는" 법을 배워, 케이블 장력이라는 내부 지식을 보완하는 것을 의미합니다. 훈련 과정에서 시스템은 현재의 텐던(tendon) 길이 벡터를 고유 수용 입력값으로 사용하여 자신의 구성을 이해하는 한편, 시뮬레이션 상에서 로봇 몸체의 여러 지점에 대한 정확한 좌표를 함께 보여주었습니다. 컴퓨터 모델이 이 지점들이 어디에 있는지 예측하도록 강제함으로써, 시스템은 로봇의 기하학적 구조에 대한 정신적 지도를 유지하는 법을 배웠습니다. 이를 통해 로봇은 특정 물체에 도달하기 위해 물체를 집어넣을 때와는 다르게 중간 부분을 다르게 굽혀야 할 수도 있다는 점을 이해할 수 있었습니다. 또한, 목표를 향한 단 하나의 완벽한 경로를 예측하는 대신, 시스템은 가능한 성공적인 움직임의 범위를 예측하도록 학습되었습니다. 이는 매우 중요한데, 소프트 바디의 경우 물체를 감싸는 데 있어 종종 다양한 방법이 존재하며, 시스템이 하나의 경직된 계획에 갇히기보다는 어떤 유효한 옵션이라도 선택할 수 있을 만큼 유연해야 했기 때문입니다.

연구진은 이 접근 방식을 두 가지 방식으로 테스트했습니다. 첫째는 컴퓨터 시뮬레이션에서, 둘째는 실제 물리적 로봇에서였습니다. 시뮬레이션에서 이 시스템은 매우 성공적이었으며, 물체 넣기 작업은 100%, 목표물 향해 뻗기 96%, 물체 움켜쥐기 88%의 성공률을 기록했습니다. 이 결과는 몸 형태에 대한 인지나 유연한 예측 모델을 사용하지 않은 다른 방법들보다 현저히 뛰어난 수치였습니다. 그러나 진정한 시험대는 실제 세계로 옮겨갔을 때였습니다. 연구진이 로봇의 뇌를 실제 기계에 직접 연결하여 카메라 및 모터와 실시간으로 작동시키려 했을 때, 성능이 급격히 떨어졌습니다. 로봇은 움켜쥐기 시도 중 75%에서 실패했는데, 이는 주로 처리 과정의 미세한 지연과 시뮬레이션과 현실 사이의 차이로 인해 로봇이 오래된 정보에 기반하여 행동했기 때문입니다.

이를 극복하기 위해 연구진은 영리한 배포 전략을 도입했습니다. 로봇이 움직이는 동안 실시간으로 생각하고 반응하게 하는 대신, 먼저 가상 시뮬레이션에서 전체 움직임 시퀀스를 계획하도록 하는 것입니다. 로봇은 실제 세계를 관찰하고 장면의 디지털 트윈을 생성한 다음, 머릿속에서 과업을 수행하며 전체 명령 목록을 생성합니다. 일단 이 전체 시퀀스가 준비되면, 로봇은 다시 멈춰서 보거나 생각하지 않고 그대로 실행합니다. 로봇의 몸은 본래 부드럽고 유연하기 때문에, 지속적인 컴퓨터 수정 없이도 작은 충돌이나 접촉 변화를 스스로 처리할 수 있습니다. 이 "계획 후 실행(plan then execute)" 방식을 사용했을 때, 물리적 로봇의 성공률은 물체 넣기 100%, 목표물 향해 뻗기 80%, 움켜쥐기 75%로 다시 급증했습니다. 이는 로봇 자신의 형태에 대한 깊은 이해과 자연스러운 물리적 유연성을 활용하는 전략을 결합함으로써, 소프트 로봇이 단순한 언어의 안내를 받아 이전에는 도달할 수 없었던 복잡한 전신 작업을 수행할 수 있음을 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →