← 최신 논문
💻 computer science

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp는 시각-언어 모델을 사용하여 경량화된 파지 생성기를 위한 시드 포인트를 예측함으로써 고차원적 의미론적 추론과 저차원적 기하학적 실행을 분리하는 데이터 효율적인 프레임워크로, 값비싼 엔드 투 엔드 학습 없이도 복잡한 장면에서 견고한 다중 로봇체계 파지를 가능하게 한다.

원저자: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

게시일 2026-07-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 지저리한 침실 바닥에서 장난감을 집으려고 노력하는 모습을 상상해 보세요. 인간에게 이것은 쉽습니다. 장난감을 보고, 손잡이가 어디에 있는지 알며, 그것을 잡으면 됩니다. 하지만 로봇에게 세상은 형태와 그림자가 뒤섞인 혼란스러운 덩어리입니다. 로봇은 두 가지 매우 다른 것을 동시에 이해해야 합니다. 즉, '큰 그림'(나의 목표는 무엇인가? "빨간 컵의 손잡이를 잡아라")과 '세밀한 디테일'(램프를 넘어뜨리지 않으려면 내 손가락이 정확히 어디를 만져야 하는가?)입니다. 이것이 바로 **로봇 파지(robotic grasping)**의 과제입니다. 오랫동안 로봇은 매우 똑똑하지만 서툴거나(무엇을 해야 할지는 알지만 물체를 만지는 물리 법칙을 파악하지 못함), 혹은 물리에는 능숙하지만 멍청했습니다(무엇이든 잡을 수는 있지만, 언어를 이해하지 못한 채 정확히 어디를 잡아야 하는지 일일이 알려줘야만 함). 과학자들은 로봇이 "바구니의 손잡이를 잡아라"와 같은 간단한 문장을 듣고, 어지러운 방 안에서도 다양한 종류의 로봇 손을 사용하여 물체를 집는 완벽한 방법을 스스로 찾아낼 수 있도록 만드는 데 매진해 왔습니다.

여기에, 마치 영리한 두 팀인 '두뇌'와 '손'처럼 작동하는 새로운 방법인 SeededGrasp가 등장했습니다. 하나의 거대하고 초복잡한 로봇 두뇌에게 모든 것을 한꺼번에 가르치려 하는 대신(이는 마치 개에게 미적분을 가르치면서 동시에 공 던지기 놀이를 배우게 하는 것과 같습니다), 연구진은 업무를 분리했습니다. 먼저, 연구진은 강력한 시각-언어 모델(VLM)—쉽게 말해 읽고 볼 줄 아는 초스마트 AI—을 사용하여 어지러운 장면과 명령어를 살펴봅니다. 이 AI는 정확한 손가락 위치를 계산하려고 시도하는 대신, 단지 파지의 시작점이 될 단 하나의 '시드 포인트(seed point)', 즉 디지털 압정처럼 물체 위의 한 점을 가리킵니다. 이는 마치 사람이 "바로 저기를 잡아"라고 말하며 손가락으로 가리키는 것과 같습니다.

이 "시드 포인트"가 심어지면, 두 번째의 가벼운 모델이 바통을 이어받습니다. 이 모델은 그 단 하나의 지점을 바탕으로 로봇의 손가락을 어떻게 움직여야 하는지 정확히 아는 숙련된 정비사와 같습니다. 무거운 언어 이해 작업은 첫 번째 AI가 수행하고, 무거운 기하학 작업은 두 번째 AI가 수행하기 때문에, 이들은 매우 효율적으로 협력할 수 있습니다. 연구진은 이를 세 가지 서로 다른 유형의 로봇 손(표준적인 두 손가락 그리퍼, 세 손가락 그리퍼, 그리고 관절이 많은 매우 정교한 손)을 사용하여 시뮬레이션된 지저리한 방에서 테스트했습니다. 그 결과, 이 "시드 포인트" 방식이 놀라울 정도로 잘 작동하여 시뮬레이션에서 72%의 성공률을 달 Achieve 했습니다. 더욱 인상적인 것은, 실제 로봇을 사용하여 실제 환경에서 테스트했을 때 78%의 시간 동안 성공했다는 점입니다.

이 논문은 또한 몇 가지 일반적인 생각에 반론을 제기합니다. 연구진은 하나의 거대한 모델을 처음부터 모든 것을 하도록 훈련시키는 것이 너무 비용이 많이 들고 데이터 집약적이라고 주장합니다. 또한, 단순히 VLM을 사용하여 전체 파지 포즈(grasp pose)를 직접 추측하게 하면 AI가 3D 기하학 구조 때문에 혼란을 겪어 실수가 자주 발생한다는 점을 보여줍니다. 대신, "시드 포인트"는 완벽한 가교 역할을 하여, 똑똑한 AI는 언어를 처리하고 특화된 모델은 물리학을 처리하도록 해줍니다. 이를 증명하기 위해 연구팀은 기존 데이터에만 의존하지 않고, 시스템 훈련을 위해 610개의 지저리한 장면에 걸친 256만 개의 파지 데이터라는 완전히 새로운 대규모 데이터셋을 직접 만들었습니다. 결과는 매우 유망하지만, 저자들은 이것이 시뮬레이션과 특정 설정에서의 실세계 실험을 통해 테스트되었음을 언급하며, 로봇 팔이 장애물에 부딪히지 않고 "시드"가 가리키는 모든 지점에 도달할 수 있도록 보장하기 위해 여전히 할 일이 남아 있다고 말합니다. 하지만 현재로서는, SeededGrasp는 로봇에게 손가락으로 가리키는 도움을 받아 듣고, 보고, 잡는 법을 가르치는 재미있고 효과적인 방법을 보여주고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →