← 최신 논문
💻 computer science

GraphPoint: Semantic Entity Graphs and Point Trajectories for Compositional Robot Manipulation

이 논문은 명령 의존적 일반화 성능을 향상시키기 위해 예측된 그리퍼 궤적을 통해 의미론적 엔티티 그래프를 기하학적 제어와 연결하는 프레임워크인 GraphPoint를 소개하며, 이는 서브태스크 간 및 서브태스크 내에서의 구성적 재사용을 테스트하도록 설계된 새로운 CoMani 벤치마크를 통해 검증되었습니다.

원저자: Kang Luo, Hesheng Wang

게시일 2026-09-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kang Luo, Hesheng Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컵을 집어 들거나 테이블 위에 그릇을 놓는 로봇은 연구실에서 흔히 볼 수 있는 모습이 되었지만, 이 기계들은 지침이 약간만 바뀌어도 종종 어려움을 겪습니다. 그릇을 접시 위에 놓도록 훈련받은 로봇은, 같은 그릇을 접시의 오른쪽에 놓으라는 요청을 받거나, 들어 올리는 대신 그곳으로 쓸어서 옮기라는 요청을 받으면 실패할 수 있습니다. 이는 현재의 많은 시스템이 동작을 설명하는 단어를 진정으로 이해하기보다는, 특정 장면의 사진과 특정 움직임을 매칭하는 법을 배우기 때문에 발생합니다. 시각적 장면이 익숙해 보이면, 로봇은 그 시각적 지름길에 의존하며 새로운 지침을 무시합니다. 로봇이 진정으로 적응할 수 있도록 구축하기 위해서, 연구자들은 로봇에게 사물의 의미와 위치를 분리하는 법을 가르치고, 동작이 새로운 방식으로 어떻게 혼합되고 조합될 수 있는지 이해하도록 가르칠 필요가 있습니다.

상하이 교통 대학교의 한 연구팀은 이 문제를 해결하기 위한 새로운 접근 방식을 개발하여, GraphPoint라고 불리는 시스템을 도입했습니다. 이 시스템은 로봇의 시야를 단일한 비구조적 이미지나 점들의 구름으로 취급하는 대신, 장면을 특정 역할의 지도로 분해합니다. 이 시스템은 로봇의 손, 움직이는 대상, 그리고 목표 목적지를 별개의 개체로 식ert합니다. 그런 다음 대규모 언어 모델을 사용하여 인간의 지침을 읽고, 이 역할들이 정확히 어떻게 상호작용해야 하는지를 정의하는 구조화된 계획으로 번역합니다. 예를 들어, 만약 어떤 사람이 "그릇을 접시 위에 놓으세요"라고 말하면, 시스템은 그릇이 움직일 대상이고, 접시가 목표이며, 동작은 '놓기'라는 것을 이해합니다. 결정적으로, 시스템은 내부 논리에서 이러한 역할들을 분리하여 유지함으로써, 전체 움직임을 처음부터 다시 배울 필요 없이 다른 물체나 다른 목표에 대해 동일한 '놓기' 논리를 적용할 수 있게 합니다.

연구진은 자신들이 만든 CoMani라는 새로운 도전 과제 세트를 사용하여 아이디어를 테스트했습니다. 이 테스트 환경은 특정 유형의 학습을 격리하도록 설계되었습니다. 한 세트의 테스트에서 로봇은 "접시 위에"와 "접시 오른쪽에"와 같이 위치에 대한 서로 다른 지침을 가지고 동일한 동작(예: 물체를 내려놓기)을 수행하도록 요청받았습니다. 또 다른 세트에서 로봇은 물체를 들어 올리는 대신 쓸어서 옮기는 것과 같은 다양한 유형의 움직임을 사용해야 했습니다. 마지막으로, 그들은 로봇이 본 적 없는 긴 순서로 몇 가지 간단한 작업들을 연결할 수 있는지 테스트했습니다. 예를 들어, 병, 그릇, 치즈를 특정 순서대로 움직이는 것과 같은 작업입니다. 목표는 로봇이 단순히 방의 시각적 패턴을 암기하는 것이 아니라, 들리는 단어에 의依存할 수 있는지 확인하는 것이었습니다.

결과는 GraphPoint가 이러한 테스트에서 다른 선도적인 방법들을 크게 능가했음을 보여주었습니다. 만약 지침이 물체 간의 관계를 변경하여, 물체를 위가 아닌 오른쪽에 놓으라고 요청했을 때, 다른 시스템들은 시각적 레이아웃에 갇혀 종종 실패한 반면, GraphPoint는 거의 모든 경우에 성공했습니다. 또한 이 시스템은 새로운 동작 유형을 학습할 수 있음을 입증했습니다. 한 번도 보여준 적 없는 작업인 노브(knob)를 돌리는 동작을 요청받았을 때, 시스템은 회전이라는 개념을 새로운 물체에 성공적으로 적용했습니다. 가장 인상적이게도, 전체를 연습해 본 적 없는 3단계 시퀀스에 직면했을 때, 시스템은 첫 두 단계를 80% 이상의 확률로 정확하게 완료했으며, 세 단계 모두를 마치는 데는 약 절반의 시도에서 성공했습니다. 이는 로봇이 개별적으로 배운 단순한 기술들을 결osh하여 복잡한 다단계 지침을 따를 수 있음을 보여주었습니다.

이 시스템의 성공은 정보를 처리하는 방식에 달려 있습니다. 시스템은 방 안의 절대적인 위치로 작업하는 대신, 모든 것을 로봇 자신의 손을 기준으로 상대적으로 설명합니다. 이를 통해 로봇은 물체가 어디서 시작했는지와 상관없이 물체를 "오른쪽으로" 움직이는 것이 무엇을 의미하는지 이해할 수 있습니다. 또한 이 시스템은 훈련 중에 물체의 세부적인 형태를 일시적으로 숨기는 기법을 사용하는데, 이는 로봇이 물체의 외형을 단순히 암기하는 대신 언어 지침과 물체의 역할에 집중하도록 강제합니다. 로봇의 움직임을 역할과 관계의 의미론적 지도에 기반하게 함으로써, 연구진은 시각적 장면이 동일하더라도 언어적 변화에 반응하는 정책을 만들었습니다. 이 연구는 로봇이 역동적인 환경에서 진정으로 유용해지기 위해서는, 시각적 패턴을 유일한 진실의 원천으로 취급하기보다 지침을 행동의 주요 가이드로 취급하는 법을 배워야 함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →