← 최신 논문
💻 computer science

Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives

이 설문 조사는 최근의 학습 기반 접근 방식들을 고수준 계획(언어, 코드 및 기하학에 대한 추론을 포함)과 저수준 행동 모델링이라는 통합된 프레임워크로 체계화하고, 파운데이션 모델이 계획 산출물과 직접적인 행동 생성 모두에 어떻게 기여하는지를 강조함으로써 파운데이션 모델 시대의 로봇 조작에 대한 구조적인 개요를 제공한다.

원저자: Shuanghao Bai, Wenxuan Song, Jiayi Chen, Yuheng Ji, Zhide Zhong, Jin Yang, Han Zhao, Wanqi Zhou, Zhe Li, Pengxiang Ding, Cheng Chi, Chang Xu, Xiaolong Zheng, Donglin Wang, Haoang Li, Shanghang Zhang
게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shuanghao Bai, Wenxuan Song, Jiayi Chen, Yuheng Ji, Zhide Zhong, Jin Yang, Han Zhao, Wanqi Zhou, Zhe Li, Pengxiang Ding, Cheng Chi, Chang Xu, Xiaolong Zheng, Donglin Wang, Haoang Li, Shanghang Zhang, Badong Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 반복의 달인이었습니다. 공장에서 동일한 정밀한 동작을 수천 번 수행해 왔지만, 세상이 변할 때는 어려움을 겪습니다. 테이블에서 싱크대로 컵을 옮기기 위해서, 전통적인 로봇은 컵이 어디에 있는지, 어떻게 잡아야 하는지, 그리고 쏟지 않고 팔을 어떻게 움직여야 하는지까지 모든 단계를 인간이 프로그래밍해 주어야 합니다. 이러한 어려움은 작업이 일련의 기술 체인을 필요로 하기 때문에 발생합니다. 즉, 물체를 보고, 그것이 무엇인지 이해하고, 그것을 움직이기 위한 단계들을 구상한 다음, 물리적으로 근육을 제어하여 작업을 수행하는 과정이 필요합니다. 수십 년 동안 연구자들은 로봇의 눈과 손 사이의 간극을 메우려 노력해 왔으나, 그 연결은 종종 취약했습니다. 최근의 진보는 '파운데이션 모델(foundation models)'이라 불리는 새로운 유형의 인공지능으로부터 나오고 있습니다. 이들은 인터넷의 방대한 데이터를 학습한 거대 시스템으로, 언어와 이미지, 그리고 물리적 세계를 거의 직관적인 방식으로 이해할 수 있습니다. 이들은 로봇에게 단순히 움직이는 법이 아니라, 움직임에 대해 생각하는 법을 가르칠 기회를 제공합니다.

아시아, 호주, 미국의 여러 대학 연구진이 작성한 포괄적인 새로운 조사 보고서는 이러한 강력한 AI 모델들이 로봇 조작(robotic manipulation) 분야를 어떻게 재편하고 있는지를 그려냅니다. 시안 교통 대학교와 홍콩 과학 기술 대학교를 포함한 기관의 학자들을 필두로 한 저자들은, 급격히 성장하는 이 연구 분야를 명확한 구조로 정리했습니다. 그들은 우리가 로봇을 하나의 단일한 코드 덩어리로 보는 대신, 두 개의 뚜렷한 층이 함께 작동하는 시스템으로 보아야 한다고 제안합니다. 즉, 무엇을 할지 결정하는 '고수준 플래너(high-level planner)'와 이를 수행하기 위해 근육을 어떻게 움직일지 결정하는 '저수준 컨트롤러(low-level controller)'입니다. 이 프레임워크는 왜 어떤 로봇은 "감자를 요리해서 재활용 통에 넣어라"와 같은 복잡한 지시를 따를 수 있는 반면, 다른 로봇은 특정 블록만을 집을 수 있는지 설명하는 데 도움이 됩니다.

이 시스템의 상단에는 플래너가 위치합니다. 과거에는 로봇에게 복잡한 지시를 내리기 위해 이를 경직되고 미리 작성된 단계들로 세분화해야 했습니다. 오늘날 파운데이션 모델은 과업을 추론할 수 있는 '두뇌' 역할을 합니다. 이 조사는 이러한 모델들이 어떻게 단순한 문장을 받아 "냉장고로 이동한다", "문을 연다", "감자를 잡는다"와 같은 논리적인 단계의 순서로 분해할 수 있는지를 강조합니다. 어떤 시스템은 대규모 언어 모델을 사용하여 이러한 계획을 생성하고, 어떤 시스템은 동작을 설명하는 컴퓨터 코드를 작성합니다. 특히 유망한 접근 방식은 로봇에게 세상의 물리적 형태를 이해하도록 가르치는 것입니다. 단순히 단어를 읽는 대신, 이 모델들은 3D 공간의 정신적 지도를 만들어 물체가 어디에 있고 어떻게 서로 맞물려 있는지를 식별합니다. 또한 이들은 '어포던스(affordance, 행동 유도성)'라는 개념, 즉 물체가 어떤 동작을 허용하는지를 학습할 수 있습니다. 예를 들어, 손잡이는 당기는 동작을 허용하고, 평평한 표면은 놓는 동작을 허용하는 식입니다. 언어, 3D 비전, 그리고 물체가 무엇을 할 수 있는지에 대한 이해를 결합함으로써, 이러한 고수준 플래너들은 로봇이 따라야 할 구조화된 가이드를 제공합니다.

계획이 세워지면, 로봇은 이를 실행해야 합니다. 이것이 추상적인 계획을 물리적 움직임으로 변환하는 저수준 액션 모델의 역할입니다. 연구진은 가장 성공적인 현대적 접근 방식들이 단일한 방법에 의존하지 않고 종종 다양한 학습 전략을 혼합한다는 것을 발견했습니다. 어떤 로봇은 인간이 비디오나 시연을 통해 보여주는 움직임을 관찰하며 배웁니다. 다른 로봇은 '강화 학습(reinforcement learning)'이라 알려진 과정, 즉 성공할 때까지 다양한 동작을 시도하는 시행착오를 통해 배웁니다. 이 논문에서 확인된 중요한 추세 중 하나는 '잠재 학습(latent learning)'의 사용입니다. 여기서 로봇은 복잡한 움직임을 더 단순하고 숨겨진 표현으로 압축하는 법을 배웁니다. 이것을 로봇이 모든 미세한 근육의 떨림을 암기하는 것이 아니라 동작의 '요지'를 배우는 것이라고 생각하면 쉽습니다. 이를 통해 로봇은 동일한 움직임을 서로 다른 물체나 상황에 적응시킬 수 있습니다. 또한 이 조사는 3D 비전과 심지어 촉각 센서를 사용하는 것에 대한 강조가 늘어나고 있음을 언급합니다. 초기 로봇들은 주로 카메라에 의존했지만, 최신 시스템들은 촉각 피드백을 통합하기 시작하여, 무언가를 너무 세게 쥐고 있는지 또는 물체가 미끄러지고 있는지 등을 느낄 수 있게 합니다. 이는 섬세한 작업에서 매우 중요합니다.

이러한 발전에도 불구하고, 저자들은 이 분야가 아직 완벽한 상태는 아니라고 주의를 줍니다. 조사에 기술된 로봇들은 아직 모든 가정이나 공장에서 인간 노동자를 대체할 준비가 되지 않았습니다. 많은 시스템이 통제된 환경이나 시뮬레이션에서는 잘 작동하지만, 현실 세계의 무질서한 예측 불가능함 앞에서는 어려움을 겪습니다. 이 조사는 이러한 모델들이 과업에 대해 추론할 수는 있지만, 로봇 팔이 벽에 부딪히지 않고 실제로 특정 지점에 도달할 수 있는지와 같은 로봇의 물리적 한계를 이해하는 데 때때로 실패한다는 점을 지적합니다. 또한 데이터와 관련된 상당한 장애물도 존재합니다. 이러한 시스템을 훈련하려면 막대한 양의 고품질 데이터가 필요한데, 이는 비용이 많이 들고 수집하기 어렵습니다. 더욱이 안전은 주요한 관심사입니다. 로봇이 점점 더 자율적으로 변함에 따라, 인간을 해치거나 물건을 부수지 않도록 보장하기 위해서는 현재의 모델들이 항상 갖추고 있지는 않은 강력한 안전장치가 필요합니다.

연구진은 앞으로의 길은 매번 재프로그래밍할 필요 없이 다양한 경험으로부터 학습하고 새로운 상황에 적응할 수 있는 더 범용적인 시스템을 구축하는 데 있다고 결론짓습니다. 그들은 로봇 조작의 미래가 이러한 시스템을 평가하는 더 나은 방법을 만들고, 더 많은 실제 데이터를 수집하며, 시각, 촉각, 청각과 같은 여러 감각을 세계에 대한 통합된 이해로 통합하는 데 달려 있다고 제안합니다. 이 조사는 우리가 로봇에게 생각하고 움직이는 법을 가르치는 데 있어 놀라운 진전을 이루었지만, 진정으로 지능적이고 적응 가능한 기계를 향한 여정은 이제 시작되었음을 보여주는 이정표 역할을 합니다. 이 연구는 로봇 조작의 문제를 해결했다고 주장하는 것이 아니라, 기술이 현재 어디에 와 있는지, 그리고 이 기계들을 우리 일상생활에서 진정으로 유용하게 만들기 위해 극복해야 할 과제가 무엇인지에 대한 명확하고 조직적인 관점을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →