← 최신 논문
💻 computer science

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

이 논문은 조작 성공률을 높이기 위해 Grasp-Pretraining Augmentation을 통합하고 효율적인 실시간 행동 생성을 위해 Robotic Attention Mamba 아키텍처를 채택하여 여러 로봇 플랫폼에서 최첨단 성능을 달성하는 새로운 프레임워크인 GPA-RAM을 제안한다.

원저자: Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

게시일 2026-08-03
📖 2 분 읽기☕ 가벼운 읽기

원저자: Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 집안일을 가르치는 모습을 상상해 보세요. 물건을 잡을 때마다 손가락을 어떻게 움직여야 하는지 일일이 알려주는 수백만 줄의 코드를 작성하고 싶지는 않을 것입니다. 대신, 부모가 아이에게 블록을 쌓거나 컵에 숟가락을 넣는 법을 가르치듯, 로봇에게 무엇을 해야 하는지 직접 보여주고 싶을 것입니다. 이것이 바로 **로봇 모방 학습(robot imitation learning)**의 세계입니다. 이는 로봇이 인간의 시연을 보고 따라 하며 배우는 과학의 한 분야입니다. 큰 과제는 무엇일까요? 로봇은 팔을 움직이는 데는 뛰어나지만, 가장 첫 단계인 '적절한 방식으로 물건을 제대로 잡는 것'에는 매우 서툴다는 점입니다. 만약 로봇이 컵의 손잡이가 아닌 테두리를 잡거나, 1밀리미터 차이로 못을 놓친다면 전체 작업이 실패할 수 있으며, 로봇은 이를 어떻게 해결해야 할지 모를 수도 있습니다. 과학자들은 로봇이 어질러진 방을 보고, 물건을 잡는 최선의 방법을 파악한 다음, 무엇인가와 충돌하지 않고 완벽하게 움직일 수 있는 '두뇌'를 구축하기 위해 끊임없이 노력하고 있습니다.

이제, 바로 그 '잡고 이동하기(grab-and-go)' 문제를 해결하기 위해 설계된 새로운 로봇 두뇌인 GPA-RAM을 만나보세요. 이 프로젝트의 연구진은 많은 로봇이 작업을 시작하기도 전에 물건을 어떻게 잡아야 하는지에 충분한 주의를 기울이지 않기 때문에 실패한다는 점을 깨달았습니다. 그들은 두 가지 영리한 기법을 결합한 시스템을 만들었습니다. 첫째, 로봇이 나머지 작업을 배우는 데 사용하는 것과 동일한 영상을 사용하여 물건을 잡는 법에 대한 '사전 학습(pre-training)'을 제공했습니다. 이는 마치 학생에게 에세이를 쓰라고 하기 전에 연필을 잡는 법에 대한 짧은 퀴즈를 주는 것과 같습니다. 즉, 로봇은 퍼즐을 풀려고 시도하기 전에 움켜쥐는 법을 먼저 배웁니다. 둘째, 로봇의 느리고 무거운 사고 엔진을 RAM(Robotic Attention Mamba)이라는 새로운 초고속 엔진으로 교체했습니다. RAM을 방대한 양의 시각 정보가 담긴 도서관을 순식간에 훑어 적절한 책을 찾아내는 매우 효율적인 사서라고 생각해보세요. 기존 시스템들은 정보에 압도되어 느려졌던 반면, RAM은 다릅니다.

연구팀은 이 새로운 두뇌를 실제 물리적 로봇과 시뮬레이션 로봇을 포함한 네 가지 서로 다른 로봇 설정에서 테스트했습니다. 그 결과, '잡기 사전 학습'을 추가함으로써 로봇이 컵 쌓기, 구멍에 못 끼우기, 두 팔 사이로 물건 옮기기와 같은 까다로운 작업에서 훨씬 더 나은 성능을 보인다는 것을 발견했습니다. 표준 테스트인 RLBench에서 이 새로운 시스템은 87.5%의 성공률을 기록하며 이전의 최고 방식들을 앞질렀습니다. 더욱 인상적인 것은, 큐브를 옮기는 양팔 로봇 작업에서 98%의 성공률을 보였으며, 어려운 양손 삽입 작업에서는 성공률이 16%에서 56%로 급증했다는 점입니다. 가장 좋은 점은 무엇일까요? 이 모든 것을 약 71fps(초당 프레임 수)로 실행하면서, 로봇이 멈추지 않고 실시간으로 반응할 수 있을 만큼 빠르게 생각했다는 것입니다. 연구진은 "먼저 잡고, 그다음에 행동하라"는 이 접근 방식이 로봇을 이전에는 실패를 유발했던 섬세한 작업들을 처리할 수 있는 훨씬 더 신뢰할 수 있는 조력자로 만들 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →