← 최신 논문
💻 computer science

xperception -- Making Robotic Grasping Easier

xperception는 객체별 학습이나 데이터 어노테이션 없이도 고혼합 저용량(high-mix low-volume) 제조 환경에서 밀리미터 단위의 정확도와 견고한 로봇 파지(grasping)를 가능하게 하기 위해 CAD 모델과 파운데이션 모델의 특징을 활용하는 제로샷 6D 포즈 추정 시스템입니다.

원저자: Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 엄청나게 재능 있지만 고집 센 요리사와 같은 세상을 상상해 보세요. 그들은 수백만 개의 동일한 당근을 완벽한 속도로 썰 수 있지만, 한 번도 본 적 없는 이상하게 생긴 감자를 건네주면 얼어붙어 버립니다. 왜 그럴까요? 그들의 "눈"과 "뇌"가 오직 당근만을 학습했기 때문입니다. 로봇에게 감자에 대해 가르치려면, 수천 장의 사진을 찍고, 모든 사진에 일일이 라벨을 붙이고, 로봇의 뇌를 다시 학습시켜야 합니다. 이 과정은 영원히 걸릴 것처럼 오래 걸리고 엄청난 비용이 듭니다. 이것이 현재 공장 자동화 세계의 병목 현상입니다. 로봇은 똑같은 일을 반복하는 데는 뛰어나지만, 새롭고, 무질서하거나, 독특한 물건에는 적응하는 데 서툽니다.

이를 해결하기 위해 과학자들은 처음부터 다시 배울 필요가 없는 새로운 종류의 "시각"을 연구하고 있습니다. 마치 세상의 모든 책을 읽은 초스마트한 사서와 같다고 생각해 보세요. 만약 이 사서에게 처음 보는 이상한 과일 사진을 보여준다면, 그는 몇 주 동안 공부할 필요가 없습니다. 이미 "과일", "질감", "모양"이라는 일반적인 개념을 이해하고 있기 때문에 즉시 그것을 알아볼 수 있습니다. 이 논문은 **6D 포즈 추정(6D pose estimation)**이라는 기술을 다룹니다. 이는 단순히 물체가 3D 공간에서 정확히 어디에 있고 어느 방향을 향하고 있는지를 파악하는 기술입니다. 목표는 로봇이 길고 지루한 학습 세션 없이도 새로운 물체를 즉각적으로 잡을 수 있게 하여, 모든 품목이 다를 수 있는 "다품종 소량 생산(high-mix, low-volume)"의 세계에서도 공장이 유연하게 대처할 수 있도록 만드는 것입니다.


xperception를 만나보세요: 사진이 아닌 매뉴얼을 읽는 로봇

이탈리아의 폰다치오네 브루노 케슬러(Fondazione Bruno Kessler) 연구진이 개발한 새로운 도구인 xperception을 소개합니다. xperception을 로봇의 "즉석 읽기" 초능력이라고 생각하세요. 새로운 물체가 어떻게 생겼는지 배우기 위해 로봇이 수천 장의 사진을 뚫어지게 쳐다보도록 강요하는 대신, xperception은 "그냥 설계도를 주세요"라고 말합니다.

옛날 방식으로는, 만약 공장에서 로봇이 새로운 종류의 나사를 집어 올리게 하고 싶다면, 그 나사를 모든 각도에서 수백 장의 사진으로 찍고, 라벨을 붙이고, 신경망을 학습시켜야 했습니다. 그것은 마치 특정 공을 던져서 개에게 그 공을 가져오도록 수천 번 반복해서 가르치는 것과 같았습니다. xperception은 이 방식을 뒤집습니다. 이 기술은 물체의 3D CAD 모델(엔지니어들이 부품을 설계할 때 사용하는 디지털 설계도)을 사용하며, 이를 시각적 세계를 이미 이해하고 있는 거대한 사전 학습된 AI 뇌인 "파운데이션 모델(foundation model)"과 결합합니다.

마법이 일어나는 과정은 이렇습니다: 바닥에 뒤섞인 장난감 더미가 있다고 상상해 보세요. 전통적인 로봇은 혼란에 빠질 수 있습니다. 하지만 xperception은 그 더미를 바라보고, 사전 학습된 뇌를 사용하여 시각 데이터로부터 **포인트 수준의 특징(point-level features)**을 추출합니다. 그런 다음 이 특징들을 디지털 설계도(CAD 모델)의 해당 특징들과 매칭하여 **포인트 클라우드 등록(point cloud registration)**을 수행합니다. 이 기술은 그 특정 장난감을 이전에 본 적이 없어도 됩니다. 단지 설계도가 필요하며, 시각적 포인트들을 모델의 기하학적 구조와 정렬할 수 있는 능력만 있으면 됩니다. 그런 다음 로봇은 6D 포즈를 계산합니다. 이는 물체가 정확히 어디에 있는지(좌, 우, 상, 하, 전, 후)와 어떤 방향으로 기울어져 있는지(롤링, 피칭, 요잉)를 정확히 파악하는 것을 의미합니다. 마치 로봇이 눈에 보이는 모든 물체에 대해 밀리미터 단위로 위치를 찾아내는 GPS와 나침반을 갑자기 갖게 된 것과 같습니다.

왜 이것이 중요한가: "빈 피킹(Bin Picking)" 문제

이 기술의 진정한 시험대는 "빈 피킹(bin picking)"이라 불리는 고전적인 산업계의 악몽입니다. 부품들이 무작위로 쏟아져 들어있는 빈(bin)을 상상해 보세요. 부품들이 서로 쌓여 있고, 일부가 가려져 있으며(폐쇄/occlusion), 조명 또한 이상할 수 있습니다. 로봇은 그 안으로 손을 뻗어 특정 부품을 집어 올려야 하며, 부품을 떨어뜨리거나 빈 벽에 부딪히지 않도록 정확히 어떻게 잡아야 하는지 알아야 합니다.

연구진은 Automatica 2025 무역 박람회에서 xperception을 매우 멋진 방식으로 테스트했습니다. 그들은 테이블 위에 흩어진 무작위의 펜을 집어 올리는 로봇을 설정했습니다. 핵심은 무엇이었을까요? 로봇은 펜을 집어 레이저 프린터에 넣고 맞춤형 메시지를 새겨야 했습니다. 레이저가 정확한 위치에 닿으려면, 로봇은 펜의 방향을 오차 거의 없이 파악해야 했습니다. 만약 펜이 아주 조금이라도 기울어져 있다면, 메시지는 삐뚤어질 것입니다.

설정은 매우 간단했습니다. 팀은 펜의 사진을 단 한 장도 찍지 않았고 로봇을 학습시키지도 않았습니다. 그들은 단지 펜의 디지털 CAD 모델을 업로드하고, 디지털 모델 위에 최적의 파지 지점(grasping points)을 미리 정의했습니다(논문의 그림에 파란색 마커로 표시됨). 로봇이 시작되었을 때, xperception은 뒤섞인 펜 더미를 보고, 각각의 펜을 찾아내어, 그것이 정확히 어떻게 놓여 있는지 파악한 뒤, 어디를 잡아야 할지 로봇에게 알려주었습니다. 로봇은 펜들이 서로 가려져 있고 조명이 까다로운 상황에서도 성공적으로 펜을 집어 들었고, 레이저를 위해 완벽하게 정렬했습니다.

결과: 빠르고, 유연하며, 현실 세계를 위한 준비가 된 기술

이 논문은 xperception이 공장의 속도를 늦추는 "학습 시간"을 제거하기 때문에 게임 체인저임을 보여줍니다. FreeZe 알고리즘(최근 BOP Challenge 2024라는 주요 국제 경진대회에서 우승한 알고리즘)을 사용함으로써, 이 시스템은 밀리미터 단위의 정확도를 달달성합니다. 이는 로봇이 섬세한 작업에도 충분히 정밀하다는 것을 의미합니다.

더욱 놀라운 점은 이것이 단순한 실험실 실험이 아니라는 것입니다. 연구진은 이 기술이 강력한 컴퓨터 칩인 NVIDIA Jetson Thor(로봇 팔에 바로 장착되도록 설계된 칩)와 같은 **산업용 에지 하드웨어(industrial edge hardware)**에서 작동함을 입증했습니다. 이는 "두뇌"가 멀리 떨어진 거대한 서버 팜에 있을 필요 없이, 작업이 일어나는 바로 그 현장에서 즉각적으로 생각하고 반응할 수 있음을 의미합니다.

저자들은 이 접근 방식이 기술 성숙도(TRL) 6단계에 도달했음을 밝히며, 실제 환경에서 테스트되었으며 상용 제품에 매우 근접해 있다고 확 {신합니다. 공학계에서 이는 기술이 관련 환경에서 검증되었음을 뜻하며, 단순히 "작동할 수도 있다"고 제안하는 것이 아니라, 실제 하드웨어와 실제 물체를 통해 작동함을 보여주었다는 의미입니다.

결론

xperception은 로봇의 경직성 문제를 해결하고 있습니다. 이 기술은 우리가 새로운 물체를 마주할 때마다 로봇을 다시 학습시킬 필요가 없다고 주장합니다. 대신, 물체의 디지털 설계도와 시각적 포인트를 기하학적 구조와 정렬하는 스마트한 사전 학습 AI를 사용함으로써, 로봇은 현대 제조의 무질서하고 예측 불가능한 현실을 처리할 수 있을 만큼 유연해질 수 있습니다. 이는 "이 이상한 새 물건을 어떻게 잡아야 하지?"라는 복잡한 과제를 간단한 "플러그 앤 플레이(plug-and-play)" 소프트웨어 업데이트로 바꾸어 놓으며, 공장이 순식간에 제품 생산을 전환할 수 있는 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →