← 최신 논문
🤖 machine learning

Posterior-driven Heuristic Support Adaptation in a Probabilistic Treatment of Real2Sim2Real for Vision-Driven Deformable Linear Object Manipulation

이 논문은 likelihood-free 추론에서 고정된 샘플링 서포트의 한계를 극려하기 위해 사후 분포 주도형 휴리스틱 서포트 적응 방법(EDGE, MODE 및 CENTRE 전략 사용)을 제안하며, 이를 통해 Real2Sim2Real 시나리오에서의 변형 가능한 선형 객체 조작을 위한 파라미터 식별 및 강건한 정책 학습을 개선한다.

원저자: Georgios Kamaras, Craig Innes, Subramanian Ramamoorthy

게시일 2026-09-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Georgios Kamaras, Craig Innes, Subramanian Ramamoorthy

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 세상을 움직이는 데 있어 놀라울 정도로 능숙해지고 있지만, 우리 일상의 많은 부분을 차지하는 부드럽고 말랑말랑한 것들을 다루는 데에는 여전히 어려움을 겪고 있습니다. 딱딱한 금속 팔은 커피 머그잔을 쉽게 집어 올릴 수 있지만, 젖은 국수 가닥, 천 조각, 또는 고무 호스를 다루라는 요청을 받으면 종종 실패하곤 합니다. 과학계에서 '변형 가능한 선형 객체(deformable linear objects)'라고 불리는 이 물체들은 움직임에 따라 형태가 끊임없이 변합니다. 로봇에게 이러한 물체를 조작하는 법을 가르치기 위해, 엔지니어들은 대개 컴퓨터 내부에 해당 물체의 '디지털 트윈'을 구축합니다. 그들은 가상 세계에서 로봇이 적절한 동작을 배울 때까지 수천 번의 시뮬레이션을 실행하며 연습하게 합니다. 문제는 가상 세계와 현실 사이의 간극에 있습니다. 만약 컴퓨터 모델이 고무 호스를 실제보다 더 단단하거나 길다고 가정한다면, 로봇은 시뮬레이션에서는 완벽하게 작동하지만 실제 물체를 사용할 때는 완전히 실패하는 기술을 배우게 될 것입니다.

이 간극을 메우기 위해 연구자들은 '가능도 없는 추론(likelihood-free inference)'이라는 방법을 사용합니다. 이것을 '교육된 추측'의 과정이라고 생각하면 쉽습니다. 로봇이 실제 물체를 관찰하면, 컴퓨터는 디지털 버전이 실제 물체와 똑같이 행동하게 만들 수 있는 숨겨진 물리적 특성(길이와 강성 등)을 찾아내려고 노력합니다. 컴퓨터는 '사후 분포(posterior)'를 생성하는데, 이는 해당 속성들에 대한 가장 가능성 높은 값들의 지도와 같습니다. 그러나 이 과정에는 숨겨진 함정이 있습니다. 컴퓨터가 추측을 시작하기 전에, 연구자는 답이 존재해야 하는 범위인 '경계'를 정의해야 합니다. 만약 이 초기 경계가 잘못 설정되면, 컴퓨터의 최선의 추측은 그 상자의 가장자리로 몰리게 되어, 확신에 차 있지만 틀린 결론을 내리게 됩니다. 연구자들인 게오르기오스 카마라스스(Georgios Kamaras), 크레이그 인스(Craig Innes), 그리고 수브라마니안 라모모르티(Subramanian Ramamoorthy)는 컴퓨터가 자신의 초기 경계가 잘못되었다는 것을 어떻게 깨닫고 실시간으로 이를 조정할 수 있을지에 대한 질문을 던지며 이 특정 문제를 해결하고자 했습니다.

연구팀은 부드러운 물체를 다루는 어려움을 잘 보여주는 과업, 즉 로봇 팔이 유연한 호스를 휘둘러 쌓여 있는 큐브의 윗부분을 쳐서 떨어뜨리는 작업에 집중했습니다. 목표는 단순하지만 물리학은 복잡합니다. 호스는 큐브를 타격할 만큼 충분히 길고 단단해야 하지만, 너무 단단해서 쌓인 것을 무너뜨리거나 너무 길어서 엉키게 해서도 안 됩니다. 연구진은 먼저 이 아이디어를 포식자와 피식자의 개체수 모델이라는 더 단순하고 추상적인 수학적 모델에서 테스트했습니다. 이 시스템은 혼돈스럽고 진동하는 거동으로 잘 알려져 있습니다. 이 테스트에서 그들은 컴퓨터가 정답을 포함하지 않는 범위의 값을 부여받았을 때, 컴퓨터가 그 범위의 가장자리로 모든 확신을 쏟아부어 잘못된 확실성을 만들어낸다는 것을 보여주었습니다. 그런 다음 그들은 컴퓨터가 이러한 실수를 인지하도록 돕는 세 가지 다른 전략을 개발했습니다. 그들이 'EDGE'라고 명명한 첫 번째 전략은 컴퓨터의 확신이 어디에 쌓이고 있는지를 살핍니다. 만약 컴퓨터가 허용된 범위의 맨 끝에 답이 있다고 확신한다면, EDGE 전략은 컴퓨터에게 그 방향으로 범위를 확장하라고 지시합니다. 'MODE'와 'CENTRE'라는 나머지 두 전략은 컴퓨터의 최선의 추측이 시간이 지남에 따라 어떻게 변하는지 또는 확신의 중심이 어디에 있는지를 살펴보지만, EDGE 방식이 가장 신뢰할 수 있는 것으로 증명되었습니다.

이 새로운 방법을 손에 넣은 연구팀은 로봇과 고무 호스를 이용한 실제 실험으로 넘어갔습니다. 그들은 길이와 부드러움이 각기 다른 네 가지 종류의 호스를 제작하고, 카메라를 설치하여 로봇이 큐브를 쳐서 떨어뜨리는 과정을 관찰했습니다. 그들은 각 호스의 특성을 학습시키기 위해 추론 과정을 실행했습니다. 고정된 경계를 사용하는 표준 방식을 사용했을 때, 컴퓨터는 약간씩 다른 호스들을 구별하지 못하고 막히는 경우가 많았습니다. 하지만 컴퓨터가 탐색 범위를 확장하는 EDGE 전략을 사용하게 하자 결과가 달라졌습니다. 컴퓨터는 이제 200mm 길이의 호스와 290mm 길이의 호스를 구분할 수 있게 되었고, 강성 또한 정확하게 측정할 수 있었습니다. 이러한 미세한 이해 덕분에 그들은 각 특정 호스에 맞는 새로운 로봇 정책을 훈련할 수 있었습니다. 로봇에게 모든 호스를 다루는 하나의 일반적인 방식을 가르치는 대신, 각 호스에 특화된 기술을 가르친 것입니다.

이 전문화된 훈련의 결과는 놀라웠습니다. 연구진이 실제 환경에서 로봇을 테스트했을 때, 적응형의 넓은 경계로 훈련된 에이전트들이 훨씬 더 우수한 성능을 보였습니다. 그들은 더 안정적이었고, 더 목적의식을 가지고 움직였으며, 큐브를 떨어뜨리는 데 훨씬 더 성공적이었습니다. 초기 경계가 너무 좁았던 호스들의 경우 개선 효과는 극적 이었습니다. 로봇은 호스를 딱 적절한 높이로 들어 올려 적절한 힘으로 휘두르는 법을 배웠는데, 이는 컴퓨터가 마침내 물체의 실제 물리적 한계를 이해했기에 자연스럽게 나타난 행동이었습니다. 반면, 기존의 고정된 경계로 훈련된 로봇들은 호스를 테이블 위로 끌거나 너무 약하게 휘둘러서 목표물을 제거하는 데 실패했습니다.

이 연구는 로봇의 학습을 위한 탐색 공간을 정의하는 방식이 학습 알고리즘 자체만큼이나 중요하다는 것을 보여줍니다. 컴퓨터가 스스로 생각할 공간이 부족하다는 것을 인식하고 그에 따라 경계를 확장할 수 있도록 함으로써, 연구진은 더 정직하게 자신이 아는 바를 인지하고 필요한 것을 배울 수 있는 시스템을 만들었습니다. EDGE 휴리스틱은 단순하지만 강력한 가이드 역할을 하여, 로봇의 디지털 훈련이 물리적 세계의 실제 복잡성을 반영하도록 보장합니다. 이 접근 방식은 단순히 로봇을 특정 작업에 더 능숙하게 만드는 것에 그치지 않고, 기계가 우리 주변의 부드럽고 예측 불가능하며 끊임없이 변화하는 재료들과 상호작용할 수 있도록 하는 일반적인 경로를 제시합니다. 이 발견은 미래의 로봇이 무엇을 기대할지 정확히 지시받을 필요 없이, 대신 자신의 이해의 한계를 파악하고 학습하면서 그 한계를 확장할 수 있는 도구를 갖게 될 것임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →