← 최신 논문
💻 computer science

Passivity-Centric Safe Reinforcement Learning for Contact-Rich Robotic Tasks

이 논문은 에너지 기반 제약 조건 및 배포를 위한 수동성 필터와 함께 수동성 인지 학습을 통합하는 프레임워크를 제안함으로써, 접촉이 빈번한 로봇 작업에서 전통적인 강화 학습의 안전성 및 안정성 한계를 해결하고, 이를 통해 제어 안정성을 보장하며 에너지 효율을 향상시킨다.

원저자: Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

게시일 2026-09-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 팔이 벽을 밀어내는 것이 아니라, 어둡고 구불구불한 미로를 더듬어 나가는 모습을 상상해 보십시오. 이것은 로봇이 문제를 해결하기 위해 주변 환경과 물리적으로 상호작용해야 하는 '접촉 집약적 로보틱스(contact-rich robotics)'의 세계입니다. 수년 동안 과학자들은 로봇에게 이 방법을 가르치기 위해 강화 학습이라는 강력한 도구를 사용해 왔습니다. 이것을 디지털 시행착오 과정이라고 생각하면 됩니다. 로봇은 움직임을 시도하고, 성공하면 보상을 받으며, 자신의 실수로부터 배웁니다. 이 방법은 컴퓨터 시뮬레이션에서 인상적인 결과를 냈지만, 이 로봇들을 실제 세상으로 옮길 때 큰 장애물이 남아 있습니다. 알고리즘은 목표로 가는 경로를 찾는 데는 탁월하지만, 에너지라는 물리계의 근본적인 규칙을 종종 무시합니다. 만약 로봇이 관절이나 환경에 너무 많은 에너지를 쏟아붓는 전략을 학습한다면, 불안정해지거나 격렬하게 흔들리거나, 심지어 자신과 접촉하는 물체에 손상을 입힐 수도 있습니다. 로봇의 움직임이 안전하고 안정적인지 확인하는 것은 단순한 이론적 관심사가 아니라, 인간과 함께 일하게 될 모든 기계에 있어 실질적인 필수 사항입니다.

이탈리아 제노바에 위치한 이탈리아 기술 연구소(Istituto Italiano di Tecnologia)의 연구진은 이 특정 문제를 해결하기 위해 나섰습니다. 그들은 다음과 같은 단순하지만 중요한 질문을 던졌습니다. "로봇에게 단순히 과업을 잘 수행하는 법뿐만 아니라, 에너지 사용 측면에서 본질적으로 안전하도록 가르칠 수 있을까?" 그들의 연구는 '수동성(passivity)'이라는 개념에 초점을 맞추고 있습니다. 쉽게 말해, 수동성이란 시스템이 아무것도 없는 상태에서 에너지를 만들어낼 수 없으며, 받은 에너지를 저장하거나 소산(dissipate)할 수만 있다는 것을 의미합니다. 수동적인 로봇은 충격을 증폭하기보다는 흡수하는, 잘 댐핑된 스프링처럼 행동하는 로봇입니다. 연구팀은 과업 성공을 극대화하도록 훈련된 표준 강화 학습 정책들이 이러한 규칙을 준수하지 못하는 경우가 많다는 것을 발견했습니다. 실험 결과, 이러한 표준 정책들은 과업을 빠르게 완료하는 법을 배웠지만, 에너지 한계를 위반하는 제어 명령을 생성함으로써 실제 환경에 배치되었을 때 불안정성을 초క 초래했습니다.

이를 해결하기 위해 연구진은 인공지능의 학습 능력과 엄격한 에너지 규칙을 결합한 새로운 접근 방식을 개발했습니다. 그들은 두 개의 뚜렷한 부분이 함께 작동하는 시스템을 만들었습니다. 첫 번째 단계는 훈련 단계에서 일어납니다. 여기서 그들은 로봇에게 '수동성을 인식(passivity-aware)'하도록 가르쳤습니다. 단순히 미로의 출구에 도달했을 때 보상을 주는 대신, 에너지를 너무 많이 사용하거나 강성(stiffness)을 너무 빠르게 변화시키면 벌점을 주는 보이지 않는 제약 조건을 추가했습니다. 이를 통해 로봇은 더 경제적인 방식으로 움직이는 법을 배우게 되었고, 자연스럽게 더 부드럽고 안정적인 전략을 발견하게 되었습니다. 두 번째 단계는 로봇이 실제로 작동할 때 일어납니다. 더 나은 훈련을 거쳤더라도 컴퓨터 프로그램이 실수를 할 수 있다는 것을 연구진은 알고 있었습니다. 그래서 그들은 로봇의 뇌와 근육 사이에 위치하는 최종 보호 계층인 '안전 필터(safety filter)'를 추가했습니다. 이 필터는 에너지 흐름을 지속적으로 모니터링합니다. 만약 로봇이 시스템에 너무 많은 에너지를 주입하려는 움직임을 시도하면, 필터가 자동으로 그 움직임을 축소하여 로봇이 안전한 한계 내에 머물도록 보장합니다.

연구팀은 로봇 팔이 벽을 더듬으며 길을 찾아 나가는 미로 탐색 과업이라는 도전적인 시나리오에서 이 방법을 테스트했습니다. 그들은 네 가지 유형의 로봇을 비교했습니다: 에너지 규칙을 완전히 무시하는 로봇, 에너지를 고려하도록 훈련되었으나 안전 필터가 없는 로봇, 안전 필터는 있지만 에너지 규칙 없이 훈련된 로봇, 그리고 마지막으로 에너지 인식 훈련과 안전 필터를 모두 결합한 그들의 새로운 방식입니다. 결과는 명확했습니다. 에너지 규칙 없이 훈련된 로봇은 시뮬레이션에서는 미로를 통과할 수 있었지만, 실제 물리적 로봇에 적용했을 때는 실패했습니다. 로봇이 너무 공격적으로 움직여 회전 구간에서 과도한 힘을 가했고, 이로 인해 제어력을 상실했습니다. 반면, 에너지 제약 조건에 따라 훈련된 로봇들은 더 보수적으로 움직이는 법을 배웠습니다. 훈련 단계에서는 과업을 배우는 데 시간이 약간 더 걸렸지만, 일단 배치된 후에는 훨씬 더 신뢰할 수 있었습니다.

연구진이 가장 잘 훈련된 모델을 실제 환경에서 테스트했을 때, 그 차이는 극명했습니다. 그들의 결합된 방식을 사용하는 로봇은 모든 시도에서 미로를 성공적으로 통과했으며, 힘의 한계를 위반하거나 에너지 예산을 초과하는 일이 한 번도 없었습니다. 표준 로봇은 안전 필터의 보호를 받더라도, 애초에 에너지를 효율적으로 관리하는 법을 배우지 못했기 때문에 어려움을 겪었습니다. 안전 필터 단독으로는 재앙을 막을 수는 있었지만, 로봇을 효율적으로 만들 수는 없었습니다. 에너지 인식 훈련 단독으로는 로봇을 효율적으로 만들었지만, 로봇이 갑작스럽고 예측 불가능한 오류를 범할 때 안전을 보장할 수는 없었습니다. 두 가지를 결합했을 때 비로소 안전하면서도 효율적인 시스템을 달 수 있었습니다. 연구진은 엄격한 에너지 제한을 가지고 훈련된 로봇이 에너지 예산을 훨씬 더 느리고 고르게 사용하여, 에너지 부족 현상 없이 복잡한 회전과 장애물을 처리할 수 있음을 발견했습니다.

이 연구는 우리가 지능형 기계를 구축하는 방식에 있어 중요한 변화를 강조합니다. 이는 로봇이 물리적 세계에서 안전하게 작동하기 위해서는 단순히 똑똑하게 교육되는 것뿐만 아니라, 물리적으로 책임감 있게 행동하도록 교육되어야 함을 시사합니다. 에너지 보존 법칙을 학습 과정에 직접 내재화하고 이를 실시간 안전 필터로 뒷받/하는 방식을 통해, 연구진은 능력이 뛰어날 뿐만 아니라 신뢰할 수 있는 로봇을 향한 길을 보여주었습니다. 7개의 관절을 가진 로보틱 암을 이용한 그들의 실험은, 기계가 자신의 안정성이나 주변 환경의 안전을 위협하지 않으면서도 접촉이 잦은 어려운 환경을 탐색하도록 가르치는 것이 가능하다는 것을 증명합니다. 이 방법은 틀릴 수도 있는 복잡한 세계의 수학적 모델에 의존하는 대신, 물리적 현실에 발을 붙이도록 안내하는 규칙을 통해 로봇이 경험을 통해 스스로의 에너지 한계를 학습하도록 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →