← 최신 논문
💻 computer science

Beyond Implicit Force: Evaluating Explicit Force-Torque Proxies in Action Chunking with Transformers

본 논문은 Action Chunking with Transformers(ACT)가 접촉이 빈번한 조작(contact-rich manipulation)을 달성하기 위해 흔히 암시적인 원격 조종 추적 오차에 의존하는 반면, 이러한 숨겨진 단서들을 온보드 센서로부터 유도된 명시적인 관절 토크 대리 지표(joint-torque proxies)로 대체하는 것이 다양한 실제 작업 전반에서 힘 인지 행동을 효과적으로 회복하거나 심지어 향상시킨다는 것을 입증한다.

원저자: King Hang Wong, Lingqiao Liu, Feras Dayoub

게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: King Hang Wong, Lingqiao Liu, Feras Dayoub

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 테이블을 닦거나 충전기를 꽂는 것과 같은 섬세한 집안일을 가르치려 한다고 상상해 보세요. 단순히 로봇에게 영상을 보여주는 것만으로는 부족합니다. 로봇은 자신이 무엇을 하고 있는지 '느껴야' 합니다. 하지만 로봇은 피부가 없고, 카메라는 '압력'이나 '마찰'을 볼 수 없습니다. 이것이 바로 로봇이 물건을 부수거나 걸리지 않고 물리적 세계와 상호작용해야 하는 **접촉이 풍부한 조작(contact-rich manipulation)**의 까다로운 세계입니다. 로봇을 가르치기 위해 과학자들은 종종 인간이 과업을 수행하는 것을 로봇이 관찰하고 이를 모방하게 하는 **모방 학습(Imitation Learning)**이라는 방법을 사용합니다. 이를 위한 인기 있는 도구는 ACT(Action Chunking with Transformers)라고 불리는데, 이는 로봇이 다음 동작을 한 번에 하나씩 예측하는 것이 아니라, 다음에 취해야 할 몇 가지 동작을 한꺼번에 예측하는 매우 똑똑한 예측기 역할을 합니다. 여기서 모두가 던지는 큰 질문은 이것입니다. 로봇이 물체를 실제로 '느낄' 수 없다면, 언제 더 세게 밀어야 할지 혹은 힘을 빼야 할지를 어떻게 알 수 있을까요? 비싸고 특수한 센서가 필요할까요, 아니면 그저 관찰하는 것만으로도 알아낼 수 있을까요?

이 논문은 우리가 로봇을 가르치는 방식 속에 숨겨진 놀라운 비밀을 파헤칩니다. 연구진은 인기 있는 ACT 로봇이 사실 약간 '속임수'를 쓰고 있었다는 것을 발견했습니다. 인간이 특별한 '리더-팔로워(leader-follower)' 설정(인간이 마스터 암을 움직이면 로봇이 슬레이브 암으로 이를 복사하는 방식)을 통해 로봇을 가르칠 때, 로봇은 단순히 팔의 위치만을 복사하는 것이 아니었습니다. 로봇은 은밀하게 그 '고군분투(struggle)'로부터 배우고 있었습니다. 만약 로봇의 팔이 벽에 부딪혀 인간의 팔만큼 빠르게 움직이지 못한다면, 그 미세한 지연이나 '추적 오차(tracking error)'가 "이봐, 무언가 가로막고 있어, 더 세게 밀어!"라고 알려주는 숨겨진 신호 역할을 했던 것입니다. 이 논문은 질문합니다. 만약 우리가 이 숨겨진 고군분투 신호를 제거한다면 어떻게 될까요? 로봇은 접촉을 다루는 법을 잊어버릴까요?

이를 알아내기 위해 저자들은 로봇이 인간의 '고군분투'를 무시하고 오직 로봇 자신의 팔이 어디로 가야 하는지만을 예측하도록 만든 버전을 구축했습니다. 그들은 이를 ACT-o라고 불렀습니다. 연구진이 칠판 닦기, 충전기 꽂기, 부드러운 병 누르기 등 실제 세계의 과업들로 테스트했을 때, 로봇은 완전히 무너졌습니다. 그 숨겨진 '지연' 신호가 없자, 로봇은 망설이거나, 멈춰버리거나, 혹은 물체 위에서 그냥 떠 있기만 하며 필요한 힘을 가하지 못했습니다. 그것은 마치 음표는 연주할 줄 알지만 소리를 내기 위해 건반을 충분히 세게 누르는 법을 잊어버린 음악가와 같았습니다.

하지만 이야기는 실패로 끝나지 않습니다. 연구진은 간단한 해결책을 시도했습니다. 로봇이 이미 가지고 있는 데이터를 사용하여 새로운 감각을 부여한 것입니다. 값비싼 외부 센서 대신, 로봇의 내부 모터 전류(모터가 전기를 얼마나 사용하는지)를 '토크 프록시(torque proxy)', 즉 로봇이 얼마나 많은 힘을 가하고 있는지에 대한 대략적인 추정치로 사용했습니다. 이 단순한 '힘의 느낌'을 로봇에게 다시 입력해주자, 로봇은 다시 살아났습니다. 로봇은 갑자기 딱딱한 표면과 부드러운 표면을 구별할 수 있게 되었고, 폼 블록에 닿았을 때 정확히 멈출 수 있었으며, 플러그를 맞추기 위해 부드럽게 '톡톡' 치는 동작까지 수행할 수 있었습니다.

이 논문은 기존의 교수법에 숨겨진 고군분투가 강력하고 우연한 스승이었지만, 우리는 더 이상 그것에 의존할 필요가 없다고 제안합니다. 모터 전류에서 유도된 기본적인 힘의 추정치를 로봇의 뇌에 추가하는 것만으로도, 우리는 로봇이 접촉을 다루는 능력을 이전만큼, 혹은 그보다 더 좋게 만들 수 있습니다. 이는 우리가 로봇에게 화려하고 비싼 힘 센서가 없는 저렴한 하드웨어에서도 섬세하고 힘에 민감한 작업들을 할 수 있도록 가르칠 수 있음을 의미합니다. 단, 그들이 자신의 모터가 작동하는 방식을 '느낄' 수 있는 방법을 제공하기만 한다면 말입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →