← 최신 논문
🤖 AI

TAM: Torque Adaptation Module for Robust Motion Transfer in Manipulation

본 논문은 고유 수용성 감각 이력(proprioceptive history)만을 기반으로 토크 명령을 적응시킴으로써, 정책 수준의 도메인 무작위화나 실제 로봇 데이터 수집의 필요성을 제거하고 서로 다른 로봇 및 페이로드 간에 동적 조작 정책의 강건한 제로샷 전이를 가능하게 하는 학습된 구성 요소인 토크 적응 모듈(TAM)을 소개한다.

원저자: Dongwon Son, Florian Shkurti, Jason Lee, Naman Shah, Beomjoon Kim, Dieter Fox

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dongwon Son, Florian Shkurti, Jason Lee, Naman Shah, Beomjoon Kim, Dieter Fox

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 특정 고급 주방에서 수년간 레시피를 완성해 온 마스터 셰프를 가지고 있다고 상상해 보십시오. 이 셰프는 칼에 얼마만큼의 압력을 가해야 하는지, 냄비를 얼마나 빨리 저어야 하는지, 그리고 특정한 형태의 무거운 맞춤형 팬을 어떻게 다뤄야 하는지를 정확히 알고 있습니다.

이제, 당신이 이 셰프에게 다른 주방에서도 똑같은 요리를 하도록 시키고 싶다고 가정해 봅시다. 그런데 이 새로운 주방은 다음과 같은 특징이 있습니다:

  • 약간 더 무거운 팬들 (알 수 없는 페이로드).
  • 오래된 기름기 때문에 약간 "끈적거리는" 느낌이 드는 칼 (마찰력).
  • 셰프가 익숙한 것보다 아주 조금 더 느리게 반응하는 가스레인지 (다른 역학 관계).

만약 셰프가 조절 없이 똑같은 움직임을 그대로 사용하려 한다면, 음식이 타버리거나, 팬이 미끄러지거나, 칼질이 제대로 되지 않을 수 있습니다. 로보틱스에서 이것은 "심투리얼(Sim-to-Real)" 문제입니다. 즉, 완벽한 컴퓨터 시뮬레이션에서 훈련된 로봇이 실제 세계의 지저집고, 무겁고, 예측 불가능한 환경에 놓였을 때 실패하게 되는 현상을 말합니다.

문제점: "완벽한 것" vs "실제적인 것"

이 논문은 기존의 해결책들이 마치 셰프에게 어떤 주방에서도 대처할 수 있도록 "매우 조심스럽게" 행동하도록 가르치는 것(도메인 랜덤화, Domain Randomization)과 같다고 설명합니다. 이는 셰프를 느리고 서투르게 만듭니다. 또는, 셰프가 요리를 하는 동안 새로운 주방의 모든 나사와 스프링을 측정하려고 시도하는 것(시스템 식별, System Identification)과도 같습니다. 이는 너무 많은 시간과 데이터가 소요됩니다.

해결책: TAM (스마트 어댑터)

저자들은 **TAM (Torque Adaptation Module, 토크 적응 모듈)**을 소개합니다. TAM은 메인 셰프 바로 옆에 서 있는 매우 똑똑한 **수셰프(sous-chef)**라고 생각하면 됩니다. 하지만 이 수셰프는 칼이 음식에 닿기 직전의 아주 마지막 순간에만 개입합니다.

TAM이 어떻게 작동하는지 간단한 부분으로 나누어 설명하겠습니다:

1. "블랙박스" 정책 (셰프)
메인 로봇 정책(셰프)은 완벽하고 이상적인 로봇 위에서 훈련되었습니다. 이 셰프는 "팔을 X 위치로 이동하라" 또는 "Y만큼의 힘을 가하라"와 같은 명령을 보냅니다. 이 셰프는 무거운 팬이나 끈적거리는 기름기에 대해 알지 못합니다.

2. 저수준 컨트롤러 (팔)
이 부분은 셰프의 명령을 실제 근육의 움직임(토크)으로 변환하는 역할을 합니다. "좋아, X 위치로 가려면 10뉴턴의 힘으로 밀어야 해"라고 말하는 단계입니다.

3. TAM (수셰프)
TAM은 저수준 컨트롤러와 실제 로봇 모터 사이에 위치합니다. TAM은 셰프에게 무엇을 해야 할지 알려주지 않습니다. 심지어 셰프가 무엇을 달성하려고 하는지도 모릅니다(목표나 레시피를 보지 않습니다).

대신, TAM은 로봇의 **이력(history)**을 관찰합니다. TAM은 다음을 살핍니다:

  • 지난 몇 초 동안 팔이 실제로 어떻게 움직였는지.
  • 실제로 얼마만큼의 힘이 가해졌는지.
  • 팔이 어떻게 느껴졌는지(고유 수용 감각).

이 이력을 바탕으로 TAM은 "헤이, 마찰력 때문에 팔이 움직이는 게 예상보다 느리네"라는 것을 깨닫습니다.

4. 마법 같은 조정 (잔여 토크)
TAM은 아주 작고 즉각적인 보정을 계산합니다. 만약 컨트롤러가 "10뉴턴으로 밀어라"라고 명령했다면, TAM은 "사실, 마찰력을 보상하기 위해 10.5뉴턴으로 밀어"라고 속삭일 수 있습니다. TAM은 모터에 전달되는 명령에 이 작은 "추가적인 힘"(잔여 토크)을 더합니다.

왜 이것이 특별한가요?

  • 플러그 앤 플레이(Plug-and-Play): 당신은 한 가지 작업(예: 상자 밀기)을 위해 훈련된 로봇 정책과 완전히 다른 작업(예: 큐브 뒤집기)을 위해 훈련된 정책을 가져올 수 있으며, TAM은 두 작업 모두에서 작동합니다. 메인 셰프를 다시 훈련할 필요가 없습니다. 그냥 TAM 어댑터를 꽂기만 하면 됩니다.
  • 시각이 아닌 "느낌"으로부터 학습: TAM은 로봇의 카메라를 볼 필요도 없고, 과업이 무엇인지 알 필요도 없습니다. TAM은 오직 로봇의 이력만을 필요로 합니다. 이는 마치 눈을 가린 전문가가 엔진 소리와 스티어링 휠의 진동만으로 차가 무거운지 알아내는 것과 같습니다.
  • 빠릅니다: TAM은 초당 1,000번(1 kHz)의 속도로 이러한 미세한 조정을 수행합니다. 이는 물체를 뒤집거나 공의 균형을 잡는 것과 같이 역동적이고 빠른 작업을 수행할 수 있을 만큼 빠릅니다. 느린 방식으로는 불가능한 속도입니다.
  • 실제 세계의 데이터가 필요 없습니다: 이 "수셰프"(TAM)는 수천 가지의 무작위 "만약의 상황"(무거운 팬, 끈적거리는 기름, 고장 난 스프링 등)이 포함된 컴퓨터 시뮬레이션 내에서 완전히 훈련되었습니다. 일단 훈련되면, 이를 실제 로봇에 그대로 적용할 수 있으며, 로봇에 완전히 알 수 없는 무게가 달려 있더라도 즉시 작동합니다.

결과

논문은 이 기술을 프랑카 판다(Franka Panda) 로봇을 사용하여 세 가지 매우 다른 작업에 테스트했습니다:

  1. 상자 밀기 (강화 학습을 통해 학습된 정책 사용).
  2. 큐브 뒤집기 (인간의 시연을 모방하여 학습된 정책 사용).
  3. 접시 위의 공 균형 잡기 (수학 기반 컨트롤러 사용).

모든 경우에서, TAM을 가진 로봇은 실시간으로 물리 법칙을 추측하려는 로봇이나 단순히 "조심스럽게" 행동하려는 로봇보다 훨씬 더 뛰어난 성능을 보였습니다. TAM은 로봇이 실제 세계의 무질서함 속에서도 마치 완벽한 시뮬레이션 속에 있는 것처럼 동일한 자신감과 속도로 움직일 수 있게 해주었습니다.

요약 비유

로봇 정책이 완벽하고 건조한 레이스 트랙에서 운전을 배운 드라이버이고, 실제 세계가 비가 내리고 진흙탕인 도로라면:

  • 기존의 방법들은 드라이버에게 매우 느리고 조심스럽게 운전하라고 지시합니다 (보수적 접근).
  • 다른 방법들은 운전하는 동안 진흙의 깊이를 측정하려고 시도합니다 (느리고 복잡함).
  • TAM은 자동차가 미끄러지는 것을 느끼고, 드라이버에게 운전 스타일을 바꾸라고 말할 필요도 없이, 차가 트랙 위에 머물 수 있도록 초당 1,000번씩 스티어링과 가속 페달을 즉각적으로 미세 조정하는 **코파일럿(부조종사)**과 같습니다.

결론적으로, 이 논문은 TAM이 "완벽한 세계"인 시뮬레이션에서 훈련된 로봇이 "무질서한 실제 세계"에서 성공할 수 있게 해주는 견고하고 유연한 도구임을 보여줍니다. 이는 로봇이 새로운 무거운 물체를 집어 들 때마다 매번 다시 훈련될 필요 없이 말입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →