← 최신 논문
💻 computer science

MoRI: Mixture of RL and IL Experts for Long-Horizon Manipulation Tasks

이 논문은 강화학습 (RL) 과 모방학습 (IL) 전문가를 동적으로 혼합하여 복잡한 장기 작업에서 샘플 효율성과 안전성을 극대화하고, 실제 환경에서 2~5 시간 내 97.5% 의 성공률로 인간 개입을 대폭 줄인 'MoRI' 시스템을 제안합니다.

원저자: Yaohang Xu, Lianjie Ma, Gewei Zuo, Wentao Zhang, Han Ding, Lijun Zhu

게시일 2026-04-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yaohang Xu, Lianjie Ma, Gewei Zuo, Wentao Zhang, Han Ding, Lijun Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 스스로 배우는 '마법 같은 조율사': MoRI 소개

안녕하세요! 오늘 소개해 드릴 논문은 로봇이 복잡한 일을 할 때, 어떻게 하면 더 빠르고 정확하게, 그리고 사람 개입 없이 스스로 학습할 수 있는지에 대한 획기적인 방법을 다룹니다. 이 방법의 이름은 **MoRI(모리)**입니다.

이걸 이해하기 위해 요리사와 요리 보조원의 이야기를 상상해 보세요.

1. 왜 로봇 학습은 어려울까요? (두 가지 문제)

로봇이 새로운 일을 배우는 데는 크게 두 가지 방식이 있습니다.

  • 방식 A: 시범 따라 하기 (Imitation Learning, IL)
    • 비유: 요리사가 "이렇게 칼질해"라고 시범을 보이면, 보조원이 그대로 따라 하는 거예요.
    • 장점: 처음부터 빠르게 배울 수 있어요.
    • 단점: 만약 시범을 본 요리사가 실수하면, 보조원도 그 실수를 그대로 따라 하게 돼요. 그리고 예상치 못한 상황 (예: 재료가 미끄러짐) 이 생기면 당황해서 일을 망치기 쉽습니다.
  • 방식 B: 시행착오를 통한 학습 (Reinforcement Learning, RL)
    • 비유: 보조원이 "내가 직접 해볼게!"라고 말하며 무작위로 시도해 보는 거예요. 실패하면 다시 하고, 성공하면 보상을 받죠.
    • 장점: 새로운 상황에도 유연하게 대처할 수 있고, 스스로 문제를 해결하는 법을 터득합니다.
    • 단점: 실패가 너무 많아요. 로봇이 물건을 떨어뜨리거나 부수는 일이 빈번해서, 사람 (감독관) 이 계속 개입해서 도와줘야 합니다. 시간이 너무 오래 걸리죠.

기존 연구들은 이 두 가지를 섞으려 했지만, 복잡한 일 (예: 수건 접기, 구멍에 꽂기) 을 할 때는 여전히 효율이 떨어졌습니다.

2. MoRI 의 해결책: "상황에 맞는 전문가 팀"

저자 팀은 **"하나의 로봇이 두 가지 두뇌를 가지고, 상황에 따라 누가 주도권을 잡게 할까?"**라는 아이디어를 냈습니다. 이것이 바로 **MoRI(Mixture of RL and IL Experts)**입니다.

이 시스템은 마치 정교한 오케스트라 지휘자처럼 작동합니다.

  • IL 전문가 (시범 따라 하기 팀):
    • 역할: 로봇이 대략적인 움직임 (예: 서랍을 여는 것, 상자를 들어 올리는 것) 을 할 때 나섭니다.
    • 특징: 미리 보여준 시범 데이터를 기반으로 하므로 빠르고 안정적입니다.
  • RL 전문가 (시행착오 팀):
    • 역할: 로봇이 정밀한 조작 (예: 나사를 꽂을 때의 미세한 각도 조절, 수건을 접을 때의 힘 조절) 을 할 때 나섭니다.
    • 특징: 실시간으로 상황을 판단하고 실험하며, 가장 좋은 방법을 찾아냅니다.

3. 어떻게 작동할까요? (지휘자의 신호)

MoRI 의 핵심은 **'어떤 전문가가 지금 더 잘할까?'**를 실시간으로 판단하는 **게이트 (Gating Network)**입니다.

  • 판단 기준: 두 전문가가 내리는 행동이 얼마나 **불확실한지 (변동성)**를 봅니다.
    • 만약 두 전문가가 "서랍을 열어"라고 거의 똑같은 말을 한다면? → IL 전문가가 주도권을 잡습니다. (안정적이니까)
    • 만약 두 전문가가 의견이 다르고, "어떻게 꽂아야 할지 모르겠다"는 신호가 강하다면? → RL 전문가가 주도권을 잡습니다. (새로운 시도가 필요하니까)
  • 안전장치: RL 전문가가 너무 무모하게 실험하지 않도록, IL 전문가의 지식을 '규칙'처럼 적용합니다. 마치 유모차에 안전벨트를 채워주는 것처럼, 로봇이 너무 위험한 행동을 하지 않게 막아줍니다.

4. 실제 성과: 놀라운 속도

이 방법을 실제 로봇 (프랑카 암) 에 적용해 보니 결과가 정말 놀라웠습니다.

  • 학습 시간: 기존 방식보다 21% 더 빨라졌습니다. (약 2~5 시간 만에 학습 완료)
  • 성공률: 4 가지 복잡한 작업 (서랍에 물건 넣기, 수건 접기 등) 에서 **97.5%**의 성공률을 기록했습니다.
  • 사람의 개입: 사람이 로봇을 도와줘야 하는 횟수가 85.8%나 줄었습니다. 로봇이 거의 혼자서 일을 해냅니다.

5. 한 줄 요약

"MoRI 는 로봇에게 '시범을 따라 하는 빠른 보조원'과 '시행착오를 통해 배우는 창의적인 전문가'를 동시에 붙여주었습니다. 그리고 상황의 난이도에 따라 누가 일할지 지휘자가 자동으로 정하게 함으로써, 로봇이 사람 도움 없이도 복잡한 일을 빠르고 정확하게 마스터하게 만들었습니다."

이 기술은 앞으로 창고 관리, 정밀 조립, 심지어 수술 보조 로봇 등 다양한 분야에서 로봇이 더 똑똑하고 안전하게 일할 수 있는 길을 열어줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →