← 최신 논문
🤖 machine learning

Adaptive Outer-Loop Control of Quadrotors via Reinforcement Learning

본 논문은 과도하게 보수적인 도메인 무작위화에 의존하지 않고 심각한 동적 교란 및 모델 불확실성 하에서 강인하고 고정밀 궤적 추적을 달성하기 위해 심층 강화 학습 정책과 잔류 동역학 예측기 및 온라인 보정 메커니즘을 결합한 쿼드로터용 적응형 외부 루프 제어 아키텍처를 제안한다.

원저자: Vishnu Saj, Sushi Vemuri, Dileep Kalathil, Moble Benedict

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vishnu Saj, Sushi Vemuri, Dileep Kalathil, Moble Benedict

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

커피 머그잔 크기의 작고 초고민첩한 드론이 폭풍 속을 완벽하게 비행하도록 가르친다고 상상해 보세요. 목표는 바람이 변하거나 드론에 무거운 가방을 매달거나, 그 가방이 진자처럼 흔들릴지라도 특정 경로를 따라 흔들림 없이 비행하게 하는 것입니다.

이 논문은 **강화 학습 (Reinforcement Learning, RL)**을 사용하여 드론이 이를 수행하는 새로운 방법을 제시합니다. 이는 개를 간식으로 훈련시키는 것과 같습니다: 드론은 다양한 시도를 하고, 잘 비행하면 '보상'을 받으며, 추락하면 '징벌'을 받아 결국 가장 좋은 비행 방식을 학습하게 됩니다.

간단한 비유를 사용하여 그들의 접근 방식을 다음과 같이 정리해 보겠습니다:

1. 문제: '과도하게 의심하는' 파일럿

일반적으로 엔지니어들은 컴퓨터 시뮬레이션에서 드론을 훈련시켜 실제 세계의 혼란에 대처하게 할 때, **도메인 무작위화 (Domain Randomization)**라는 방법을 사용합니다.

  • 비유: 조종사를 훈련시킬 때, 시뮬레이터에 던져 넣어서 매초마다 바람, 비행기의 무게, 엔진 출력이 무작위로 변하게 한다고 상상해 보세요.
  • 결과: 조종사는 극도로 신중하게 행동하는 법을 배웁니다. 그들은 모든 것에 과민하게 반응하는 '의심 많은' 조종사가 됩니다. 실제 세계에서는 이로 인해 드론이 신경질적인 운전자가 도로의 작은 자갈 하나마다 브레이크를 강하게 밟는 것처럼 불안정하고 떨리는 행동을 하게 됩니다. 작동은 하지만 매끄럽거나 효율적이지는 않습니다.

2. 해결책: '탐정' 드론

저자들은 드론을 모든 것에 대해 의심하게 만드는 대신, 지금 정확히 무슨 일이 일어나고 있는지 파악하고 그에 따라 조정하는 탐정처럼 가르치는 더 지능적인 시스템을 제안합니다.

그들은 세 부분으로 구성된 시스템을 구축했습니다:

부분 A: '오라클 (Oracle)' (선생님)

먼저, 그들은 컴퓨터 내에서 드론의 '완벽한' 버전을 훈련시켰습니다. 이 버전은 매 밀리초마다 정확한 풍속, 정확한 탑재하중의 무게, 그리고 가해지는 정확한 힘을 알려주는 마법 같은 '오라클'을 가지고 있었습니다.

  • 결과: 이 드론은 무엇이 잘못되었는지 정확히 알고 즉시 수정했기 때문에 완벽하게 비행했습니다.
  • 문제점: 실제 드론에는 이러한 마법 같은 센서가 없습니다. 그들은 바람이나 정확한 무게 변화를 '느낄' 수 없습니다. 따라서 이 완벽한 버전은 실제 세계에서는 비행할 수 없습니다.

부분 B: RDP (탐정)

'센서 부재' 문제를 해결하기 위해, 그들은 **잔류 동역학 예측기 (Residual Dynamics Predictor, RDP)**를 추가했습니다. 이는 탐정 역할을 하는 작은 AI 두뇌 (신경망) 입니다.

  • 작동 원리: 드론의 과거를 살펴봅니다: "1 초 전에는 어디에 있었나? 얼마나 빠르게 움직였나? 방금 모터에 어떤 명령을 보냈나?"
  • 비유: 자동차를 운전하다가 갑자기 왼쪽으로 당기는 느낌을 받는다고 상상해 보세요. "타이어에 돌이 부딪혔다"라고 알려주는 센서가 필요하지 않습니다. 차가 왼쪽으로 당겨지고 핸들이 뻣뻣해졌기 때문에 그 일이 발생했다고 추론할 수 있습니다. RDP 는 드론에게서도 이렇게 작동합니다. 모터 명령과 이동 기록을 살펴보고, "아, 왼쪽에 무거운 가방이 매달려 있겠구나" 또는 "위쪽으로 밀어 올리는 돌풍이 있구나"라고 추측합니다.
  • 마법: 특별한 힘 센서가 필요하지 않습니다. 드론이 이미 가지고 있는 데이터 (속도, 위치, 모터 신호) 만을 사용하여 보이지 않는 힘을 추측합니다.

부분 C: '보정 브릿지' (번역기)

AI 를 컴퓨터에서 실제 드론으로 옮겼을 때, 약간의 불일치가 있었습니다. 컴퓨터 세계는 완벽하지만, 실제 세계는 약간 닳은 모터나 100% 충전되지 않은 배터리와 같은 미세한 결함이 존재합니다.

  • 비유: 책을 영어에서 프랑스어로 번역하는 것과 같습니다. 단어는 같지만 억양이 약간 다릅니다.
  • 해결책: AI 전체를 다시 훈련시키는 것 (영원히 걸림) 대신, 그들은 '선형 보정 브릿지'를 사용했습니다. 드론을 몇 초간 비행하게 한 후, AI 가 일어난 것으로 생각한 것실제로 일어난 것을 비교하여 간단한 수학 보정을 적용했습니다. 라디오의 볼륨 조절 노브를 돌려 완벽한 소리를 얻는 것과 같습니다. 이는 몇 초간의 데이터만 필요했습니다.

3. 결과: 성능 평가

그들은 이 '탐정 드론'을 실제 마이크로 드론 (Crazyflie) 에서 세 가지 어려운 시나리오로 테스트했습니다:

  1. 무게 추가: 드론에 추를 매달았습니다.
    • 기존 방식: 드론이 무거워질수록 흔들리며 추락했습니다.
    • 새로운 방식: 탐정이 무게가 더 무거워졌다고 추측하고 더 많은 출력을 요청하여 매끄럽게 비행했습니다.
  2. 불균형 무게: 한쪽 팔에만 추를 매달았습니다.
    • 기존 방식: 드론이 비틀림을 견디지 못해 통제 불능 상태가 되어 회전했습니다.
    • 새로운 방식: 탐정이 "내가 왼쪽으로 비틀리고 있구나"라고 깨닫고 모터를 조정하여 이를 완벽하게 상쇄했습니다.
  3. 흔들리는 하중: 끈에 추를 매달아 (진자처럼) 비행시켰습니다.
    • 도전 과제: 드론이 움직일 때 추는 앞뒤로 흔들리며 예측 불가능한 힘을 생성했습니다.
    • 결과: 드론은 추가 격렬하게 흔들리는 동안에도 8 자 경로를 완벽하게 추적했습니다. 탐정 AI 는 흔들리는 운동을 '보고' 실시간으로 이를 상쇄할 수 있었습니다.

핵심 교훈

이 논문은 최악의 시나리오를 예상하는 '의심 많은' 파일럿이 필요하지 않음을 증명합니다. 대신 다음과 같은 지능적이고 적응적인 파일럿을 구축할 수 있습니다:

  1. 관찰: 지금 일어나고 있는 일을 파악합니다.
  2. 추측: 표준 데이터만을 사용하여 보이지 않는 힘 (바람, 무게, 흔들림) 을 추측합니다.
  3. 조정: 매끄럽게 비행하기 위해 즉시 조정합니다.

이 방법은 훈련 속도가 더 빠르고, 컴퓨팅 파워를 덜 사용하며, 값비싸고 무거운 센서를 작은 드론에 장착할 필요 없이 이전 방법들보다 훨씬 매끄럽게 비행합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →