← 최신 논문
🤖 machine learning

ARMOR: Robust Reinforcement Learning-based Control for UAVs under Physical Attacks

이 논문은 물리적 센서 공격 상황에서도 특권 공격 정보 없이 배포 시점에 공격에 탄력적인 잠재 상태 표현을 학습하기 위해 2단계 훈련 프레임워크를 채택함으로써, 물리적 센서 공격 하에서도 견고한 UAV 운용을 보장하는 모델 프리 강화 학습 제어기인 ARMOR를 소개한다.

원저자: Pritam Dash, Ethan Chan, Nathan P. Lawrence, Karthik Pattabiraman

게시일 2026-08-04
📖 6 분 읽기🧠 심층 분석

원저자: Pritam Dash, Ethan Chan, Nathan P. Lawrence, Karthik Pattabiraman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 드론 조종법을 가르치고 있다고 상상해 보세요. 현실 세계에서 로봇은 인간처럼 눈을 가지고 있지 않습니다. 대신 위치를 파악하기 위한 GPS, 균형을 잡기 위한 자이로스코프, 움직임을 포착하기 위한 카메라와 같은 일련의 센서에 의존하여 자신이 어디에 있는지, 어떻게 움직여야 하는지를 파악합니다. 이것이 바로 인공지능의 한 종류인 **강화 학습(Reinforcement Learning, RL)**의 세계입니다. 강화 학습은 마치 강아지가 간식을 통해 기술을 배우는 것처럼, 컴퓨터가 무언가를 시도해 보고 좋은 행동에 대해 보상을 받으며 의사결정 방법을 배우는 방식입니다. 목표는 복잡한 과업을 안전하게 수행할 수 있는 드론의 "두뇌"를 만드는 것입니다.

하지만 여기 교활한 문제가 있습니다. 센서들이 속임수에 빠질 수 있다는 점입니다. 마술사가 당신의 눈을 속일 수 있듯이, 해커는 드론의 센서에 가짜 신호를 보낼 수 있습니다. 이를 **물리적 공격(physical attack)**이라고 합니다. 예를 들어, 그들은 드론이 다른 곳에 있다고 믿게 만들기 위해 가짜 GPS 신호를 보내거나, 음파를 사용하여 드로의 균형 센서를 방해할 수 있습니다. 만약 드론의 두뇌가 이 거짓말을 믿게 된다면, 드론은 추락하거나 건물에 부딪힐 수 있습니다. 과학자들은 위험을 피하는 "안전한" 두뇌를 만들기 위해 노력해 왔지만, 대부분의 안전망은 누군가 적극적으로 속이려 할 때 실패합니다. 기존 방식들은 세상이 그저 조금 어수선한 상태라고 가정할 뿐, 누군가 로봇을 적극적으로 속이고 있다는 사실은 고려하지 않습니다.

여기서 ARMOR라는 새로운 아이디어가 등장합니다. 연구진은 드론이 센서가 진실을 외치고 있을 때조차 거짓을 포착할 수 있는 컨트롤러를 만들고자 했습니다. 그들은 단순히 드론을 더 "강하게" 만든 것이 아니라, 세상을 보는 새로운 방식을 가르쳤습니다. 쉽게 속을 수 있는 가공되지 않은 센서 데이터에 의서 의존하는 대신, ARMOR는 실제로 일어나고 있는 일에 대한 "비밀 요약본"을 만드는 법을 배웁니다. 이 논문은 특수한 2단계 훈련 방법을 사용함으로써, 해커가 발명한 모든 새로운 속임수에 대해 매번 다시 훈련할 필요 없이, 공격을 받는 중에도 경로를 유지하며 비행할 수 있는 드론을 만들 수 있다고 제안합니다.

ARMOR 이야기: 거짓말을 알아채는 드론

ARMOR(Adaptive Robust Manipulation-Optimized State Representations)를 만나보세요. ARMOR를 단순한 조종사가 아니라, 가짜 알리바이를 무시하도록 학습된 탐정이라고 생각하십시오.

드론 제어의 일반적인 방식은 컴퓨터에 센서로부터 온 가공되지 않은 데이터를 입력하는 것입니다: "나는 좌표 X에 있다", "나는 속도 Y로 회전하고 있다." 하지만 해커가 가짜 신호를 주입하면 컴퓨터는 그 거짓말을 믿게 됩니다. 기존의 방법들은 특정 유형의 속임수에 대비해 훈련함으로써(마치 특정 유형의 시험 문제만을 공부하는 학생처럼) 드론을 "의심 많게" 만들려고 노력했습니다. 하지만 이는 느리고 비용이 많이 들며, 해커가 속임수를 약간만 바꾸더라도 드론은 실패하게 됩니다.

ARMOR는 다른 접근 방식을 취합니다. 이 방식은 마치 마스터 교사와 학생이 있는 것과 같은 2단계 훈련 프레임워크를 사용합니다.

1단계: 초능력을 가진 선생님
먼저, 연구진은 "선생님 인코더(Teacher Encoder)"를 훈련시킵니다. 이 스마트한 AI 구성 요소는 초능력을 가지고 있습니다. 바로 **특권 정보(privileged information)**에 접근할 수 있다는 것입니다. 시뮬레이션 속에서 선생님은 언제 공격이 발생하는지, 어떤 센서가 거짓말을 하고 있는지, 그리고 그 거짓말이 얼마나 큰지를 정확히 알고 있습니다. 이는 마치 선생님이 정답지를 보면서 학생의 시험을 채점하는 것과 같습니다.

이 참조 정보를 바탕으로, 선생님은 지저나 거짓이 섞인 센서 데이터를 **강건한 잠재 표현(robust latent representation)**으로 번역하는 법을 배웁니다. 이것을 "비밀 코드" 또는 "진실한 요약본"이라고 상상해 보십시오. 설령 GPS가 드론이 바다에 있다고 말하더라도, 선생님의 비밀 코드는 "아니, GPS가 거짓말을 하고 있어. 드론은 실제로 하늘에 있어"라고 판단합니다. 드론의 제어 정책(그의 두뇌)은 가공되지 않은 센서 데이터가 아닌 이 비밀 코드를 기반으로 결정을 내리는 법을 배웁니다. 이를 통해 드론은 공격을 받는 중에도 진실로부터 배우기 때문에 완벽하게 비행하는 법을 익힐 수 있습니다.

2단계: 진실을 보는 법을 배우는 학생
여기서 까다로운 부분이 있습니다. 현실 세계에서 드론은 정답지를 가진 선생님을 가질 수 없습니다. 드론은 자신이 공격받고 있다는 사실을 알 수 없습니다. 그래서 연구진은 **학생 인코더(Student Encoder)**를 훈련시킵니다.

학생은 정답지 없이 진실을 파악해야 하는 탐정과 같습니다. 학생은 오직 드론의 과거 기록, 즉 지난 몇 초간의 센서 데이터 흐름에만 접근할 수 있습니다. 학생은 이 기록을 살펴보고 선생님이 생성한 "비밀 코드"를 추측하도록 훈련됩니다. 학생은 "잠깐, GPS 수치가 천천히 변하고 있어. 이건 보통 가짜 신호가 들어올 때 나타나는 패턴이야"라거나 "자이로스코프가 이상한 리듬으로 떨리고 있어"와 같은 패턴을 찾아내는 법을 배웁니다.

학생이 비밀 코드를 잘 추측하게 되면, 선생님은 은퇴합니다. 이제 드론은 학생과 제어 정책만을 가지고 배치됩니다. 이제 현실 세계에서 드로가 비행하다 공격을 받으면, 학생은 센서 데이터의 이력을 분석하여 "진실한 요약본"을 생성하고, 제어 정책은 이를 사용하여 드론이 경로를 똑바로 유지하도록 만듭니다.

실험 결과가 보여주는 것

연구진은 시뮬레이션된 3D 환경에서 드론을 다섯 가지 유형의 물리적 공격(GPS 스푸핑, 자이로스코프 조작, 가속도계 변조, 자기장 교란, 광학 흐름 스푸핑)에 맞붙여 ARMOR를 테스트했습니다. 그리고 ARMOR를 적대적 훈련을 사용하는 RARL 및 하이브리드 회복 정책인 HRP와 같은 기존의 최고 수준의 방법들과 비교했습니다.

시뮬레이션 결과는 매우 명확했습니다:

  • 생존율(Survival Rate): 공격에 직면했을 때, ARMOR는 약 **88%**의 확률로 드론을 성공적으로 비행시켰습니다. 반면, 기존 방식들은 어려움을 겪었으며 성공률은 30%에서 83% 사이였습니다.
  • 추락(Crashes): 더욱 놀라운 점은, ARMOR가 테스트된 모든 공격 유형에서 0%의 추락률을 기록했다는 것입니다. 기존 방식들은 빈번하게 추락했습니다. 예를 들어, GPS 공격 상황에서 경쟁 모델은 **50%**의 확률로 추락했습니다.
  • 경로 유지(Staying on Course): 드론이 경로에서 벗어났을 때도, ARMOR는 "상태 드리프트(state drift, 경로에서 벗어난 정도)"를 GPS 공격 시 약 0.1미터 정도로 매우 낮게 유지했습니다. 다른 방식들은 드론을 몇 미터 혹은 몇 도씩 벗어나게 하여 충돌이나 임무 실패를 유발했습니다.

"제로샷(Zero-Shot)" 초능력

가장 흥激한 발견은 저자들이 **제로샷 일반화(zero-shot generalization)**라고 부르는 능력입니다. 보통 로봇에게 GPS 거짓말을 처리하도록 훈련시키면, 갑자기 자이로스코프 거짓말을 만났을 때 실패할 수 있습니다. 이는 마치 수학만 공부하고 역사 시험을 망치는 것과 같습니다.

하지만 ARMOR는 본 적 없는 공격에 대해서도 추가 훈련 없이 대처할 수 있음을 보여주었습니다.

  • GPS 공격에 대해서만 훈련시킨 후, 한 번도 경험해보지 못한 자이로스코프 공격을 테스트했을 때, ARMOR는 여전히 **60%**의 성공률을 보였습니다. 반면 기존 방식인 RARL은 완전히 실패하여 **0%**의 성공률을 기록했습니다.
  • 자이로스코프 공격에 대해 훈련한 후 GPS 공격을 테스트했을 때, ARMOR는 **70%**의 성공률을 보였으나, 다른 방식은 겨우 **5%**에 그쳤습니다.

이는 "실제 물리적 상태"의 비밀 코드를 학습함으로써, 드론이 어떤 센서가 거짓말을 하더라도 그 유형을 학습한 적이 없더라도 이를 인식할 수 있음을 시사합니다.

이것이 왜 중요한가 (그리고 한계점은 무엇인가)

이 논문은 이 2단계 방식이 두 가지 큰 문제를 동시에 해결하기 때문에 중요한 진전이라고 제안합니다. 첫째, 훈련 속도가 빠르고 비용이 저렴합니다. 전통적인 방식은 컴퓨터가 가짜 공격자와 끊임없이 싸우는 수천 시간의 "적대적 훈련"을 필요로 합니다. ARMOR는 선생님을 이용해 빠르게 진실을 학습한 뒤 학생에게 그 진실을 모방하도록 가르침으로써 이 과정을 건너뜁니다.

둘째, 드론을 더 다양한 위협으로부터 안전하게 만듭니다. 저자들은 ARMOR가 단일 센서 공격이나 일부 다중 센서 공격을 처리하는 데 매우 뛰어나지만, 한계가 있다는 점도 언급했습니다. 만약 공격자가 너무 많은 센서를 복합적인 방식으로 조작한다면 시스템이 여전히 어려움을 겪을 수 있습니다. 또한, 현재의 결과는 실제 하드웨어가 해킹된 환경에서의 실제 비행이 아닌 시뮬레이션에 기반하고 있습니다. 저자들은 결과가 유망하지만, 다음 단계는 이것이 실제 세계의 실제 드론에서도 작동하는지 확인하는 것이라고 신중하게 밝히고 있습니다.

요약하자면, ARMOR는 드론에게 소음이 섞인 거짓 센서의 말을 듣는 대신, 현실의 "비밀 요약본"을 듣도록 가르칩니다. 이는 취약한 로봇을 회복 탄력성을 갖춘 로봇으로 바꾸어, 세상이 속이려 할 때도 똑바로 비행할 수 있게 만드는 영리한 전략입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →