← 최신 논문
🤖 AI

Joint UAV Flight and Opportunistic Routing under Reinforcement Learning for Delay-Tolerant Networks

이 논문은 근접 정책 최적화(Proximal Policy Optimization)를 활용하여 지연 내성 네트워크(Delay-Tolerant Networks)에서 분산형 기회적 라우팅과 제어 가능한 UAV 비행을 공동으로 최적화함으로써, PRoPHET 및 MaxProp와 같은 기존 프로토콜에 비해 메시지 전달률을 높이고 혼잡을 줄이는 강화 학습 기반 프레임워크인 JUROR를 제안한다.

원저자: Xiao Wang, Shun-Ren Yang

게시일 2026-08-06
📖 7 분 읽기🧠 심층 분석

원저자: Xiao Wang, Shun-Ren Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷이 존재하지 않거나, 적어도 당신의 휴대폰이 매 초마다 서버에 연결되어 있는 그런 종류의 인터넷이 없는 세상을 상상해 보십시오. 재난 지역, 외딴 숲, 혹은 신호가 막히는 번잡한 도시와 같은 곳에서는 메시지가 송신자로부터 수신자에게 즉각적으로 "날아갈" 수 없습니다. 대신, 메시지는 "뜨거운 감자(hot potato)" 놀이를 해야 합니다. 이것은 움직이는 자동차와 드론이 플레이어가 되는 태그 놀이와 같습니다. 메시지는 이 "태그"입니다. 만약 당신이 태그를 잡았다면, 그것을 더 멀리 운반할 수 있는 다른 사람과 부딪힐 때까지 붙잡고 있어야 합니다. 이것을 "저장, 이동, 전달(store-carry-forward)"이라고 부릅니다.

까다로운 점은 이러한 네트워크가 종종 희소하고 혼란스럽다는 것입니다. "플레이어"(자동차와 사람들)는 정해진 도로를 따라 움직이며, "태그"(메시지)는 만료되기 전까지 시간 제한이 있습니다. 만 만약 플레이어들이 충분히 자주 만나지 못하거나, 너무 붐벼서 태그를 담을 주머니(용량)가 부족해지면 메시지는 유실됩니다. 이를 해결하기 위해 과학자들은 드론(UAV)을 비행하는 메신저로 사용하기 시작했습니다. 드론은 교통 흐름 위를 날아다니고, 더 멀리 도달하며, 정확히 어디로 갈지 선택할 수 있습니다. 하지만 여기서 큰 질문이 생깁니다. 중앙에서 모두에게 명령을 내리는 '보스' 없이, 어떻게 드론에게 어디로 날아갈지 알려주고 동시에 지상의 자동차들에게 언제 메시지를 전달할지 알려줄 수 있을까요? 만약 드론이 엉뚱한 방향으로 날아간다면, 자동차들은 서로 만날 수 없을 것입니다. 만약 자동차들이 메시지를 엉뚱한 사람에게 전달한다면, 드론은 빈 공간을 향해 날아갈 수도 있습니다.

이것이 바로 샤오 왕(Xiao Wang)과 슌-렌 양(Shun-Ren Yang)이 JUROR(Joint UAV flight and Opportunistic Routing)에 관한 논문에서 다룬 퍼즐입니다. 그들은 단순히 추측한 것이 아니라, **강화 학습(Reinforcement Learning)**이라는 일종의 인공지능을 사용하여 스마트한 시스템을 구축했습니다. 드론과 자동차가 함께 비디오 게임을 하는 팀을 상상해 보십시오. 그들은 미래의 지도를 가지고 있지는 않지만, 시행착오를 통해 배웁니다. 메시지를 성공적으로 전달하면 "점수"를 얻습니다. 메시지가 만료되거나 드론이 다른 드론 무리와 충돌하면 점수를 잃습니다. 논문은 이 드론과 자동차들이 협력하는 방법을 가르치기 위해 이 시나리오를 수천 번 시뮬레이션합니다.

주요 발견은 드론과 자동차가 고정된 규칙을 따르는 대신 하나의 팀으로서 함께 작동하도록 학습할 때, 훨씬 더 많은 메시지를 전달한다는 것입니다. 연구진은 드론이 "제어 가능(controllable)"해야 한다는 것을 발견했습니다. 즉, 교통 체증이 발생하는 곳에 따라 드론이 어디로 날아갈지 결정해야 한다는 것입니다. 또한, 드론이 시뮬레이터에서 학습하는 동안에는 "참조 가이드(전역 정보)"를 사용할 수 있지만, 실제로 작동할 때는 오직 자신이 볼 수 있는 로컬 정보만을 사용하여 스스로 결정을 내려야 한다는 것도 발견했습니다. **중앙 집중식 훈련 및 분산 실행(Centralized Training and Decentralized Execution, CTDE)**이라 불리는 이 접근 방식이 바로 비결이었습니다.

시뮬레이션에서 JUROR 시스템은 기존의 전통적인 방식들을 크게 앞질렀습니다. 예를 들어, 69개의 메시지가 발송된 한 테스트 시나리오에서 기존 방식들은 약 절반 정도만 전달했지만, JUROR 시스템은 57개 이상의 메시지를 전달했습니다(약 83%). 이 논문은 단순히 드론을 추가하는 것만으로는 충분하지 않으며, 드론이 지상 차량들을 위한 새로운 만남의 장소를 만들기 위해 능동적으로 조종되어야 하고, 차량들은 드론이 무엇을 하고 있는지에 따라 메시지를 전달할 시점을 결정해야 한다고 제안합니다. 이는 비행하는 자와 걷는 자가 서로 조화를 이루어 움직여야 하는 섬세한 춤과 같으며, 네트워크가 끊기거나 희소한 상황에서도 정보의 흐름을 유지하게 합니다.

비행하는 메신저들의 이야기

그렇다면 J-UROR는 실제로 어떻게 작동할까요? 번잡한 도시 거리를 상상해 보십시오. 교통 체증에 갇힌 자동차들(지상 노드)이 있고, 그 위를 드론(UAV)들이 윙윙거리며 날아다닙니다. 자동차들은 특정 목적지로 보내야 할 메시지를 가지고 있지만, 근처에 있을 때만 다른 자동차나 드론과 통신할 수 있습니다. 만약 자동차들이 교통 체증에 갇혀 있다면, 그들은 누구에게도 도달할 수 없습니다. 만약 드론이 무작정 원을 그리며 날아다닌다면, 교통 체증을 완전히 놓칠 수도 있습니다.

연구진은 이것이 "닭과 달걀" 문제라는 것을 깨달았습니다. 자동차들은 메시지를 밖으로 내보내기 위해 드론이 자신들에게 날아오기를 필요로 하지만, 드론은 어디로 날아가야 할지 알기 위해 자동차들이 어디에 밀집해 있는지 알아야 합니다. 이 문제를 해결하기 위해 JUROR는 전체 네트워크를 하나의 팀으로 취급합니다. 각 자동차와 각 드론은 각자의 뇌를 가진 "에이전트(agent)"입니다.

학습 과정: 시행착오
시스템은 근사 정책 최적화(Proximal Policy Optimization, PPO) 방식을 사용합니다. 강아지에게 공 가져오기를 가르치는 모습을 상상해 보십시오. 당신은 강아지에게 정확히 어떻게 달려야 하는지 말해주지 않습니다. 그저 공을 던지고, 강아지가 공을 가져오면 "착한 개야!"라고 말해줄 뿐입니다. 시간이 지나면서 강아지는 어떤 움직임이 간식을 가져다주는지 배우게 됩니다. JUROR도 수학을 통해 똑같이 수행합니다.

  1. 시뮬레이션: 연구진은 70개의 노드(65대의 자동차와 5대의 드론)가 있는 가상 세계(시뮬레이터)를 만들었습니다. 그들은 갑작스러운 메시지 폭주나 꾸준한 교통 흐름과 같은 다양한 교통 시나리오를 설정했습니다.
  2. 팀 보상: 단 하나의 드론이나 자동차에게만 보상을 주는 대신, 시스템은 "팀 점수"를 부여합니다. 메시지가 전달되면 모두가 점수를 얻습니다. 메시지가 만료되거나 버퍼(메모리)가 가득 차서 메시지를 떨어뜨리면 모두가 점수를 잃습니다. 이는 드론과 자동차가 협력하도록 강제합니다. 드론이 자동차가 없는 곳으로 날아간다면 팀 점수에 도움이 되지 않습니다. 자동차가 메시지를 너무 오래 들고 있으면 팀은 점수를 잃습니다.
  3. "참조 가이드"와 실제 생활: 이 부분이 영리한 대목입니다. 시스템이 *훈련(학습)*할 때, "교사(비평가/critic)"는 전체 판을 볼 수 있습니다. 교사는 모든 자동차와 드론이 어디에 있는지, 메모리가 얼마나 남았는지, 교통 체증이 어디인지 정확히 압니다. 교사는 에이전트들에게 "헤이, 방금 아주 좋은 움직임이었어!" 또는 "그건 나쁜 움직임이었어!"라고 말하며 이 "전역 뷰(global view)"를 사용합니다. 하지만 시스템이 *배포(실제 사용)*될 때, 드론과 자동차는 오직 자기 앞에 보이는 것만 볼 수 있습니다. 그들은 도시 전체를 볼 수 없습니다. 그들은 현재 자신이 접촉하거나 대화하고 있는 대상만을 알 수 있습니다. 논문은 이 제한된 시야를 가지고 있음에도 불구하고, 에이전트들이 "참조 가이드"의 도움을 받아 훈련되었기 때문에 매우 뛰어난 성능을 발휘할 수 있음을 보여줍니다.

드론의 새로운 역할
기존 시스템에서 드론은 잔디 깎는 기계가 앞뒤로 왔다 갔다 하는 것처럼 미리 정해진 패턴을 따라 움직였을 수 있습니다. 하지만 JUROR는 드론이 똑똑해지도록 가르칩니다. 드론은 "스트레스 필드(stress fields)"를 관찰합니다. 도시가 메시지가 쌓이고 있는 곳을 보여주는 보이지 않는 열지도(heat map)를 가지고 있다고 상상해 보십시오. 많은 메시지를 가진 자동차들이 한 구역에 갇혀 있다면, 그 구역은 붉게 빛납니다. 드론은 메시지를 수거하고 운반하기 위해 이 붉은 구역을 향해 날아가는 법을 배웁니다.

연구진은 또한 드론이 미래의 교통 상황을 예측(LSTM이라는 도구 사용, 이는 패턴을 파악하는 단기 기억과 같습니다)해야 하는지도 테스트했습니다. 그들은 미래를 예측하는 것이 어떤 상황에서는 도움이 될 수 있지만, 항상 필요한 것은 아니라는 것을 발견했습니다. 때로는 현재의 교통 체증에 반응하는 것만으로도 충분합니다. 실제로 일부 과밀 교통 시나리오에서는 미래를 예측하려는 시도가 오히려 예측값이 노이즈가 섞여 드론을 혼란스럽게 만들어 시스템을 약간 더 악화시키기도 했습니다.

연구 결과
결과는 명확했습니다. 시뮬레이션에서 JUROR는 게임 체인저였습니다.

  • 드론이 없을 때: 단순히 자동차만 있고 제어 가능한 드론이 없다면 시스템은 고전합니다. 한 테스트에서 69개의 메시지 중 약 13개만이 전달되었습니다.
  • 드론이 있을 때 (학습 후): 제어 가능한 드론 하나를 추가하는 것만으로도 큰 차이가 생겨 45개 이상의 메시지를 전달했습니다. 드론과 자동차가 하나의 완전한 팀으로서 협력하도록 학습하자, 전달률은 57개 이상의 메시지로 급증했습니다.
  • 기존 방식과의 비교: JUROR는 대부분의 시나리오, 특히 교통량이 많을 때 기존 방식들보다 훨씬 더 많은 메시지를 전달했습니다. 그러나 논문은 교통 흐름이 규칙적이고 예측 가능한 시나리오에서는 PRoPHET과 같은 전통적인 방식들도 꽤 잘 작동했다는 점을 언급하며, J-UROR의 장점이 복잡하고 혼잡하거나 혼란스러운 환경에서 가장 두드러진다는 것을 보여주었습니다.

논문은 몇 가지 아이디어도 검증하여 제외했습니다. 드론을 자동차와 별개의 존재로 취급해서는 안 된다는 점을 발견했습니다. 드론과 메시지 라우팅을 함께 최적화해야 합니다. 만약 드론의 비행 경로를 메시지 라우팅과 분리하여 최적화하려고 하면, 시스템은 잠재력을 최대한 발휘하지 못합니다. 또한 "핫스팟" 예측(교통이 발생할 곳을 추측하는 것)이 멋지게 들릴 수는 있지만, 그것이 마법의 탄환은 아니라는 것도 발견했습니다. 이는 교통 유형에 크게 의존합니다. 때로는 도움이 되기도 하고, 때로는 해가 되기도 합니다. 가장 신뢰할 수 있는 설정은 드론과 자동차가 전역 교사(global teacher)의 도움을 받아 훈련된 상태에서, 로컬 관측치를 사용하여 현재 상황에 반응하는 방식이었습니다.

이것이 중요한 이유
이것은 단순히 이메일을 더 빨리 보내는 것에 관한 문제가 아닙니다. 이것은 인터넷이 끊겼을 때 발생하는 상황에 관한 것입니다. 셀 타워(기지국)가 무너진 자연 재해 상황을 생각해 보십시오. 생존자로부터 구조대에 메시지를 전달해야 합니다. 생존자는 자동차 안에 있을 수 있고, 구조대는 드론에 있을 수 있습니다. 만약 드론이 어디로 날아가야 할지 모르거나, 자동차가 언제 메시지를 전달해야 할지 모른다면, 그 메시지는 사라집니다. JUROR는 이러한 네트워크를 견고하게 만드는 방법을 보여줍니다. 비행하는 부분과 지상의 부분이 함께 춤추도록 학습함으로써, 세상이 무너지는 순간에도 통신망을 유지할 수 있음을 증명합니다.

연구진은 단순히 이론만 세운 것이 아니라 수치를 입증했습니다. 그들은 다섯 가지 유명한 방법(PRoPHET, MaxProp 등)과 비교 실험을 진행했으며, 교통량이 많아질 때 JUROR가 일반적으로 승리했습니다. 논문은 이 "결합된(joint)" 접근 방식, 즉 비행 경로와 메시지 경로가 함께 결정되는 방식이 지연 내성 네트워크(DTN)의 잠재력을 완전히 끌어올리는 핵심이라는 결론을 내립니다. 이는 혼란스러운 세상 속에서 우리가 계속 연결되어 있기 위한 최선의 방법은, 지상에 있든 하늘에 있든 하나의 팀으로서 협력하는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →