← 최신 논문
🤖 machine learning

AERIS: Offline Policy Improvement for Multi-UAV Integrated Sensing and Communication

본 논문은 과거의 비행 로그로부터 학습함으로써 성능 지표를 대폭 향상시키는 동시에 위험한 온라인 시행착오 탐색을 제거하여, 안전하고 효율적인 다중 UAV 통합 센싱 및 통신 제어를 가능하게 하는 STAR-CRDT 알고리즘을 특징으로 하는 오프라인 정책 개선 프레임워크인 AERIS를 제안한다.

원저자: Ziyuan Wang (Steven), Yifan Sui (Steven), Wei Wei (Steven), Wenjie Xin (Steven), Zekai Zhang (Steven), Xiangwang Hou (Steven), Xiao-Ping (Steven), Zhang

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ziyuan Wang (Steven), Yifan Sui (Steven), Wei Wei (Steven), Wenjie Xin (Steven), Zekai Zhang (Steven), Xiangwang Hou (Steven), Xiao-Ping (Steven), Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

가까운 미래에 우리의 기기들을 연결하는 무선 네트워크는 단순히 데이터를 전송하는 것을 넘어, 물리적 세계를 위한 눈과 귀의 역할까지 수행하게 될 것입니다. '통합 감지 및 통신(integrated sensing and communication)'이라 불리는 이 신흥 개념은, 당신의 휴대폰과 대화하는 동시에 주변 환경을 매핑하고, 움직이는 물체를 탐지하며, 환경을 모니터링할 수 있는 단일 시스템을 구상합니다. 여기에 무인 항공기, 즉 드론이 결합되면 그 가능성은 크게 확장됩니다. 이 비행 기체들은 지상 기지국이 닿을 수 없는 곳에서도 공중에 떠서 사용자 및 타겟에 대한 명확한 가시선을 확보할 수 있습니다. 하지만, 두 가지 과업을 동시에 수행하도록 드론 군집을 제어하는 것은 매우 까리한 도전입니다. 드론은 고속 인터넷 연결과 정확한 감지를 유지하기 위해 자신의 위치와 신호 방향을 끊임없이 조정해야 하며, 동시에 서로 충돌하지 않도록 피하면서 모니터링 중인 물체를 놓치지 않아야 합니다. 환경은 예측 불가능하고 타겟은 무작위로 움직이기 때문에, 모든 드론의 최적의 비행 경로를 실시간으로 찾아내는 것은 매우 어렵고 계산 비용이 많이 드는 일입니다.

연구자들은 이를 해결하기 위해 인공지능, 구체적으로는 컴퓨터 프로그램이 시행착오를 통해 학습하는 방식인 '강화 학습(reinforcement learning)'에 주목했습니다. 일반적인 온라인 학습 시나리오에서는 시스템이 드론을 실제로 날려 보내서 실수를 저지르게 하고, 그 결과로부터 배우는 과정을 거쳐야 합니다. 하지만 현실 세계에서 이러한 시행착오 방식의 비행은 위험합니다. 학습 중인 드론이 다른 드론에 너무 가까이 접근하거나, 충돌하거나, 센서 방향을 잘못 지정하여 중요한 데이터를 손실할 수 있기 때문입니다. 이러한 위험을 피하기 위해 중국과 캐나다의 대학 연구진은 'AERIS'라는 새로운 접근 방식을 제안했습니다. 드론이 실제 세계에서 직접 비행하며 배우는 대신, 이 시스템은 고정된 과거 비행 기록 전체로부터 학습합니다. 이는 조종사가 비행기를 추락시키며 배우는 것이 아니라, 더 나은 조종사가 되기 위해 이전 비행 기록이 담긴 로그북을 공부하는 것과 같습니다. 목표는 기존의 불완전한 비행 로그를 활용하여, 위험한 테스트 비행을 전혀 요구하지 않고도 드론의 의사 결정 능력을 향상시키는 시스템을 만드는 것이었습니다.

연구진이 직면한 핵심 문제는 중앙 컴퓨터는 모든 드론이 무엇을 하고 있는지 전체적인 그림을 볼 수 있는 반면, 개별 드론은 오직 자신의 국소적인 이력만을 알고 있다는 점이었습니다. 만약 드론이 자신이 보는 정보에만 기반하여 행동을 바꾸려 한다면, 자신에게는 좋아 보일지 몰라도 팀 전체에는 해로운 움직임을 보일 수 있습니다. 반대로, 시스템이 중앙 컴퓨터의 조언에 따라 드차의 행동을 너무 공격적으로 수정하려고 하면, 과거 데이터와 너무 동떨어진 움직임을 제안하게 되어 시스템이 신뢰할 수 없게 되고 안전하지 않게 될 수 있습니다. 연구진은 기존 방식들이 두 가지 함정 중 하나에 빠진다는 것을 발견했습니다. 즉, 기존의 불완전한 로그에 너무 밀착하여 개선에 실패하거나, 혹은 너무 미지의 영역으로 벗어나 위험한 오류를 초래한다는 것이었습니다.

이를 해결하기 위해 연구진은 'STAR-CRDT'라는 특정 알고리즘을 개발했습니다. 이 방법은 중앙 컴퓨터가 과거 로그의 전역 정보를 사용하여 드론의 비행 경로에 대한 잠재적 변화를 평가하는 방식으로 작동합니다. 그러나 이 시스템은 모든 제안을 맹목적으로 수용하지 않습니다. 대신, '신중한 스승' 역할을 합니다. 시스템은 전체 군집의 성능을 개선할 가능성이 높으면서도 안전한, 드론의 행동에 대한 작은 조정을 찾습니다. 그리고 이 조정이 신뢰할 수 있을 만큼 안전한 기록된 행동과 충분히 가깝고, 동시에 실질적인 개선을 제공할 만큼 충분히 떨어져 있을 때만 이를 수용합니다. 이 과정은 드론이 충돌을 방지해 주었던 기존의 안전 제약 조건을 결코 잊지 않으면서도 더 나은 방향으로 학습하도록 보장합니다. 이 시스템은 무거운 연산 작업이 과거 데이터를 사용하는 훈련 단계에서 이루어지도록 설계되었으며, 최종 결과물은 각 드론이 실시간으로 스스로 따를 수 있는 단순한 로컬 규칙들의 집합이 됩니다.

연구진이 이 새로운 프레임워크를 테스트했을 때, 결과는 매우 유의미했습니다. 무작위 경로를 비행하는 여러 대의 드론을 포함한 시뮬레이션에서, 이 새로운 시스템은 기존의 가장 우수한 방식들과 비교했을 때 군집의 전체 성능을 거의 30% 향면시켰습니다. 더욱 중요한 점은, 이 성과를 달성하면서도 위험한 상황을 획기적으로 줄였다는 것입니다. 시스템은 타겟 감지 성공률을 거의 5% 높였고, 충돌 위험을 절반 이상 줄였습니다. 또한 높은 통신 품질을 유지하여 드론들이 서로 통신하고 지상 사용자들과 효과적으로 소통할 수 있도록 관리했습니다. 아마도 가장 인상적인 부분은, 연구진이 시스템이 한 번도 본 적 없는 실제 도시 거리 기반의 완전히 새로운 지도에서 훈련된 드론들을 테스트했다는 점입니다. 생소한 환경에서도 드론들은 다른 어떤 방식보다 뛰어난 성능을 보였으며, 복잡한 도시 구조를 성공적으로 항해하면서도 안전과 서비스 품질을 유지했습니다.

이 연구는 위험한 실세계 실험 없이도 매우 효과적이고 안전하며 협력적인 드론 네트워크를 구축하는 것이 가능하다는 것을 보여줍니다. 고정된 과거 비행 기록으로부터 학습하고, 신중하고 신뢰 기반의 방법을 사용하여 그 교훈을 정교화함으로써, 연구진은 인공지능이 강력하면서도 신뢰할 수 있게 만들어질 수 있음을 입증했습니다. 이 접근 방식은 안전과 신뢰성이 최우선인 실제 세계에 고급 감지 및 통신 네트워크를 배치하기 위한 실질적인 경로를 제시합니다. 연구 결과는 적절한 훈련 전략이 있다면, 자율 시스템이 복잡하고 역동적인 환경을 효과적으로 다룰 수 있으며, 여러 대의 움직이는 드론이 만드는 잠재적 혼돈을 조화롭고 효율적인 운영으로 바꿀 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →