← Neueste Arbeiten
💻 computer science

WDQAR:A Weighted Double Q-Learning Based Adaptive Routing Protocol for Flying Ad Hoc Networks

Dieses Paper schlägt WDQAR vor, ein adaptives Routing-Protokoll für Flying Ad Hoc Networks, das ein gewichtetes Double-Q-Learning-Framework in Kombination mit dynamischer Nachbarschaftserkennung und sektorbasierten Filtern nutzt, um die Verzerrung der Q-Wert-Schätzung zu mildern und die Routing-Leistung in hochmobilen UAV-Umgebungen zu optimieren.

Ursprüngliche Autoren: Qingzhong Ni, Yijie Bai, Daojie Yu, Qi Zhang, Fan Meng

Veröffentlicht 2026-09-15
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Qingzhong Ni, Yijie Bai, Daojie Yu, Qi Zhang, Fan Meng

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Am Himmel über Katastrophengebieten, Schlachtfeldern oder entlegener Wildnis arbeiten zunehmend kleine fliegende Roboter, sogenannte unbemannte Luftfahrzeuge oder UAVs, in Schwärmen zusammen. Diese Maschinen verlassen sich nicht auf Mobilfunkmasten oder feste Internetkabel; stattdessen kommunizieren sie direkt miteinander und bilden ein temporäres, selbstorganisierendes Netzwerk, das in der Luft schwebt. Diese Art von Netzwerk wird als „Flying Ad Hoc Network“ bezeichnet. Die Herausforderung für diese Schwärme besteht darin, dass die Luft ein chaotischer Ort ist. Die Drohnen bewegen sich schnell, ihre Positionen ändern sich jede Sekunde, und die unsichtbaren Funkverbindungen, die sie miteinander verbinden, können genauso leicht zerbrechen, wie sie entstanden sind. Um eine Nachricht von einer Drohne zur nächsten weiterzuleiten, bis sie eine Bodenstation erreicht, benötigt das Netzwerk ein Routing-System, das in Sekundenbruchteilen Entscheidungen darüber treffen kann, welchem Nachbarn es den nächsten Sprung anvertraut. Traditionelle Methoden haben hier oft Schwierigkeiten, da sie entweder zu langsam auf Veränderungen reagieren oder kostbare Batterieleistung verschwenden, indem sie ständig Updates an jeden Nachbarn senden.

Ein Team von Forschern der People's Liberation Army Information Engineering University hat einen neuen Weg vorgeschlagen, um dieses Problem zu lösen, genannt WDQAR. Ihr Ansatz betrachtet das Pfadfindungsproblem nicht als eine statische Karte, die gezeichnet werden muss, sondern als einen Lernprozess. Stellen Sie sich eine Drohne vor, die diese spezifische Route noch nie zuvor geflogen ist; sie muss lernen, welche Nachbarn zuverlässig sind, welche Verbindungen wahrscheinlich abbrechen werden und in welche Richtung sie am effizientesten zum Ziel führt. Die Forscher verwendeten eine Technik aus dem Bereich der künstlichen Intelligenz, die als Reinforcement Learning (bestärkendes Lernen) bekannt ist, bei dem ein Agent durch Versuch und Irrtum lernt und Belohnungen für gute Entscheidungen sowie Strafen für schlechte Entscheidungen erhält. Standardmäßige Lernmethoden können jedoch manchmal übermäßig optimistisch sein und vermuten, dass ein Pfad besser ist, als er tatsächlich ist. Um dies zu korrigieren, führte das Team eine „gewichtete doppelte“ Lernmethode ein. Dieses System führt zwei separate interne Aufzeichnungen dessen, was es gelernt hat, ein. Durch den Vergleich dieser beiden Datensätze und das Verschmelzen ihrer Vorhersagen vermeidet das System die Falle der Selbstüberschätzung, was zu stabileren und genaueren Entscheidungen im schnelllebigen Himmel führt.

Das Protokoll arbeitet in zwei Hauptphasen. Zuerst müssen die Drohnen wissen, wer sich in ihrer Umgebung befindet. In einem schnell beweglichen Netzwerk verschwendet das zu häufige Senden einer „Hello“-Nachricht, um die eigene Anwesenheit anzukündigen, Energie, aber sendet man sie zu selten, erkennt die Drohne möglicherweise nicht, dass ein Nachbar aus der Reichweite gedriftet ist. Das WDQAR-System löst dies, indem es die Häufigkeit dieser Nachrichten adaptiv gestaltet. Wenn eine Drohne ein stabiles Muster fliegt, wobei sich die Nachbarn in dieselbe Richtung bewegen, verringert sie die Frequenz ihrer Hello-Nachrichten. Wenn der Wind oder Manöver dazu führen, dass die Verbindungen instabil werden, erhöht sie die Nachrichtenrate, um auf dem Laufenden zu bleiben. Diese dynamische Anpassung stellt sicher, dass das Netzwerk sich seiner sich ändernden Form bewusst bleibt, ohne die Funkwellen mit unnötigem Geplapper zu überfluten.

Sobald eine Drohne ihre Nachbarn kennt, muss sie entscheiden, wohin sie das Datenpaket als Nächstes sendet. Anstatt jeden einzelnen Nachbarn zu fragen, filtert das System die Liste zunächst basierend auf der Geografie. Es erstellt eine kegelförmige Zone, die in Richtung des Ziels zeigt, und berücksichtigt nur Nachbarn innerhalb dieses Kegels. Dies verengt das Auswahlfeld und ermöglicht es dem Lernalgorithmus, sich auf die vielversprechendsten Pfade zu konzentrieren. Die Entscheidung, welchen Nachbarn man wählt, wird dann durch ein Belohnungssystem geleitet, das vier spezifische Faktoren gewichtet: wie viel Batterieleistung der Nachbar noch hat, wie lange die Verbindung voraussichtlich anhalten wird, wie viel näher der Nachbar dem endgültigen Ziel kommt und wie viele andere zuverlässige Nachbarn dieser Nachbar hat. Durch das Abwägen dieser Faktoren vermeidet das System, Daten an eine Drohne zu senden, die kurz vor dem Entleeren der Batterie steht oder die in eine Sackgasse steuert.

Um dieses Lernen zu beschleunigen, gaben die Forscher den Drohnen einen Vorsprung. Anstatt mit keinerlei Wissen zu beginnen, weist das System jedem Nachbarn einen Anfangswert basierend auf seiner Position relativ zum Ziel zu. Ein Nachbar, der physisch näher am Ziel liegt, erhält eine bessere Startbewertung. Dies verhindert, dass die Drohnen Zeit damit verschwenden, frühzeitig nutzlose Pfade zu erkunden. Darüber hinaus passt das System seine eigene Lerngeschwindigkeit basierend auf der Stabilität des Netzwerks an. Wenn eine Verbindung langsam oder unzuverlässig ist, lernt das System schnell aus diesem Fehlschlag. Wenn die Verbindung stabil ist, lernt es langsamer und vertraut auf seine vergangenen Erfahrungen. Diese Flexibilität ermöglicht es dem Netzwerk, sich augenblicklich an plötzliche Änderungen in Geschwindigkeit oder Richtung anzupassen.

Die Forscher testeten ihre Idee mithilfe einer Computersimulation, die ein Szenario zur Überwachung von Katastrophen mit bis zu einhundert Drohnen in einem dreidimensionalen Raum modellierte. Sie verglichen ihr neues Protokoll mit anderen bestehenden Methoden, die ebenfalls Lernalgorithmen verwenden. Die Ergebnisse zeigten, dass das WDQAR-System signifikant effektiver war. Es lieferte einen höheren Prozentsatz an Datenpaketen an die Bodenstation und erreichte eine durchschnittliche Erfolgsquote von über neunzig zwei Prozent, selbst als die Anzahl der Drohnen zunahm. Es gelang auch, die Daten schneller ans Ziel zu bringen, mit einer durchschnittlichen Verzögerung, die fast vierzig Prozent niedriger war als die des nächstbesten Konkurrenten. Vielleicht am wichtigsten für die Langlebigkeit des Schwarms: Das neue Protokoll verbrauchte weniger Energie und erzeugte weniger Steuerungsverkehr. Durch das Senden wenigerer Hello-Nachrichten und die Wahl effizienterer Pfade bewahrten die Drohnen ihre Batterielebensdauer und hielten das Netzwerk reibungslos am Laufen.

Die Studie bestätigt, dass durch die Kombination einer intelligenten Methode zur Filterung von Nachbarn mit einer sorgfältigeren Methode des Lernens aus Erfahrung ein Routing-System geschaffen werden kann, das robust genug für die unvorhersehbare Natur des Flugs ist. Obwohl die Ergebnisse aus Simulationen und nicht aus physischen Flugtests stammen, legen die Daten nahe, dass dieser Ansatz zukünftige Drohnenschwärme in realen Situationen, in denen die Kommunikationsinfrastruktur fehlt oder beschädigt ist, zuverlässiger machen könnte. Die Arbeit unterstreicht, dass es in einer Welt voller beweglicher Teile die beste Strategie ist, nicht nur zu reagieren, sondern zu lernen, Optionen sorgfältig abzuwägen und sich kontinuierlich an die Umgebung anzupassen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →