← Nieuwste papers
💻 computer science

ER-Curriculum-DDQN for Critical Task Offloading in UAV-MEC via Transparent LEO Relays

Dit artikel stelt ER-Curriculum-DDQN voor, een deep reinforcement learning-framework dat haalbaarheidsmaskering, kritieke taakdrukken en reservatiegestuurd curriculumleren integreert om online taakoffloading in UAV-MEC-systemen via transparante LEO-relais te optimaliseren, waardoor de tijdige voltooiingsratio van kritieke taken onder strikte servicevensterbeperkingen wordt gemaximaliseerd.

Oorspronkelijke auteurs: Ziang Zhang, Zhenjiang Zhang, Jiaxing Du, Zhaoyuan Liu, Yujie Wang

Gepubliceerd 2026-09-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ziang Zhang, Zhenjiang Zhang, Jiaxing Du, Zhaoyuan Liu, Yujie Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de uitgestrekte, stille stroken van de lucht waar de infrastructuur van de grond vervaagt, krijgt een nieuw soort netwerk vorm. Stel je een vloot drones voor, of onbemande luchtvaartuigen, die boven een rampgebied of een afgelegen bergketen zweven en het gewicht dragen van urgente data van sensoren en camera's. Deze drones fungeren als vliegende computers, maar ze hebben beperkingen. Om complexe problemen op te lossen, moeten ze hun zware data naar krachtige servers op de grond of in de cloud sturen. Wanneer de grond te ver weg is of de wegen geblokkeerd zijn, kijken deze drones omhoog naar de sterren voor hulp. Ze maken verbinding met lage baan-satellieten die fungeren als transparante spiegels, die signalen simpelweg tussen de drone en een verre gateway reflecteren zonder de informatie zelf te verwerken. Dit creëert een vluchtige brug, een smal tijdvenster waarin de drone, de satelliet en het grondstation allemaal op één lijn liggen. De uitdaging is dat dit venster kort en onvergeeflijk is. Als een drone probeert een massief, niet-urgent bestand via deze brug te sturen, kan het de gehele verbinding voor de duur van de transactie blokkeren. Als er een kritiek noodbericht arriveert terwijl die brug bezet is, kan dit niet worden verzonden totdat de eerste taak is voltooid, wat potentieel een levensreddende deadline kan missen. De kernvraag voor wetenschappers is hoe ze deze schaarse, tijdgebonden verbinding kunnen beheren zodat de belangrijkste taken altijd doorkomen, zelfs wanneer het systeem overvol is.

Onderzoekers aan de Beijing Jiaotong University en de Army Arms University van de PLA hebben dit probleem aangepakt door een slim beslissingssysteem voor deze vliegende netwerken te ontwerpen. Ze concentreerden zich op een scenario waarin twintig drones samenwerken en twee grondgebaseerde computercentra en twee satellietpaden delen. Het systeem moet op het moment dat een nieuwe taak arriveert beslissen of hij deze lokaal op de drone verwerkt, naar een nabijgelegen grondserver stuurt, of door de satelliet doorstuurt. De crux is dat het satellietpad werkt volgens een strikte "first-come, first-served"-regel die niet onderbroken kan worden zodra deze is gestart. Als een routinetaken wordt toegelaten tot het satellietpad, reserveert deze de gehele verbinding voor zijn reis, waardoor elke andere taak, ongeacht de urgentie, wordt geblokkeerd totdat de retourvlucht is voltooid. De onderzoekers hadden een manier nodig om te voorspellen wanneer ze "nee" moesten zeggen tegen een routetaak om het satellietpad vrij te houden voor een toekomstige noodsituatie, en dat alles zonder te weten welke taken er als volgende zouden arriveren.

Om dit op te lossen, ontwikkelde het team een nieuwe methode genaamd ER-Curriculum-DDQN. Dit is een type kunstmatige intelligentie die leert door vallen en opstaan, maar met een specifieke set regels om het geworteld te houden in de realiteit. Het systeem gebruikt een "feasibility mask" (haalbaarheidsmasker), dat fungeert als een filter dat direct onmogelijke keuzes verwijdert. Bijvoorbeeld, als het satellietvenster gesloten is of het lokale geheugen van de drone vol is, kan het systeem deze opties simpelweg niet overwegen. Dit voorkomt dat de AI tijd verspilt aan het nadenken over acties die door fysieke beperkingen zouden falen. Naast het weten wat mogelijk is, houdt het systeem een "druk"-kenmerk bij. Dit is een maatstaf voor hoeveel vraag er in de recente geschiedenis naar het satellietpad is geweest vanuit kritieke taken. Als het systeem merkt dat kritieke taken regelmatig arriveren, wordt het voorzichtiger met het toelaten van routinetaken aan de satelliet, waardoor de brug effectief wordt bewaard voor de noodsituaties die daarna kunnen komen.

Het leerproces zelf werd begeleid door een "curriculum", een onderwijsstrategie die begint met eenvoud en steeds moeilijker wordt. In de vroege stadia van de training werd de AI expliciet verteld dat zij een straf zou krijgen wanneer zij een routetaak het gebruik van de satelliet liet, indien die actie de druk op het systeem verhoogde. Dit leerde de AI de waarde van het achterhouden van middelen. Naarmate de training vorderde, werd deze expliciete straf geleidelijk afgebouwd, waardoor de AI werd gedwongen de les te internaliseren en de juiste beslissingen te nemen op basis van de geleerde patronen, in plaats van een simpele regel te volgen. Het doel was niet alleen om taken uit te voeren, maar om te garanderen dat de meest kritieke taken op tijd worden voltooid.

De onderzoekers testten hun systeem via uitgebreide computersimulaties, waarbij ze het stelden tegenover andere bekende methoden en eenvoudige regelgebaseerde benaderingen. Ze varieerden de omstandigheden door te variëren in hoeveel taken er per seconde arriveerden, hoe lang de satellietvensters duurden en hoe groot het aandeel van de kritieke noodsituaties was. In elk scenario, vooral wanneer het systeem onder zware belasting stond of de satellietvensters zeer kort waren, presteerde de nieuwe methode beter dan de anderen. Het behaalde de hoogste snelheid van tijdige voltooiing voor kritieke taken. Bijvoorbeeld, wanneer het aantal inkomende taken hoog was en de satellietvensters krap waren, slaagde het nieuwe systeem erin om kritieke taken ongeveer 69% van de tijd te voltooien, terwijl andere methoden aanzienlijk lager scoorden. De resultaten toonden aan dat door een strikte filter voor onmogelijke bewegingen te combineren met een geleerd gevoel voor toekomstige vraag, het systeem de belangrijkste data kon beschermen zonder de toekomst te hoeven kennen.

De studie bevestigt dat in deze hoogwaardige, tijdgevoelige omgevingen de beste strategie niet alleen is om te reageren op wat er nú gebeurt, maar om de schaarste van de verbinding zelf te begrijpen. De onderzoekers kwamen tot de conclusie dat het simpelweg prioriteren van kritieke taken door ze hogere gewichten te geven niet genoeg was; het systeem moest de kosten begrijpen van het bezetten van het satellietpad met een routetaak. Door een leerbenadering te gebruiken die de fysieke limieten van het netwerk respecteert en leert van de geschiedenis van de vraag, kunnen de drones slimmere keuzes maken. Dit werk beweert niet elk probleem in de ruimtecommunicatie te hebben opgelost, noch belooft het in elk mogelijk toekomstig scenario te werken, maar het demonstreert een duidelijke en effectieve manier om de delicate balans te beheren tussen routinematig werk en dringende behoeften in een netwerk waar tijd de meest waardevolle hulpbron is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →