ER-Curriculum-DDQN for Critical Task Offloading in UAV-MEC via Transparent LEO Relays
تقترح هذه الورقة إطار عمل ER-Curriculum-DDQN، وهو إطار تعلم تعزيزي عميق يدمج قناع الجدوى، وميزات ضغط المهام الحرجة، والتعلم المنهجي الموجه بالحجز لتحسين عملية ترحيل المهام عبر الإنترنت في أنظمة الطائرات بدون طيار (UAV-MEC) عبر مرحلات الأقمار الصناعية ذات المدار المنخفض (LEO) الشفافة، وذلك بهدف تعظيم نسبة الإنجاز في الوقت المحدد للمهام الحرجة تحت قيود نافذة الخدمة الصارمة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في الامتدادات الشاسعة والصامتة للسماء، حيث تتلاشى البنية التحتية للأرض، يتشكل نوع جديد من الشبكات. تخيل أسطولاً من الطائرات بدون طيار، أو المركبات الجوية غير المأهولة، تحلق فوق منطقة كوارث أو سلسلة جبال نائية، حاملةً ثقل البيانات العاجلة من المستشعرات والكاميرات. تعمل هذه الطائرات كحواسيب طائرة، لكن لها حدوداً. فمن أجل حل المشكلات المعقدة، تحتاج إلى إرسال بياناتها الثقيلة إلى خوادم قوية على الأرض أو في السحابة. وعندما تكون الأرض بعيدة جداً أو تكون الطرق مسدودة، تتطلع هذه الطائرات إلى النجوم طلباً للمساعدة؛ حيث تتصل بأقمار اصطناعية في مدار منخفض تعمل كمرايا شفافة، تقوم ببساطة بعكس الإشارات بين الطائرة وبوابة بعيدة دون التوقف لمعالجة المعلومات بنفسها. هذا يخلق جسراً عابراً، نافذة زمنية ضيقة يكون فيها الطرد، والقمر الاصطناعي، والمحطة الأرضية جميعهم على استقامة واحدة. التحدي يكمل في أن هذه النافذة قصيرة ولا ترحم؛ فإذا حاولت طائرة بدون طيار إرسال ملف ضخم غير عاجل عبر هذا الجسر، فقد يؤدي ذلك إلى توقف الاتصال بالكامل طوال مدة المعاملة. وإذا وصلت رسالة طوارئ حرجة أثناء انشغال هذا الجسر، فلا يمكن إرسالها حتى تنتهي المهمة الأولى، مما قد يؤدي إلى تفويت موعد نهائي لإنقاذ الأرواح. السؤال الجوهري للعلماء هو كيفية إدارة هذا الاتصال الشحيح والمحدود زمنياً لضمان وصول المهام الأكثر أهمية دائماً، حتى عندما يكون النظام مزدحماً.
لقد تصدى باحثون من جامعة بكين جياوتونغ وجامعة الجيش (Army Arms University) التابعة لجيش التحرير الشعبي لهذه المشكلة من خلال تصميم نظام ذكي لاتخاذ القرار لهذه الشبكات الطائرة. ركزوا على سيناريو تعمل فيه عشرون طائرة بدون طيار معاً، وتتشارك مركزين للحوسبة على الأرض ومسارين للأقمار الاصطناعية. يجب على النظام أن يقرر، في اللحظة التي تصل فيها مهمة جديدة، ما إذا كان سيتم معالجتها محلياً على الطائرة، أو إرسالها إلى خادم أرضي قريب، أو تمريرها عبر القمر الاصطناعي. والعقبة هي أن مسار القمر الاصطناعي يعمل وفق قاعدة صارمة وهي "الأولوية لمن يأتي أولاً"، ولا يمكن مقاطعته بمجرد بدئه. فإذا تم قبول مهمة روتينية في مسار القمر الاصطناعي، فإنها تحجز الاتصال بالكامل لرحلتها، مما يحجب أي مهمة أخرى، مهما كانت عاجلة، حتى تكتمل رحلة الذهاب والإياب. احتاج الباحثون إلى طريقة للتنبؤ بمتى يجب قول "لا" لمهمة روتينية لتوفير مسار القمر الاصطناعي لمهمة طوارئ مستقبلية، كل ذلك دون معرفة ماهية المهام التي ستصل لاحقاً.
ولحل ذلك، طور الفريق طريقة جديدة تسمى ER-Curriculum-DDQN. وهذا نوع من الذكاء الاصطناعي الذي يتعلم عن طريق التجربة والخطأ، ولكن مع مجموعة محددة من القواعد لإبقائه واقعياً. يستخدم النظام "قناع الجدوى" (feasibility mask)، الذي يعمل كمرشح يستبعد فوراً أي خيارات مستحيلة. فعلى سبيل المثال، إذا كانت نافذة القمر الاصطناعي مغلقة أو ذاكرة الطائرة المحلية ممتلئة، فلا يمكن للنظام ببساطة النظر في هذه الخيارات؛ وهذا يمنع الذكاء الاصطناعي من إضاعة الوقت في التفكير في إجراءات ستفشل بسبب القيود الفيزيائية. وبالإضافة إلى معرفة ما هو ممكن، يتتبع النظام ميزة "الضغط" (pressure)، وهي مقياس لمدى الطلب الذي حدث على مسار القمر الاصطناعي من المهام الحرجة في الماضي القريب. فإذا استشعر النظام وصول مهام حرجة بشكل متكرر، يصبح أكثر حذراً بشأن السماح للمهام الروتينية باستخدام القمر الاصطناعي، مما يحفظ الجسر فعلياً للطوارئ التي قد تأتي لاحقاً.
أما عملية التعلم نفسها فقد وجهها "منهج تعليمي" (curriculum)، وهو استراتيجية تعليم تبدأ بسيطة ثم تزداد صعوبة. في المراحل الأولى من التدريب، قيل للذكاء الاصطناعي صراحةً إنه سيتعرض لعقوبة كلما سمح لمهمة روتينية باستخدام القمر الاصטناعي إذا كان هذا الإجراء يزيد من الضغط على النظام. علّم هذا الذكاء الاصطناعي قيمة الاحتفاظ بالموارد. ومع تقدم التدريب، تم تقليل هذه العقوبة الصريحة تدريجياً، مما أجبر الذكاء الاصطناعي على استيعاب الدرس واتخاذ القرار الصحيح بناءً على الأنماط التي تعلمها، بدلاً من اتباع قاعدة بسيطة. لم يكن الهدف مجرد إنجاز المهام، بل ضمان إنهاء المهام الأكثر حرجاً في وقتها المحدد.
اختبر الباحثون نظامهم من خلال محاكاة حاسوبية مكثفة، حيث وضعوه في مواجهة طرق أخرى معروفة ونهج قائمة على القواعد البسيطة. قاموا بتغيير الظروف، مثل تغيير عدد المهام التي تصل في الثانية الواحدة، ومدة نوافذ الأقمار الاصطناعية، ونسبة المهام التي تمثل حالات طوارئ حرجة. وفي كل سيناريو، خاصة عندما كان النظام تحت حمل ثقيل أو عندما كانت نوافذ الأقمار الاصطناعية قصيرة جداً، تفوق الأسلوب الجديد على الآخرين. فقد حقق أعلى معدل لإكمال المهام الحرجة في الوقت المحدد. على سبيل المثال، عندما كان عدد المهام الواردة مرتفعاً ونوافذ الأقمار الاصطناعية ضيقة، تمكن النظام الجديد من إكمال المهام الحرجة بنسبة 69% من الوقت تقريباً، بينما كافحت الأساليب الأخرى بشكل أقل بكثير. وأظهرت النتائج أنه من خلال الجمع بين مرشح صارم للحركات المستحيلة وبين إدراك مُكتسب للطلب المستقبلي، يمكن للنظام حماية البيانات الأكثر أهمية دون الحاجة لمعرفة المستقبل.
تؤكد الدراسة أنه في هذه البيئات عالية المخاطر والحساسة للوقت، فإن الاستراتيجية المثلى ليست مجرد التفاعل مع ما يحدث الآن، بل فهم ندرة الاتصال نفسه. وجد الباحثون أن مجرد إعطاء أولوية للمهام الحرجة عبر منحها أوزانًا أعلى لم يكن كافياً؛ بل كان على النظام أن يفهم تكلفة إشغال مسار القمر الاصطناعي بمهمة روتينية. ومن خلال استخدام نهج تعلم يحترم الحدود الفيزيائية للشبكة ويتعلم من تاريخ الطلب، يمكن للطائرات بدون طيار اتخاذ خيارات أذكى. لا يدعي هذا العمل أنه حل كل مشكلة في اتصالات الفضاء، ولا يعد بالعمل في كل سيناريو مستقبلي ممكن، ولكنه يوضح طريقة واضحة وفعالة لإدارة التوازن الدقيق بين العمل الروتيني والاحتياجات العاجلة في شبكة يعد فيها الوقت المورد الأكثر قيمة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.