Decision Transformer for UAV-Mounted RIS-Assisted Dynamic D2D Communications
تقترح هذه الورقة إطار عمل يعتمد على "Decision Transformer" لتحسين مسار الطائرات بدون طيار، ووضعية ميلها، وأطوار الأسطح العاكسة الذكية (RIS) لاتصالات (D2D) الديناميكية، مما يظهر قدرات فائقة في التعميم عبر السيناريوهات المختلفة والقدرة على النقل الصفري مقارنة بنهج التعلم المعزز العميق التقليدية.
في المساحات المزدحمة والمكتظة في المصانع والمستودعات الحديثة، غالبًا ما تكافح الإشارات اللاسلكية لإيجاد مسار واضح. فالأجهزة التي تحاول التواصل مع بعضها البعض كثيرًا ما تتعرض للحجب بواسطة الآلات الثقيلة، أو رفوف التخزين، أو الكثافة العالية للبيئة المحيطة. ولحل هذه المشكلة، توجه المهندسون إلى تقنية تسمى "السطح الذكي القابل لإعادة التشكيل". تخيل هذا السطح كجدار أو لوحة ذكية مغطاة بآلاف العناصر الصغيرة القابلة للضبط، والتي يمكنها التقاط موجة راديوية وعكسها بدقة إلى حيث يجب أن تذهب، مما يخلق فعليًا مسارًا جديدًا وواضحًا لانتقال البيانات. وبينما تكون هذه الأسطح عادةً ثابتة في مكانها، يستكشف الباحثون الآن كيفية تثبيتها على الطائرات بدون طيار (الدرونز). إذ يمكن للطائرة بدون طيار أن تطير إلى الموقع المثالي وتُميل سطحها لالتقاط الإشارات من أي زاوية، مما يوفر مستوى من المرونة لا تستطيع الجدران الثابتة مضاهاته ببساطة. ومع ذلك، فإن التحكم في طائرة بدون طيار تحمل أيضًا مرآة معقدة وحساسة للزوايا يعد عملية توازن صعبة، تتطلب حسابات دقيقة لمكان الطيران، وكيفية الإمالة، وكيفية ضبط سطح المرآة في الوقت الفعلي.
لقد تصدى أحد الباحثين لهذا التحدي عبر تطوير طريقة جديدة لتعليم هذه الأنظمة المثبتة على الطائرات بدون طيار كيفية اتخاذ القرارات. فبدلاً من برمجة الطائرة بقواعد جامدة أو إجبارها على تعلم كل شيء من الصفر في كل مرة تدخل فيها غرفة جديدة، استخدموا طريقة تحاكي كيفية تعلم البشر من خلال مراقبة الخبراء. قاموا أولاً بتدريب عدة خوارزميات تعلم قياسية في محاكاة حاسوبية لإيجاد أفضل الطرق للطيران وضبط المرآة في مجموعة متنوعة من مخططات المصانع المختلفة. ومن خلال هذه المحاكاة، اختاروا الاستراتيجيات "الخبير" الأكثر نجاحًا وسجلوا المسارات والحركات الدقيقة التي اتخذتها الطائرة لتحقيق أداء عالٍ. ثم قاموا بتغذية هذه المجموعة من تجارب الخبراء في نموذج تعلم متخصص يسمى "محول القرار" (Decision Transformer). هذا النموذج لا يحفظ البيانات فحسب، بل يتعلم الأنماط الكامنة لكيفية أداء فعل معين بناءً على موقف محدد، مما يسمح له بالتنبؤ بالخطوة الأفضل حتى في غرفة لم يسبق له رؤيتها من قبل.
اختبر الباحث هذا النهج في بيئة محاكاة تمثل مساحة صناعية كثيفة، حيث بلغت مساحتها 40 في 40 مترًا بارتفاع 8 أمتار. وداخل هذه المساحة، حاولت أربعة أجهزة ذات هوائي واحد التواصل، مشكلةً أزواجًا لتبادل البيانات بينما كانت الطائرة بدون طيار تحلق على ارتفاع 4.5 مترًا. كان على النظام مراعاة حقيقة أن قوة الإشارة تتغير اعتمادًا على الزاوية التي تصطدم بها الموجة بالمرآة، وهو تفصيل غالبًا ما يتم تجاهله في النماذج الأبسط. كانت مهمة الطائرة بدون طيار هي ضبط مسار طيرانها، وإمالتها ثلاثية الأبعاد، وإعدادات عناصر المرآة الـ 16 العاكسة لتعظيم إجمالي كمية البيانات المتدفقة بين الأجهزة. وقارن الباحث طريقته الجديدة بعدة تقنيات تعلم أخرى، بما في ذلك تقنية تحاول ببساطة نسخ سلوك خبير من سيناريو قريب. وأظهرت النتائج أن الطريقة الجديدة، عندما مُنحت موقع بدء جديد تمامًا للطائرة بدون طيار، استطاعت الأداء بمستوى عالٍ فورًا دون الحاجة إلى مزيد من التدريب. وكانت هذه القدرة على "الأداء الصفري" (zero-shot) أفضل بكثير من مجرد نقل استراتيجية من سيناريو مشابه ولكن مختلف.
وعندما سمح الباحث للنظام بالتفاعل مع البيئة الجديدة لفترة قصيرة ثم قام بصقل معرفته بناءً على أفضل النتائج التي لاحظها، تحسن الأداء بشكل أكبر. وفي هذه الاختبارات، وصل النظام الذي تم صقله إلى نفس المستوى العالي من الأداء الذي حققه نظام تم تدريبه خصيصًا من الصفر لهذه الغرفة تحديدًا. ووجدت الدراسة أن خوارزمية "DDPG expert"، التي كانت بمثابة المعيار لإمكانات النظام، حققت متوسط معدل بيانات يبلغ حوالي 29.5 بت في الثانية لكل هرتز، وهو رقم أعلى ملحوظًا من طرق التعلم الأخرى المختبرة، والتي استقرت عند 25 و20.5 و17 على التوالي. والنتيجة الرئيسية هي أنه من خلال التعلم من مجموعة متنوعة من أمثلة الخبراء مسبقًا، يمكن للنظام تعميم معرفته على المواقف غير المرئية، وتجنب الحاجة إلى التعلم القائم على التجربة والخطأ المكلف والمستهلك للوقت في العالم الحقيقي. وهذا يشير إلى أن الشبكات اللاسلكية المستقبلية يمكن أن تستخدم الطائرات بدون طيار لإصلاح انقطاعات الإشارة ديناميكيًا في البيئات المعقدة، والتكيف بسرعة مع التخطيطات الجديدة بأقل قدر من التدخل البشري.
ملخص تقني: محول القرار (Decision Transformer) للاتصالات الديناميكية بين جهاز وجهاز (D2D) المدعومة بأسطح عاكسة ذكية (RIS) مثبتة على طائرة بدون طيار (UAV)
بيان المشكلة تتناول هذه الورقة البحثية تحدي تحسين أداء الاتصالات في البيئات الداخلية الديناميكية حيث يتم تفعيل روابط الاتصال بين الأجهزة (D2D) بشكل عشوائي وتتعرض لانسداد الإشارة. تركز الدراسة على نظام مدعوم بسطح عاكس ذكي (RIS) مثبت على طائرة بدون طيار (UAV). وخلافاً للأعمال السابقة التي غالباً ما تعامل الـ RIS كسطح ثابت أو تتجاهل الديناميكيات الدورانية ثلاثية الأبعاد للطائرة، فإن هذا البحث يعتبر نظاماً متكاملاً بالكامل حيث:
حركة الطائرة ووضعيتها: تعتبر مسارات الطائرة ثلاثية الأبعاد ووضعيات دورانها (الانعراج، الميل، والتدحرج) متغيرات للتحسين.
الانعكاس المعتمد على الزاوية: تم نمذجة الـ RIS كمصفوفة مستوية منتظمة (UPA) مع معاملات انعكاس عملية تتغير بناءً على زاوية سقوط الموجات الكهرومغناطيسية.
ديناميكيات القنوات: يعمل النظام تحت قنوات تلاشي "رايسين" (Rician fading) متغيرة زمنياً، حيث تعتمد مكونات خط البصر (LoS) على موقع الطائرة واتجاهها.
الهدف الجوهري هو التحسين المشترك لمسار طيران الطائرة، وزوايا الوضعية ثلاثية الأبعاد، وإزاحة الطور للـ RIS لتعظيم متوسط معدل المجموع لجميع أزواج الـ D2D، مع مراعاة القيود المتعلقة بالحركة، والطاقة، والحدود المادية. المشكلة غير محدبة (non-convex) وعالية الترابط، مما يجعل تطبيق طرق التحسين التقليدية أمراً صعباً.
المنهجية يقترح المؤلف إطار عمل يعتمد على التعلم التعزيزي العميق (DRL) المعزز بـ محول القرار (Decision Transformer - DT) لتحقيق تحكم قوي وقدرة على التعميم عبر سيناريوهات مختلفة.
نمذجة النظام:
نموذج القناة: يستخدم تلاشي "رايسين" مع مكونات خط البصر (LoS) وخطوط عدم البصر (NLoS). يتم حساب استجابة المصفوفة بناءً على زوايا السمت والارتفاع المحددة بالنسبة للـ RIS.
نموذج الانعكاس: يتبنى نموذجاً عملياً حيث يكون معامل انعكاس عناصر الـ RIS دالة في زاوية السقوط، بدلاً من افتراض انعكاس وحدوي مثالي.
نموذج الحركة: يتضمن مصفوفة دوران ثلاثية الأبعاد لتحديث المتجه العمودي للـ RIS وزوايا السقوط بناءً على انعراج، وميل، وتدحرج الطائرة.
إطار التحسين:
صياغة عملية ماركوف لاتخاذ القرار (MDP): تُصاغ المشكلة كعملية ماركوف لاتخاذ القرار حيث تشمل الحالة موقع/سرعة/وضعية الطائرة ومصفوفات القناة، وتشمل الإجراءات تحديثات المسار، وتعديلات الوضعية، وإزاحات طور الـ RIS.
توليد بيانات الخبراء: يتم تدريب عدة خوارزميات DRL (مثل DDPG، PPO، SAC، TD3) في سيناريوهات متعددة. ويحدد التحليل المقارن خوارزمية DDPG كأفضل خوارزمية "خبير" لهذه المشكلة ذات التحكم المستمر وعالي الأبعاد.
تدريب محول القرار (DT):
التدريب المسبق غير المتصل (Offline Pre-training): يتم تدريب الـ DT مسبقاً على مجموعة كبيرة من مسارات الخبراء الناتجة عن خوارزمية DDPG عبر مواقع ابتدائية متعددة للطائرة. يتعلم الـ DT التنبؤ بالإجراءات مشروطة بالحالات التاريخية، والإجراءات، و"العوائد المتبقية للوصول" (الجوائز المستقبلية المستهدفة).
الضبط الدقيق عبر الإنترنت (Online Fine-tuning): للسيناريوهات غير المرئية، يتم نشر الـ DT المدرب مسبقاً بأسلوب "التعلم الصفري" (zero-shot). وللتكيف مع البيئة الجديدة، يقوم النظام بجمع بيانات التفاعل، واختيار أفضل المسارات أداءً (بناءً على العوائد التراكمية)، واستخدامها لضبط سياسة الـ DT بدقة. وهذا يتجنب تدهور الأداء الذي غالباً ما يُلاحظ عند نقل السياسات بشكل مباشر.
المساهمات الرئيسية
النمذجة المتكاملة ثلاثية الأبعاد: تقدم الورقة نموذجاً شاملاً يحسن بشكل مشترك مسار الطائرة ووضعية الـ 3D (الانعراج، الميل، والتدحرج) جنباً إلى جنب مع أطوار الـ RIS، مع مراعاة الربط الصريح بين اتجاه الطائرة وخصائص الانعكاس المعتمدة على الزاوية للـ RIS.
التحكم القابل للتعميم عبر محول القرار: بدلاً من الاعتماد فقط على DRL القياسي الذي قد يواجه صعوبة في البيئات غير المرئية، يستخدم المؤلف "محول القرار". يضع هذا النهج التعلم التعزيزي في إطار نمذجة التسلسل الشرطي، مما يمكّن السياسة من التعلم من بيانات الخبراء غير المتصلة والتعميم على سيناريوهات جديدة دون الحاجة لإعادة تدريب مكثف.
استراتيجية التدريب الهجين: يجمع إطار العمل المقترح بين التدريب المسبق غير المتصل على مسارات الخبراء عالية الجودة وبين آلية الضبط الدقيق عبر الإنترنت التي تستخدم انتقائياً المسارات ذات العوائد العالية من البيئة الجديدة. وهذا يوازن بين كفاءة العينات والقدرة على التكيف.
النتائج أُجريت عمليات محاكاة عددية في سيناريو تصنيع صناعي ثلاثي الأبعاد يحتوي على أربعة أزواج من الـ D2D ومصفوفة RIS بحجم 4×4.
اختيار خوارزمية DRL: من بين الخوارزميات المختبرة (DDPG, PPO, SAC, TD3)، أظهرت DDPG أسرع تقارب وأعلى متوسط معدل مجموع (حوالي 29.5 بت/ثانية/هرتز)، مما جعلها الخبير المختار لتوليد بيانات التدريب.
أداء التعميم: في السيناريوهات غير المرئية (مواقع ابتدائية مختلفة للطائرة)، تفوق Zero-Shot DT بشكل كبير على السياسات التي تم الحصول عليها من خلال نقل نموذج DDPG مدرب على سيناريو واحد أو سيناريو مجاور مباشرة.
فعالية الضبط الدقيق: حقق Fine-tuned DT أداءً يكاد يكون مطابقاً لخبير DDPG الخاص بالسيناريو، ولكنه تطلب تفاعلات أقل بكثير عبر الإنترنت للتكيف.
الاستقرار: أظهرت المنهجيات القائمة على DT أداءً أكثر استقراراً مع تقلبات أقل مقارنة بطرق النقل المباشر، والتي كانت حساسة لتغير التوزيع في حالات القنوات واقتران المستخدمين.
الأهمية والادعاءات تدعي الورقة أن إطار عمل "محول القرار" المقترح يقدم حلاً واعداً للتحكم في أنظمة الـ RIS المثبتة على الطائرات بدون طيار في البيئات الديناميكية. ومن خلال الاستفادة من بيانات الخبراء غير المتصلة ونمذجة التسلسل الشرطي، يتغلب هذا الأسلوب على قيود المتانة التي تواجهها سياسات DRL التقليدية. ويؤكد المؤلف أن نهجه يتيح التعميم عبر السيناريوهات بفعالية والتكيف السريع عبر الإنترنت بتفاعلات أقل، مما يلبي الحاجة الماسة لاتصالات مرنة وموثوقة في الشبكات اللاسلكية المعقدة والمتغيرة زمنياً. يسلط العمل الضوء على إمكانات نمذجة التسلسل القائمة على بيانات الخبراء لحل مشكلات التحسين المشترك المعقدة في اتصالات الـ UAV-RIS دون الحاجة إلى تدريب عبر الإنترنت مكلف حاسوبياً من الصفر.