← أحدث الأبحاث
🤖 AI

Decision Transformer for UAV-Mounted RIS-Assisted Dynamic D2D Communications

تقترح هذه الورقة إطار عمل يعتمد على "Decision Transformer" لتحسين مسار الطائرات بدون طيار، ووضعية ميلها، وأطوار الأسطح العاكسة الذكية (RIS) لاتصالات (D2D) الديناميكية، مما يظهر قدرات فائقة في التعميم عبر السيناريوهات المختلفة والقدرة على النقل الصفري مقارنة بنهج التعلم المعزز العميق التقليدية.

المؤلفون الأصليون: Yaxuan Liu

نُشر 2026-09-10
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yaxuan Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في المساحات المزدحمة والمكتظة في المصانع والمستودعات الحديثة، غالبًا ما تكافح الإشارات اللاسلكية لإيجاد مسار واضح. فالأجهزة التي تحاول التواصل مع بعضها البعض كثيرًا ما تتعرض للحجب بواسطة الآلات الثقيلة، أو رفوف التخزين، أو الكثافة العالية للبيئة المحيطة. ولحل هذه المشكلة، توجه المهندسون إلى تقنية تسمى "السطح الذكي القابل لإعادة التشكيل". تخيل هذا السطح كجدار أو لوحة ذكية مغطاة بآلاف العناصر الصغيرة القابلة للضبط، والتي يمكنها التقاط موجة راديوية وعكسها بدقة إلى حيث يجب أن تذهب، مما يخلق فعليًا مسارًا جديدًا وواضحًا لانتقال البيانات. وبينما تكون هذه الأسطح عادةً ثابتة في مكانها، يستكشف الباحثون الآن كيفية تثبيتها على الطائرات بدون طيار (الدرونز). إذ يمكن للطائرة بدون طيار أن تطير إلى الموقع المثالي وتُميل سطحها لالتقاط الإشارات من أي زاوية، مما يوفر مستوى من المرونة لا تستطيع الجدران الثابتة مضاهاته ببساطة. ومع ذلك، فإن التحكم في طائرة بدون طيار تحمل أيضًا مرآة معقدة وحساسة للزوايا يعد عملية توازن صعبة، تتطلب حسابات دقيقة لمكان الطيران، وكيفية الإمالة، وكيفية ضبط سطح المرآة في الوقت الفعلي.

لقد تصدى أحد الباحثين لهذا التحدي عبر تطوير طريقة جديدة لتعليم هذه الأنظمة المثبتة على الطائرات بدون طيار كيفية اتخاذ القرارات. فبدلاً من برمجة الطائرة بقواعد جامدة أو إجبارها على تعلم كل شيء من الصفر في كل مرة تدخل فيها غرفة جديدة، استخدموا طريقة تحاكي كيفية تعلم البشر من خلال مراقبة الخبراء. قاموا أولاً بتدريب عدة خوارزميات تعلم قياسية في محاكاة حاسوبية لإيجاد أفضل الطرق للطيران وضبط المرآة في مجموعة متنوعة من مخططات المصانع المختلفة. ومن خلال هذه المحاكاة، اختاروا الاستراتيجيات "الخبير" الأكثر نجاحًا وسجلوا المسارات والحركات الدقيقة التي اتخذتها الطائرة لتحقيق أداء عالٍ. ثم قاموا بتغذية هذه المجموعة من تجارب الخبراء في نموذج تعلم متخصص يسمى "محول القرار" (Decision Transformer). هذا النموذج لا يحفظ البيانات فحسب، بل يتعلم الأنماط الكامنة لكيفية أداء فعل معين بناءً على موقف محدد، مما يسمح له بالتنبؤ بالخطوة الأفضل حتى في غرفة لم يسبق له رؤيتها من قبل.

اختبر الباحث هذا النهج في بيئة محاكاة تمثل مساحة صناعية كثيفة، حيث بلغت مساحتها 40 في 40 مترًا بارتفاع 8 أمتار. وداخل هذه المساحة، حاولت أربعة أجهزة ذات هوائي واحد التواصل، مشكلةً أزواجًا لتبادل البيانات بينما كانت الطائرة بدون طيار تحلق على ارتفاع 4.5 مترًا. كان على النظام مراعاة حقيقة أن قوة الإشارة تتغير اعتمادًا على الزاوية التي تصطدم بها الموجة بالمرآة، وهو تفصيل غالبًا ما يتم تجاهله في النماذج الأبسط. كانت مهمة الطائرة بدون طيار هي ضبط مسار طيرانها، وإمالتها ثلاثية الأبعاد، وإعدادات عناصر المرآة الـ 16 العاكسة لتعظيم إجمالي كمية البيانات المتدفقة بين الأجهزة. وقارن الباحث طريقته الجديدة بعدة تقنيات تعلم أخرى، بما في ذلك تقنية تحاول ببساطة نسخ سلوك خبير من سيناريو قريب. وأظهرت النتائج أن الطريقة الجديدة، عندما مُنحت موقع بدء جديد تمامًا للطائرة بدون طيار، استطاعت الأداء بمستوى عالٍ فورًا دون الحاجة إلى مزيد من التدريب. وكانت هذه القدرة على "الأداء الصفري" (zero-shot) أفضل بكثير من مجرد نقل استراتيجية من سيناريو مشابه ولكن مختلف.

وعندما سمح الباحث للنظام بالتفاعل مع البيئة الجديدة لفترة قصيرة ثم قام بصقل معرفته بناءً على أفضل النتائج التي لاحظها، تحسن الأداء بشكل أكبر. وفي هذه الاختبارات، وصل النظام الذي تم صقله إلى نفس المستوى العالي من الأداء الذي حققه نظام تم تدريبه خصيصًا من الصفر لهذه الغرفة تحديدًا. ووجدت الدراسة أن خوارزمية "DDPG expert"، التي كانت بمثابة المعيار لإمكانات النظام، حققت متوسط معدل بيانات يبلغ حوالي 29.5 بت في الثانية لكل هرتز، وهو رقم أعلى ملحوظًا من طرق التعلم الأخرى المختبرة، والتي استقرت عند 25 و20.5 و17 على التوالي. والنتيجة الرئيسية هي أنه من خلال التعلم من مجموعة متنوعة من أمثلة الخبراء مسبقًا، يمكن للنظام تعميم معرفته على المواقف غير المرئية، وتجنب الحاجة إلى التعلم القائم على التجربة والخطأ المكلف والمستهلك للوقت في العالم الحقيقي. وهذا يشير إلى أن الشبكات اللاسلكية المستقبلية يمكن أن تستخدم الطائرات بدون طيار لإصلاح انقطاعات الإشارة ديناميكيًا في البيئات المعقدة، والتكيف بسرعة مع التخطيطات الجديدة بأقل قدر من التدخل البشري.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →