FL-GWO: A Federated Learning and Grey Wolf Optimization Framework for Blockchain-Assisted Trust Management in Decentralized IoT-Edge Systems
تقترح هذه الورقة إطار عمل FL-GWO، وهو إطار عمل مبتكر يدمج التعلم الاتحادي مع تحسين الذئب الرمادي وتقنية البلوكشين لتمكين إدارة الثقة المحافظة على الخصوصية، والتكيفية، والقوية في أنظمة إنترنت الأشياء والحافة اللامركزية من خلال تحسين معلمات الثقة ديناميكيًا عبر ذكاء السرب.
في الشبكات المترامية وغير المرئية التي تُشغل العالم الحديث، تعمل مليارات الأجهزة الصغيرة — من المستشعرات الذكية في الحقول إلى مراقبات حركة المرور في المدن — معاً لاتخاذ القرارات دون وجود مدير مركزي. هذا هو عالم "إنترنت الأشياء"، حيث تتحدث الحواسيب مع بعضها البعض للحفاظ على سير الأمور بسلاسة. ولكن عندما تتوزع هذه الأجهزة عبر منطقة شاسعة، يصبح الوثوق ببعضها البعض لغزاً صعباً. فإذا بدأ جهاز ما يتصرف بغرابة، ربما بسبب نفاد بطاريته أو لأن متسللاً قد سيطر عليه، يمكن للنظام بأكمله أن يغرق في الفوضى. تعتمد الطرق التقليدية للتحقق من مدى الموثوقية غالباً على قواعد جامدة أو سلطة مركزية تجمع كل البيانات، لكن هذه الأساليب تجد صعوبة في التكيف مع الواقع المتغير والمتداخل للعالم الحقيقي، وغالباً ما تفشل في حماية خصوصية الأجهزة المعنية.
ولحل هذه المعضلة، لجأ الباحثون إلى فكرتين قويتين. الفكرة الأولى هي طريقة لتعليم الحواسيب التعلم معاً دون مشاركة أسرارها الخاصة أبداً. تخيل مجموعة من الجيران يريدون جميعاً تعلم كيفية إصلاح نوع معين من المحركات، لكن لا أحد منهم يريد السماح لأي شخص آخر برؤية أدواته أو ملاحظاته الشخصية. بدلاً من ذلك، يتدرب كل منهم بمفرده، ويدون فقط الدروس العامة التي تعلمها، ويشارك تلك الملاحظات مع معلم مركزي يقوم بدمجها في دليل رئيسي. هذه الطريقة، المعروفة باسم "التعلم الاتحادي" (Federated Learning)، تسمح للمجموعة بأن تصبح أكثر ذكاءً مع الحفاظ على أمان معلوماتها الخاصة. أما الفكرة الثانية فمستمدة من الطبيعة: وهي الطريقة التي تصطاد بها الذئاب الرمادية. في قطيع الذئاب، يقود القادة المجموعة نحو الفريسة، مع تعديل مواقعهم باستمرار للعثوة أفضل مسار. وقد تُرجمت هذه الاستراتيجية الطبيعية للعمل معاً لإيجاد الحل الأمثل إلى خوارزمية حاسوبية يمكنها حل المشكلات المعقدة من خلال محاكاة التسلسل الهرمي وحركة القطيع.
قام فريق من الباحثين في كلية لاكشمي نارين للتكنولوجيا في الهند بدمج هذين المفهومين في نظام جديد مصمم للحفاظ على أمن ونزاهة الشبكات اللامركزية. وقد أطلقوا على ابتكارهم اسم "FL-GWO"، وهو إطار عمل يستخدم خصوصية التعلم الاتحادي وقوة البحث الذكي لخوارزمية الذئب الرمادي لإدارة الثقة. في نظامهم، يقوم كل جهاز في الشبكة بتدريب نموذجه المحلي الخاص لتقييم ما إذا كان جيرانه يتصرفون بشكل جيد. وبدلاً من إرسال بيانات خام عما يراه، يرسل الجهاز فقط القواعد المحدثة التي تعلمها. تُرسل هذه القواعد إلى مركز محوري، ليس ليتم دمجها بطريقة بسيطة، بل ليتم صقلها بواسطة خوارزمية الذئب الرمادي. تعامل هذه الخوارزمية البحث عن مجموعة القواعد المثالية للثقة كأنه عملية صيد، حيث تقود أفضل ثلاثة حلول تم العثور عليها بقية المجموعة نحو طريقة أكثر دقة في تقييم السلوك. وبمجرد العثور على أفضل مجموعة من القواعد، يتم إرسالها إلى جميع الأجهزة، مما يخلق حلقة مستمرة حيث تتعلم الشبكة وتتكيف باستمرار مع التهديدات الجديدة.
ولضمان عدم التلاعب بسجلات الثقة هذه، قام الباحثون أيضاً بربط نظامهم بتقنية "البلوكشين" (Blockchain)، وهي سجل رقمي يعمل كمذكرات دائمة وغير قابلة للتغيير. في كل مرة تقوم فيها الشبكة بتحديث قواعد الثقة الخاصة بها، يتم تسجيل هذا التغيير في هذا السجل، مما يخلق تاريخاً شفافاً يمكن للجميع التحقق منه ولكن لا يمكن لأحد تعديله. يضمن هذا الإعداد أنه حتى لو حاول جهاز ما الكذب بشأن سلوكه السابق، فإن السجل غير القابل للتغيير سيكشف الحقيقة. اختبر الباحثون نظامهم في بيئة محاكاة تضم خمسين جهازاً، بما في ذلك أجهزة صادقة، وأخرى معيبة، وأخرى خبيثة مصممة لتعمل مثل المتسللين. وقارنوا طريقتهم الجديدة بالتقنيات القديمة التي استخدمت قواعد ثابتة أو عمليات تجانس بسيطة. وأظهرت النتائج أن النظام الجديد كان أفضل بكثير في رصد العناصر السيئة؛ فقد حدد الأجهزة الجديرة بالثقة بنسبة 93.2% من الوقت، بينما عانت الطرق القديمة، حيث فشلت بعضها في رصد الأجهزة الخبيثة بنسبة تقارب 15% من الوقت.
ولعل الأهم من ذلك هو أن النظام أثبت أنه مرن للغاية. فحتى عندما زاد الباحثون عدد الأجهزة الخبيثة إلى 40% من الشبكة — وهو سيناريو قد تنهار فيه معظم الأنظمة الأخرى — حافظ الإطار الجديد على دقة بلغت 89.5%. ويعود ذلك إلى أن خوارزمية الذئب الرمادي ليست ثابتة؛ إذ يمكنها تغيير تركيزها فوراً. فإذا بدأ جهاز كان موثوقاً به سابقاً يتصرف بشكل مريب، يقوم النظام بسرعة بتعديل الوزن الذي يعطيه للسلوكيات المختلفة، مثل سرعة إرسال الرسائل أو مقدار استهلاك الطاقة، للإمساك بالتغيير. كما وجدت الدراسة أن هذا المستوى العالي من الأمان لم يأتِ على حساب السرعة؛ فقد توصل النظام إلى حل في 85 جولة تواصل فقط، وهو أسرع من الطرق المنافسة. وبينما يشير الباحثون إلى أن نظامهم تم اختباره في محاكاة وأن النشر في العالم الحقيقي سيتطلب مزيداً من العمل للتعامل مع المقاييس الضخمة واحتياجات الخصوصية المعقدة، فإن النتائج تشير إلى مسار واعد للمستقبل. فمن خلال السماح للأجهزة بالتعلم معاً دون مشاركة الأسرار واستخدام المنطق المستوحى من الطبيعة لإيجاد أفضل القواعد، يقدم هذا النهج طريقة قوية للحفاظ على أمن وموثوقية المستقبل اللامركزي للتكنولوجيا.
ملخص تقني: إطار عمل FL-GWO لإدارة الثقة في أنظمة إنترنت الأشياء والحوسبة الحافية اللامركزية
1. بيان المشكلة
تواجه أنظمة إنترنت الأشياء (IoT) والحوسبة الحافية (Edge Computing) اللامركزية تحديات حرجة في إدارة الثقة بسبب السلوكيات الديناميكية للشبكة وانتشار العقد الخبيثة. تعتمد نماذج الثقة التقليدية غالبًا على مخططات أوزان ثابتة أو استدلال بايزي بسيط، وهي نماذج تفشل في التكيف مع الظروف المتطورة مثل استنفاد الطاقة، أو ازدحام الشبكة، أو الهجمات العدائية مثل تسميم البيانات (Data Poisoning) والركوب المجاني (Free-riding). علاوة على ذلك، فإن طرق التجميع المركزية تضر بخصوصية البيانات، بينما تظل تطبيقات التعلم الاتحادي (Federated Learning) القياسية عرضة لهجمات بيزنطية (Byzantine attacks) حيث تقوم العقد الخبيثة بإرسال تحديثات فاسدة لتدهور أداء النموذج العالمي. كما أن قواعد التجميع القوية الموجودة (مثل Krum وMedian) تفترض غالبًا ثقة ثابتة أو تتطلب معرفة مسبقة بسلوك العقدة، مما يفتقر إلى القدرة على التكيف اللازمة لبيئات إنترنت الأشياء غير المتجانسة والديناميكية.
2. المنهجية: إطار عمل FL-GWO
يقترح المؤلفون FL-GWO، وهو إطار عمل مبتكر يدمج التعلم الاتحادي (Federated Learning) مع تحسين الذئب الرمادي (Grey Wolf Optimization - GWO) لإدارة الثقة المدعومة بسلسلة الكتل (Blockchain). يعمل النظام وفق بنية ثلاثية الطبقات: أجهزة إنترنت الأشياء التي تولد بيانات سلوكية، وعقد حافية تقوم بالتدريب المحلي، وخوادم سحابية تنفذ التحسين العالمي وتحافظ على سجل سلسلة الكتل.
المكونات الأساسية:
التعلم الاتحادي (الحفاظ على الخصوصية): تقوم كل عقدة حافية مشاركة بتدريب نموذج ثقة محلي على بياناتها السلوكية الخاصة دون مشاركة المعلومات الخام. تتضمن مجموعة البيانات المحلية ستة سمات سلوكية: موثوقية الاتصال، نسبة تسليم الحزم، زمن الانتقال (Latency)، استهلاك الطاقة، السمعة، ومخرجات كشف الشذوذ.
صياغة نموذج الثقة: يتم حساب درجة الثقة (Ti) للعقدة باستخدام دالة سيجمويد (Sigmoid) غير خطية موزونة من السمات السلوكية الست. الهدف هو تعلم متجه الأوزان الأمثل (w) والانحياز (b) لتقليل خسارة الإنتروبيا المتقاطعة الثنائية (Binary Cross-Entropy Loss) بين درجات الثقة المتوقعة وتسميات الحقيقة الأرضية (Ground-truth labels).
التجميع العالمي المدفوع بـ GWO: بدلاً من التجميع التقليدي القائم على التدرج (مثل FedAvg)، يستخدم إطار العمل خوارزمية تحسين الذئب الرمادي (GWO) للبحث عن معاملات الثقة العالمية المثلى.
آلية الصيد: يعامل عملية البحث عن المعاملات كمسألة صيد متعددة الأبعاد. يتم تنظيم مجتمع الحلول المرشحة في تسلسل هرمي: تمثل الذئاب ألفا (α)، وبيتا (β)، ودلتا (δ) أفضل ثلاثة حلول مرشحة، والتي توجه بقية القطيع (ذئاب أوميغا).
تحديثات المواقع: تقوم ذئاب أوميغا بتحديث مواقعها بناءً على متوسط مواقع القادة الثلاثة، مما يوازن بين الاستكشاف (البحث العالمي) والاستغلال (التحسين المحلي) عبر معامل يتناقص خطيًا (a).
تقييم اللياقة: يتم تقييم لياقة مجموعة المعاملات المرشحة بناءً على المجموع الموزون للخسائر المحلية عبر جميع العقد المشاركة.
التغذية الراجعة ذات الحلقة المغلقة: يتم بث المعاملات العالمية المحسنة (θ∗) مرة أخرى إلى العقد المحلية، لتحل محل النماذج السابقة. وهذا يخلق دورة تكرارية حيث يتكيف منطق تقييم الثقة باستمرار مع تغير ظروف الشبكة.
تكامل سلسلة الككتل (Blockchain): يسجل سجل لامركزي المعاملات العالمية المحسنة ودرجات الثقة. وباستخدام آلية إجماع خفيفة الوزن (مثل PBFT)، يضمن النظام مسارات تدقيق غير قابلة للتغيير، والشفافية، والمرونة ضد نقاط الفشل الواحدة.
3. المساهمات الرئيسية
يحدد البحث أربع مساهمات رئيسية مقارنة بالطرق الموجودة:
التحسين التكيفي: يستبدل تخصيص أوزان الثقة التجريبي أو الثابت بعملية تحسين قائمة على ذكاء السرب (GWO) مدفوعة رياضيًا، والتي تعمل على معايرة معاملات الثقة ديناميكيًا لتكون أكثر تمثيلًا لدقة موثوقية العقدة.
الحفاظ على الخصوصية: من خلال استخدام التعلم الاتحادي، يلغي إطار العمل الحاجة إلى تجميع البيانات المركزية، مما يبقي البيانات السلوكية الخام على العقد المحلية.
المتانة ضد الحلول المحلية المثلى: يقلل استخدام GWO من خطر التقارب المبكر الذي يُلاحظ غالبًا في خوارزميات ذكاء السرب الأخرى (مثل Particle Swarm Optimization)، مما يحسن المتانة في ظل الظروف الديناميكية.
الشفافية اللامركزية: يضمن دمج سلسلة الكتل ثبات وشفافية سجلات الثقة، مما يعزز الثقة بين العقد دون الاعتماد على سلطة مركزية.
4. النتائج التجريبية
تم تقييم إطار العمل في شبكة محاكاة لإنترنت الأشياء والحوسبة الحافية اللامركزية مكونة من 50 عقدة (60% صادقة، 20% معطلة بشكل متقطع، 20% خبيثة) باستخدام مجموعة بيانات اصطناعية. تمت مقارنته بأربعة نماذج مرجعية: الثقة الموزونة الثابتة (SWT)، والمتوسط الاتحادي (FedAvg)، وFL-Krum، وPSO-Trust.
دقة توقع الثقة (TPA): حقق FL-GWO أعلى دقة بنسبة 93.2%، متفوقًا بشكل كبير على SWT (78.4%)، وFedAvg (82.1%)، وFL-Krum (85.6%)، وPSO-Trust (88.9%).
معدلات الخطأ: أظهر إطار العمل متانة أمنية فائقة بمعدل إيجابي كاذب (FPR) قدره 3.1% ومعدل سلبي كاذب (FNR) قدره 2.8%، مما يشير إلى انخفاض خطر قبول العقد الخبيثة أو معاقبة العقد الصادقة.
سرعة التقارب: تقارب FL-GWO في 85 جولة اتصالات، وهو أسرع من PSO-Trust (112 جولة) وFedAvg (145 جولة).
المتانة: تحت شدة هجوم متزايدة (تصل إلى 40% من العقد الخبيثة)، حافظ FL-GWO على دقة بلغت 89.5%، بينما انخفضت دقة FedAvg إلى 71.2%.
التكيف الديناميكي: أظهر التحليل الزمني أن محرك GWO قام بتعديل أوزان السمات بسرعة (مثل زيادة وزن كشف الشذوذ) استجابة للهجمات المحاكات، وهي قدرة تفتقر إليها النماذج الثابتة.
دراسة الاستئصال (Ablation Study): أدى إزالة طبقة سلسلة الكتل إلى تأثير ضئيل على الدقة ولكن أدى إلى المساس بقابلية التدقيق. أما استبدال تهيئة التحديث المحلي بتهيئة عشوائية فقد تسبب في انخفاض كبير في الدقة، مما يبرز أهمية الاستفادة من المعرفة المحلية.
5. الأهمية والادعاءات
يدعي البحث أن FL-GWO يمثل تقدمًا مهمًا في إدارة الثقة التكيفية والحفاظ على الخصوصية في البيئات اللامركزية. ومن خلال الجمع بين التعلم الاتحادي، وتحسين الذئب الرمادي، وسلسلة الكتل، يعالج إطار العمل القيود الموجودة في النهج الحالية التي تعالج عادةً واحدًا أو اثنين فقط من هذه الجوانب بشكل منعزل.
يؤكد المؤلفون أن النظام يوفر أساسًا قويًا للتشغيل الآمن والموثوق في أنظمة إنترنت الأشياء والحوسبة الحافية الديناميكية. وتحديدًا، يوفر إطار العمل:
التغلب على ضعف التعلم الاتحادي القياسي تجاه الهجمات البيزنطية من خلال تحسين المعاملات المدفوع بذكاء السرب.
توفير آلية للتكيف المستمر والديناميكي مع ظروف الشبكة المتطورة دون الحاجة لمشاركة البيانات الخام.
ضمان مرونة النظام وشفافيته من خلال الإجماع اللامركزي ومسارات التدقيق غير القابلة للتغيير.
يخلص البحث إلى أنه بينما يضيف إطار العمل عبئًا حسابيًا يمكن إدارته (حوالي 2.3 ثانية لكل جولة لـ 50 عقدة)، فإنه يقدم مسارًا قابلًا للتطبيق نحو أنظمة دعم القرار المرنة في مواجهة التهديدات العدائية الديناميكية. ويُقترح في العمل المستقبلي التركيز على كفاءة الاتصال، والدفاعات ضد التواطؤ، ودمج الخصوصية التفاضلية (Differential Privacy).