← أحدث الأبحاث
🔢 mathematics

Incentive-Aligned Vehicle-to-Vehicle Energy Trading via Nash-Integrated Multi-Agent Reinforcement Learning

تقترح هذه الورقة Nash-MADDPG، وهو إطار عمل جديد للتعلم المعزز متعدد الوكلاء يدمج حلول تفاوض ناش لتحقيق تداول طاقة بين المركبات (V2V) متوافق مع الحوافز، وعادل، وقابل للتوسع، مما يظهر تحسينات كبيرة في الرفاهية الاجتماعية، وحجم التداول، والعدالة مقارنة بطرق المزاد المزدوج القائمة.

المؤلفون الأصليون: Yujin Lin, Yue Yang, Hao Wang

نُشر 2026-05-22
📖 4 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yujin Lin, Yue Yang, Hao Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل موقف سيارات مزدحم مليء بالسيارات الكهربائية. بعض السيارات تعاني من انخفاض في البطارية وتحتاج بشدة إلى الشحن (المشترون)، بينما تمتلك سيارات أخرى طاقة زائدة لا يحتاجونها الآن ويمكنهم بيعها (البائعون).

الهدف من هذه الورقة البحثية هو معرفة كيفية قيام هذه السيارات بتداول الطاقة فيما بينها مباشرة، دون الحاجة إلى "رئيس مركزي" (مثل شبكة الكهرباء) يملي عليها ما تفعله. ومع ذلك، هناك عقبة: كل سيارة تتصرف وفق مصلحتها الذاتية. فالبائع يريد أعلى سعر ممكن، والمشتري يريد أدنى سعر. إذا تفاوضوا بشكل عشوائي، فقد يصبح السوق فوضوياً، أو غير عادل، أو غير فعال.

يقترح المؤلفون، يوجين لين، ويوي يانغ، وهاو وانغ من جامعة موناش، نظاماً جديداً يسمى Nash-MADDPG. وإليك كيفية عمله، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: "الغرب المتوحش" لتداول الطاقة

في السوق العادية، إذا تركت السيارات تتفاوض بمفردها باستخدام التعلم الحاسوبي القياسي (المسمى التعلم المعزز متعدد الوكلاء)، فقد تكتسب عادات سيئة. قد يحاولون خداع بعضهم البعض، أو قد تتقلب الأسعار بجنون، أو قد تظل بعض السيارات عالقة بدون طاقة بينما تجلس أخرى على فائض. الأمر يشبه مجموعة من الغرباء يحاولون تقسيم بيتزا دون خطة؛ قد ينتهي الأمر بشخص دون شريحة، أو قد تبرد البيتزا بالكامل قبل أن يأكل أي شخص.

2. الحل: "مدرب العدالة"

جمع المؤلفون بين فكرتين قويتين:

  • حل التفاوض ناش (NBS): فكر في هذا كقاعدة رياضية لـ "صفقة عادلة". هي تضمن أنه إذا تداولت سيارتان، فسيخرج كلاهما بوضع أفضل مما لو لم يتداولا على الإطلاق، وتكون الصفقة فعالة قدر الإمكان. إنه يشبه حكماً يضمن تقسيم البيتزا بحيث يحصل الجميع على شريحة تجعلهم سعداء.
  • التعلم المعزز متعدد الوكلاء (MARL): هذا هو "محرك التعلم". السيارات تشبه الطلاب في فصل دراسي؛ يجربون أسعاراً وكميات مختلفة، ويرون ما يحدث، ويتعلمون من أخطائهم ليصبحوا أفضل في التداول بمرور الوقت.

الابتكار: علم المؤلفون "محرك التعلم" كيف يستمع إلى "مدرب العدالة".

  • خلال "الفصل الدراسي" (التدريب): يقوم النظام بحساب ما سيكون عليه السعر العادل "المثالي" (باستاستخدام قاعدة ناش). بعد ذلك، يعطي السيارات "مكافأة" أو "جزاءً" بناءً على مدى قرب سعرهم المقترح من ذلك السعر العادل المثالي. يسمى هذا مكافأة تقارب السعر (Price Proximity Reward). إنه يشبه إعطاء معلم درجات إضافية لطالب لأنه اقترب من الإجابة الصحيحة، مما يوجههم نحو السلوك الصحيح حتى قبل أن يتقنوه.
  • خلال "العالم الحقيقي" (التنفيذ): بمجرد خروج السيارات إلى موقف السيارات، لا يحتاجون إلى المعلم بعد الآن. يستخدمون ما تعلموه للتداول بشكل مستقل، لكنهم لا يزالون يتصرفون بطريقة تؤدي طبيعياً إلى نتائج عادلة وفعالة.

3. كيف اختبروا ذلك

قاموا بمحاكاة موقف سيارات يحتوي على عدد يتراوح من 6 إلى 100 سيارة على مدار 30 يوماً. كانت السيارات تصل وتغادر باستمرار (تماماً كما في الحياة الواقعية)، وكانت احتياجات البطارية غير متوقعة.

قارنوا نظامهم الجديد بثلاث طرق أخرى:

  1. التعلم فقط: تتعلم السيارات بمفردها دون قواعد عدالة.
  2. المتوسط الجشع (Greedy Average): تقسم السيارات فرق السعر ولكنها لا تحسن عملية تحديد من يتاجر مع من.
  3. المزاد المزدوج (Double Auction): وهو أسلوب يشبه سوق الأسهم القياسي حيث يلتقي أعلى مشترٍ بأقل بائع.

4. النتائج: موقف سيارات أكثر سعادة

فاز نظام Nash-MADDPG الجديد في كل الفئات تقريباً:

  • مزيد من الطاقة المتداولة: لقد نقل طاقة أكثر بنسبة 62.9% من طريقة المزاد القياسية. كان الأمر يشبه تحويل مجرى مائي ضئيل إلى تيار مستمر.
  • مزيد من المال الموفر/المكتسب (الرفاهية الاجتماعية): كانت المنفعة الإجمالية لجميع السيارات مجتمعة أعلى بنسبة 61.6%.
  • العدالة: هذا أمر كبير. كان النظام أكثر عدلاً بنسبة 40.1%. في الطرق الأخرى، حصلت بعض السيارات على صفقة سيئة بينما حالف الحظ سيارات أخرى. في هذا النظام، تم توزيع "شرائح البيتزا" بشكل أكثر توازناً بكثير.
  • الاستقرار: لم يتعطل النظام أو يرتبك عندما تغير عدد السيارات. لقد تعامل مع فوضى وصول السيارات ومغادرتها بسلاسة، بينما كانت الطرق الأخرى تميل إلى الانهيار أو تصبح غير متوقعة.

5. لماذا يهم هذا الأمر

تدعي الورقة البحثية أنه من خلال دمج قاعدة رياضية للعدالة (تفاوض ناش) مع نظام تعلم يتكيف مع التغيير (التعلم المعزز)، فقد خلقوا نظاماً تتصرف فيه السيارات التي تسعى لمصالحها الذاتية بشكل تعاوني بطبيعتها.

الخلا خلاف:
بدلاً من صراع السيارات على الطاقة في فوضى عارمة، يعمل هذا النظام كوسيط ذكي وغير مرئي. إنه يعلم السيارات أن أفضل طريقة للفوز لأنفسهم هي اللعب وفق قواعد عادلة. والنتية هي موقف سيارات تحصل فيه المزيد من السيارات على الشحن، وتُهدر فيه طاقة أقل، ويحصل فيه الجميع على صفقة عادلة، رغم أنهم جميعاً غرباء يحاولون رعاية مصالحهم الخاصة.

ملاحظة: تركز الورقة البحثية حصرياً على محاكاة المركبات الكهربائية في موقف للسيارات. وهي لا تدعي حل مشكلات سريرية، أو طبية، أو تطبيقات أخرى غير ذات صلة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →