← أحدث الأبحاث
🤖 machine learning

DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control

تقدم الورقة البحثية DGLight، وهو إطار عمل مبتكر يقوم بضبط نموذج لغوي كبير مُدرب مسبقاً للتحكم في إشارات المرور من خلال الاستفادة من ناقد شبكة كيو العميقة (Deep Q-Network) لتوجيه تحسين السياسة النسبي الجماعي (Group Relative Policy Optimization)، مما ينتج عنه نظام يحقق أداءً رائداً بين المتحكمات القائمة على النماذج اللغوية الكبيرة مع توفير مسارات استدلال تفسيرية.

المؤلفون الأصليون: Chenbo Yu

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chenbo Yu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل تقاطع طرق في مدينة مزدحمة كأنه ساحة رقص فوضوية. السيارات هي الراقصون الذين يحاولون الدخول والخروج، ولكن إذا حاول الجميع الرقص في وقت واحد، فسيصطدمون ببعضهم البعض، مما يخلق ازدحاماً مرورياً. "متحكم إشارة المرور" هو "الدي جي" (DJ) الذي يقرر من يحق له الرقص (الانطلاق) ومن يجب عليه الانتظار (التوقف).

لفترة طويلة، استخدم "الدي جيز" طريقتين رئيسيتين:

  1. الدي جي المعتمد على المترونوم (الوقت الثابت): يعزف نفس الإيقاع كل 30 ثانية، بغض النظر عن عدد الأشخاص الموجودين على الساحة. إنه بسيط، ولكن إذا وصلت حشود ضخمة، فلن يتمكن من التكيف.
  2. الدي جي البشري الخبير (التعلم التعزيزي التقليدي - RL): هذا "الدي جي" يراقب الحشد ويتعلم من أخطائه. يصبح أفضل بمرور الوقت، لكنه غالباً ما يكون "صندوقاً أسود". لا يمكنك سؤاله لماذا اختار إيقاعاً معيناً، وإذا نقلته إلى نادٍ مختلف (مدينة أخرى)، فقد يشعر بالارتباك لأنه تعلم "جو" النادي الأول تحديداً.

إليك DGLight: "المتدرب الذكي" مع "مدرب مخضرم"

تقدم هذه الورقة البحثية DGLight، وهي طريقة جديدة لتدريب متحكم إشارة المرور باستخدام نموذج لغوي كبير (LLM) — وهو ببساطة ذكاء اصطناٍعي فائق الذكاء في الكتابة والاستنتاج.

إليك كيف يعمل DGLight، باستخدام تشبيه بسيط:

1. الطالب (النموذج اللغوي الكبير - LLM)

فكر في النموذج اللغوي الكبير كمتدرب عبقري يمكنه كتابة تقرير مفصل يشرح لماذا اتخذ قراراً ما. "أرى أن المسار الشرقي مزدحم، لذا سأسمح لحركة المرور في الشرق بالمرور". هذا أمر رائع لأنك، على عكس "الدي جي" الذي يعمل كصندوق أسود، يمكنك قراءة ملاحظات المتدرب وفهم منطقه. ومع ذلك، فإن هذا المتدرب جديد على حركة المرور؛ فهو يعرف كيف يكتب، لكنه لا يعرف كيف يقود في مدينة.

2. المدرب (ناقد DQN)

لتعليم المتدرب، قام الباحثون بتعيين "مدرب مخضرم". هذا المدرب هو ذكاء اصطناعي تقليدي (يعتمد على شبكة Q العميقة - Deep Q-Network بناءً على طريقة تسمى CoLight) قضى سنوات في مراقبة حركة المرور في مدينة محددة (هانغتشو). هذا المدرب خبير في معرفة أي مرحلة إشارة ستعمل على تقليل الازدحام في هذه اللحظة تحديداً.

3. معسكر التدريب (العملية المكونة من مرحلتين)

يحدث سحر DGLight في مرحلتين:

  • المرحلة الأولى: اعتماد المدرب. أولاً، يتم تدريب "المدرب المخضرم" على بيانات حركة مرور حقيقية حتى يصبح خبيراً في التنبؤ بالاختيار الأفضل للإشارة.
  • المرحلة الثانية: المتدرب يتعلم من المدرب. الآن، يبدأ "المتدرب" (LLM) في الممارسة.
    • ينظر المتدرب إلى حالة المرور ويكتب خطة: "أعتقد أنه يجب أن نسمح للمرور في الشمال بالمرور لأن..."
    • بدلاً من الانتظار لمعرفة ما إذا كان المرور سينقشع بالفعل (وهو أمر يستغرق وقتاً طويلاً وبطيء التعلم)، يقوم المدرب فوراً بالنظر إلى خطة المتدرب وإعطائها درجة. "خطة جيدة، +10 نقاط!" أو "خطة سيئة، -5 نقاط".
    • يستخدم المتدرب هذه الدرجات للتعلم. ولأن المدرب يعطي درجة لكل حركة ممكنة (وليس فقط الحركة التي حدثت بالفعل)، فإن المتدرب يتعلم بشكل أسرع وأعمق.

لماذا هذا الأمر مميز؟

1. يتحدث لغة البشر (القابلية للتفسير)
معظم أنظمة الذكاء الاصطناعي للمرور تخرج مجرد رقم (مثلاً: "انتقل إلى المرحلة 2"). أما DGLight فيخرج جملة: "أنا أنتقل إلى المرحلة 2 لأن المسار الشرقي به طابور طويل". إنه مثل امتلاك متحكم مرور يشرح منطقه باللغة الإنجليزية البسيطة.

2. هو "عام" ذكي (القابلية للنقل)
عادةً، إذا دربت ذكاءً اصطناعياً للمرور في المدينة (أ)، فسيفشل في المدينة (ب). ولكن بما أن DGLight يتعلم منطق حركة المرور (كيفية الاستنتاج حول الطوابير والتأخير) بدلاً من مجرد حفظ شوارع المدينة (أ)، فإنه يعمل بشكل جيد بشكل مفاجئ في مدن جديدة تماماً (مثل جينان) لم يرها المدرب من قبل. إنه مثل متدرب يتعلم مبادئ السيطرة على الحشود، بحيث يمكنه إدارة حفلة في مدينة جديدة دون الحاجة لإعادة تعلم كل شيء.

3. هو أفضل من "الحرس القديم"
اختبرت الورقة البحثية DGLight مقابل طرق "المترونوم" القديمة وطرق "الدي جي البشري الخبير".

  • النتيجة: كان DGLight هو الأفضل بين جميع طرق الذكاء الاصطناዊ التي تستخدم اللغة.
  • النتيجة: كان بجودة، وأحياناً أفضل من، أقوى أنظمة المرور التقليدية، مع ميزة إضافية وهي القدرة على شرح قراراته.

ما الذي لم يفعلوه؟

الورقة البحثية حذرة جداً في توضيح ما لا يمثله هذا النظام:

  • هو ليس عصا سحرية تحل مشكلة المرور للأبد.
  • لم يتم اختباره على حركة مرور حقيقية مباشرة بعد (فقط في عمليات المحاكاة).
  • تم تدريب "المدرب" في مدينة واحدة، لكن "المتدرب" تعلم كيفية التعميم. تشير الورقة إلى أنه بينما يعد المتدرب جيداً في المدن الجديدة، إلا أنه ليس مثالياً، ولا يزال النظام يعتمد على التدريب الأولي للمدرب.

الخلاصة

DGLight هو نظام يعلم ذكاءً اصطناعياً ذكياً ومتحدثاً كيفية التحكم في إشارات المرور من خلال جعله يتدرب تحت إشراف خبير مرور تقليدي. والنتيجة هي متحكم يتمتع بذكاء الخبراء، ولكن يمكنه أيضاً إخبارك لماذا اتخذ خياراته، مما يجعله أداة أكثر موثوقية وقدرة على التكيف لإدارة حركة المرور في المدن.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →