← أحدث الأبحاث
💻 computer science

Sample-efficient Neuro-symbolic Proximal Policy Optimization

تقترح هذه الورقة امتداداً عصبياً-رمزياً فعالاً في استهلاك العينات لخوارزمية تحسين السياسة القريبة (PPO)، يستفيد من مواصفات السياسة المنطقية الجزئية لتوجيه التعلم في البيئات المعقدة ذات المكافآت الشحيحة، مما يظهر أداءً متفوقاً على خوارزمية PPO القياسية ونماذج آلة المكافأة المرجعية من خلال استراتيجيتي دمج متميزتين.

المؤلفون الأصليون: Simone Murari, Celeste Veronese, Daniele Meli

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Simone Murari, Celeste Veronese, Daniele Meli

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية التنقل في متاهة عملاقة ومربكة. الروبوت ذكي جدًا (يستخدم "التعلم التعزيزي العميق")، لكنه يتعلم عن طريق التجربة والخطأ. عليه أن يصطدم بالجدران، ويجرب الطرق المسدودة، وينتظر لفترة طويلة جدًا ليحصل على مكافأة واحدة من نوع "عمل جيد". إذا كانت المتاهة ضخمة أو كانت المكافآت نادرة، فقد لا يتمكن الروبوت من اكتشاف الحل أبدًا، أو قد يستغرق الأمر ملايين المحاولات.

تقترح هذه الورقة البحثية طريقة لإعطاء الروبوت "ورقة غش" مكونة من قواعد منطقية بسيطة، دون إجباره على اتباع هذه القواعد بشكل أعمى. يطلق المؤلفون على هذا النهج اسم "النهج العصبي الرمزي" (neuro-symbolic)، وهو مجرد طريقة فخمة للقول بأنهم يمزجون بين "دماغ" الروبوت (الشبكات العصبية) و"كتاب القواعد" (المنطق الرمزي).

إليك كيف فعلوا ذلك، باستخدام طريقتين مختلفتين:

الطريقتان: "الوكزة" و"المدرب"

أخذ الباحثون خوارزمية تعلم شهيرة وموجودة بالفعل تسمى PPO (تحسين السياسة القريبة)، وأضافوا قواعد المنطق الخاصة بهم بطريقتين مختلفتين.

1. H-PPO-Product: "الوكزة" (انحياز المعاينة)
تخيل هذا كمرشد ودود يقف بجانب الروبوت عند كل مفترق طرق.

  • كيف تعمل: عندما يوشك الروبوت على اختيار مسار ما، يقول المرشد: "مهلًا، بناءً على القواعد التي نعرفها، هذا المسار يبدو واعدًا".
  • الخدعة: المرشد لا يجبر الروبوت على اتخاذ هذا المسار. بدلاً من ذلك، هو فقط يجعل هذا المسار أكثر احتمالية للاختيار. الأمر يشبه إضافة وزن بسيط إلى الميزان.
  • التلاشي التدريجي: في بداية التدريب، يكون المرشد صاخبًا ومفيدًا للغاية. ولكن مع تعلم الروبوت بمفرده بشكل أكبر، يهمس المرشد ببطء أكثر فأكثر حتى يختفي تمامًا. هذا يضمن أن يتعلم الروبوت الاستكشاف بمفرده في النهاية، بدلًا من مجرد اتباع الأوامر للأبد.
  • الأفضل لـ: إخراج الروبوت من حالة الجمود في المتاهات الضخمة والفارغة حيث يحتاج إلى العثور على أي مسار جيد بسرعة.

2. H-PPO-SymLoss: "المدرب" (تنظيم الخسارة)
تخيل هذا كمدرب صارم يراجع واجبات الروبوت المنزلية بعد انتهائه من جولة واحدة.

  • كيف يعمل: يحاول الروبوت حل المتاهة. بعد ذلك، ينظر المدرب إلى خيارات الروبوت ويقول: "لقد أبليت بلاءً حسنًا، ولكن تذكر القاعدة: 'إذا رأيت بابًا أحمر، فلا تفتحه بعد'. لقد انتهكت تلك القاعدة، لذا سأضيف عقوبة صغيرة إلى درجتك".
  • الخدعة: تُضاف هذه العقوبة إلى رياضيات التعلم الخاصة بالروبوت. إنها تدفع دماغ الروبوت بلطف لتعديل إعداداته الداخلية بحيث يرتكب أخطاء "انتهاك القواعد" بشكل أقل في المستقبل.
  • الأفضل لـ: صقل أداء الروبوت بمجرد أن يبدأ في التعلم بالفعل. يساعد هذا المدرب الروبوت ليكون دقيقًا وفعالًا للغاية، لكنه لا يساعد كثيرًا عندما يكون الروبوت تائهًا تمامًا في البداية.

التجارب: ثلاث متاهات مختلفة

اختبر الفريق هذه الأساليب على ثلاثة أنواع من "المتاهات" (محاكاة حاسوبية):

  1. DoorKey (مفتاح الباب): عالم شبكي حيث يجب على الروبوت العثور على مفتاح محدد لفتح باب محدد.
    • النتيجة: كانت طريقة "الوكزة" مذهلة هنا. في النسخ الأصعب (الشبكات الكبيرة، والمفاتيح الكثيرة)، تعثر الروبوت التقليدي، لكن روبوت "الوكزة" وجد الحل بسرعة. أما طريقة "المدرب" فكانت أبطأ في البداية لكنها لحقت به في النهاية.
  2. OfficeWorld (عالم المكتب): عالم شبكي يحتوي على مكاتب، وبريد، وقهوة، ونباتات. يجب على الروبوت زيارة الأماكن بترتيب معين (مثل: الحصول على القهوة، ثم البريد) دون الاصطدام بالنباتات.
    • النتيجة: تألقت طريقة "المدرب" هنا. بمجرد أن بدأ الروبوت في التعلم، ساعد "المدرب" الروبوت على إتقان روتينه، محققًا أعلى الدرجات. أما "الوكزة" فكانت سريعة في البارم، لكنها تعثرت عند درجة أقل لاحقًا.
  3. WaterWorld (عالم الماء): مساحة مستمرة مع كرات متحركة ذات ألوان مختلفة. يجب على الروبوت ضرب الكرات بتسلسل لوني محدد.
    • النتيجة: كانت هذه هي الاختبار الأصعب. كانت طريقة "الوكزة" هي الوحيدة التي استطاعت التنقل بنجاح في التسلسلات المعقدة. أما طريقة "المدرب" فقد عانت هنا لأن القواعد كانت مقيدة للغاية لدرجة منعت الروبوت من فهم "الرقصة" المعقدة بمفرده.

الخلاصة الكبرى

النقطة الرئيسية في الورقة البحثية هي أنك لست بحاجة لتكون خبيرًا مثاليًا لمساعدة الروبوت على التعلم. أظهر المؤلفون أنه حتى لو كان "كتاب القواعد" الذي أعطيته للروبوت غير مثالي أو تم تعلمه فقط من النسخ السهلة من اللعبة، فقد ساعد ذلك الروبوت على تعلم النسخ الصعبة بشكل أسرع بكثير.

  • إذا كنت بحاجة للتحرك بسرعة في مساحة كبيرة وفارغة: استخدم الوكزة (H-PPO-Product).
  • إذا كنت بحاجة لصقل الأداء والحصول على أعلى درجة: استخدم المدرب (H-PPO-SymLoss).

من خلال الجمع بين القواعد المنطقية والتعلم القياسي للذكاء الاصطناعي، جعلوا الروبوت يتعلم بشكل أسرع، ويستخدم عدد محاولات (عينات) أقل، ويحل المشكلات التي عادة ما تستسلم أمامها الروبوتات القياسية. فعلوا ذلك دون الحاجة إلى تعديل إعدادات الروبوت باستمرار في كل مرة تصبح فيها اللعبة أصعب.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →