← أحدث الأبحاث
🤖 machine learning

Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning

تقدم هذه الورقة البحثية نموذج التوجيه الانتشار لفك الارتباط الآمن (SDGD)، وهو إطار عمل جديد للتعلم التعزيزي الآمن غير المتصل يجمع بين التوجيه الخالي من المصنف المشروط بالتكلفة وبين إعادة تسمية المسارات الممكنة لفك ارتباط قيود السلامة عن تحسين المكافأة بفعالية، مما يحقق امتثالاً فائقاً للسلامة وعوائد عالية في سيناريوهات الميزانية التكيفية.

المؤلفون الأصليون: Rufeng Chen, Zhaofan Zhang, Zhejiang Yang, Hechang Chen, Sihong Xie

نُشر 2026-05-06
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Rufeng Chen, Zhaofan Zhang, Zhejiang Yang, Hechang Chen, Sihong Xie

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم روبوت كيفية قيادة سيارة، ولكن ليس لديك سوى تسجيل فيديو لكيفية قيادة السيارات الأخرى في الماضي. لا يمكنك السماح للروبوت بالقيادة والارتطام لتتعلم؛ بل يجب أن يتعلم حصرياً من تلك اللقطات القديمة. هذا هو التعلم المعزز غير المتصل (Offline Reinforcement Learning).

الآن، أضف لمسة من التغيير: في بعض الأحيان تريد من الروبوت أن يكون حذراً للغاية (مثل القيادة في منطقة مدرسية)، وفي أحيان أخرى تريده أن يكون مندفعاً قليلاً (مثل القيادة على طريق سريع مفتوح). "ميزانية السلامة" تتغير بناءً على الموقف. هذا هو التعلم المعزز الآمن والمتكيف (Adaptive Safe Reinforcement Learning).

المشكلة هي أن معظم الطرق الموجودة تشبه طالباً يحاول حفظ مسار محدد لسرعة محددة. إذا تغير حد السرعة، فإنه يصاب بالارتباك أو يرتطم.

إليك كيف تحل طريقة البحث الجديدة، SDGD، هذه المشكلة، مشروحة من خلال تشبيهات بسيطة:

1. الطريقة القديمة: "خطوة بخطوة" مقابل "الصورة الضبابية"

  • الطريقة القديمة (النماذج ذات الترتيب الذاتي - Autoregressive Models): تخيل أنك تحاول رسم طريق متعرج وطويل عبر رسم جزء صغير جداً، ثم الجزء التالي، ثم التالي. إذا ارتكبت خطأً صغيراً في الجزء الأول، فسيتعين على الجزء التالي تعويض ذلك الخطأ، وبحلول النهاية، سيكون طريقك بعيداً تماماً عن الخريطة. هكذا كانت تعمل مخططات الذكاء الاصطناعي القديمة؛ حيث كانت ترتكب أخطاء صغيرة تتراكم، مما يؤدي إلى انتهاك قواعد السلامة.
  • الطريقة الجديدة (نماذج الانتشار - Diffusion Models): تخيل التقاط صورة ضبابية ومشوشة للطريق بالكامل دفعة واحدة، ثم جعلها واضحة تدريجياً حتى يصبح المسار بأكمله واضحاً. هذا هو ما يفعله الانتشار (Diffusion). إنه ينشئ الرحلة بأكملة معاً، بحيث لا تتراكم الأخطاء الصغيرة.

2. المشكلة الجوهرية: خلط "السلامة" و"السرعة"

في الماضي، حاول الذكاء الاصطناعي الموازنة بين السلامة والسرعة من خلال معاملتهما كقوتين متضادتتين تسحبان الروبوت في اتجاهات مختلفة.

  • التشبيه: تخيل سائقاً قيل له: "قد بأقصى سرعة ممكنة، ولكن لا تصطدم بالحائط". سيحاول الذكاء الاصطناعي حساب الزاوية المثالية للذهاب بسرعة و البقاء آمناً في نفس الوقت. ولكن إذا تحرك "الحائط" (حد السلامة)، فسيصاب الذكاء الاصطناዊ بالارتباك. غالباً ما يحاول الذهاب بسرعة ويصطدم بالحائط بالخطأ لأنه اعتقد أن الحائط في مكان آخر.

3. حل SDGD: نظام "المدربين الاثنين"

أدرك المؤلفون أن السلامة والسرعة لا ينبغي أن يتصارعا؛ بل يجب أن يكون لكل منهما مهام مختلفة. لقد أنشأوا نظاماً بمدربين متميزين:

  • المدرب الأول: منفذ السلامة (التوجيه الخالي من التصنيف - Classifier-Free Guidance)

    • المهمة: ينظر هذا المدرب إلى "ميزانية السلامة" (مثلاً: "يمكنك إنفاق 10 نقاط فقط على المخاطر اليوم").
    • الإجراء: هو لا يحاول حساب الزاوية المثالية. بدلاً من ذلك، يقول ببساطة: "إذا كان المسار الذي ترسمه يدخل في 'منطقة الخطر' (تجاوز الميزانية)، فامسحه وأعد رسمه". إنه يعمل كمرشح يسمح فقط للمسارات الآمنة بالوجود. لا يهتم بمدى سرعتك، بل يهتم فقط بأن تبقى داخل الخطوط.
  • المدرب الثاني: مدرب السرعة (توجيه تدرج المكافأة - Reward-Gradient Guidance)

    • المهمة: ينظر هذا المدرب إلى المسارات الآمنة ويقول: "من بين جميع المسارات الآمنة، أي منها يوصلك إلى خط النهاية بشكل أسرع؟"
    • الإجراء: إنه يدفع الروبوت نحو أسرع مسار آمن.

السحر: من خلال فصل هاتين الوظيفتين، يمكن للروبوت الانتقال فوراً من "وضع المنطقة المدرسية" (ميزانية سلامة ضيقة) إلى "وضع الطريق السريع" (ميزانية واسعة) بمجرد إخبار المدرب الأول بتغيير القواعد. لا يحتاج إلى إعادة تعلم كيفية القيادة.

4. الفخ الخفي: "إعادة تسمية المسار القابل للتنفيذ" (FTR)

كان هناك عقبة واحدة. حتى مع وجود مدربين، قد يصبح "مدرب السرعة" جشعاً.

  • المشكلة: في بعض الأحيان، تتضمن أسرع طريقة للحصول على درجة عالية اتخاذ مخاطرة كبيرة في بداية الرحلة. إذا اتخذ الروبوت تلك المخاطرة، فقد يصطدم فوراً، لكن "مدرب السرعة" يرى الإمكانية العالية للدرجة ويقول: "انطلق!".
  • الحل (FTR): قدم المؤلفون قاعدة تسمى إعادة تسمية المسار القابل للتنفيذ (Feasible Trajectory Relabeling).
    • التشبيه: تخيل طالباً حصل على درجة 'A' في اختبار ولكنه غش في السؤال الأول. المعلم (FTR) يقول: "على الرغم من حصولك على 'A'، وبسبب غشك في الجزء الأول، سنعتبر اختبارك بالكامل 'F'".
    • كيف يعمل: ينظر النظام إلى الخطوات الأولى لخطة الروبوت. إذا كانت تلك الخطوات الأولى خطيرة (حتى لو بدا بقية المخطط رائعاً)، فإن النظام يخبر "مدرب السرعة": "لا تعطه ائتماناً لهذا المسار". هذا يمنع الروبوت من اتخاذ طرق مختصرة خطيرة لمجرد الحصول على درجة عالية.

5. النتائج: التوازن المثالي

اختبر الباحثون طريقتهم في 38 مهمة مختلفة من مهام القيادة والروبوتات (مثل سيارة تحاول الضغط على زر أو طائرة بدون طيار تطير عبر مسار).

  • النتيجة: كانت طريقتهم (SDGD) آمنة بما يكفي لاجتياز القواعد في 36 من أصل ๆ 38 مهمة.
  • الأداء: من بين جميع الطرق التي كانت آمنة، كانت SDGD هي الأسرع (أعلى مكافأة) في 21 من تلك المهام.
  • المرونة: استطاعوا تغيير قواعد السلامة أثناء تشغيل الروبوت، وتكيف الروبوت فوراً دون الحاجة إلى إعادة التدريب.

ملخص

فكر في SDGD كنظام ملاحة ذكي لا يحسب أسرع مسار فحسب.

  1. يقوم أولاً برسم خريطة تتضمن فقط الطرق القانونية لسرعتك الحالية (مدرب السلامة).
  2. ثم يختار أسرع مسار من تلك الخريطة القانونية (مدرب السرعة).
  3. لديه قاعدة خاصة تقول: "إذا كان المنعطف الأول غير قانوني، فإن المسار بأكمله غير قانوني"، مما يمنع النظام من محاولة الغش للوصول إلى وقت أسرع.

هذا يسمح للروبوتات بأن تكون آمنة وفعالة، حتى عندما تتغير قواعد الطريق أثناء العمل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →