Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data
تقدم الورقة البحثية PROCO، وهو إطار عمل للتعلم المعزز الآمن غير المتصل (offline) القائم على النموذج، والذي يستفيد من النماذج اللغوية الكبيرة لترسيخ المعرفة باللغة الطبيعية في دالة تكلفة متحفظة، مما يتيح توليد عينات غير آمنة تخيلية (counterfactual) وتعلم سياسات آمنة حتى عندما تفتقر بيانات التدريب إلى الانتهاكات المرصودة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيفية قيادة سيارة. الطريقة المعتادة لتعليم الروبوت هي تركه يقود، ويرتكب الأخطاء، ويصطدم بالأشياء، ويتعلم من هذه الاصطدامات. لكن في العالم الحقيقي، لا يمكنك ترك الروبوت يصطدم بجدار أو بمشاة لمجرد رؤية ما سيحدث. هذا أمر خطير للغاية.
لذا، بدلاً من ذلك، تعطي الروبوت مجموعة بيانات من سجلات القيادة التي جمعها سائق بشري كان حذراً جداً ولم يصطدم أبداً. الروبوت لا يرى سوى "القيادة الآمنة".
المشكلة: فخ "الوشك على الاصطدام"
هنا تكمن الحيلة الصعبة: مجرد كون الروبوت لم يشهد حادثاً في البيانات لا يعني أنه يعرف شكل الحادث قبل وقوعه.
تخيل سيارة تقترب من جدار. في مجموعة البيانات، كان السائق البشري دائماً يضغط على المكابح قبل الاصطدام بالجدار مباشرة. الروبوت يرى السيارة تتوقف بأمان. لكن الروبموت لا يدرك أنه لو لم يضغط على المكابح، فسيصطدم بالجدار خلال ثانيتين. سيعتقد الروبوت: "أوه، القيادة بهذه السرعة أمر جيد!" لأنه لم يرَ حادثاً قط.
هذه هي المشكلة الجوهرية التي تعالجها الورقة البحثية: كيف تعلم السلامة عندما لا تملك أمثلة على الخطر، بل تملك فقط أمثلة على تجنب البشر للخطر بصعوبة؟
الحل: PROCO (محاكي "ماذا لو")
يقترح المؤلفون طريقة جديدة تسمى PROCO. فكر في PROCO كمدرب سلامة يستخدم أداتين رئيسيتين: بلورة سحرية (نموذج لكيفية عمل العالم) ودليل سلامة (كتبه ذكاء اصطناعي فائق الذكاء).
إليك كيف يعمل الأمر، خطوة بخطوة:
1. البلورة السحرية (نموذج الديناميكيات)
أولاً، يتعلم الروبوت "بلورة سحرية" من سجلات القيادة الآمنة. هذا ليس سحراً؛ إنه نموذج رياضي يتنبأ بـ: "إذا كنت هنا، ولففت المقود بهذا الاتجاه، فأين سأكون في الثانية التالية؟"
- التشبيه: يشبه الأمر محاكي الطيران. يتعلم الروبوت فيزياء السيارة حتى يمكنه تخيل سيناريوهات مستقبلية دون قيادتها فعلياً.
2. دليل السلامة (دالة التكلفة المعتمدة على LLM)
بعد ذلك، يحتاج الروبوت لمعرفة معنى "غير آمن". وبما أنه لا يملك بيانات عن الاصطدام، يطلب الباحثون من نموذج لغوي كبير (LLM) — وهو ذكاء اصطناعي فائق الذكاء يقرأ ويفهم اللغة البشرية — أن يكتب "دليل سلامة".
- الأمر (Prompt): يخبرون الـ LLM: "القاعدة هي: لا تصطدم بالجدار. ولكن يرجى أن تكون حذراً للغاية. إذا كنت قريباً من الجدار، تعامل مع الأمر كما لو أنك اصطدمت به بالفعل".
- النتيجة: يكتب الـ LLM دالة برمجية (قطعة من الكود) تعمل كـ "دالة تكلفة" (Cost Function). وهي تعطي "درجة عقوبة" عالية ليس فقط عند الاصطدام بالجدار، بل عند كونك قريباً بشكل خطر منه. هذا يخلق "منطقة عازلة للسلامة".
3. لعبة "ماذا لو" (السيناريوهات الاستباقية)
الآن يأتي الجزء الذكي. يستخدم الروبوت البلورة السحرية لمحاكاة القيادة للأمام انطلاقاً من البيانات الآمنة التي لديه. يسأل نفسه: "إذا استمررت في السير للأمام من هذه النقطة الآمنة، فماذا سيحدث؟"
- بفضل دليل السلامة، يعرف المحاكي أن الاقتراب من الجدار أمر سيء.
- يقوم المحاكي بتشغيل سيناريوهات "ماذا لو" هذه وينتج بيانات اصطدام وهمية. إنه ينشئ آلاف الأمثلة لـ "الوشك على الاصطدام" و"الاصطدامات" التي لم تحدث في الواقع، ولكن من المتوقع رياضياً حدوثها.
4. التعلم من البيانات الوهمية
أخيراً، يتدرب الروبوت على هذه المجموعة الجديدة والمختلطة من البيانات:
- البيانات الحقيقية الآمنة الأصلية.
- بيانات الاصطدام الوهمية التي تم إنشاؤها بواسطة البلورة السحرية والتي حددها دليل السلامة.
من خلال التدريب على هذه المخاطر المحاكية، يتعلم الروبوت التعرف على "منطقة الخطر" (الحالات التي ستؤدي إلى اصطدام) ويتعلم الابتعاد عنها، رغم أنه لم يصطدم فعلياً في الواقع.
لماذا هذا أفضل؟
- الطريقة القديمة: إذا عرضت على الروبوت بيانات آمنة فقط، فقد يعتقد أن "القيادة بسرعة بالقرب من الجدار آمنة" لأنه لم يرَ حادثاً قط. قد ينحرف نحو منطقة الخطر ويصطدم عند استخدامه في الواقع.
- طريقة PROCO: إنها تنشئ استباقياً سيناريوهات الخطر التي يحتاجها للتعلم. إنها تقول فعلياً: "أنا أعلم أنني لم أصطدم بعد، ولكن بلورتي السحرية تخبرني أنني سأصطدم إذا لم أبطئ السرعة الآن".
النتائج
اختبر المؤلفون هذا على 17 مهمة مختلفة للروبوت (مثل قيادة سيارة، أو تحريك ذراع روبوت، أو السباحة).
- قارنوا PROCO بطرق متقدمة أخرى حاولت تعلم السلامة من نفس البيانات "الآمنة فقط".
- النتيجة: كان PROCO أفضل بشكل دراماتيكي. في كثير من الحالات، قلل من انتهاكات السلامة (الاصطدامات) بنسبة تزيد عن 400% مقارنة بالطرق الأخرى. لقد تعلم البقاء آمناً بشكل أكثر موثوقية لأنه استطاع "رؤية" مخاطر المستقبل التي لم تستطع الطرق الأخرى رؤيتها.
باختة القول: PROCO هي طريقة لتعليم الروبوت كيف يكون آمناً عبر تركه يلعب لعبة "ماذا لو" باستخدام محاكي ودليل لغوي ذكي، ليتعلم تجنب الكوارث التي لم يسبق له تجربتها فعلياً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.