Mission-Aligned Learning-Informed Control of Autonomous Systems: Formulation and Foundations
تقدم هذه الورقة إطار عمل عام للتحسين ثنائي المستوى يدمج بشكل تآزري بين التحكم في المستوى الأدنى، والتخطيط الكلاسيكي، والتعلم التعزيزي لتعزيز سلامة وموثوقية وقابلية تفسير الأنظمة ذاتية القيادة، وهو ما تم توضيحه تحديداً من خلال سيناريو رعاية روبوتية نمطي.
تخيل أنك توظف روبوتاً ليكون مقدم رعاية شخصي لأحد أقاربك المسنين. تريد لهذا الروبوت أن يكون ذكياً بما يكفي ليتعلم ما يحبه قريبك (رب perhaps يفضل شايَه ساخناً، أو أنه يصبح عصبياً إذا اضطر للانتظار طويلاً)، ولكنك تحتاج أيضاً لأن يكون آمناً ومفهوماً. لا تريد "صندوقاً أسود" يتخذ قرارات لا يمكنك تفسيرها، خاصة إذا كان الأمر يتعلق بتحريك إنسان هش أو التعامل مع أشياء حادة.
تقترح هذه الورقة حلاً لتلك المشكلة. إنها تقترح بناء عقل الروبوت ليس كشبكة عصبية واحدة ضخمة ومربكة، بل كـ فريق مكون من ثلاث طبقات يعملون معاً. فكر في الأمر كأنه مطبخ في مطعم فاخر.
الفريق المكون من ثلاث طبقات
1. رئيس الطهاة (المجدول والمخطط)
ماذا يفعل: هذا هو المفكر في "الصورة الكبيرة". ينظر إلى قائمة طعام اليوم ويقرر تسلسل الأحداث: "أولاً، نحتاج لتحضير الإفطار. ثم، نحتاج لإعطاء المريض دواءه. لاحقاً، سنقوم ببعض التمارين الخفيفة".
التشبيه: تخيل رئيس طهاة لا يلمس الموقد أبداً. هو يكتب الوصفة والجدول الزمني. يستخدم المنطق والقواعد (مثل "لا تقدم الحساء قبل استيقاظ المريض"). يتحدث بلغة بشرية واضحة (رموز/tokens)، وليس بالرياضيات.
لماذا يهم ذلك: تضمن هذه الطبقة أن الروبوت يقوم بالأشياء الصحيحة في الترتيب الصحيح. إنها قابلة للتفسير، مما يعني أن الإنسان يمكنه النظر إلى الخطة والقول: "نعم، هذا يبدو منطقياً".
2. الطاهي المساعد (متحكم MPC)
ماذا يفعل: بمجرد أن يقول رئيس الطهاة: "اذهب لتحضير الحساء"، يتولى الطاهي المساعد المهمة. هو لا يهتم بقائمة الطعام؛ بل يهتم بـ الفيزياء. "كم مقدار الحرارة التي أحتاجها؟ ما هي السرعة التي يجب أن أحرك بها الملعقة؟ إذا حركت القدر بسرعة كبيرة، هل سيتدفق الخارج؟"
التشبيه: هذا هو الخبير الذي يعرف قوانين الفيزياء. يستخدم التحكم التنبئي بالنموذج (MPC). فكر في هذا كأنه نظام طيار آلي فائق الدقة. إنه يتنبأ بالمستقبل باستمرار: "إذا أدرت المقبض الآن، سيفور الحساء خلال 3 ثوانٍ. من الأفضل أن أبطئ السرعة".
لماذا يهم ذلك: هذا يضمن الأمان. حتى لو كان الروبوت يتعلم، فإن هذه الطبقة تعمل كشبكة أمان، مما يضمن أن الروبوت لن يفعل أبداً شيئاً خطيراً من الناحية الفيزيائية (مثل الاصطدام بجدار أو إسقاط مريض).
3. لجنة التذوق (التعلم المعزز / RL)
ماذا يفعل: هذا هو الجزء الذي يتعلم من الخبرة. بعد تقديم الحساء، قد يقول المريض: "كان مالحاً بعض الشيء"، أو "لقد أحببت طريقة التقديم". تأخذ لجنة التذوق هذه الملاحظات وتقوم بتعديل الوصفة للمرة القادمة.
التشبيه: هذا هو المتعلم من خلال "التجربة والخطأ". في الذكاء الاصطناعي التقليدي، يكون هذا "صندوقاً أسود" يخمن فقط. ولكن هنا، هو لا يعيد كتابة عقل الروبوت بالكامل. بدلاً من ذلك، هو فقط يعدل الإعدادات لرئيس الطهاة والطاهي المساعد.
لماذا يهم ذلك: يسمح للروبوت بـ التخصيص. فهو يتعلم أن هذا المريض تحديداً يحب حساءه ساخناً، بينما يفضل مريض آخر أن يكون دافئاً، دون أن ينسى أبداً قواعد السلامة.
كيف يعملون معاً (الخلطة السحرية)
فكرة الورقة الكبرى هي ربط هذه الطبقات الثلاث بحيث يمكنهم التحدث مع بعضهم البعض فورياً.
المشكلة في الذكاء الاصطناعي القديم: عادةً ما تقوم بتدريب الروبوت عن طريق تركه يصطدم مليون مرة في محاكاة حتى يتعلم. هذا أمر خطير في الحياة الواقعية. كما أنه لا يمكنك سؤال الروبوت لماذا فعل شيئاً ما.
النهج الجديد:
يختار رئيس الطهاة مهمة (مثلاً: "تحضير الحساء").
يحسب الطاهي المساعد الطريقة الأكثر أماناً ودقة لتحريك أذرع الروبوت للقيام بذلك، باستخدام قوانين الفيزياء.
يقوم الروبوت بالمهمة.
ترى لجنة التذوق رد فعل المريض.
التحول: ترسل اللجنة إشارة رجوع إلى رئيس الطهاة والطاهي المساعد. هي لا تقول "افعلها بشكل مختلف". بل تقول: "في المرة القادمة، أعطِ الأولوية للسرعة على حساب الأمان" أو "في المرة القادمة، كن أكثر لطفاً".
يقوم النظام بتحديث "أوزان التفضيلات" الداخلية الخاصة به ويجرب مرة أخرى.
مثال من الواقع من الورقة البحثية
تخيل أن الروبوت يجب أن يسلم دواءً.
رئيس الطهاة يقرر: "اذهب إلى الصيدلية، أحضر الحبوب، وأحضرها للمريض".
لجنة التذوق تتعلم: "المريض يكره الانتظار. لقد أعطى تقييماً منخفضاً عندما كان الروبوت بطيئاً".
النتيجة: في المرة القادمة، قد يختار رئيس الطهاة مساراً أخطر قليلاً ولكنه أسرع، وسيقوم الطاهي المساعد بتعديل سرعته لتكون أسرع ولكن لا تزال آمنة. لقد تعلم الروبوت تفضيل المريض دون أن يخاطر أبداً بحدوث تصادم.
لماذا تعتبر هذه الورقة أمراً هاماً جداً
السلامة أولاً: تضع حارس أمان فيزيائي "صلب" (الطاهي المساعد) حول الجزء "الناعم" من التعلم. يمكن للروبوت أن يتعلم، لكن لا يمكنه كسر قوانين الفيزياء أو قواعد السلامة.
لا وجود للصناديق السوداء: بما أن رئيس الطهاة يستخدم المنطق والطاهي المساعد يستخدم الرياضيات، يمكن للبشر فهم لماذا اتخذ الروبوت قراراً ما. "لق been اخترت المسار البطيء لأن الممر كان مزدحماً".
القدرة على التكيف: يمكن للروبوت تعلم مهام جديدة (مثل "تحضير الحساء" مقابل "توصيل الحبوب") دون الحاجة إلى إعادة تدريبه من الصفر. هو فقط يستبدل وصفة رئيس الطهاة.
باختاًصر
تتعلق هذه الورقة ببناء روبوت ذكي بما يكفي ليتعلم عاداتك ولكن صارم بما يكفي لكي لا يؤذيك أبداً. وهو يفعل ذلك من خلال تقسيم عقل الروبوت إلى مخطط منطقي، ومتحكم خبير بالفيزياء، وحلقة تعلم بالتغذية الراجعة، يعملون جميعاً في تناغم. إنه الفرق بين الذكاء الاصطناعي الفوضوي وغير المتوقع، وبين المساعد الروبوتي الموثوق والاعتمادي.
تتناول الورقة التحدي الحرج المتمثل في نشر الوكلاء ذاتيي القيادة في البيئات التي تركز على الإنسان وتتطلب معايير سلامة عالية (تحديداً الرعاية الروبوتية لكبار السن). تعاني الأساليب الحالية المتطورة، وخاصة التعلم التعزيزي العميق (Deep RL)، من ثلاث قيود جوهرية في هذا السياق:
الافتقار إلى ضمانات السلامة: يعد التعلم التعزيزي نموذجاً إحصائياً يفتقر إلى الدمج الهيكلي للقوانين الفيزيائية، مما يجعل من الصعب تقديم ضمانات رسمية ضد الفشل الكارثي (مثل الاصطدامات).
طبيعة "الصندوق الأسود": غالباً ما تكون سياسات التعلم التعزيزي غامضة، وتفتقر إلى القابلية للتفسير المطلوبة لبناء ثقة المستخدم والحصول على الاعتماد التنظيمي.
ضعف التعميم: يعاني التعلم التعزيزي القياسي مع السيناريوهات الخارجة عن نطاق التوزيع (out-of-distribution) ويتطلب استكشافاً واسع النطاق عبر التجربة والخطأ، وهو أمر غير مقبول في بيئات الحياة الواحدة (مثل رعاية المرضى).
يقترح المؤلفون حلاً ينتقل من التعلم التعزيزي الشامل (end-to-end) نحو بنية هجينة تدمج بين التعلم التعزيزي (RL)، والتحكم التنبئي بالنماذج (MPC)، والتخطيط الكلاسيكي. والهدف هو إنشاء نظام يتعلم من البيانات للتكيف مع تفضيلات المستخدم مع الحفاظ على السلامة، والقابلية للتفسير، والقيود الفيزيائية للتحكم القائم على النموذج.
2. المنهجية: إطار عمل هرمي ثنائي المستوى
المساهمة الجوهرية هي إطار تحسين ثنائي المستوى يفصل عملية اتخاذ القرار إلى طبقتين متفاعلتين:
أ. المستوى العلوي: التخطيط المتوافق مع المهمة (الطبقة الرمزية)
الوظيفة: يتولى اتخاذ القرارات عالية المستوى والمتقطعة (مثل "إطعام المريض"، "تقديم الدواء").
الآلية: يستخدم التخطيط الكلاسيكي (بناءً على المنطق العلاقاتي ولغة PDDK) لتوليد تسلسلات من الأفعال المرمزة (tokenized actions).
التعلم: يوظف التعلم التعزيزي (RL) لتعلم متجه التفضيلات (w). يقوم هذا المتجه بدمج الأهداف المتعددة في دالة تكلفة واحدة (على سبيل المثال، الموازنة بين الوقت، والسلامة، والطاقة، وراحة المستخدم) بناءً على التغذية الراجعة البشرية.
ب. المستوى السفلي: التحكم الفيزيائي الآمن (الطبقة المستمرة)
الوظيفة: تنفيذ الحركات الفيزيائية المطلوبة لتحقيق الأفعال عالية المستوى.
الآلية: يستخدم التحكم التنبئي بالنماذج (MPC). يقوم الـ MPC بحل مسألة تحسين غير خطية مقيدة بمقياس زمني سريع لتوليد مدخلات تحكم مستمرة (السرعة، عزم الدوران).
السلامة: يفرض الـ MPC صراحةً القيود الفيزيائية (تجنب الاصطدام، الديناميكيات) باستخدام نماذج فيزيائية معروفة، مما يضمن مسارات آمنة.
التكيف: معاملات الـ MPC (مصفوفات التكلفة Q,R، والحالات المستهدفة) ليست ثابتة؛ بل يتم تعديلها ديناميكياً من قبل المستوى العلوي بناءً على التفضيلات المتعلمة.
ج. آلية التكامل: "التفاضل عبر الضبابية" (Differentiation through Fuzzification)
الرابط المبتكر بين الطبقة الرمزية المتقطعة وطبقة التحكم المستمرة هو واجهة المنطق الضبابي (Fuzzy Logic Interface):
الضبابية (Fuzzification): يتم رسم الحالات الفيزيائية المستمرة (مثل موقع الروبوت z) إلى قيم عضوية ضبابية (μ∈[0,1]) تمثل الذرات المنطقية (مثل "الروبوت في الموقع أ").
القابلية للتفاضل: تم تصميم دوال العضوية هذه لتكون قابلة للتفاضل.
انتشار التدرج: يستخدم النظام حساسيات مبرهنة الدالة الضمنية (IFT) لحساب تدرجات حل الـ MPC بالنسبة لمعاملاته.
التعلم الشامل (End-to-End Learning): تتدفق التدرجات من التغذية الراجعة البشرية (المستوى العلوي) ← عبر الواجهة الضبابية ← إلى معاملات الـ MPC (المستوى السفلي). وهذا يسمح للنظام بتعلم كيفية ضبط المتحكم الفيزيائي لتلبية أهداف المهمة عالية المستوى دون كسر قيود السلامة.
3. المساهمات الرئيسية
صياغة التحسين ثنائي المستوى: مخطط رياضي رسمي يدمج الـ MPC المدعوم بالتعلم التعزيزي (المستوى السفلي) مع التخطيط الكلاسيكي المدعوم بالتعلم التعزيزي (المستوى العلوي)، مما يحل التبعية بين التخطيط المتقطع والتحكم المستمر.
واجهة ضبابية قابلة للتفاضل: منهجية لربط المنطق الرمزي بالتحكم المستمر باستخدام دوال العضوية الضبابية، مما يتيح التعلم القائم على التدرج عبر الحدود الرمزية-المستمرة.
الاستكشاف الآمن عبر RLMPC: يدمج الإطار الـ MPC داخل حلقة التعلم التعزيزي، مما يضمن أنه حتى أثناء مرحلة التعلم/الاستكشاف، يعمل النظام ضمن قيود فيزيائية آمنة (خلافاً للتعلم التعزيزي الصرف الذي قد يستكشف حالات غير آمنة).
التكيف غير المرتبط بالمهمة: تسمح البنية بالتكيف السريع مع مهام جديدة (مثل الانتقال من تقديم الدواء إلى تحضير الوجبات) عن طريق إعادة تعريف مشكلة التخطيط مع إعادة استخدام النماذج الديناميكية الفيزيائية ونماذج تفضيلات المستخدم المتعلمة.
4. النتائج التجريبية
قام المؤلفون بالتحقق من صحة الإطار في بيئة مستشفى محاكية مع روبوت يعمل بنظام الدفع التفاضلي يؤدي مهمتين متميزتين: تقديم الدواء وتحضير الوجبات.
الإعداد: تفاعل النظام مع خمسة "ملفات تعريف مرضى" متميزة، لكل منها تفضيلات حقيقية فريدة (مثل "الأولوية للسلامة"، "التركيز على السرعة"، "التركيز على طريقة التقديم").
التقارب:
نجح النظام في تعلم أوزان التفضيلات الصحيحة في 22 من أصل 25 تجربة.
الملفات التعريفية ذات ذروات التفضيل الحادة (مثل "الأولوية للسلامة") تقاربت بسرعة (خلال 10-15 حلقة).
حدد النظام بدقة بُعد التفضيل المهيمن في 100% من التجارب، حتى عندما لم يتحقق التقارب العددي الكامل.
التكيف السلوكي:
أدت ملفات "الأولوية للسلامة" إلى اختيار مسارات تتجنب المناطق عالية المخاطر (مثل منطقة الموقد)، حتى لو كانت أطول.
اختارت ملفات "التركيز على السرعة" أقصر المسارات وأسرع أنواع الوجبات (السندوتشات).
اختارت ملفات "التركيز على التقديم" أنواع وجبات أكثر تعقيداً (وجبات كاملة) لتعظيم "جودة المظهر".
جودة التنفيذ: حافظ الـ MPC على معدل إنجاز مهام بنسبة 100% دون أي انتهاكات للسلامة، مما يثبت أن عملية التعلم لم تخل بالسلامة الفيزيائية.
5. الأهمية والأثر
توفر هذه الورقة مخططاً تأسيسياً للأنظمة ذاتية القيادة الموثوقة في المجالات الحساسة:
جسر الفجوة: إنها تجسر بفعالية الفجوة بين مرونة التعلم التعزيزي القائم على البيانات وبين صرامة التحكم القائم على النموذج (MPC) والتخطيط القائم على المنطق.
القابلية للتطبيق التنظيمي: من خلال ضمان السلامة عبر قيود الـ MPC والتفسير عبر التخطيط الرمزي، يعالج الإطار حاجز "الصندوق الأسود" الذي يمنع حالياً الاعتماد الواسع للذكاء الاصطناعي في الرعاية الصحية والبنية التحتية الحرجة.
القابلية للتوسع: يسمح النهج بإعادة استخدام نماذج الديناميكيات الفيزيائية عبر مهام مختلفة، مما يقلل من العبء الحسابي والبيانات مقارنة بتدريب وكلاء تعلم تعزيزي منفصلين لكل سيناريو جديد.
الاتجاه المستقبلي: تؤسس الورقة لبرنامج بحثي لـ "التحكم الموجه بالتعلم"، مما يشير إلى أن الأنظمة ذاتية القيادة المستقبلية لا ينبغي أن تعتمد فقط على التعلم الإحصائي، بل يجب أن تكون مرتكزة على الفيزياء والمنطق من المبادئ الأولى، حيث يعمل التعلم على ضبط المعاملات والمواءمة مع القيم البشرية.