Issues with Value-Based Multi-objective Reinforcement Learning: Value Function Interference and Overestimation Sensitivity
تحدد هذه الورقة وتحلل تحديين لم يسبق الإبلاغ عنهما، وهما تداخل دالة القيمة والحساسية تجاه المبالغة في التقدير، واللذان يعيقان أداء خوارزميات التعلم المعزز متعدد الأهداف القائمة على القيمة عند استخدامها مع دوال المنفعة غير الخطية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك قبطان سفينة فضائية تحاول الوصول إلى كوكب بعيد. لكن هناك عقبة: أنت لا تحاول فقط الوصول بسرعة، بل لديك لوحة تحكم بثلاثة أهداف متضاربة:
- السرعة (الوصول بسرعة).
- كفاءة الوقود (توفير الطاقة).
- الأمان (تجنب الكويكبات).
في عالم الذكاء الاصطناعي، يسمى هذا تعلم تعزيز متعدد الأهداف (MORL). على وكيل الذكاء الاصطنا جنبي (كمبيوتر سفينتك) أن يتعلم كيفية الموازنة بين هذه الأهداف المتنافسة. عادةً، يتعلم الذكاء الاصطناعي من خلال الاحتفاظ بـ "بطاقة نقاط" (تسمى قيمة Q) لكل حركة محتملة. في الذكاء الاصطناعي البسيط، تكون هذه الدرجة مجرد رقم واحد. ولكن في هذا العالم المعقد، تكون بطاقة النقاط عبارة عن متجه (vector) — وهي قائمة من الأرقام، رقم واحد لكل هدف (على سبيل المثال: [السرعة: 10، الوقود: 5، الأمان: 9]).
الورقة البحثية التي قدمتها، والتي كتبها بيتر فامبلو وزملاؤه، تكتشف "خللين" رئيسيين يحدثان عندما تحاول استخدام بطاقات النقاط المعقدة هذه مع تفضيلات غير خطية (حيث لا تتبع رياضيات سعادتك خطاً مستقيماً).
إليك تفصيل للمشكلتين، مشروحة بتشبيهات من الحياة اليومية.
المشكلة 1: فخ "المتوسط مقابل الواقع" (تداخل دالة القيمة)
المفهذا:
في الذكاء الاصطناعي القياسي، إذا كنت تخوض مقامرة، فإن الذكاء الاصطناعي يحسب النتيجة المتوسطة ويتخذ قراراً بناءً على ذلك المتوسط. هذا يعمل بشكل جيد إذا كانت سعادتك خطاً مستقيماً (خطياً). ولكن إذا كانت سعادتك منحنى (غير خطية)، فإن المتوسط قد يخدعك.
التشبيه: تذكرة اليانصيب مقابل المبلغ المضمون
تخيل أنك في كازينو. لديك خياران:
- الخيار (أ) (المقامرة): فرصة 50/50 للفوز إما بـ 10 دولارات أو 100 دولار.
- القيمة المتوسطة هي 55 دولاراً.
- الخيار (ب) (الرهان الآمن): مبلغ مضمون قدره 40 دولاراً.
السيناريو 1: أنت تحب المال بشكل خطي.
إذا كنت تريد فقط الحصول على أكبر قدر من المال، فإن 55 دولاراً (متوسط الخيار أ) أفضل من 40 دولاراً (الخيار ب). ستختار (أ). بسيط.
السيناريو 2: أنت تتجنب المخاطر (منفعة غير خطية).
لنفترض أن دالة "سعادتك" غريبة. أنت مرعوب من الخسارة، لذا فإن الحصول على 10 دولارات يجعلك بائساً، لكن الحصول على 100 دولار يجعلك مبتهجاً للغاية.
- متوسط سعادتك للخيار (أ) قد يكون منخفضاً لأن خطر الحصول على 10 دولارات يسحب السعادة للأسفل.
- ومع ذلك، تشير الورقة البحثية إلى فخ رياضي محدد: أحياناً، يقوم الذكاء الاصطناعي بحساب المتجه المتوسط أولاً، ثم يطبق معادلة السعادة الخاصة بك.
- هو يرى المتجه المتوسط:
[السرعة: 55، ...]. - ثم يحسب السعادة بناءً على هذا المتوسط:
السعادة(55). - الفخ: في بعض السيناريوهات الرياضية المعقدة (مثل المنحنيات "المحدبة" أو "المقعرة" المذكورة في الورقة)، فإن
السعادة(المتوسط)ليست هي نفسهاالمتوسط(السعادة).
- هو يرى المتجه المتوسط:
النتيجة في العالم الحقيقي:
قد ينظر الذكاء الاصطناعي إلى "المتجه المتوسط" للمقامرة، ويحسب درجة، ويقرر أنه أفضل من الرهان الآمن. لكن في الواقع، إذا لعبت هذه اللعبة 100 مرة، ستكون أكثر سعادة إذا اخترت الرهان الآمن في كل مرة. يصاب الذكاء الاصطناعي بالارتباك بسبب "المتوسط" ويختار المسار الخاطئ، مما يؤدي إلى نتيجة دون المستوى الأمثل.
الحل:
تقترح الورقة البحثية أنه إذا كان على الذكاء الاصطناعي الاختيار بين حركتين تبدوان متساويتين في الجودة، فلا ينبغي له أن يرمي عملة معدنية (يختار عشوائياً). بل يجب أن يختار نفس الحركة في كل مرة (بشكل حتمي). هذا يمنع الذكاء الاصطناعي من إنشاء "متوسط زائف" يربك منطقه الخاص.
المشكلة 2: حساسية "الدرجة المبالغ فيها" (المبالغة في التقدير)
المفهوم:
غالباً ما تصاب خوارزميات الذكاء الاصطناعي ببعض الحماس الزائد. فهي تميل إلى المبالغة في تقدير مدى جودة الحركة. في الذكاء الاصطناعي البسيط (هدف واحد)، لا يهم هذا كثيراً. إذا اعتقدت أن حركة ما تستحق 10 نقاط بدلاً من 8، وهناك حركة أخرى تستحق 5، فستظل تختار الأولى. الترتيب يبقى كما هو.
التشبيه: الخريطة المشوهة
تخيل أنك تتنزه مع خريطة بها تشويه طفيف.
- الخريطة الخطية (الذكاء الاصطناعي البسيط): تقول الخريطة إن الجبل (أ) ارتفاعه 100 متر، والجبل (ب) ارتفاعه 50 متراً. حتى لو كانت الخريطة خاطئة وتقول إن ارتفاعهما 105 و55 متراً، فستظل تعرف أن (أ) أعلى. ستختار (أ).
- الخريطة غير الخطية (الذكاء الاصطناعي المعقد): الآن، تخيل أن هدفك ليس مجرد "الارتفاع"، بل "الجمال الطبيعي"، والذي يعتمد على معادلة غريبة. ربما تهتم فقط بالجبال التي يزيد ارتفاعها عن 100 متر بالضبط، أو ربما يتراجع الجمال بشكل حاد بعد نقطة معينة.
- إذا بالغت الخريطة في تقدير الجبل (ب) ولو بقدر ضئيل جداً، فقد يتجاوز فجأة "عتبة" في معادلتك.
- فجأة، يعتقد الذكاء الاصطناعي أن الجبل (ب) هو الأكثر جمالاً، رغم أن الجبل (أ) هو الأفضل في الواقع.
النتيجة في العالم الحقيقي:
تظهر الورقة البحثية أنه عندما تستخدم قواعد معقدة وغير خطية (مثل "يجب أن يكون الأمان مثالياً، وإلا فلن أهتم بالسرعة")، فإن مجرد قدر ضئيل من "الضجيج" أو المبالغة في التقدير في بطاقة نقاط الذكاء الاصطناعي يمكن أن يقلب قراره تماماً.
- الذكاء الاصطناعي الخطي: المبالغة في التقدير هي مجرد ضجيج غير ضار.
- الذكاء الاصطناعي غير الخطي: المبالغة في التقدير هي كارثة. فهي تتسبب في اختيار الذكاء الاصطناعي للمسار الخاطئ تماماً، مما يؤدي إلى خسائر هائلة في الأداء.
تشبيه "العتبة":
فكر في لوحة تحديد السرعة.
- إذا كنت تقود بسرعة 59 ميلاً في الساعة وكان عداد السرعة معطلاً قليلاً ويقول 61 ميلاً، فقد تصاب بالذعر وتظن أنك تتجاوز السرعة.
- إذا كنت تقود بسرعة 61 ميلاً في الساعة وقال العداد 63 ميلاً، فأنت لا تزال تتجاوز السرعة.
- لكن إذا كانت "منفعتك" هي "أنا سعيد إذا كنت تحت 60، وأشعر بالبؤس إذا تجاوزت ذلك"، فإن خطأً طفيفاً في عداد السرعة سيقلب حالتك العاطفية بالكامل من "سعيد" إلى "بائس". المبالغة في التقدير لدى الذكاء الاصطناعي تعمل مثل عداد السرعة المعطل هذا.
الملخص: ماذا يجب أن نفعل؟
خلص المؤلفون إلى أن طرق الذكاء الاصطناعي الحالية هشة نوعاً ما عند التعامل مع المشكلات المعقدة متعددة الأهداف.
- أوقف العشوائية: عندما يكون الذكاء الاصطناعي غير متأكد بين خيارين متساويين، توقف عن رمي العملة المعدنية. اختر واحداً باستمرار لتجنب إرباك حسابات "المتوسط".
- راقب المبالغة: كن حذراً جداً مع الذكاء الاصطناعي الذي يستخدم قواعد معقدة وغير خطية. حتى الأخطاء الصغيرة في كيفية تقدير الذكاء الاصطناعي لمكافآته المستقبلية يمكن أن تؤدي إلى اتخاذ قرارات كارثية.
- الحلول المستقبلية: تقترح الورقة البحثية طريقتين للإصلاح:
- التعلم التوزيعي (Distributional Learning): بدلاً من تعلم "متوسط" الدرجة فقط، علّم الذكاء الاصطناعي تعلم النطاق الكامل للنتائج المحتملة (مثل معرفة أن هناك احتمال 50% للحصول على 10 دولارات و50% للحصول على 100 دولار، بدلاً من مجرد "متوسط 55 دولاراً"). هذا يسمح للذكاء الاصطناعي بحساب السعادة الحقيقية بشكل صحيح.
- التسكيل (Scalarization): تحويل أهداف المتجهات المعقدة إلى رقم واحد فوراً عند كل خطوة، بدلاً من الانتظار حتى النها. هذا يتجنب فخ "المتوسط مقابل الواقع" تماماً.
باختصار: عندما يتعين على الذكاء الاصطناعي الموازنة بين أهداف متعددة ومتضاربة بقواعد معقدة، فإنه يرتبك بسهء من المتوسطات والأخطاء الصغيرة. نحن بحاجة لتعليمه أن ينظر إلى الصورة الكاملة، وليس فقط إلى المتوسط، وأن يكون دقيقاً جداً في تسجيل درجاته.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.