← أحدث الأبحاث
🤖 machine learning

Policy Gradients for Cumulative Prospect Theory in Reinforcement Learning

تستنتج هذه الورقة نظرية تدرج السياسة لنظرية الاحتمال التراكمي (CPT) في أهداف التعلم المعزز ذات الأفق المحدود، وتقترح خوارزمية من الدرجة الأولى متقاربة بشكل مثبت باستخدام الإحصاءات الرتبوية لأسلوب مونت كارلو لتحسين السياسات غير المحدبة والحساسة للمخاطر.

المؤلفون الأصليون: Olivier Lepel, Anas Barakat

نُشر 2026-09-09
📖 7 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Olivier Lepel, Anas Barakat

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

البشر سيئون للغاية في حساب المخاطر بشكل ملحوظ. فنحن لا نزن الاحتمالات كما يفعل الرياضي؛ بل نشعر بها. نحن نميل إلى الخوف من احتمال ضئيل لحدوث خسارة فادحة أكثر بكثير من خوفنا من احتمال كبير لحدوث خسارة متوسطة، وغالباً ما نلهث وراء فرصة ضئيلة لتحقيق مكسب هائل حتى عندما تكون الاحتمالات ضدنا. هذا ليس خللاً في برمجياتنا؛ بل هو الطريقة التي جُبلنا بها. لعقود من الزمن، استخدم الاقتصاديون وعلماء النفس إطاراً يسمى "نظرية التوقعات التراكمية" لوصف هذه السمات الغريبة. وهي تشير إلى أننا لا نحكم على النتائج بناءً على قيمتها المطلقة، بل بناءً على كيفية مقارنتها بنقطة مرجعية شخصية، وأننا نشوه احتمالية وقوع الأحداث، فنبالغ في تقدير الكوارث النادرة ونقلل من شأن الأحداث الشائعة.

لفترة طويلة، تجاهل مجال الذكاء الاصطناعي، وتحديداً "التعلم التعزيزي"، هذه السمات البشرية الغريبة. في هذا المجال، يتعلم "الوكيل" (agent) اتخاذ القرارات من خلال التفاعل مع بيئة ما لتعظيم المكافأة. يفترض النهج القياسي أن الوكيل عقلاني تماماً، حيث يحسب متوسط النتيجة المتوقعة لكل مسار ممكن ويختار المسار الذي يحقق أعلى رقم. هذا يعمل جيداً مع الآلات، لكنه يفشل في استيعاب كيفية تصرف البشر فعلياً في المواقف المعقدة وغير اليقينية. عندما نحاول بناء ذكاء اصطناعي يعمل جنباً إلى جنب مع البشر أو يتخذ قرارات نيابة عنهم، فإن الوكيل العقلاني البحت غالباً ما يتصرف بطرق تبدو باردة، أو غير عقلانية، أو ببساطة خاطئة للمراقب البشري. والسؤال الذي طرحه الباحثون هو: هل يمكننا تعليم الآلات التفكير مثلنا، ليس فقط في خياراتها النهائية، بل في كيفية إدراكها للمخاطر والمكافآت؟

لقد اتخذ فريق من الباحثين الآن خطوة كبيرة نحو الإجابة على ذلك السؤال. فقد طوروا إطاراً رياضياً جديداً يسمح لوكلاء الذكاء الاصطناعي بتحسين سلوكهم بناءً على مبادئ علم النفس البشري بدلاً من الحساب البارد. وفي سلسلة من عمليات المحاكاة، أثبتوا أنه من خلال تعليم الوكيل رؤية العالم من خلال عدسة "نظرية التوقعات التراكمية"، يبدأ الجهاز في إظهار نفس سلوكيات المخاطرة الدقيقة والمتناقضة أحياناً التي يظهرها البشر. لم يقترح الباحثون نظرية فحسب؛ بل بنوا خوارزمية عملية يمكنها تعلم هذه السلوكيات وأثبتوا أنها تعمل رياضياً، مما يوفر وسيلة لجعل الذكاء الاصطناعي يتوافق مع التفضيلات البشرية في البيئات عالية المخاطر مثل التمويل، والرعاية الصحية، وإدارة حركة المرور.

جوهر عملهم هو طريقة جديدة لتعليم الوكيل كيفية التعلم. في التعلم التعزيزي التقليدي، يحاول الوكيل تعظيم مجموع المكافآت التي يتوقع الحصول عليها. الطريقة الجديدة تغير الهدف؛ فبدلاً من السؤال: "ما هو متوسط المكافأة؟"، تسأل: "كيف يدرك الإنسان تدفق المكافآت هذا؟". وللقيام بذلك، يجب على الوكيل أولاً أن يقرر ما الذي يعتبر ربحاً وما الذي يعتبر خسارة بالنسبة لنقطة مرجعية محددة. فمثلاً، قد يكون انخفاض الألم من مستوى سبعة إلى خمسة بمثابة انتصار هائل إذا كان خط الأساس للمريض هو سبعة، ولكنه تحسن طفيف إذا كان خط الأساس هو اثنين. ثم يطبق الوكيل تحويلاً خاصاً على هذه الأرباء والخسائر، مما يجعل ألم الخسارة يبدو أثقل من بهجة الربح المساوي له. وأخيراً، يقوم بتشويه الاحتمالات، مما يجعل الأحداث النادرة تبدو أكثر احتمالاً والأحداث الشائعة تبدو أقل احتمالاً، تماماً كما يفعل العقل البشري.

واجه الباحثون عقبة كبيرة في جعل هذا العمل ناجحاً. فالمنظر الرياضي الذي تخلقه هذه التشوهات الشبيهة بالبشر معقد للغاية ومتعرج. وخلافاً للتلال السلسة والمتوقعة للتحسين القياسي، فإن هذا المنظر الجديد مليء بالقمم الحادة والوديان العميقة، مما يجعل من الصعب على الخوارزمية إيجاد المسار الأفضل دون أن تتعثر. علاوة على ذلك، فإن الأدوات القياسية المستخدمة لتعليم الذكاء الاصطناعي كيفية تحسين قراراته لم تكن قابلة للتطبيق هنا لأن دالة الهدف الشبيهة بالبشر لا تتبع القواعد البسيطة للإضافة والخطية التي تعتمد عليها معظم خوارزميات التعلم. اضطر الفريق إلى اشتقاق مجموعة جديدة تماماً من القواعد، وهي "مبرهنة تدرج السياسة"، والتي تعمل كبوصلة للوكيل. توفر هذه المبرهنة الجديدة طريقة لحساب الاتجاه الذي يجب أن يغير الوكيل سلوكه فيه لتحسين أدائه، حتى عندما يتم قياس هذا الأداء بمعيار معقد يشبه المعايير البشرية.

لاختبار بوصلتهم الجديدة، أجرى الباحثون سلسلة من التجارب. في سيناريو بسيط، وضعوا وكيلاً في موقف يتعين عليه الاختيار بين مكافأة صغيرة آمنة ومكافأة كبيرة محفوفة بالمخاطر. الوكيل العقلاني القياسي كان يختار دائماً الخيار ذو متوسط العائد الأعلى، حتى لو كان ذلك يعني المقامرة. أما الوكيل المتحفظ من المخاطر، المصمم لتجنب عدم اليقين، فقد تجنب المقامرة باستمرار. لكن الوكيل الذي تم تدريبه باستخدام الإطار الجديد الشبيه بالبشر أظهر شيئاً أكثر إثارة للاهتمام. فعندما تضمن الخيار مكاسب محتملة، تصرف بحذر، مفضلاً الخيار الآمن. ومع ذلك، عندما انقلب السيناريو ليشمل خسائر محتملة، أصبح نفس الوكيل جريئاً فجأة، واختار الخيار المحفوف بالمخاطر لتجنب خسارة مؤكدة. هذا التحول في السلوك، المعروف باسم "تأثير الانعكاس"، هو سمة مميزة لاتخاذ القرار البشري التي تكافح نماذج الذكاء الاصطناعي القياسية لمحاكاتها. لقد التقطت الخوارزمية الجديدة هذا التباين بدقة، باستخدام نفس الإعدادات الداخلية لكلا السيناريوهين.

قارن الباحثون أيضاً طريقتهم بالنهج القائمة التي حاولت نمذجة المخاطر. ووجدوا أن الطرق القديمة، التي اعتمدت على "التقدير من الدرجة صفر" (والذي يعتمد أساساً على تخمين اتجاه التحسين عبر إجراء تغييرات صغيرة ورؤية ما سيحدث)، واجهت صعوبات كلما زادت تعقيد المشكلات. أصبحت هذه الطرق غير فعالة وبطيئة مع زيادة عدد المتغيرات. في المقابل، كانت الخوارزمية الجديدة، التي تستخدم معلومات "الدرجة الأولى" لحساب الاتجاه الدقيق للتحسين، أكثر قدرة على التوسع بشكل أفضل. فقد ظلت فعالة حتى مع زيادة تعقيد البيئة، مما يشير إلى إمكانية تطبيقها على مشكلات العالم الحقيقي ذات الأجزاء المتحركة الكثيرة، مثل إدارة شبكة الطاقة أو تداول الأسهم.

تمتد آثار هذا العمل إلى ما هو أبعد من الألعاب البسيطة. فقد أوضح الباحثون كيف يمكن استخدام هذا النهج في المجالات الحيوية. في الرعاية الصحية، على سبيل المثال، قد يحتاج الطبيب الذي يدير الألم المزمن لمريض ما إلى موازنة الراحة الفورية مقابل خطر الاعتماد طويل الأمد. قد يقوم ذكاء اصطناعي قياسي ببساطة بتقليل متوسط درجة الألم، متجاهلاً احتمالاً كبيما أثر مخاوف المريض من أعراض الانسحاب. ومع ذلك، يمكن لوكيل متوافق مع البشر أن يزن الخوف من عرض جانبي نادر ولكنه كارثي بشكل أكبر، مما يؤدي إلى خطط علاجية تبدو أكثر أماناً ومراعاة للمريض. وبالمثل، في التمويل، يمكن ضبط وكيل ليعكس القدرة المحددة على تحمل المخاطر للمستثمر، ليس فقط من خلال تعديل رقم واحد، بل من خلال تغيير كيفية إدراكه لاحتمالية انهيارات السوق أو المكاسب المفاجئة بشكل جوهري.

كما أوضحت الدراسة ما هو مطلوب لكي تعمل هذه الوكلاء. أشار الباحثون إلى أنه لكي تعمل الخوارزمية، يجب معرفة التفضيلات البشرية مسبقاً—أي مدى خوف الشخص من الخسارة أو كيفية تشويهه للاحتمالات. هذه التفضيلات لا يتعلمها الوكيل من الصفر، بل يتم توفيرها كجزء من النموذج، تماماً مثل وضع قواعد اللعبة. وهذا يسمح للنظام بأن يكون مخصصاً لأفراد أو مجموعات محددة. وأظهر الباحثون أنه من خلال تعديل النقطة المرجعية أو الحساسية تجاه الخسائر، يمكن تغيير سلوك الوكيل بشكل جذري، مما يثبت أن النظام مرن بما يكفي لنمذجة مجموعة واسعة من المواقف البشرية.

بينما تبدو النتائج واعدة، فإن الباحثين حذرون في صياغة نتائجهم ضمن حدود عمليات المحاكاة الخاصة بهم. لقد أثبتوا أن الخوارزمية تتقارب نحو حل مستقر وأنها قادرة على إيجاد سياسات مثالية في بيئات معقدة وغير خطية. وقد أظهروا من خلال المحاكاة أنها تتفوق على الطرق القديمة من حيث السرعة والقابلية للتوسع. ومع ذلك، لم يقوموا بعد بنشر هذا النظام في بيئة حقيقية مباشرة حيث توجد حياة بشرية أو أصول مالية معرضة للخطر الفوري. يظل العمل بمثابة اختراق نظري وحسابي، وهو إثبات لمفهوم أن الآلات يمكن تعليمها التنقل في المشهد الفوضوي وغير العقلاني لإدراك المخاطر البشرية.

يتضمن المسار المستقبلي تحسين هذه النماذج واختبارها في سيناريوهات أكثر تنوعاً من العالم الحقيقي. يقترح الباحثون أن العمل المستقبلي يمكن أن يركز على تعلم التفضيلات البشرية مباشرة من البيانات، بدلاً من برمجتها مسبقاً، وتوسيع النظرية لتشمل المشكلات المستمرة ذات الأفق اللانهائي. كما يرون إمكانية الجمع بين هذا النهج وطرق أخرى للتعلم من التغذية الراجعة البشرية، مما يخلق نظاماً هجيناً يمكنه التكيف مع التفضيلات المتغيرة بمرور الوقت. في الوقت الحالي، يمثل هذا الإنجاز جسراً بين عالمين: المنطق البارد لتحسين الآلة، والواقع البشري الدافئ والمتناقض غالباً. إنه يقدم وسيلة لبناء ذكاء اصطناعي لا يحسب النتيجة الأفضل فحسب، بل يفهم ما تعنيه تلك النتيجة للناس الذين يخدمهم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →