← أحدث الأبحاث
💰 quantitative finance

Tackling Decision Processes with Non-Cumulative Objectives using Reinforcement Learning

تقدم هذه الورقة رسمًا خرائطيًا عامًا يحول عمليات ماركوف لاتخاذ القرار غير التراكمية (NCMDPs) إلى عمليات ماركوف لاتخاذ القرار القياسية (MDPs)، مما يتيح التطبيق المباشر لتقنيات التعلم التعزيزي الحالية لتحسين دوال المكافأة التعسفية وإثبات تحسن الأداء وكفاءة التدريب عبر مهام متنوعة.

المؤلفون الأصليون: Maximilian Nägele, Jan Olle, Thomas Fösel, Remmy Zen, Florian Marquardt

نُشر 2026-10-01
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Maximilian Nägele, Jan Olle, Thomas Fösel, Remmy Zen, Florian Marquardt

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطناعي، يوجد إطار عمل قوي يُستخدم لتعليم الآلات كيفية اتخاذ القرارات. تخيل روبوتاً يتعلم المشي، أو برنامج كمبيوتر يتقن لعبة فيديو، أو خوارزمية تداول تدير محفظة أسهم. تعمل هذه الأنظمة من خلال اتخاذ سلسلة من الإجراءات، واحداً تلو الآخر، استجابةً لمحيطها. ومع كل حركة، يتلقى النظام إشارة، تُسمى غالباً "مكافأة"، تخبره ما إذا كان هذا الإجراء جيداً أم سيئاً. لعقود من الزمن، كانت القاعدة القياسية للنجاح في هذه السيناريوهات بسيطة: تعظيم المجموع الكلي لجميع المكافآت التي يتم جمعها بمرور الوقت. إذا حصل الروبوت على نقطة صغيرة مقابل كل خطوة للأمام، فإن الهدف هو الحصول على أكبر عدد ممكن من النقاط بنهاية الرحلة. هذا النهج، المعروف باسم "عملية ماركوف لاتخاذ القرار"، حقق نجاحاً هائلاً، حيث وجه كل شيء بدءاً من الروبوتات الصناعية وصولاً إلى السيارات ذاتية القيادة.

ومع ذلك، فإن الحياة الواقعية غالباً ما تكون أكثر تعقيداً من مجرد ورقة حساب بسيطة. فأحياناً، لا يكون المخرج الأهم هو المبلغ الإجمالي للأشياء الجيدة التي حدثت، بل اللحظة الأسوأ التي وقعت، أو اتساق الأداء بمرور الوقت. تأمل مركبة فضائية تهبط على كوكب ما؛ فالهدف ليس مجرد الهبوط بأمان، بل ضمان عدم تجاوز المركبة لسرعة خطيرة خلال عملية الهبوط بأكملها، بغض النظر عن مدى سلاسة بقية الرحلة. وفي التمويل، قد يهتم المستثمر بكيفية تقلب أرباحه أكثر من اهتمامه بإجمالي الربح المحقق خلال عام، ساعياً وراء عائد ثابت بدلاً من مقامرة محفوفة بالمخاطر. تتضمن هذه السيناريوهات ما يسميه الباحثون "الأهداف غير التراكمية"، حيث تعتمد النتيجة النهائية على دالة محددة لتاريخ المكافآت بأكد، مثل القيمة القصوى التي تم الوصول إليها أو نسبة متوسط الربح إلى التقلب. وحتى الآن، كان تعليم الذكاء الاصطناعي لتحسين هذه الأهداف المعقدة المعتمدة على التاريخ أمراً صعباً، وغالباً ما يتطلب خوارزميات مصممة خصيصاً يصعب تطبيقها على مشكلات جديدة.

لقد طور فريق من الباحثين من معهد ماكس بلانك لعلوم الضوء وجامعة فريدريش ألكسندر إرلانجن-نورنبرغ حلاً عاماً لهذه المشكلة. فقد اكتشفوا طريقة لترجمة هذه التحديات المعقدة وغير التراكمية إلى التنسيق القياسي الذي تعرفه أدوات الذكاء الاصطناعي القوية الموجودة بالفعل. فبدلاً من اختراع نوع جديد من خوارزميات التعلم من الصفر، أنشأوا جسراً. لقد أظهروا أنه من خلال تغيير طفيف في كيفية إدراك الآلة لوضعها الحالي وكيفية حساب تغذيتها الراجعة الفورية، يمكن تحويل أي هدف معقد إلى مشكلة "مجموع مكافآت" قياسية. وهذا يسمح للباحثين بأخذ أكثر برمجيات التعلم الجاهزة تقدماً المتاحة اليوم وتطبيقها مباشرة على مشكلات كانت في السابق بعيدة المنال، دون الحاجة إلى تعديل البرمجيات نفسها.

يتمثل جوهر منهجهم في منح "الوكيل" (agent) ذاكرة أكبر قليلاً. في الإعداد القياسي، يحتاج الوكيل فقط لمعرفة حالته الحالية لاتخاذ قرار. ولكن عندما يعتمد الهدف على تاريخ المكافآت بأكمله — مثل تذكر أعلى سرعة تم الوصول إليها حتى الآن — يحتاج الوكيل إلى حمل هذه المعلومات معه. اقترح الباحثون نظاماً يتم فيه توسيع "حالة" الوكيل لتشمل ملخصاً جارياً للماضي، مثل أعلى أو أدنى مكافأة شوهدت حتى تلك اللحظة. وفي الوقت نفسه، قاموا بتعديل المكافأة الفورية التي يتلقاها الوكيل؛ فبدلاً من الحصول على مكافأة تعكس الإجراء الحالي ببساطة، يتلقى الوكيل قيمة محسوبة، والتي عند جمعها على مدار الرحلة بأكملها، تعيد بناء الهدف المعقد بدقة. على سبيل المثال، إذا كان الهدف هو تقليل السرعة القصوى، يتم مكافأة الوكيل بطريقة لا تعاقبه إلا عندما يسجل رقماً قياسياً جديداً في السرعة، مما يحول مشكلة "الحد الأدنى من القيم القصوى" إلى "مجموع قياسي".

تم اختبار هذا النهج عبر مجموعة واسعة من المهام الصعبة، مما أثبت تعدد استخداماته. في محاكاة لمركبة هبوط قمرية، درب الباحثون وكيلاً لهبوط مركبة فضائية مع وضع حد صارم لسرعتها القصوى. وقارنوا طريقتهم بالنهج القياسي الذي حاول تقريب الهدف عن طريق إضافة عقوبة في نهاية الرحلة. وجدت الطريقة الجديدة، التي عاملت حد السرعة كجزء مستمر من عملية التعلم، توازناً أفضل بكما بين الهبوط بأمان والتحرك بكفاءة. وفي مجال التمويل، طبقوا التقنية على تحسين المحافظ الاستثمارية، حيث الهدف هو تعظيم "نسبة شارب" (Sharpe ratio)، وهي مقياس للعائد المعدل حسب المخاطر يقسم متوسط الربح على تقلب تلك الأرباح. كانت الأساليب السابقة تعتمد على تقريبات تقريبية لهذه النسبة، ولكن باستخدام هذا الربط الجديد، استطاعت الوكلاء تعلم تعظيم النسبة الدقيقة مباشرة، مما أدى إلى استراتيجيات استثمارية أفضل بكثير أثناء التدريب.

كما استكشف الباحثون مشكلات التحسين المنفصلة، مثل إيجاد الترتيب الأكثر كفاءة لبوابات المنطق الكمي أو تبسيط المخططات المعقدة المستخدمة في الحوسبة الكمية. في هذه المهام، يكون الهدف غالباً هو العثور على الحالة الوحيدة الأفضل التي تم الوصول إليها خلال بحث طويل، بدلاً من مجموع جميع التحسينات التي تمت على طول الطريق. هنا، سمحت الطديدة الجديدة للوكلاء باستكشاف أكثر جرأة؛ فبما أن الوكيل لم يكن يُعاقب على النكسات المؤقتة التي كانت ضرورية للوصول إلى حل أفضل لاحقاً، فقد تعلم بشكل أسرع ووجد حلولاً ذات جودة أعلى من الوكلاء الذين تم تدريبهم باستخدام المكافآت التراكمية القياسية. وفي تجربة واحدة تتعلق بتصحيح الخطأ الكمي، حسنت الطريقة الجديدة الأداء بفارق كبير، حيث وجدت حلولاً أفضل في وقت أقل.

تكمن قوة هذا العمل في بساطته وعموميته. فالباحثون لم يبتكروا خوارزمية تعلم جديدة، بل أنشأوا طبقة ترجمة. وهذا يعني أن أي خبير في مجال معين، من الروبوتات إلى التمويل، يمكنه أخذ مشكلته الحالية، وتطبيق هذا الربط، واستخدام أقوى أدوات التعلم المعزز المتاحة فوراً. تعمل الطريقة في البيئات المتوقعة وتلك المليئة بالضجيج العشوائي، وتتعامل مع الأهداف البسيطة والمعقدة على حد سواء. وبينما أشار الباحثون إلى أن الذاكرة الموسعة المطلوبة للوكيل يمكن أن تجعل المشكلة أكبر قليلاً، فإن تقنيات التعلم العميق الحديثة مجهزة جيداً للتعامل مع ذلك. والنتيجة هي إطار عمل موحد يزيل الحاجز بين الأهداف المعقدة في العالم الحقيقي وأدوات الذكاء الاصطناعي المتطورة، مما يفتح الباب أمام الآلات لتعلم استراتيجيات كانت في السابق صعبة التعريف للغاية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →