← أحدث الأبحاث
💻 computer science

A Reinforcement Learning Supervisor with Dynamic Performance-Metric Weighting for Cryptocurrency Portfolio Management

تقترح هذه الورقة إطار عمل لإشراف التعلم التعزيزي يقوم بوزن متعدد لمقاييس الأداء ديناميكياً لاختيار سياسة التداول المثلى من مجموعة غير متجانسة من الوكلاء، مما يظهر عوائد فائقة معدلة حسب المخاطر في أسواق العملات المشفرة غير المستقرة مقارنة بالوكلاء الفرديين والاستراتيجيات الثابتة.

المؤلفون الأصليون: Hee-jae Kwon, Su-cheon Lee, Eun-Ji Lee, Se-hun Lee, Tae-Geol Woo, Kang-moon Park

نُشر 2026-09-16
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Hee-jae Kwon, Su-cheon Lee, Eun-Ji Lee, Se-hun Lee, Tae-Geol Woo, Kang-moon Park

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إن الاستثمار في الأسواق المالية هو لعبة تكيف مستمرة. فقواعد اللعبة تتغير مع تحول الاقتصاد من فترة نمو مزدهرة إلى ركود جانبي بطيء، أو إلى انخفاض حاد ومفاجئ. وفي هذه البيئات، غالبًا ما تفشل استراتيجية واحدة نجحت تمامًا خلال فترة الازدهار عندما تنقلب أحوال السوق. هذا هو التحدي الجوهري لإدارة المحافظ الاستثمارية: اتخاذ القرار بشأن كيفية تقسيم الأموال بين أصول مختلفة عندما يكون المستقبل غير مؤكد والماضي ليس خريطة موثوقة. لعقود من الزمن، اعتمد المستثمرون على صيغ رياضية لموازنة المخاطر والمكافآت، لكن هذه النماذج الثابتة غالبًا ما تعاني عندما تتغير ظروف السوق بسرعة. ومؤخرًا، توجه علماء الكمبيوتر إلى نوع من الذكاء الاصطناعي يسمى "التعلم التعزيزي". فبدلاً من تلقين هذه البرامج قواعد محددة، تتعلم هذه البرامج من خلال التجربة والخطأ، عبر التفاعل مع سوق محاكية لاكتشاف أي الإجراءات تؤدي إلى أفضل النتائج على المدى الطويل. وبينما يمكن لهذه البرامج أن تتعلم التداول، إلا أنها غالبًا ما تقع في فخ التفكير بنمط واحد، وتصبح عاجزة عن التحول عندما يتغير نظام السوق.

اقترح فريق من الباحثين في جامعة كوريا الوطنية للنقل طريقة جديدة لحل هذه المشكلة. فبدلاً من محاولة بناء روبوت تداول واحد مثالي، أنشأوا نظامًا يعمل بمثابة مشرف، يدير فريقًا من خمسة روبوتات تداول مختلفة، تم تدريب كل منها باستخدام طريقة تعلم مختلفة قلي بالقدر نفسه من الاختلاف. لا يقوم المشرف بعمليات التداول بنفسه، بل يراقب أداء كل روبوت مؤخرًا ويقرر أي منهم يجب أن يتولى القيادة في أي لحظة. اختبر الباحثون هذا النظام باستخدام بيانات حقيقية عالية التردد من سوق العملات الرقمية، وهو مكان معروف بتقلباته الشديدة وتغيراته السريعة. ووجدوا أن نظام المشرف هذا تفوق باستمرار على أي روبوت منفرد، وكذلك على استراتيجيات الاستثمار التقليدية، من خلال الانتقال ديناميكيًا إلى الوكيل الأنسب لظروف السوق الحالية.

بدأ الباحثون ببناء فريق من خمسة وكلاء متميزين. كل وكيل هو برنامج كمبيوتر مصمم لاتخاذ قرارات استثمارية، ولكن تم تدريبهم باستخدام مناهج رياضية مختلفة. ورغم أن جميع الوكلاء تم تدريبهم في نفس بيئة المحفظة وبنفس دالة المكافأة، إلا أن آليات التعلم المتميزة لكل منهم جعلت كل وكيل يطور "شخصية" فريدة. فقد يكون أحدهم عدوانيًا للغاية، يسعى وراء أرباح عالية ولكنه يتحمل مخاطر كبيرة، بينما قد يكون آخر أكثر حذرًا، ويعطي الأولوية للاستقرار على حساب المكاسب السريعة. في سوق مستقرة، قد يتألق الوكيل العدواني، أما في سوق مضطربة، فقد يكون الوكيل الحذر هو الوحيد الذي ينجو. والمشكلة هي أنه لا يوجد وكيل واحد هو الأفضل في كل شيء طوال الوقت. فإذا اختار المستثمر وكيلًا واحدًا فقط وتمسك به، فمن المرجح أن يعاني عندما يتغير السوق بطريقة لا يفضلها ذلك الوكيل.

ولحل هذه المعضلة، قدم الباحثون "وكيلًا مشرفًا". هذا المشرف لا يعرف الكود الداخلي للوكلاء الخمسة الذين يديرهم، بل يعمل مثل مدرب يراقب مباراة، حيث ينظر فقط إلى لوحة النتائج. فهو يتتبع سبعة مقاييس أداء مختلفة لكل وكيل، مثل مقدار الربح الذي حققوه، وحجم المخاطر التي اتخذوها لتحقيق ذلك الربح، ونسبة الفترات ذات العوائد الإيجابية. وينظر في هذه الأرقام عبر فترات زمنية مختلفة، من الساعات القليلة الماضية إلى الأيام الماضية. وظيفة المشرف هي معرفة أي من هذه المقاييس هو الأكثر أهمية في الوقت الحالي. ففي سوق هادئة، قد يقرر المشرف أن الأرباح الثابتة والمستمرة هي أهم علامة على جودة الوكيل. أما في سوق فوضوية، فقد يقرر أن تجنب الخسائر الكبيرة هو الشيء الوحيد الذي يهم.

يتعلم المشرف نظام الأوزان هذا من خلال عملية التدريب الخاصة به. فهو يراقب السوق وتاريخ الوكلاء الأخير، ثم يتعلم كيفية تخصيص درجات الأهمية لمقاييس الأداء المختلفة. هو لا يختار ببساطة الوكيل صاحب أعلى ربح أخير، بل يحسب درجة لكل وكيل من خلال دمج بيانات أدائهم مع أوزان الأهمية التي تعلمها المشرف لتلك اللحظة المحددة. والوكيل الذي يحصل على أعلى إجمالي درجات هو الذي يتم اختياره لإدارة المحفظة لفترة التداول التالية. وهذا يخلق نظامًا يعيد تقييم خياراته باستمرار، وينقل ثقته من وكيل إلى آخر مع تغير بيئة السوق.

اختبر الباحثون هذا النظام باستخدام بيانات أسعار بفاصل ثلاثين دقيقة من منصة "بينانس" لتداول العملات الرقمية، تغطي الفترة من 1 يناير 2021 إلى 31 ديسمبر 2025. وقد وضعوا سيناريوهين مختلفين: أحدهما يحتوي على أربع عملات رقمية شائعة، والآخر يحتوي على خمس عملات، بإضافة أصل خامس لمعرفة ما إذا كان النظام يمكنه التعامل مع مجموعة أكبر قليلاً من الاستثمارات. وقارنوا نظام المشرف الخاص بهم ضد الوكلاء الخمسة المنفردين، واستراتيجية بسيطة تتمثل في شراء جميع الأصول والاحتفاظ بها بالتساوي، وعدة صيغ استثمار تقليدية. وكانت النتائج واضية؛ فقد حقق نظام المشرف قيمًا نهائية للمحفظة أعلى بكثير من أي من الوكلاء المنفردين أو الاستراتيجيات التقليدية. في سيناريو الأصول الأربعة، رفع المشرف قيمة المحفظة إلى 2.349 ضعف المبلغ الأصلي، بينما وصل أفضل وكيل منفرد إلى 1.652 فقط. وفي سيناريو الأصول الخمسة، وصل المشرف إلى 3.044 ضعف القيمة الأصلية، مقارنة بـ 2.554 لأفضل وكيل منفرد.

والأهم من ذلك، أن هذا النمو الإضافي لم يأتِ على حساب زيادة المخاطر. فقد شهد نظام المشرف أيضًا خسائر قصوى (تراجع في القيمة) أصغر من الوكلاء المنفردين. وهذا يشير إلى أن النظام لم يكن مجرد مقامر كبير للحصول على عوائد أعلى، بل كان يدير المخاطر بشكل أفضل من خلال معرفة متى ينتقل إلى وكيل أكثر أمانًا. كما قارن الباحثون نظامهم بنسخة أبسط استخدمت قاعدة ثابتة واحدة للتبديل بين الوكلاء، مثل اختيار الوكيل صاحب أعلى ربح أخير دائمًا. وقد تفوق نظام المشرف بفارق كبير على استراتيجيات القاعدة الواحدة هذه، مما أثبت أن نجاح النظام جاء من قدرته على وزن عوامل متعددة في آن واحد، بدلاً من الاعتماد على معيار واحد جامد.

لفهم ما جعل النظام يعمل بالضبط، أجرى الباحثون سلسلة من الاختبارات حيث قاموا بإزالة أجزاء من النظام لمعرفة ما سيحدث. ووجدوا أن النظام يحتاج إلى جميع مقاييس الأداء السبعة وجميع النوافذ الزمنية الأربعة ليعمل بأفضل حالاته. فإزالة المقاييس المتعلقة بالربح أضرت بقدرة النظام على تنمية الثروة، بينما أدت إزالة المقاييس المتعلقة بالمخاطر إلى الإضرار بقدرته على الحماية من الخسائر. وبالمثل، احتاج النظام إلى النظر في تاريخ الأداء قصير وطويل المدى. ففي اختبار الأصول الأربعة، كان التاريخ طويل المدى هو الأكثر أهمية، بينما في اختبار الأصول الخمسة، كان التاريخ قصير المدى هو الأكثر أهمية. أظهر هذا التباين أن النظام لم يكن يستخدم قاعدة ثابتة، بل كان يتكيف حقًا مع الاحتياجات المحددة للمحفظة الحالية وظروف السوق.

تخلص الدراسة إلى أن إدارة المحفظة لا تقتصر فقط على إيجاد خوارزمية تداول واحدة هي الأفضل، بل تتعلق بإنشاء هيكل يمكنه اختيار الأداة المناسبة للوظة مع تغير تلك الوظيفة. ومن خلال استخدام مشرف لوزن إشارات الأداء المختلفة ديناميكيًا، يمكن للنظام التنقل في الطبيعة غير المتوقعة لأسواق العملات الرقمية بشكل أكثر فعالية من أي وكيل منفرد أو استراتيجية ثابتة. ويشير الباحثون إلى أن نظامهم الحالي يستخدم مجموعة محددة من خمسة وكلاء ومجموعة محددة من بيانات السوق. ويمكن للعمل المستقبلي توسيع ذلك من خلال تضمين وكلاء بملفات تعريف مخاطر مختلفة أو اختبار النظام على أنواع أخرى من الأصول. ومع ذلك، تظل النتيجة الجوهرية قوية: النهج الهرمي الذي يتعلم اختيار السياسات بناءً على رؤية مرنة ومتعددة الأوجه للأداء يوفر طريقة قوية للتعامل مع عدم اليقين في الأسواق المالية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →