Adaptive Alpha Weighting with PPO: Enhancing Prompt-Based LLM-Generated Alphas in Quant Trading
تقترح هذه الورقة إطار عمل للتعلم التعزيزي باستخدام تحسين السياسة القريبة (PPO) لوزن الألفا المولدة بواسطة النماذج اللغوية الكبيرة (LLMs) ديناميكياً، مما يوضح أنه على الرغم من عدم قدرته دائماً على تعظيم العوائد التراكمية، إلا أنه يحسن بشكل كبير الأداء المعدل حسب المخاطر والاستقرار مقارنة بالاستراتيجيات المرجعية التقليدية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك طاهٍ يحاول ابتكار الوصفة المثالية لسوق الأسهم. لعقود من الزمن، اعتمد الطهاة (المتداولون) على مجموعة ثابتة من التوابل (المؤشرات مثل المتوسطات المتحركة) للتنبؤ بما إذا كان الطبق (السهم) سيكون مذاقه جيدًا غدًا. لكن الأسواق تشبه الطقس؛ فهي تتغير باستمرار، والتوابل التي نجحت بالأمس قد تجعل مذاق الطبق سيئًا اليوم.
مؤخرًا، وصلت أداة جديدة: النماذج اللغوية الكبيرة (LLMs). تخيل هذه النماذج كأنها "مساعد طاهٍ" (Sous-chef) ذكي للغاية ومطلع، قرأ كل كتب الطبخ، والمقالات الإخبارية، والتقارير المالية في التاريخ. يمكنك أن تسأله: "أعطني 50 مزيجًا جديدًا من التوابل للتنبؤ بسهم شركة أبل"، وسيقوم فورًا بابتكار 50 وصفة رياضية فريدة (تسمى Alpha Formulaic).
المشكلة:
يشير البحث إلى خلل رئيسي في كيفية استخدام الناس الحالي لـ "مساعدي الطهاة" هؤلاء. عادةً ما يأخذ المتداولون جميع الوصفات الخمسين ويمزجونها معًا في وعاء كبير، مع إعطاء كل واحدة منها ملعقة متساوية. أو قد يختارون بعض الوصفات المفضلة لديهم ويتمسكون بها للأبد.
لكن السوق مطبخ فوضوي! أحيانًا تنجح توابل "الزخم" (Momentum) بشكل رائع، ولكن توابل "المشاعر" (Sentiment) - القائمة على الأخبار - تكون عديمة الفائدة. إذا استمررت في إعطائهم أوزانًا متساوية، فستحرق الوجبة. أنت بحاجة إلى طريقة لتعديل أحجام الملاعق ديناميكيًا بناءً على ما يحدث الآن.
الحل: "المتذوق الذكي" (PPO)
يقدم هذا البحث وكيلًا للتعلم التعزيزي يسمى PPO (تحسين السياسة القريبة). لنطلق على PPO اسم "المتذوق الذكي".
إليك كيف يعمل النظام، خطوة بخطوة:
- مساعد الطاهي (LLM): يقوم الذكاء الاصطناعي بتوليد 50 إشارة تداول مختلفة (وصفات) لـ 10 شركات مختلفة (مثل تويوتا، أبل، نتفليكس). هذه الإشارات تنظر إلى السعر، وحجم التداول، وحتى "مزاج" الأخبار.
- المتذوق الذكي (PPO): بدلاً من مجرد خلطهم جميعًا بالتساوي، يراقب المتذوق الذكي السوق كل يوم.
- إذا كان السوق هادئًا وفي اتجاه صاعد، فقد يقول المتذوق: "هيا، لنصب الكثير من وصفة 'الزخم' وقليلًا من وصفة 'الأخبار'".
- إذا أصبح السوق مخيفًا ومتقلبًا، فقد يقول المتذوق: "توقف! لنخفض الوصفات الخطرة ونركز على وصفات 'الأمان'".
- الهدف: المتذوق لا يحاول صنع أكبر قدر من الحساء (أعلى ربح إجمالي) بأي ثمن. هدفه هو صنع الحساء الأكثر اتساقًا مع أقل فرصة لحرق لسانك (أقل مخاطرة وأصغر خسائر).
ماذا حدث عندما جربوا ذلك؟
اختبر الباحثون هذا "المتذوق الذكي" مقابل طرق أخرى، مثل شراء السهم والاحتفاظ به (Buy-and-Hold) أو استخدام قواعد بسيطة.
- طاهي "الشراء والاحتفاظ": هذا الطاهي عادة ما يصنع أكبر قدر من الحساء (أعلى ربح إجمالي) إذا ارتفع السوق. ولكن إذا انهار السوق، فسيحترق هذا الطاهي بشدة.
- "المتذوق الذكي" (PPO): لم يصنع هذا الطاهي دائمًا أكبر قدر من الحساء (أعلى ربح إجمالي). أحيانًا، حقق مالاً أقل من طاهي "الشراء والاحتفاظ". ومع ذلك، كان حساء "المتذوق الذكي" أكثر أمانًا بكثير.
- أقل تعرضًا للحرق: حقق المتذوق الذكي "أقصى تراجع" (Maximum Drawdowns) أصغر بكثير (أكبر انخفاض في القيمة). لقد عرف متى يتراجع ويتجنب النار.
- نسبة أفضل: عندما تنظر إلى "نسبة شارب" (Sharpe Ratio) - وهي درجة تقيس مقدار الربح الذي تحصل عليه مقابل كل وحدة من المخاطرة تأخذها - نجد أن المتذوق الذكي قد فاز في كل مرة تقريبًا. لقد كان الطاهي الأكثر كفاءة.
الدروس المستفادة من المطبخ:
- النماذج اللغوية الكبيرة (LLMs) مولدات رائعة: يمكن للذكاء الاصطناعي ابتكار أفكار تداول إبداعية ومتنوعة قد يغفل عنها البشر.
- القدرة على التكيف هي الملك: السحر الحقيقي ليس مجرد امتلاك الوصفات؛ بل هو امتلاك نظام يعرف أي وصفة يستخدمها في هذه اللحظة.
- الأمان أولاً: أثبت النظام أنك لست بحاجة لأن تكون متداولًا عدوانيًا للغاية لتفوز. من خلال كونك ذكيًا بشأن المخاطر، يمكنك الحصول على نتائج أفضل بمرور الوقت، حتى لو لم يكن إجمالي أرباحك هو الرقم الأعلى على اللوحة.
- ليس مجرد خوارزمية واحدة: جرب الباحثون "متذوقين" آخرين (خوارزميات ذكاء اصطناعي مختلفة)، وبينما كان PPO رائعًا، كانت الخوارزميات الأخرى تعمل جيدًا أيضًا. المفتاح هو امتلاك النظام الذي يتكيف، وليس مجرد عقل الذكاء الاصطناعي المحدد.
باختصار:
يتعلق هذا البحث بتعليم الذكاء الاصطناعي أن يكون مدير محفظة مرن وواعٍ بالمخاطر. بدلاً من اتباع قائمة ثابتة من القواعد بشكل أعمى، يتعلم الذكاء الاصطناعي الاستماع إلى السوق، وتعديل أوزان إشارات التداول المختلفة في الوقت الفعلي، وحماية أموالك من الانهيارات الكبيرة، حتى لو كان ذلك يعني تفويت بعض الأرباح الضخمة والمخاطرة. إنه الفرق بين المقامر المتهور والمستثمر المتمرس والحذر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.