OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents
تقدم هذه الورقة OpenPM، وهو إطار تقييم قابل للتدقيق في نقطة زمنية محددة لوكلاء إدارة محافظ النماذج اللغوية الكبيرة (LLM) الذين يفرضون قيوداً صارمة على توافر البيانات والمخاطر لمنع النتائج المتضخمة، مما يكشف أن جودة المحلل وتكاليف دوران العمالة أكثر أهمية من اختيار نموذج البناء في تحقيق عوائد متواضعة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: OpenPM – تقييم نقطي زمني قابل للتدقيق لوكلاء إدارة محافظ نماذج اللغة الكبيرة (LLM)
1. بيان المشكلة
تتناول الورقة ثلاث حالات فشل حرجة في التقييم الحالي لوكلاء التداول المعتمدين على نماذج اللغة الكبيرة (LLM)، والتي تؤدي غالبًا إلى نتائج متضخمة أو غير قابلة للتطبيق الفعلي:
- تسرب المعلومات: غالبًا ما يصل الوكلاء إلى بيانات غير متاحة وقت اتخاذ القرار (مثل الملاحظات المستقبلية، أو السجلات المختومة بالحدث بدلاً من السجلات المختومة بالتوافر)، مما يخلق مهارة اصطناعية.
- التنفيذ المتفائل: تتجاهل العوائد المُبلغ عنها تكاليف التداول (الفرق بين سعر البيع والشراء، الانزلاق السعري، معدل الدوران)، مما يقدم حدودًا عليا بدلاً من تقديرات واقعية قابلة للتنفيذ.
- التفويضات غير المفروضة: غالبًا ما تُعامل القيود النوعية باللغة الطبيعية (مثل "محافظ"، "بحد أقصى 20 اسمًا") كتفضيلات لينة للتقييم اللاحق بدلاً من كونها قيودًا صلبة مفروضة على المحفظة المنفذة.
غالبًا ما تفشل الاختبارات المعيارية الحالية في ضبط هذه القضايا في آن واحد، لا سيما في افتقارها إلى بوابات البيانات النقطية الزمنية (PIT) والفرض الصارم للتفويضات.
2. المنهجية: إطار عمل OpenPM
OpenPM هو إطار تقييم نقطي زمني قابل للتدقيق، صُمم ليعامل التقييم الموثوق كأثر هندسي.
مبادئ التصميم الأساسية
- بيئة بيانات نقطية زمنية: يفرض النظام "بوابة توافر" صارمة. تدخل السجل في حالة الوكيل عند وقت القرار فقط إذا كان
ts_available. هذا يميز بين وقت الحدث ووقت التوافر (على سبيل المثال، التقرير الربع سنوي لا يكون متاحًا إلا بعد قبول هيئة EDGAR). تغطي البيئة نطاق S&P 500 مع ملاحظات حالة السوق كل 5 دقائق. - فرض التفويض: يتم تحليل تفويضات المخاطر باللغة الطبيعية إلى قيود محددة النوع (مثل الحد الأقصى للوزن لكل اسم، الحد الأقصى لعدد الأسماء). والأهم من ذلك، يتم فرض هذه القيود بواسطة ناقد حتمي داخل الحلقة (in-loop critic) يقوم بإسقاط الأوزان المقترحة من الوكيل على المجموعة الممكنة قبل التنفيذ، بدلاً من مجرد تقييم الوكيل لاحقًا.
- التنفيذ الواعي بالتكلفة: تُحسب العوائد باستخدام أنصاف فروق الأسعار الجانبية (الشراء بسعر الطلب، والبيع بسعر العرض) مع عدم نمذجة تأثير السوق، مما يوفر خط أساس تكلفة متحفظًا ولكنه واقعي.
الموزع المتدرج (الوكيل المرجعي)
تقدم الورقة بنية وكيل مرجعي لعزل مكونات محددة في خط أنابيب التداول:
- تجميع التفويض: يحول اللغة الطبيعية إلى قيود محددة النوع.
- بوابة السيولة: تصفّي النطاق إلى الأسماء القابلة للتداول (مثل أفضل 50 اسمًا من حيث السيولة).
- طبقة المحلل: ستة محللين يعملون بنموذج LLM بالتوازي يقومون بتقييم المرشحين بشكل مستقل عبر قنوات محددة النوع (الجانب الفني، النظام، الأحداث، الأخبار، عناصر 8-K، وسرديات 10-K/10-Q).
- المُنشئ (Constructor): نموذج لغة كبير منفصل يقترح أوزان المحفظة بناءً على درجات المحللين المجمعة والفروق السعرية، ولكن بدون الوصول إلى الأسعار الخام أو الدرجة المركبة.
- الناقد الحتمي: يُسقط مقترح المُنشئ على المجموعة الممكنة (فرض نظام "اللونج-أونلي"، سقف الأسماء، حدود السيولة).
- محاكي التنفيذ: ينفذ الصفقات عند الجوانب المقتبسة.
الإعداد التجريبي
- مجموعة البيانات: لقطة ثابتة ومختومة برمجياً (content-hashed) لمؤشر S&P 500 (508 اسمًا) نشطة بين 19 فبراير 2026 و1 مايو 2026. نافذة التقييم هي من 2 مارس 2026 إلى 1 مايو 2026 (44 يوم تداول).
- استراتيجية العزل: لعزل قدرة "المُنشئ"، قام المؤلفون بتشغيل طبقة المحلل مرة واحدة لإنشاء "التقاط ثابت" للأدلة. ثم يتم إعادة تشغيل نفس هذه الأدلة عبر نماذج مُنشئ مختلفة (gpt-5, Opus-4.7, DeepSeek-V3.2, Qwen3-Max, gpt-4o-mini) لتحديد ما إذا كان المُنشئ يضيف قيمة مستقلة عن جودة الإشارة.
- الأنماط: تجرى التجارب في نمطي "المرة الواحدة ثم الاحتفاظ" (إعادة توازن واحدة) وأنماط إعادة التوازن اليومية.
3. النتائج الرئيسية
تقرير الورقة عن نتائج هيكلية بدلاً من ادعاءات ألفا مطلقة، مؤكدة على أنها تمثل حدودًا عليا.
قدرة المُنشئ
- المكاسب الشرطية: تظهر المُنشئات الأقوى (مثل gpt-5, Opus-4.7) مكاسب طفيفة تعتمد على النموذج مقارنة بتوزيع الأوزان المتساوي (EW) لنفس مجموعة المرشحين، ولكن فقط عندما تكون إشارة المحلل في المرحلة السابقة قوية.
- هيمنة المحلل: جودة طبقة المحلل هي المحرك الرئيسي للأداء. عندما كانت عملية التقاط المحلل ضعيفة (DeepSeek-V3.2)، لم يستطع أي مُنشئ التغلب على خط الأساس لـ EW لنفس المجموعة. وعندما كانت عملية الالتقاط قوية (gpt-5)، تفوق معظم المُنشئين على EW.
- التداخل: تعيد المُنشئات القوية وزن قائمة EW نفسها إلى حد كبير (تداخل بنسبة 75-78%) بدلاً من استبدالها بالكامل. أما المُنشئات الأضعف فغالباً ما تنحرف بشكل كبير وتؤدي أداءً أقل.
التكلفة والدوران
- الدوران هو المحرك الرئيسي للتكلفة: في إعادة التوازن اليومية، يصبح دوران المحفظة هو العامل المهيمن على التكلفة. النماذج ذات الدوران العالي (مثل Qwen3-Max, gpt-4o-mini) شهدت انخفاض عوائدها الصافية تحت مؤشر SPY بسبب عبء التكلفة، رغم امتلاكها عوائد إجمالية مشابهة للنماذج ذات الدوران المنخفض.
- الانضباط مهم: النمط الفائز يتضمن الاختيار الجيد والتداول بحذر. الدوران المنخفض وحده غير كافٍ (كان gpt-5 صاحب أدنى معدل دوران ولكنه أخفق في التفوق على SPY بسبب سوء الاختيار في ذلك النظام المحدد).
الامتثال والتدقيق
- الالتزام بالتفويض: نجحت جميع المُنشئات في الالتزام بالحدود الرقمية الصريحة (مثل الحد الأقصى للوزن 10%).
- ضرورة الناقد: كان الناقد الحتمي ضرورياً لفرض قيود السيولة (القص الصلب) التي كانت أكثر صرامة من التفويض وغير مرئية للنموذج.
- التلوث: اجتازت جميع التشغيلات شهادة التلوث، مما أكد عدم وجود تسرب للمعلومات المستقبلية.
4. الأهمية والادعاءات
تضع الورقة OpenPM ليس كمولد ألفا تم التحقق منه، بل كأداة تشخيصية لمجتمع التداول المعتمد على نماذج اللغة الكبيرة.
- أثر هندسي: تعيد صياغة التقييم كمشكلة هندسية تتطلب عقود بيانات صارمة، وبوابات توافر، وطبقات فرض حتمية.
- الصدق في الادعاءات: يصرح المؤلفون صراحة بأن جميع العوائد هي "حدود عليا لنافذة واحدة ثابتة بدون تأثير السوق، وليست ألفا تم التحقق منها". الهدف هو الحفاظ على صدق الادعاءات من خلال ربط كل رقم بشرط محدد (بصمة البيانات، نموذج التكلفة، التفويض) الذي أنتجه.
- الرؤى التشخيصية: يكشف الإطار أن "مهارة الإنشاء" غالباً ما تكون وسيطاً لـ "جودة إشارة المحلل". وتجادل الورقة بضرورة منح الأولوية في الحوسبة لطبقة المحلل، باستخدام أرخص مُنشئ قادر بعد ذلك.
- القابلية للتدقيق: من خلال إنشاء آثار مثل شهادات التلوث، ومنحنيات الحساسية للتكلفة، وتقارير الالتزام بالقيود لكل تشغيل، يسمح OpenPM للباحثين بالتحقق مما إذا كانت النتائج ناتجة عن تسرب البيانات أو افتراضات التنفيذ المتفائلة.
باختصار، يوضح OpenPM أنه بينما يمكن لنماذج اللغة الكبيرة بناء محافظ تتفوق على الخطوط الأساسية البسيطة في ظروف معينة، فإن أداءها يعتمد بشدة على جودة الإشارة في المرحلة السابقة ويتم تآكله بسهولة بفعل تكاليف الدوران. يوفر الإطار الدقة اللازمة للتمييز بين المهارة الحقيقية وآثار التقييم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.