OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents
यह शोध पत्र OpenPM प्रस्तुत करता है, जो LLM पोर्टफोलियो-प्रबंधन एजेंटों के लिए एक ऑडिट करने योग्य पॉइंट-इन-टाइम मूल्यांकन ढांचा है जो बढ़ा चढ़ाकर दिखाए गए परिणामों को रोकने के लिए सख्त डेटा उपलब्धता और जोखिम संबंधी बाधाओं को लागू करता है, जिससे यह पता चलता है कि मामूली रिटर्न उत्पन्न करने में निर्माण मॉडल के चयन की तुलना में विश्लेषक की गुणवत्ता और टर्नओवर लागत अधिक महत्वपूर्ण हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: OpenPM – LLM पोर्टफोलियो-प्रबंधन एजेंटों के लिए ऑडिट करने योग्य पॉइंट-इन-टाइम मूल्यांकन
1. समस्या विवरण
यह शोध पत्र LLM ट्रेडिंग एजेंटों के वर्तमान मूल्यांकन में तीन महत्वपूर्ण विफलताओं को संबोधित करता है, जो अक्सर अत्यधिक या गैर-तैकाबिल (non-deployable) परिणाम उत्पन्न करते हैं:
- सूचना रिसाव (Information Leakage): एजेंट अक्सर उस डेटा तक पहुँच प्राप्त कर लेते हैं जो निर्णय के समय उपलब्ध नहीं था (जैसे, भविष्य के अवलोकन, उपलब्धता-स्टैम्प के बजाय इवेंट-स्टैम्प वाले रिकॉर्ड), जिससे कृत्रिम कौशल का भ्रम पैदा होता है।
- आशावादी निष्पादन (Optimistic Execution): रिपोर्ट किए गए रिटर्न अक्सर ट्रेडिंग लागतों (स्प्रेड, स्लिपेज, टर्नओवर) की अनदेखी करते हैं, जो वास्तविक तैनात अनुमानों के बजाय केवल ऊपरी सीमा प्रस्तुत करते हैं।
- अनिवार्य निर्देशों का प्रवर्तन न होना (Unenforced Mandates): प्राकृतिक भाषा के जोखिम प्रतिबंधों (जैसे, "रूढ़िवादी," "अधिकतम 20 नाम") को अक्सर पोस्ट-होक स्कोरिंग के लिए सॉफ्ट प्राथमिकताओं के रूप में माना जाता है, न कि निष्पादित पोर्टफोलियो पर लागू कठोर बाधाओं के रूप में।
मौजूदा बेंचमार्क अक्सर इन मुद्दों को एक साथ नियंत्रित करने में विफल रहते हैं, विशेष रूप से पॉइंट-इन-टाइम (PIT) डेटा गेटिंग और सख्त मैंडेट प्रवर्तन के मामले में।
2. कार्यप्रणाली: OpenPM फ्रेमवर्क
OpenPM एक ऑडिट करने योग्य, पॉइंट-इन-टाइम मूल्यांकन ढांचा है जिसे विश्वसनीय मूल्यांकन को एक इंजीनियरिंग आर्टिफैक्ट (engineering artifact) के रूप में मानने के लिए डिज़ाइन किया गया है।
मुख्य डिजाइन सिद्धांत
- पॉइंट-इन-टाइम डेटा वातावरण: सिस्टम एक सख्त "उपलब्धता गेट" (availability gate) लागू करता है। एक रिकॉर्ड निर्णय समय पर एजेंट के स्टेट में तभी प्रवेश करता है जब उसका
ts_availableहो। यह इवेंट टाइम और उपलब्धता टाइम के बीच अंतर करता है (उदाहरण के लिए, एक त्रैमासिक फाइलिंग केवल EDGAR स्वीकृति के बाद ही उपलब्ध होती है)। वातावरण एक S&P 500 यूनिवर्स को 5-मिनट के मार्केट-स्टेट अवलोकनों के साथ कवर करता है। - मैंडेट प्रवर्तन (Mandate Enforcement): प्राकृतिक भाषा के जोखिम निर्देशों को टाइप किए गए बाधाओं (जैसे, प्रति नाम अधिकतम वेट, नामों की अधिकतम संख्या) में पार्स किया जाता है। महत्वपूर्ण रूप से, ये एक डिटरमिनिस्टिक इन-लूप क्रिटिक (deterministic in-loop critic) द्वारा लागू किए जाते हैं जो निष्पादन से पहले एजेंट के प्रस्तावित वेट्स को व्यवहार्य सेट (feasible set) पर प्रोजेक्ट करता है, न कि केवल पोस्ट-होक स्कोरिंग के रूप में।
- लागत-जागरूक निष्पादन (Cost-Aware Execution): रिटर्न की गणना साइड-अवेयर हाफ-स्प्रेड्स (खरीद 'ask' पर, बिक्री 'bid' पर) का उपयोग करके की जाती है, जिसमें कोई मार्केट इम्पैक्ट मॉडलिंग नहीं है, जो एक रूढ़िवादी लेकिन यथार्थवादी लागत आधार प्रदान करता है।
टियर्ड एलोकेटर (संदर्भ एजेंट)
यह पेपर विशिष्ट ट्रेडिंग पाइपलाइन घटकों को अलग करने के लिए एक संदर्भ एजेंट आर्किटेक्चर पेश करता है:
- मैंडेट कंपाइलेशन: प्राकृतिक भाषा को टाइप किए गए बाधाओं में परिवर्तित करता है।
- लिक्विडिटी गेट: ट्रेड करने योग्य नामों (जैसे, लिक्विडिटी के आधार पर शीर्ष 50) के लिए यूनिवर्स को फ़िल्टर करता है।
- एनालिस्ट टियर: छह समानांतर LLM एनालिस्ट स्वतंत्र रूप से टाइप किए गए चैनलों (तकनीकी, रिजीम, इवेंट्स, न्यूज, 8-K आइटम्स, 10-K/10-Q नैरेटिव्स) के माध्यम से उम्मीदवारों को स्कोर करते हैं।
- कंस्ट्रक्टर: एक अलग LLM पोर्टफोलियो वेट्स का प्रस्ताव देता है, जो एग्रीगेटेड एनालिस्ट स्कोर और स्प्रेड्स के आधार पर होता है, लेकिन बिना कच्चे (raw) कीमतों या कंपोजिट स्कोर के।
- डिटरमिनिस्टिक क्रिटिक: कंस्ट्रक्टर के प्रस्ताव को व्यवहार्य सेट (लॉन्ग-ओनली, नाम कैप्स, लिक्विडिटी लिमिट्स को लागू करते हुए) पर प्रोजेक्ट करता है।
- फिल सिम्युलेटर: कोटेड साइड्स पर ट्रेड निष्पादित करता है।
प्रयोगात्मक सेटअप
- डेटासेट: S&P 500 (508 नाम) का एक फ्रोजन, कंटेंट-हैश्ड स्नैपशॉट जो 19 फरवरी, 2026 से 1 मई, 2026 के बीच सक्रिय था। मूल्यांकन विंडो 2 मार्च, 2026 से 1 मई, 2026 (44 ट्रेडिंग डेज़) तक है।
- आइसोलेशन स्ट्रैटेजी: "कंस्ट्रक्टर" क्षमता को अलग करने के लिए, लेखक साक्ष्य के एक "फ्रोजन कैप्चर" को बनाने के लिए एनालिस्ट टियर को एक बार चलाते हैं। इस समान साक्ष्य को फिर विभिन्न कंस्ट्रक्टर मॉडल्स (gpt-5, Opus-4.7, DeepSeek-V3.2, Qwen3-Max, gpt-4o-mini) के माध्यम से फिर से चलाया जाता है ताकि यह निर्धारित किया जा सके कि क्या कंस्ट्रक्टर सिग्नल की गुणवत्ता के स्वतंत्र रूप से मूल्य जोड़ता है।
- मोड्स: प्रयोग "वन्स-देन-होल्ड" (एकल रीबैलेंस) और डेली रीबैलेंसिंग मोड्स में चलते हैं।
3. मुख्य परिणाम
पेपर पूर्ण अल्फा दावों के बजाय संरचनात्मक निष्कर्षों की रिपोर्ट करता है, जो एक एकल फ्रोजन विंडो पर ऊपरी सीमाओं पर जोर देता है।
कंस्ट्रक्टर क्षमता
- सशर्त लाभ (Conditional Gains): मजबूत कंस्ट्रक्टर्स (जैसे, gpt-5, Opus-4.7) उसी कैंडिडेट पूल के इक्वल-वेटिंग (EW) पर मामूली, मॉडल-निर्भर लाभ दिखाते हैं, लेकिन केवल तभी जब अपस्ट्रीम एनालिस्ट सिग्नल मजबूत हो।
- एनालिस्ट डोमिनेंस: प्रदर्शन का प्राथमिक चालक एनालिस्ट टियर की गुणवत्ता है। जब एनालिस्ट कैप्चर कमजोर था (DeepSeek-V3.2), तो कोई भी कंस्ट्रक्टर समान-पूल EW बेसलाइन को नहीं हरा सका। जब कैप्चर मजबूत था (gpt-5), तो अधिकांश कंस्ट्रक्टर्स ने EW को पछाड़ा।
- ओवरलैप: मजबूत कंस्ट्रक्टर्स काफी हद तक EW रोस्टर को पुन: भारित (re-weight) करते हैं (75–78% ओवरलैप), न कि उसे पूरी तरह से बदलते हैं। कमजोर कंस्ट्रक्टर्स काफी भिन्न होते हैं और कम प्रदर्शन करते हैं।
लागत और टर्नओवर
- टर्नओवर मुख्य लागत चालक है: डेली रीबैलेंसिंग में, टर्नओवर प्रमुख लागत कारक बन जाता है। उच्च-टर्नओवर वाले मॉडल्स (जैसे, Qwen3-Max, gpt-4o-mini) ने अपने नेट रिटर्न्स को कम प्रदर्शन करने वाले मॉडल्स की तुलना में कॉस्ट ड्रैग के कारण SPY बेंचमार्क से नीचे गिरा दिया, जबकि उनके ग्रॉस रिटर्न्स कम-टर्नओवर वाले मॉडल्स के समान थे।
- अनुशासन मायने रखता है: जीतने वाला पैटर्न अच्छा चयन करना और कम व्यापार करना है। केवल कम टर्नओवर पर्याप्त नहीं है (gpt-5 का टर्नओवर सबसे कम था लेकिन उस विशिष्ट रिजीम में खराब चयन के कारण इसने SPY को पीछे छोड़ दिया)।
अनुपालन और ऑडिटिंग
- मैंडेट एडहेरेंस: सभी कंस्ट्रक्टर्स ने अपने कच्चे प्रस्तावों में स्पष्ट संख्यात्मक कैप्स (जैसे, 10% मैक्स वेट) का सफलतापूर्वक पालन किया।
- क्रिटिक की आवश्यकता: लिक्विडिटी बाधाओं (हार्ड क्लिप्स) को लागू करने के लिए डिटरमिनिस्टिक क्रिटिक आवश्यक था जो मैंडेट से अधिक सख्त और मॉडल के लिए अदृश्य थे।
- संदूषण (Contamination): सभी रन 'कंटामिनेशन सर्टिफिकेट' पास कर गए, जिससे पुष्टि हुई कि कोई लुक-अहेड लीकेज नहीं हुआ है।
4. महत्व और दावे
यह पेपर OpenPM को एक प्रमाणित अल्फा जनरेटर के रूप में नहीं, बल्कि LLM ट्रेडिंग समुदाय के लिए एक डायग्नोस्टिक टूल के रूप में स्थापित करता है।
- इंजीनियरिंग आर्टिफैक्ट: यह मूल्यांकन को एक इंजीनियरिंग समस्या के रूप में फिर से परिभाषित करता है जिसके लिए सख्त डेटा कॉन्ट्रैक्ट्स, उपलब्धता गेटिंग और डिटरमिनिस्टिक एनफोर्समेंट लेयर्स की आवश्यकता होती है।
- दावों में ईमानदारी: लेखक स्पष्ट रूप से कहते हैं कि सभी रिटर्न "एक एकल फ्रोजन विंडो पर ऊपरी सीमाएँ हैं, बिना मार्केट इम्पैक्ट के, प्रमाणित अल्फा नहीं।" लक्ष्य हर रिपोर्ट किए गए नंबर को विशिष्ट स्थितियों (डेटा फिंगरप्रिंट, कॉस्ट मॉडल, मैंडेट) से बांधकर दावों को ईमानदार रखना है।
- डायग्नोस्टिक अंतर्दृष्टि: फ्रेमवर्क प्रकट करता है कि "कंस्ट्रक्शन स्किल" अक्सर "एनालिस्ट सिग्नल क्वालिटी" का प्रॉक्सी होता है। पेपर का तर्क है कि कंप्यूट को एनालिस्ट टियर के लिए प्राथमिकता दी जानी चाहिए, जिसके बाद सबसे सस्ते सक्षम कंस्ट्रक्टर का उपयोग किया जाए।
- ऑडिटेबिलिटी: हर रन के लिए कंटामिनेशन सर्टिफिकेट, कॉस्ट-सेंसिटिविटी कर्व्स और कंस्ट्रेंट-एडहेरेंस रिपोर्ट्स जैसे आर्टिफैक्ट्स जेनरेट करके, OpenPM शोधकर्ताओं को यह सत्यापित करने की अनुमति देता है कि परिणाम डेटा लीकेज या आशावादी निष्पादन धारणाओं के आर्टिफैक्ट तो नहीं हैं।
संक्षेप में, OpenPM यह प्रदर्शित करता है कि जबकि LLMs विशिष्ट परिस्थितियों में सरल बेसलाइन्स से बेहतर पोर्टफोलियो बना सकते हैं, उनका प्रदर्शन अपस्ट्रीम सिग्नल क्वालिटी पर बहुत अधिक निर्भर करता है और टर्नओवर लागतों से आसानी से कम हो सकता है। फ्रेमवर्क वास्तविक कौशल और मूल्यांकन आर्टिफैक्ट्स के बीच अंतर करने के लिए आवश्यक कठोरता प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।