← नवीनतम पेपर
💰 quantitative finance

CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents

यह शोध पत्र CLQT को प्रस्तुत करता है, जो एक क्लोज्ड-लूप, लागत-जागरूक और रणनीति-संगत बेंचमार्क है जो LLM पोर्टफोलियो-प्रबंधन एजेंटों के मूल्यांकन को सरल रिटर्न-आधारित रैंकिंग से बदलकर एक नैदानिक ढांचे में परिवर्तित करता है जो विशिष्ट तर्क विफलताओं को अलग करने और एक सत्यापन योग्य, बहु-चरणीय ट्रेडिंग चक्र के माध्यम से टिकाऊ दक्षताओं को मापने में सक्षम है।

मूल लेखक: Bo Qu, Mingguang Chen

प्रकाशित 2026-06-30
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bo Qu, Mingguang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने पैसे का प्रबंधन करने के लिए रोबोट वित्तीय सलाहकारों की एक टीम को काम पर रख रहे हैं। अतीत में, लोगों ने इन रोबोटों का परीक्षण सरल प्रश्न पूछकर किया था जैसे, "एप्पल स्टॉक की कीमत क्या है?" या यह देखकर कि एक तिमाही में किसने सबसे अधिक पैसा बनाया।

इस शोध पत्र के लेखक तर्क देते हैं कि पुराने परीक्षण दोषपूर्ण हैं। वे ऐसे हैं जैसे किसी शेफ का मूल्यांकन केवल इस आधार पर करना कि उसके व्यंजन में कितनी कैलोरी है, बिना यह चखे कि भोजन कैसा है या यह जांचे कि क्या उसने वास्तव में रेसिपी का पालन किया। एक रोबोट केवल इसलिए बहुत पैसा बना सकता है क्योंकि उस दिन बाजार ऊपर गया था, न कि इसलिए कि वह वास्तव में बुद्धिमान है। या, वह कल की खबरों को "झाँककर" (peeking) धोखाधड़ी कर सकता है।

यह पेपर AI एजेंटों का परीक्षण करने का एक नया तरीका पेश करता है जिसे CLQT कहा जाता है। CLQT को एक दौड़ के रूप में न देखें कि कौन जीतता है, बल्कि इसे AI के लिए एक मेडिकल डायग्नोस्टिक टूल (नैदानिक उपकरण) के रूप में समझें। AI को एक एकल स्कोर (जैसे "गोल्ड मेडल") देने के बजाय, यह AI को पांच विशिष्ट महत्वपूर्ण संकेतों (vitals) के साथ एक विस्तृत स्वास्थ्य रिपोर्ट कार्ड देता है।

CLQT कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. "धोखाधड़ी न करने" का नियम (द टाइम गेट)

कल्पना कीजिए कि एक परीक्षा है जहाँ छात्रों को परीक्षा शुरू होने से पहले ही उत्तर कुंजी देखने की अनुमति दी जाती है। कई पुराने परीक्षणों में AI के साथ ऐसा ही हुआ; उन्होंने अनजाने में AI को भविष्य के डेटा को देख लेने दिया।
CLQT में एक सख्त "टाइम गेट" (समय द्वार) है। यह एक सुरक्षा गार्ड की तरह है जो घड़ी की जाँच करता है। AI को केवल उसी जानकारी का उपयोग करने की अनुमति है जो उसके निर्णय लेने से पहले मौजूद थी। यदि वह कल की स्टॉक कीमतों को झाँकने की कोशिश करता है, तो परीक्षण तुरंत विफल हो जाता है। यह सुनिश्चित करता है कि AI वास्तव में सोच रहा है, न कि केवल याद कर रहा है।

2. पांच-भाग वाला स्वास्थ्य परीक्षण (द स्कोरकार्ड)

"आपने कितना पैसा कमाया?" पूछने के बजाय, CLQT पांच गहरे प्रश्न पूछता है। यह AI को प्रत्येक पर 0 से 100 तक स्कोर देता है:

  • कोहेरेंस (Coherence - "कहानीकार" परीक्षण): क्या AI का कार्य उसकी अपनी कहानी से मेल खाता है?
    • उदाहरण: कल्पना कीजिए कि एक ड्राइवर कहता है, "मैं धीरे गाड़ी चलाऊंगा क्योंकि बारिश हो रही है," लेकिन फिर वह अचानक एक्सीलेटर दबा देता है। CLQT जाँचता है कि क्या AI का तर्क उसके वास्तविक ट्रेडों से मेल खाता है। शोध पत्र में पाया गया कि कई AI बेहतरीन कहानी सुनाते हैं लेकिन कुछ बिल्कुल अलग ही करते हैं।
  • एक्यूटी (Acuity - "फोकस" परीक्षण): क्या AI शोर को अनदेखा कर सकता है?
    • उदाहरण: कल्पना कीजिए कि आप एक शोर भरे स्टेडियम में अपने दोस्त की बात सुनने की कोशिश कर रहे हैं। कुछ AI हर तेज़ आवाज़ (रैंडम प्राइस जंप) से विचलित हो जाते हैं और महत्वपूर्ण संकेत (असली ट्रेंड्स) को भूल जाते हैं। CLQT मापता है कि क्या AI सही चीजों पर ध्यान केंद्रित कर सकता है।
  • कंपोजर (Composure - "धैर्य" परीक्षण): जब चीजें अस्थिर होती हैं, तो क्या AI घबरा जाता है?
    • उदाहरण: जब शेयर बाजार अचानक गिरता है, तो एक शांत निवेशक स्थिर रहता है। एक घबराया हुआ व्यक्ति सब कुछ उन्माद में बेच देता है। CLQT जाँचता है कि क्या AI छोटी बाधाओं पर अत्यधिक प्रतिक्रिया देता है या अनुशासित रहता है।
  • डिसिप्लिन (Discipline - "नियम का पालन करने वाला" परीक्षण): क्या AI योजना पर टिका रहता है?
    • उदाहरण: यदि आप एक रोबोट को कहते हैं, "केवल नीली शर्ट खरीदें," और वह लाल शर्ट खरीद लेता है, तो उसमें अनुशासन की कमी है। CLQT जाँचता है कि क्या AI बिना किसी मानवीय हस्तक्षेप के अपने नियमों और बजट सीमाओं का सम्मान करता है।
  • रिलायबिलिटी (Reliability - "स्टैमिना" परीक्षण): क्या रोबोट वास्तव में काम पूरा करता है?
    • उदाहरण: कुछ रोबट काम शुरू करते हैं, भ्रमित हो जाते हैं, क्रैश हो जाते हैं या बीच में ही हार मान लेते हैं। CLQT गिनता है कि AI कितनी बार बिना रुके अपने सोचने और कार्य करने के पूर्ण चक्र को सफलतापूर्वक पूरा करता है।

3. "दो मोड" वाला प्रयोग

शोधकर्ताओं ने दो अलग-अलग "व्यक्तित्व" मोड में AI का परीक्षण किया:

  • स्ट्रक्चर्ड मोड (संरचित मोड): AI एक सख्त समिति की तरह कार्य करता है। उसे एक चरण-दर-चरण चेकलिस्ट का पालन करना होता है (जैसे पायलट की प्री-फ्लाइट चेकलिस्ट)।
  • ऑटोनॉमस मोड (स्वायत्त मोड): AI को जो वह सबसे अच्छा समझता है, वह करने की पूरी स्वतंत्रता दी जाती है, बिना किसी चेकलिस्ट के।

चौंकाने वाला निष्कर्ष:
शोध पत्र में पाया गया कि "स्वतंत्रता" हमेशा AI को स्मार्ट नहीं बनाती।

  • कुछ AI (जैसे कि DeepSeek) को पूरी स्वतंत्रता दी जाने पर वे खराब प्रदर्शन करते थे, लेकिन चेकलिस्ट का पालन करने के लिए मजबूर किए जाने पर वे उत्कृष्ट हो गए।
  • अन्य AI (जैसे कि Claude) वास्तव में बेहतर प्रदर्शन करते थे जब उन्हें पूरी स्वतंत्रता दी गई थी।
  • सबक: आप केवल यह नहीं कह सकते कि "AI अच्छा है" या "AI बुरा है।" आपको यह जानना होगा कि कौन सा AI किस प्रकार के प्रबंधन के साथ सबसे अच्छा काम करता है।

4. "वास्तविक दुनिया" बनाम "सिमुलेशन"

शोध पत्र ने एक वर्ष के लिए एक सिमुलेशन चलाया और एक वास्तविक ब्रोकर का उपयोग करके दो सप्ताह के लिए एक "लाइव" परीक्षण भी किया (लेकिन नकली पैसे के साथ)।

  • परिणाम: "स्वास्थ्य जाँच" दोनों में पूरी तरह से काम करती है। भले ही AI ने पहले कभी लाइव डेटा नहीं देखा था, फिर भी परीक्षण आपको बता सकता था कि वह शांत, केंद्रित या विश्वसनीय है।
  • "गैप" (अंतर): शोध पत्र ने पाया कि AI जो कहता है कि वह करेगा और जो वह वास्तव में करता है, उसके बीच एक निरंतर अंतर है। लाइव परीक्षण में भी, AI के कार्य अक्सर उसके तर्क से मेल नहीं खाते थे। यह सुझाव देता है कि AI "बातें करने में" अच्छा है लेकिन कभी-कभी "काम करने में" संघर्ष करता है।

5. यह क्यों मायने रखता है ( "मैप" बनाम "लीडरबोर्ड")

लेखक कहते हैं: "लीडरबोर्ड देखना बंद करें।"
पुराने परीक्षण AI को 1 से 10 तक रैंक करने की कोशिश करते थे। यह पेपर कहता है कि यह बेकार है क्योंकि बाजार बदलता रहता है। एक AI जो आज जीत रहा है, वह कल हार सकता है।

इसके बजाय, CLQT सीमाओं का एक मैप (मानचित्र) प्रदान करता है।

  • यह आपको बताता है: "यह AI शांत रहने में बहुत अच्छा है लेकिन नियमों का पालन करने में बुरा है।"
  • यह आपको बताता है: "यह AI बुद्धिमान है लेकिन यदि इसे सोचने के लिए पर्याप्त समय नहीं दिया गया तो यह क्रैश हो जाता है।"

सारांश

CLQT निवेश करने वाले AI का परीक्षण करने का एक नया, कठोर तरीका है। यह उन्हें धोखाधड़ी करने से रोकता है, उन्हें अपने तर्क समझाने के लिए मजबूर करता है, और उनके व्यक्तित्व और आदतों पर एक विस्तृत रिपोर्ट कार्ड देता है। यह साबित करता है कि सिमुलेशन में पैसा बनाना यह नहीं दर्शाता कि AI वास्तव में स्मार्ट है; यह केवल भाग्यशाली हो सकता है। वास्तविक मूल्य "विजेता" को खोजने में नहीं है, बल्कि यह समझने में है कि प्रत्येक AI कहाँ मजबूत है और कहाँ उसके विफल होने की संभावना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →