← नवीनतम पेपर
🤖 machine learning

Representation Signatures and Risk-Feedback Alignment in LLM Trading Agents

यह शोध पत्र TradeArena प्रस्तुत करता है, जो एक ऑडिट करने योग्य टेस्टबेड है जो यह प्रदर्शित करता है कि विशिष्ट रिप्रजेंटेशन सिग्नेचर—जैसे कि एम्बेडिंग ड्रिफ्ट और प्रभावी-रैंक संकुचन (effective-rank contraction)—LLM ट्रेडिंग एजेंट की विफलताओं के शुरुआती संकेतक के रूप में कार्य कर सकते हैं, जबकि यह भी प्रकट करता है कि संरचित जोखिम फीडबैक, लाभप्रदता को सार्वभौमिक रूप से बढ़ाने के बिना, एलाइनमेंट डायग्नोस्टिक्स में सुधार करता है।

मूल लेखक: Weicheng Xue

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weicheng Xue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास बहुत बुद्धिमान, विद्वान रोबोट ट्रेडर्स की एक टीम है। वे समाचार पढ़ सकते हैं, चार्ट देख सकते हैं और स्टॉक खरीदने और बेचने के बारे में जटिल निर्णय ले सकते हैं। लेकिन समस्या यह है कि कभी-कभी ये रोबोट भयानक गलतियाँ करते हैं, जिससे वे ऐसे तरीकों से पैसा गंवा देते हैं जिनकी भविष्यवाणी करना कठिन होता है।

यह शोध पत्र एक नया "ट्रेनिंग जिम" पेश करता है जिसे TradeArena कहा जाता है। केवल अंतिम स्कोर (उन्होंने कितना पैसा कमाया या गंवाया) देखने के बजाय, यह जिम उस हर विचार, हिचकिचाहट और रिस्क-चेक को रिकॉर्ड करता है जो रोबोट इस प्रक्रिया के दौरान करता है। शोधकर्ताओं ने इस जिम का उपयोग एक सरल प्रश्न का उत्तर देने के लिए किया: क्या हम पैसा गंवाने से पहले ही रोबोट के "घबराने" या "अपना मानसिक संतुलन खोने" को देख सकते हैं?

यहाँ मुख्य खोजें दी गई हैं, जिन्हें रोजमर्रा के उदाहरणों के माध्यम से समझाया गया है:

1. "टनल विजन" (सीमित दृष्टि) का चेतावनी संकेत

सबसे बड़ी खोज यह है कि किसी भी वित्तीय नुकसान से पहले, रोबोट के सोचने का तरीका पता लगाने योग्य तरीके से बदल जाता है।

  • उदाहरण: कल्पना कीजिए कि एक ड्राइवर एक खतरनाक मोड़ की ओर बढ़ रहा है। एक सामान्य ड्राइवर इधर-उधर देखता है, शीशों की जांच करता है और विभिन्न रास्तों पर विचार करता है। लेकिन एक ड्राइवर जिसका एक्सीडेंट होने वाला है, वह अचानक सीधे सामने देखते हुए बाकी सब कुछ अनदेखा कर सकता है। उसका "मानसिक मानचित्र" सिकुड़ जाता है।
  • खोज: शोधकर्ताओं ने पाया कि वित्तीय नुकसान से पहले, रोबोट के आंतरिक "विचार पैटर्न" (जिन्हें गणितीय आकृतियों के रूप में दर्शाया गया है) वास्तव में सिकुड़ जाते हैं और कम विविध हो जाते हैं। वे इसे "इफेक्टिव-रैंक कॉन्ट्रैक्शन" (effective-rank contraction) कहते हैं। यह ऐसा है जैसे रोबोट "टनल विजन" में चला जाता है, यानी वह विचारों के एक संकीर्ण सेट पर ध्यान केंद्रित करने लगता है, भले ही बाजार जटिल हो। वे क्रैश होने से पहले इस सिकुड़न को लगभग 80% सटीकता के साथ पहचान सकते हैं।

2. जोखिम रिपोर्ट के लिए "झूठ पकड़ने वाला यंत्र" (Lie Detector)

रोबोट्स को एक "रिस्क कोच" दिया जाता है जो उन्हें बताता है कि क्या कोई ट्रेड बहुत खतरनाक है। शोधकर्ताओं ने परीक्षण किया कि क्या होता है जब कोच सच बोलता है, झूठ बोलता है, या चुप रहता है।

  • उदाहरण: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है।
    • सत्य (Truth): शिक्षक कहता है, "तुमने यह गलत किया क्योंकि तुमने पढ़ाई नहीं की थी।" छात्र सीखता है और सुधार करता है।
    • प्लेसबो (नकली सत्य): शिक्षक कहता है, "तुमने यह गलत किया," भले ही छात्र ने वास्तव में सही किया हो। छात्र भ्रमित हो जाता है और अनावश्यक रूप से खुद पर संदेह करने लगता है।
    • छिपा हुआ (Hidden): शिक्षक कुछ नहीं कहता। छात्र वही गलतियाँ करता रहता है।
  • खोज: जब रोबोट्स को अपने जोखिमों के बारे में सच्ची प्रतिक्रिया मिली, तो उन्होंने वास्तव में सुरक्षित रहना सीखा और बेहतर निर्णय लिए। लेकिन जब उन्हें नकली (प्लेसबो) प्रतिक्रिया मिली, तो वे अत्यधिक सतर्क या भ्रमित हो गए, भले ही उनके वास्तविक प्रदर्शन में कोई सुधार नहीं हुआ था। यह दर्शाता है कि रोबोट्स को वास्तव में खतरे को समझे बिना ही "सुरक्षित दिखने" के लिए मूर्ख बनाया जा सकता है।

3. "जुड़वा भ्रम" की गलती

शोधकर्ताओं ने 51 अलग-अलग स्टॉक्स के पोर्टफोलियो के साथ रोबोट्स का परीक्षण किया। उन्होंने एक विशिष्ट कमी (blind spot) की पहचान की।

  • उदाहरण: कल्पना कीजिए कि आप दो जुड़वा बच्चों को खरीद रहे हैं। आप सोचते हैं, "मैं जुड़वा A को खरीदूँगा क्योंकि वह बहुत अच्छा लग रहा है, और मैं जुड़वा B को भी खरीदूँगा क्योंकि वह भी बहुत अच्छा लग रहा है।" आपको यह अहसास नहीं होता कि यदि एक जुड़वा छींकता है, तो दूसरा भी छींकता है। आपने अनजाने में एक ही चीज़ पर दो बार दांव लगा दिया है।
  • खोज: रोबोट अक्सर उन स्टॉक जोड़ों पर बहुत अधिक वजन देते हैं जो बिल्कुल एक ही तरह से चलते हैं (जैसे दो टेक दिग्गज या दो तेल कंपनियाँ)। वे प्रत्येक स्टॉक के क्यों खरीदने लायक होने के बारे में लंबी, प्रभावशाली कहानियाँ लिखते थे, लेकिन वे यह समझने में विफल रहे कि दोनों को खरीदना एक दोहरा जोखिम है। "रिस्क कोच" को लगातार हस्तक्षेप करना पड़ता था और कहना पड़ता था, "रुको! तुम एक ही जोखिम पर दो बार दांव लगा रहे हो!"

4. "शोर" (Noise) का परीक्षण

शोधकर्ता यह सुनिश्चित करना चाहते थे कि "टनल विजन" की चेतावनी केवल अव्यवस्थित डेटा के कारण होने वाली कोई गड़बड़ी नहीं है।

  • उदाहरण: कल्पना कीजिए कि आप एक शोर भरे कमरे में अपने दोस्त की फुसफुसाहट सुनने की कोशिश कर रहे हैं। यदि कमरा और अधिक शोर वाला हो जाता है (अधिक शोर), तो क्या आप अभी भी फुसफुसाहट सुन सकते हैं?
  • खोज: उन्होंने डेटा में रैंडम "शोर" (नकली कीमतों के उतार-चढ़ाव) जोड़ा। 20% अधिक शोर के बावजूद, रोबोट अभी भी "टनल विजन" के चेतावनी संकेत दिखाते थे। यह साबित करता है कि चेतावनी रोबोट के सोचने के तरीके के बारे में है, न कि केवल उन अव्यवस्थित नंबरों के बारे में जिन्हें वे देख रहे हैं।

5. "भ्रम" (Hallucination) का जाल

कभी-कभी रोबोट तथ्य बना लेते हैं (जैसे ऐसी न्यूज़ स्टोरी बनाना जो कभी हुई ही नहीं)।

  • उदाहरण: एक रोबोट कहता है, "मैं इस स्टॉक को इसलिए खरीद रहा हूँ क्योंकि CEO ने अभी-अभी नोबेल पुरस्कार जीता है," जबकि CEO ने कभी नोबेल पुरस्कार नहीं जीता।
  • खोज: शोधकर्ताओं ने इन मनगढ़ंत तथ्यों को पकड़ने के लिए एक सिस्टम बनाया। उन्होंने पाया कि जब रोबतों ने तथ्य बनाए, तो "रिस्क कोच" को अक्सर ट्रेड को रोकना पड़ा। यह साबित करता है कि "रिस्क कोच" एक सुरक्षा जाल (safety net) के रूप में कार्य करता है, जो रोबोट के बेतुके अनुमानों को वास्तविक धन हानि बनने से पहले ही पकड़ लेता है।

निष्कर्ष (The Bottom Line)

यह शोध पत्र यह दावा नहीं करता कि ये रोबोट आपके रिटायरमेंट फंड को संभालने के लिए तैयार हैं या वे शेयर बाजार की सटीक भविष्यवाणी कर सकते हैं। वास्तव में, कई परीक्षणों में, उन्होंने बहुत अधिक पैसा नहीं कमाया।

इसके बजाय, यह शोध पत्र दावा करता है कि TradeArena निदान (Diagnosis) के लिए एक शक्तिशाली उपकरण है। यह हमें यह देखने की अनुमति देता है कि ये रोबोट कैसे सोचते हैं। यह हमें दिखाता है कि:

  1. रोबोट विफल होने से पहले "टनल विजन" के संकेत दिखाते हैं।
  2. रोबोट नकली फीडबैक से भ्रमित हो सकते हैं।
  3. रोबोट यह समझने में संघर्ष करते हैं कि कब दो चीजें वास्तव में एक ही जोखिम हैं।

मुख्य बात यह है कि पैसे के साथ AI पर भरोसा करने के लिए, हमें केवल लाभ के चार्ट को नहीं देखना चाहिए; हमें "विचार प्रक्रिया" (thought process) को देखना चाहिए कि क्या वह शांत है या घबराहट में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →