From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate
यह शोध पत्र प्रदर्शित करता है कि जहाँ यूरोपीय सूचीबद्ध रियल एस्टेट विश्लेषण को विशिष्ट एलएलएम (LLM) एजेंटों में विभाजित करने से संख्यात्मक कार्य प्रदर्शन में महत्वपूर्ण सुधार होता है, वहीं एकीकृत वित्तीय निर्णय क्षमता को बढ़ाने के लिए केवल प्रॉम्प्ट-स्तरीय अपघटन के बजाय सुदृढीकरण लर्निंग (GRPO) के माध्यम से लक्षित पैरामीटर अनुकूलन की आवश्यकता होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को वित्तीय विश्लेषक (financial analyst) बनना सिखाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन रोबोटों को 'लार्ज लैंग्वेज मॉडल्स' (LLMs) कहा जाता है। इन्हें उन अविश्वसनीय रूप से पढ़े-लिखे छात्रों के रूप में समझें जिन्होंने पुस्तकालय की लगभग हर किताब पढ़ ली है, लेकिन जब उनसे कुछ विशिष्ट या कठिन गणित करने या विभिन्न नियमों के मिश्रण के आधार पर कोई जटिल निर्णय लेने के लिए कहा जाता है, तो वे कभी-कभी भ्रमित हो जाते हैं। यह शोध पत्र विज्ञान के उस कोने में रहता है जहाँ शोधकर्ता यह पता लगाने की कोशिश करते हैं कि इन रोबकारों को पैसा और व्यावसायिक नियमों को संभालने के लिए "प्रशिक्षित" करने का सबसे अच्छा तरीका क्या है। मुख्य सवाल यह है: क्या रोबोट से एक ही बार में सब कुछ करने के लिए कहना बेहतर है, या हमें काम को विभाजित करके उसे अलग-अलग विशेषज्ञों की एक टीम के रूप में कार्य करने के लिए कहना चाहिए? यह कुछ इस तरह है जैसे पूछना, "क्या एक अकेले प्रतिभाशाली शेफ से पूरा भोज पकाने के लिए कहना बेहतर है, या एक ऐसी रसोई जिसमें एक समर्पित बेकर, एक समर्पित ग्रिल मास्टर और एक समर्पित सॉस विशेषज्ञ हो?"
शोधकर्ताओं ने इस विचार का परीक्षण करने के लिए एक बहुत ही विशिष्ट और कठिन विषय का उपयोग किया: यूरोपीय रियल एस्टेट कंपनियां। ये कंपनियां उन पड़ोसियों के समूह की तरह हैं जो एक ही इमारत में रहते हैं लेकिन जिस देश में वे रहते हैं, उसके आधार पर अलग-अलग नियमों का पालन करते हैं। कुछ को अपने मुनाफे का अधिकांश हिस्सा लाभांश (dividends) के रूप में देना पड़ता है, जबकि अन्य को कुछ भी नहीं देना पड़ता। यदि आप गलत कंपनी के लिए गलत नियम का उपयोग करते हैं, तो गणित गलत हो जाता है, और निवेश की सलाह खतरनाक हो जाती है। टीम यह देखना चाहती थी कि क्या विश्लेषण को "विशेषज्ञ" भूमिकाओं में विभाजित करने से रोबोट को आंकड़े सही करने में मदद मिली, और क्या इससे रोबोट को यह बड़े, जटिल निर्णय लेने में मदद मिली कि क्या किसी कंपनी में निवेश करना सुरक्षित है।
विशेषज्ञों की टीम बनाम एक व्यक्ति का शो
अपने विचार का परीक्षण करने के लिए, शोधकर्ताओं ने "लारिक्स" (Larix) नामक एक प्रणाली बनाई। कल्पना कीजिए कि लारिक्स एक मैनेजर के रूप में है जिसके पास एक रियल एस्टेट कंपनी का विश्लेषण करने के लिए एक विशाल 16-चरणीय चेकलिस्ट है। पूरे चेकलिस्ट को एक रोबोट को सौंपकर यह कहने के बजाय कि, "यह सब खुद करो," लारिक्स एक अलग दृष्टिकोण अपनाता है। यह चेकलिस्ट को आठ छोटी टीमों, या "विशेषज्ञों" में विभाजित करता है। एक टीम "वित्तीय" (Financials) विशेषज्ञ है, दूसरी "परिसंपत्ति गुणवत्ता" (Asset Quality) विशेषज्ञ है, और तीसरी "मैक्रो ओवरले" (Macro Overlay) विशेषज्ञ है।
शोधकर्ताओं ने एक बहुत ही शक्तिशाली रोबोट (एक "फ्रंटियर" मॉडल) के साथ एक दौड़ आयोजित की ताकि देखा जा सके कि कौन जीतेगा। पहली दौड़ में, रोबोट को अकेले सब कुछ करना था ("मोनोलिथिक" दृष्टिकोण)। दूसरी दौड़ में, रोबोट को पूरी 16-चरणीय चेकलिस्ट दी गई थी लेकिन फिर भी उसे यह सब अकेले ही करना था। तीसरी दौड़ में, रोबोट को एक विशिष्ट विशेषज्ञ भूमिका, जैसे कि "वित्तीय" विशेषज्ञ, सौंपी गई थी और उसे केवल चेकलिस्ट का वही हिस्सा दिया गया जो उस काम के लिए प्रासंगिक था।
परिणाम आश्चर्यजनक और बहुत स्पष्ट थे। जब बात उबाऊ, यांत्रिक गणित की थी—जैसे किसी रिपोर्ट में एक विशिष्ट संख्या ढूंढना या एक साधारण गणना करना—तो विशेषज्ञ दृष्टिकोण एक बड़ा विजेता रहा। विशेषज्ञ के रूप में कार्य करने वाले रोबोट ने उन कार्यों को सही ढंग से किया जिन्हें करने में "एक व्यक्ति वाला शो" वाला रोबोट विफल रहा था। विशेषज्ञ रोबोट ने उन संख्यात्मक कार्यों को 15.8 प्रतिशत अंक अधिक बार सही किया जितना कि वह रोबोट जिसने एक साथ सब कुछ करने की कोशिश की थी। यह ऐसा है जैसे विशेषज्ञ रोबोट ने शोर रद्द करने वाले हेडफ़ोन लगा लिए हों, सभी भ्रमित करने वाले अतिरिक्त निर्देशों को अनदेखा कर दिया हो, और बस गणित पर ध्यान केंद्रित किया हो।
हालाв, जब "निर्णय" (judgment) वाले कार्यों की बात आई—जहाँ रोबको को विभिन्न साक्ष्यों को देखना था और यह तय करना था कि कोई कंपनी जोखिम भरी है या सुरक्षित—तो विशेषज्ञ दृष्टिकोण ने बिल्कुल भी मदद नहीं की। वास्तव में, इसने चीजों को और भी खराब कर दिया। विशेषज्ञ के रूप में कार्य करने वाले रोबोट का स्कोर उन कार्यों पर भी उतना ही था जितना कि अकेले सब कुछ करने वाले रोबोट का। यह स्पष्ट है कि एक अच्छा निर्णय लेने के लिए, आपको वास्तव में पूरी तस्वीर देखने की आवश्यकता होती है, न कि केवल एक संकीकर हिस्से की। काम को विभाजित करके, रोबोट सूचना के विभिन्न टुकड़ों के बीच के संबंधों को समझने में चूक गया।
"मस्तिष्क" को प्रशिक्षित करने का जादू
शोधकर्ताओं ने फिर दूसरा सवाल पूछा: यदि काम को टुकड़ों में बांटने से कठिन निर्णयों में मदद नहीं मिलती है, तो क्या हम रोबोट के मस्तिष्क को बेहतर बनाने के लिए उसे "प्रशिक्षित" कर सकते हैं? उन्होंने एक छोटे, सस्ते रोबोट (Qwen3.5-9B नामक 9-बिलियन-पैरामीटर मॉडल) को लिया और उसे "ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन विद रीइन्फोर्समेंट लर्निंगिंग" (GRPO) नामक एक विशेष प्रकार का प्रशिक्षण दिया।
इस प्रशिक्षण को एक वीडियो गेम की तरह समझें जहाँ रोबोट को हर बार सही उत्तर देने पर उच्च स्कोर मिलता है और गलत होने पर कम स्कोर मिलता है। समय के साथ, रोबोट अपने आंतरिक "मस्तिष्क सेटिंग्स" को समायोजित करना सीखता है ताकि वह अधिक उच्च स्कोर प्राप्त कर सके। उन्होंने इसे केवल उत्तर रटने के लिए नहीं सिखाया; उन्होंने इसे खेल के नियमों को समझने के लिए प्रशिक्षित किया।
यह प्रशिक्षण निर्णय कार्यों के लिए जादू की तरह काम कर गया। प्रशिक्षण के बाद, निर्णय कार्यों पर छोटे रोबोट का स्कोर 14.2 अंक बढ़ गया। यह केवल उन कंपनियों पर बेहतर नहीं हुआ जिनका उसने अभ्यास किया था; यह उन कंपनियों पर भी बेहतर हुआ जिन्हें उसने पहले कभी नहीं देखा था। जब पूरी तरह से नई फर्मों पर परीक्षण किया गया, तो इसका समग्र स्कोर 15.2 अंक बढ़ गया, और एक विशिष्ट "कौवेंट स्ट्रेस" (covenant stress) परीक्षण (यह जांचना कि क्या कोई कंपनी वित्तीय संकट को झेल सकती है) पर, इसमें 40.4 अंक की भारी वृद्धि हुई।
मुख्य निष्कर्ष
तो, इस शोध पत्र ने वास्तव में क्या पाया? यह सुझाव देता है कि रोबोट का उपयोग करने का कोई एक "सर्वश्रेष्ठ" तरीका नहीं है। यह पूरी तरह से इस बात पर निर्भर करता है कि आप रोबोट से क्या करने के लिए कह रहे हैं।
- संख्याओं और गणित के लिए: काम को विशेषज्ञों में विभाजित करना ही सही रास्ता है। यह रोबोट को ध्यान केंद्रित करने और विकर्षणों को अनदेखा करने में मदद करता है, जिससे गणना बहुत अधिक सटीक हो जाती है।
- बड़ी तस्वीर वाले निर्णयों के लिए: काम को विभाजित करना मदद नहीं करता है। इसके बजाय, आपको रोबोट के मस्तिष्क को सीधे "प्रशिक्षित" करने की आवश्यकता है ताकि वह विभिन्न सूचनाओं के बीच संबंध बनाना सीख सके।
शोधकर्ता सावधान रहे कि यह सब कुछ हल करने वाला कोई जादुई समाधान नहीं है। उन्होंने दिखाया कि केवल रोबोट को नियमों की एक लंबी सूची देने से (पूर्ण 16-लेंस फ्रेमवर्क) समस्या हल नहीं हुई; बल्कि विशिष्ट विशेषज्ञता ने गणित में मदद की, और विशिष्ट प्रशिक्षण ने निर्णय लेने में मदद की। उन्होंने यह भी नोट किया कि उनके परिणाम 19 कंपनियों के एक विशिष्ट सेट और रियल एस्टेट के एक विशिष्ट प्रकार पर आधारित हैं, इसलिए हम 100% निश्चित नहीं हो सकते कि यह दुनिया के हर प्रकार के व्यवसाय के लिए बिल्कुल उसी तरह काम करेगा। लेकिन यूरोपीय रियल एस्टेट की दुनिया के लिए सबक स्पष्ट है: गणित के लिए विशेषज्ञों की एक टीम का उपयोग करें, और बड़े निर्णयों के लिए एक अच्छी तरह से प्रशिक्षित सामान्य विशेषज्ञ (generalist) का उपयोग करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।