Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable
यह शोध पत्र कैपिटल मार्केट्स एलएलएम रिलायबिलिटी स्कोर (CM-LRS) को प्रस्तुत करता है, जो विनियमित वित्तीय वर्कफ़्लो में लार्ज लैंग्वेज मॉडल के आउटपुट की "बैंकबिलिटी" का आकलन करने के लिए डिज़ाइन किया गया एक नवीन सात-आयामी मूल्यांकन ढांचा है, जो यह प्रकट करता है कि जबकि फ्रंटियर मॉडल समग्र प्रदर्शन में बारीकी से क्लस्टर करते हैं, ओपन-वेट बेसलाइन्स की तुलना में रिट्रीवल और सिंथेसिस क्षमताओं में महत्वपूर्ण अंतराल बने हुए हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल पुस्तकालय में हैं जहाँ एक बैंक के लिए रिपोर्ट लिखने के लिए एक अत्यंत बुद्धिमान रोबोट को काम पर रखा गया है। यह रोबोट एक आर्टिफिशियल इंटेलिजेंस (AI) है जिसे लार्ज लैंग्वेज मॉडल (LLM) कहा जाता है, और यह लिखने में अविश्वसनीय रूप से प्रतिभाशाली है। यह एक अनुभवी विशेषज्ञ की तरह लग सकता है, इसका व्याकरण एकदम सटीक हो सकता है, और इसकी कहानी बहुत सुंदर ढंग से बह सकती है। लेकिन यहाँ एक पेंच है: उच्च-दांव वाले वित्त (high-stakes finance) की दुनिया में, केवल अच्छा सुनाई देना ही काफी नहीं है। यदि रोबोट कोई संख्या बना देता है, अपने स्रोतों की जाँच करना भूल जाता है, या किसी जटिल गणना में कोई चरण छोड़ देता है, तो यह बैंक को लाखों का नुकसान पहुँचा सकता है या उन्हें नियामकों (regulators) के साथ मुसीबत में डाल सकता है। बड़ा सवाल यह नहीं है कि "क्या रोबोट एक सुचारू वाक्य लिख सकता है?" बल्कि यह है कि "क्या रोबोट एक ऐसा वाक्य लिख सकता है जिस पर एक मानव विशेषज्ञ अपने करियर के साथ भरोसा कर सके?" यह शोध पत्र ठीक इसी समस्या की गहराई में जाता है, जो "क्या इसने सही उत्तर दिया?" जैसे सरल परीक्षणों से आगे बढ़कर इस गहरे परीक्षण की ओर बढ़ता है कि "क्या यह उत्तर उपयोग करने के लिए सुरक्षित है?"
लेखक एक नया उपकरण पेश करते हैं जिसे CM-LRS (कैपिटल मार्केट्स LLM रिलायबिलिटी स्कोर) कहा जाता है। इसे AI रिपोर्टों के लिए एक "सुरक्षा निरीक्षक" (safety inspector) के रूप में समझें। केवल पास या फेल का ग्रेड देने के बजाय, निरीक्षक रिपोर्ट की सात अलग-अलग स्तरों पर जाँच करता है: क्या कहानी सच है? क्या आप स्रोत दस्तावेज़ के उस सटीक पृष्ठ की ओर इशारा कर सकते हैं जहाँ से वह तथ्य आया है? क्या गणित के नंबर आपस में मेल खाते हैं? क्या रोबोट ने पूरा काम पूरा किया, या उसने कोई चरण छोड़ दिया? क्या उसने खाली जगहों को भरने के लिए तथ्य गढ़े? क्या रिपोर्ट वास्तव में निर्णय लेने के लिए उपयोगी है? और अंत में, क्या एक मानव आसानी से रोबोट के काम की जाँच कर सकता है? शोधकर्ताओं ने पांच वास्तविक बैंकिंग कार्यों पर चार अलग-अलग AI मॉडलों का परीक्षण किया, जैसे बॉन्ड अनुबंधों से नंबर निकालना, समान पिछले सौदों को खोजना और कंपनी प्रोफाइल लिखना।
यहाँ उन्हें क्या मिला। सबसे पहले, तीन सबसे उन्नत, महंगे "क्लोज्ड-सोर्स" AI मॉडल (Anthropic और OpenAI जैसी कंपनियों के) सभी विश्वसनीयता के एक बहुत ही समान, उच्च स्तर पर प्रदर्शन कर रहे हैं। उनके स्कोर इतने करीब हैं कि इन विशिष्ट कार्यों के लिए यह कहना कठिन है कि कोई एक दूसरे से स्पष्ट रूप से बेहतर है। हालाँकि, इन शीर्ष-स्तरीय मॉडलों और एक "ओपन-सोर्स" मॉडल (Llama 3.3 70B) के बीच एक स्पष्ट अंतर है। ओपन-सोर्स मॉडल का स्कोर काफी कम था, विशेष रूप से उन कार्यों पर जिनमें कई दस्तावेजों को खोजने या विभिन्न स्रोतों से जानकारी को मिलाने की आवश्यकता थी। यह एक एकल पृष्ठ से नंबरों को कॉपी करने जैसे सरल कार्यों में अच्छा था, लेकिन जब इसे साक्ष्य खोजने या सारांश लिखने की आवश्यकता हुई, तो इसे संघर्ष करना पड़ा।
सबसे आश्चर्यजनक खोज "डिसीजन यूज़फुलनेस" (Decision Usefulness) नामक एक विशिष्ट भाग के बारे में थी। यह मापता है कि क्या एक मानव बैंकर उस रिपोर्ट का उपयोग करने के लिए वास्तव में तैयार होगा बिना इसके कि उसे आधा हिस्सा फिर से लिखना पड़े। एक विशिष्ट कार्य (कंपनी प्रोफाइल लिखना) पर, इस एकल कारक के लिए मॉडलों के बीच स्कोर बहुत अधिक भिन्न थे, जिसमें 5-पॉइंट स्केल पर 4.0 अंकों का अंतर था। यह सुझाव देता है कि जबकि कई AI धाराप्रवाह लिख सकते हैं, केवल सबसे अच्छे ही वास्तव में "बैंकेबल" (bankable) कार्य उत्पन्न कर सकते हैं—जिसका अर्थ है कि यह बिना किसी मानवीय सुधार के वास्तविक दुनिया में उपयोग के लिए तैयार है। शोध पत्र निष्कर्ष निकालता है कि उच्च-दांव वाली नौकरियों के लिए, हमें केवल यह नहीं देखना चाहिए कि एक AI कितनी अच्छी तरह बात करता है; हमें यह सुनिश्चित करने के लिए CM-LRS जैसा एक सख्त चेकलिस्ट की आवश्यकता है कि गणित सही है, स्रोत वास्तविक हैं, और काम भरोसे के लायक सुरक्षित है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।