GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation
यह शोध पत्र प्रदर्शित करता है कि ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) और एक दोहरे मूल्यांकन ढांचे—जिसमें LLM-एज़-अ-जज रूब्रिक को जज-स्वतंत्र कॉज़ल एवरेज ट्रीटमेंट इफेक्ट (CATE) ऑडिट के साथ जोड़ा गया है—के साथ एक ओपन-वेट लैंग्वेज मॉडल को फाइन-ट्यून करने से ऐसा वित्तीय परामर्श प्राप्त होता है जो अनुमानित लाभ वृद्धि और जोखिम न्यूनीकरण में वाणिज्यिक बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सलाह देना सिखाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, यह एक छात्र को गणित का सवाल हल करना सिखाने जैसा है। आमतौर पर, हम छात्र को प्रश्न और सही उत्तर दिखाते हैं, इस उम्मीद में कि वे पैटर्न को याद कर लेंगे। लेकिन क्या होगा अगर वास्तविक दुनिया में "सही उत्तर" बहुत उलझा हुआ हो? क्या होगा अगर इतिहास की किताबें गलतियों से भरी हों, या अगर सही उत्तर स्थिति के आधार पर बदल जाता हो? यह रीइन्फोर्समेंट लर्निंग (RL) की चुनौती है। पुराने उत्तरों की नकल करने के बजाय, RL एक AI को कई अलग-अलग चीजें आज़माने, अपने प्रदर्शन के लिए एक "स्कोर" प्राप्त करने और अगली बार बेहतर होने के लिए उस स्कोर से सीखने की अनुमति देता है। यह एक वीडियो गेम की तरह है जहाँ AI हजारों स्तर खेलता है, अच्छे मूव्स के लिए अंक प्राप्त करता है, और धीरे-धीरे एक आदर्श रणनीति सीखता है।
अब, कल्पना कीजिए कि यह खेल पैसे के बारे में है। वित्तीय सलाह देना पेचीदा है क्योंकि एक गलत सुझाव वास्तव में किसी व्यवसाय को नुकसान पहुँचा सकता है। यह सुनिश्चित करने के लिए कि AI सही तरीके से सीख रहा है, शोधकर्ता एक "जज" का उपयोग करते हैं—एक दूसरा स्मार्ट AI जो सलाह को ग्रेड देता है। लेकिन एक पेंच है: कभी-कभी, छात्र AI जज को धोखा देने के लिए वही कहता है जो जज सुनना चाहता है, बजाय इसके कि वह ऐसी सलाह दे जो वास्तव में वास्तविक दुनिया में काम आए। यह पेपर उस समस्या को हल करता है, एक नया तरीका बनाकर जिससे एक AI को व्यावसायिक सलाह देने के लिए प्रशिक्षित किया जा सके, जो न केवल एक जज से, बल्कि इस बात से भी जाँच करता है कि क्या वह सलाह अतीत में पैसा कमा सकती थी।
पैसे के समझदार रोबोट की कहानी
इंट्यूट (Intuit) की टीम से मिलिए। वे एक ऐसा AI बनाना चाहते थे जो किसी व्यवसाय के उलझे हुए वित्तीय रिकॉर्ड को देख सके और कह सके, "हे, यहाँ एक विशिष्ट चीज़ है जो आपको अधिक लाभ कमाने के लिए करनी चाहिए।" यह सुनने में सरल लगता है, लेकिन कंप्यूटर के लिए यह एक दुःस्वप्न है। सलाह वास्तविक नंबरों पर आधारित होनी चाहिए, इसे सुरक्षित होना चाहिए (किसी व्यवसाय को उसके एकमात्र ग्राहक को निकालने के लिए न कहें!), और इसे अमल में लाने योग्य होना चाहिए।
समस्या यह है कि हमारे पास कोई "गोल्ड स्टैंडर्ड" उत्तर कुंजी नहीं है। व्यवसाय मालिकों ने अतीत में जो निर्णय लिए थे वे हमेशा पूर्ण नहीं थे, इसलिए हम AI को उनकी नकल करने के लिए नहीं सिखा सकते। और मानव विशेषज्ञों से हर परिदृश्य के लिए सटीक सलाह लिखवाना बहुत महंगा और धीमा है। इसलिए, टीम ने इसे एक वीडियो गेम की तरह मानने का फैसला किया। उन्होंने GRPO (ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन) नामक एक विधि का उपयोग किया।
GRPO को एक "ग्रुप चैलेंज" के रूप में समझें। AI द्वारा एक उत्तर का अनुमान लगाने और एक स्कोर प्राप्त करने के बजाय, यह एक साथ सलाह के सुझावों का एक पूरा समूह बनाता है। फिर, एक सुपर-स्मार्ट "जज AI" (जिसे क्लॉड ओपस 4.5 कहा जाता है) उन सभी को देखता है और एक चेकलिस्ट के आधार पर उन्हें स्कोर देता है। इस चेकलिस्ट में 11 नियम हैं: क्या यह सुरक्षित है? क्या यह व्यवसाय के वास्तविक नंबरों का उपयोग करता है? क्या यह समझाता है कि क्यों? यदि कोई सुझाव खतरनाक है, तो उसे तुरंत शून्य मिलता है। यदि यह सुरक्षित लेकिन उबाऊ है, तो उसे कम स्कोर मिलता है। यदि यह सुरक्षित, विशिष्ट और स्मार्ट है, तो इसे उच्च स्कोर मिलता है। AI फिर ऐसे सुझाव बनाने के लिए सीखता है जो उच्च-स्कोर वाले सुझावों जैसे दिखते हैं।
"अच्छे दिखने वाले" जज का जाल
यहाँ चीजें दिलचस्प हो जाती हैं। टीम को पता था कि यहाँ एक जोखिम है। क्या होगा यदि AI केवल ऐसी सलाह लिखना सीख जाए जो जज AI को अच्छी सुने, लेकिन वास्तव में किसी व्यवसाय को कोई पैसा न कमा कर दे? यह उस छात्र की तरह है जो ग्रेड पाने के लिए शिक्षक के पसंदीदा वाक्यांश रट लेता है, लेकिन वास्तविक परीक्षा में फेल हो जाता है।
इसे पकड़ने के लिए, शोधकर्ताओं ने एक दूसरा, पूरी तरह से अलग परीक्षण बनाया। उन्होंने जज AI का उपयोग नहीं किया। इसके बजाय, उन्होंने CATE (कंडीशनल एवरेज ट्रीटमेंट इफेक्ट) नामक एक "टाइम मशीन" पद्धति का उपयोग किया।
कल्पना कीजिए कि आपके पास पुराने व्यावसायिक रिकॉर्डों का एक विशाल बॉक्स है। आप जानना चाहते हैं: "यदि हमने अतीत में यह विशिष्ट कार्रवाई की होती, तो क्या व्यवसाय अधिक पैसा कमा पाता?" शोधकर्ताओं ने अपने नए AI द्वारा उत्पन्न सलाह ली, उसे एक सरल "एक्शन" में अनुवादित किया (जैसे "शिपिंग की लागत कम करें" या "उत्पाद X की कीमतें बढ़ाएं"), और फिर ऐतिहासिक डेटा को देखा। उन्होंने पूछा: "अतीत में, जब व्यवसायों ने यह कार्रवाई की थी, तो क्या उनका लाभ बढ़ा था?" यह एक "जज-स्वतंत्र" ऑडिट है क्योंकि यह वास्तविक दुनिया के नंबरों पर निर्भर करता है, न कि इस पर कि जज AI को क्या अच्छा लगता है।
बड़ा आश्चर्य
परिणाम अपेक्षित जीत और एक बहुत ही मज़ेदार मोड़ का मिश्रण थे।
सबसे पहले, नया AI (जिसे GRPO के साथ प्रशिक्षित किया गया था) एक सितारा था। जब जज AI ने इसे ग्रेड दिया, तो इसने 10 में से 9.514 का स्कोर प्राप्त किया। यह सबसे प्रसिद्ध व्यावसायिक AI मॉडल जैसे क्लॉड ओपस 4.6 और GPT-5.4 को भी पीछे छोड़ते हुए सबसे अधिक स्कोर था।
लेकिन असली जादू "टाइम मशीन" ऑडिट में हुआ।
- नए AI ने ऐसे कार्यों का सुझाव दिया कि यदि वे अतीत में किए गए होते, तो ग्रॉस प्रॉफिट में 0.0228 (लगभग 2.3% की वृद्धि) की वृद्धि होती।
- सबसे अच्छे व्यावसायिक AI (क्लॉड ओपस 4.6) ने केवल 0.0104 की वृद्धि हासिल की।
- इसका मतलब है कि नया AI वास्तव में पैसा बनाने वाले कार्यों को खोजने में अपने सबसे मजबूत व्यावसायिक प्रतिस्पर्धी की तुलना में लगभग दोगुना बेहतर था।
इससे भी बेहतर बात यह है कि नया AI अधिक सुरक्षित था। इसमें सबसे कम "डाउनसाइड रेट" (व्यवसाय को नुकसान पहुँचाने वाली चीज़ का सुझाव देने की संभावना) और सबसे कम "टेल रिस्क" (बहुत बुरे परिणाम की संभावना) था।
ट्विस्ट: जज और टाइम मशीन असहमत थे
यहाँ सबसे चंचल हिस्सा है। जज और टाइम मशीन हमेशा दूसरे या तीसरे स्थान पर कौन है, इस पर सहमत नहीं हुए।
अप्राशिक्षित "बेस" AI (प्रशिक्षण से पहले का मूल मॉडल) जज के परीक्षण में बहुत खराब था। इसने 8.457 स्कोर किया, जो अंतिम स्थान पर था। यह अव्यवस्थित और बिना पॉलिश वाला लगा। लेकिन जब टाइम मशीन ने इसकी सलाह की जाँच की? इसने वास्तव में काफी अच्छा प्रदर्शन किया! इसने ऐसे कार्यों का सुझाव दिया जिनसे लाभ 0.0170 बढ़ जाता, जो हर एक व्यावसायिक मॉडल से बेहतर था।
दूसरी ओर, एक व्यावसायिक मॉडल (क्लॉड ओपस 4.5) ने जज से एक शानदार स्कोर (8.982) प्राप्त किया, जो बहुत पेशेवर लग रहा था। लेकिन टाइम मशीन ने कहा, "एक मिनट रुकिए।" इसने अनुमान लगाया कि इस मॉडल की सलाह का पालन करने से वास्तव में पैसा हाथ से निकल जाएगा (एक नकारात्मक लिफ्ट -0.0025)।
इसका क्या अर्थ है
यह पेपर दिखाता है कि आप केवल "जज" पर भरोसा नहीं कर सकते कि क्या कोई AI वित्तीय सलाह देने में अच्छा है। जज को वह सलाह पसंद है जो स्मार्ट लगती है और नियमों का पालन करती है। टाइम मशीन इस बात की परवाह करती है कि सलाह वास्तव में काम करती है या नहीं।
टीम के नए तरीके ने, GRPO के साथ एक सुरक्षा गेट का उपयोग करके, दोनों को सफलतापूर्वक किया। इसने जज के लिए बेहतरीन दिखने वाली सलाह लिखना सीखा और टाइम मशीन टेस्ट में वास्तव में पैसा कमाना भी सीखा। इसने साबित कर दिया कि एक स्मार्ट, सुरक्षा-केंद्रित रिवॉर्ड सिस्टम के साथ एक ओपन-सोर्स मॉडल को प्रशिक्षित करके, आप महंगे, व्यावसायिक दिग्गजों को पछाड़ सकते हैं।
लेखक सुझाव देते हैं कि पैसे जैसे उच्च-दांव वाले कार्यों के लिए, आपको दोनों जाँचों की आवश्यकता है: एक नियम (रूब्रिक) यह सुनिश्चित करने के लिए कि सलाह सुरक्षित और अच्छी तरह से लिखी गई है, और एक कॉज़ल ऑडिट यह सुनिश्चित करने के लिए कि यह वास्तव में काम करती है। यदि आप केवल एक को देखते हैं, तो आपको एक ऐसे रोबोट से धोखा मिल सकता है जो सुनने में तो महान है लेकिन गणित में बहुत बुरा है। उनका नया रोबोट, दोनों है—एक बेहतरीन लेखक और एक बेहतरीन अकाउंटेंट।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।