From Critic to Confidence: PPO for Language-Based Quantitative Prediction with Confidence Estimation
यह शोध पत्र CARE-PPO को प्रस्तुत करता है, जो एक सुदृढीकरण अधिगम (reinforcement learning) ढांचा है जो भाषा-आधारित मात्रात्मक भविष्यवाणियों और उनकी विश्वसनीयता को संयुक्त रूप से अनुकूलित करने के लिए कॉन्फिडेंस-अलाइन्ड रिवॉर्ड (Confidence-Aligned Reward) का लाभ उठाता है, जिसमें PPO क्रिटिक को एक मजबूत कॉन्फिडेंस एस्टीमेटर के रूप में पुन: उपयोग किया गया है, जिससे यह स्वास्थ्य सेवा और वित्त डोमेन में सटीकता और अनिश्चितता अंशांकन (uncertainty calibration) में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दोस्त है जो आपके लंच के बिखरे हुए विवरण को पढ़कर यह अंदाज़ा लगा सकता है कि उसमें कितने ग्राम कार्बोहाइड्रेट हैं। यह उन लोगों के लिए बहुत अच्छा है जिन्हें इंसुलिन की खुराक जानने के लिए मधुमेह (डायबिटीज) में इसकी ज़रूरत होती है। लेकिन इसमें एक पेंच है: कभी-कभी यह रोबोट पूरी तरह से गलत उत्तर देने के बावजूद बहुत अधिक आत्मविश्वास दिखा सकता है। यह कह सकता है, "मुझे 100% यकीन है कि इस पिज्जा में 5 ग्राम कार्ब्स हैं!" जबकि वास्तव में इसमें 40 ग्राम हो सकते हैं। यह खतरनाक है।
यह पेपर CARE-PPO नामक एक नई ट्रेनिंग विधि पेश करता है ताकि इसे ठीक किया जा सके। इसे ऐसे सोचें कि रोबोट के पास काम करने वाले दो दिमाग हैं: एक एक्टर (Actor) (अनुमान लगाने वाला) और एक क्रिटिक (Critic) (जज)।
पुराना तरीका बनाम नया तरीका
आमतौर पर, जब हम इन रोबोट्स को ट्रेन करते हैं, तो हम उन्हें बस इतना बताते हैं, "तुम सही थे" या "तुम गलत थे।" यह एक शिक्षक की तरह है जो छात्र को लाल 'X' या हरा 'टिक' देता है। छात्र नंबर सही लाना सीख जाता है, लेकिन वह यह नहीं सीख पाता कि उसे खुद पर कब भरोसा करना चाहिए। वे बेतहाशा अनुमान लगा सकते हैं और फिर भी उन्हें हरा 'टिक' मिल सकता है यदि वे भाग्यशाली रहे, या वे गलत होने पर भी अनिश्चित महसूस कर सकते हैं।
लेखकों का तर्क है कि यह "बाइनरी" (सही/गलत) दृष्टिकोण पर्याप्त नहीं है। वे स्पष्ट रूप से रोबोट के अपने आंतरिक "कॉन्फिडेंस स्कोर" (जैसे कि वह अपने विचारों के आधार पर कितना आश्वस्त महसूस करता है) का उपयोग करने या उसे शब्दों में "मैं 80% निश्चित हूँ" कहने के लिए कहने को खारिज करते हैं, क्योंकि इन तरीकों से रोबोट अक्सर अति-आत्मविश्वासी और गलत हो जाता है।
CARE-PPO का जादू
CARE-PPO खेल बदल देता है क्योंकि यह रोबोट को एक क्रिटिक देता है जो एक सख्त लेकिन निष्पक्ष कोच की तरह काम करता है। यह कैसे काम करता है, यहाँ देखें:
- रिवॉर्ड सिस्टम (इनाम प्रणाली): केवल "सही/गलत" के टिक मार्क के बजाय, क्रिटिक एक स्कोर देता है जो इस बात पर आधारित होता है कि अनुमान से कितनी दूरी थी। यदि रोबक 44 ग्राम का अनुमान लगाता है और वास्तविक उत्तर 44 ग्राम है, तो उसे बहुत बड़ा इनाम मिलता है। यदि वह 17 ग्राम का अनुमान लगाता है, तो उसे छोटा इनाम (या दंड) मिलता है। अनुमान जितना करीब होगा, स्कोर उतना ही अधिक होगा।
- क्रिटिक का गुप्त काम: जबकि एक्टर नंबर सही पाने की कोशिश कर रहा है, क्रिटिक यह अनुमान लगाने की सीख रहा है कि एक्टर का अनुमान कितना अच्छा होगा। पेपर सुझाव देता है कि इन स्कोरों की भविष्यवाणी करने के लिए क्रिटिक को प्रशिक्षित करके, वह स्वाभाविक रूप से एक कॉन्फिडेंस मीटर बन जाता है।
- यदि क्रिटिक ऐसी स्थिति देखता है जहाँ एक्टर आमतौर पर बड़ी गलतियाँ करता है, तो वह कम "कॉन्फिडेंस स्कोर" देता है।
- यदि स्थिति आसान है और एक्टर आमतौर पर सही होता है, तो क्रिटिक उच्च "कॉन्फिडेंस स्कोर" देता है।
यह एक वीडियो गेम की तरह है जहाँ क्रिटिक केवल खिलाड़ी को देख नहीं रहा है; बल्कि वह खिलाड़ी के भविष्य के प्रदर्शन की भविष्यवाणी करना सीख रहा है। समय के साथ, क्रिटिक इसमें इतना अच्छा हो जाता है कि उसकी भविष्यवाणी ही कॉन्फिडेंस स्कोर बन जाती है। आपको रोबोट से यह पूछने की ज़रूरत नहीं है कि, "आप कितने निश्चित हैं?" क्योंकि क्रिटिक पहले से ही जानता है।
आंकड़े क्या कहते हैं
लेखकों ने दो वास्तविक कार्यों पर इसका परीक्षण किया:
- पोषण (Nutrition): भोजन के विवरण (जैसे "एक स्लाइस पेपरोनी पिज्जा") से कार्ब्स का अनुमान लगाना।
- वित्त (Finance): उत्पादों के विवरण (जैसे एक ब्लेंडर) से उनकी कीमत का अनुमान लगाना।
उन्होंने Qwen-3 नामक मॉडल के दो संस्करणों का उपयोग किया (एक 4 बिलियन पैरामीटर्स वाला और एक 8 बिलियन वाला)।
परिणाम उत्साहजनक थे:
- सटीकता (Accuracy): CARE-PPO मॉडल अन्य सर्वोत्तम तरीकों की तरह ही लगभग सटीक नंबर प्राप्त करने में सफल रहे।
- आत्मविश्वास (Confidence): यहीं इसने अपनी चमक दिखाई। क्रिटिक के कॉन्फिडेंस स्कोर अन्य तरीकों की तुलना में वास्तविकता से मेल खाने में बहुत बेहतर थे। परीक्षणों में, जब मॉडल गलत था, तो क्रिटिक ने कम स्कोर दिया, और जब वह सही था, तो उच्च स्कोर दिया।
- मजबूती (Robustness): यह विधि तब भी काम करती रही जब रोबोट का परीक्षण उन चीजों पर किया गया जिन्हें उसने पहले नहीं देखा था, जैसे विभिन्न भाषाओं (स्पेनिश, इतालवी, आदि) में भोजन के विवरण, या एक अलग श्रेणी (उपकरणों के बजाय इलेक्ट्रॉनिक्स) के उत्पाद।
"टास्क ओवरफिटिंग" की समस्या
एक दिलचस्प खोज यह है कि यह विधि रोबोट को "टास्क-अवेयर" (कार्य के प्रति जागरूक) रहने में मदद करती है। यदि आप भोजन के लिए प्रशिक्षित एक रोबोट को कविता लिखने के लिए कहते हैं, तो पुराने "सुपरवाइज्ड फाइन-ट्यूनिंग" (SFT) तरीके से प्रशिक्षित रोबोट भ्रमित हो सकता है और कविता में भी कार्ब्स की गणना करने की कोशिश कर सकता है! हालाँकि, CARE-PPO रोबोट यह समझने में बहुत बेहतर थे कि, "हे, यह भोजन नहीं है, मुझे कार्ब्स का अनुमान नहीं लगाना चाहिए।" उन्होंने अपना सामान्य "मैं कुछ भी कर सकता हूँ" वाला व्यक्तित्व बनाए रखते हुए विशिष्ट कार्य में महारत हासिल की।
निचोड़
पेपर सुझाव देता है कि प्रशिक्षण के दौरान भविष्यवाणी के "त्रुटि" (error) को सीधे "आत्मविश्वास" से जोड़कर, हम ऐसे AI बना सकते हैं जो न केवल बेहतर नंबर देता है बल्कि यह भी जानता है कि उसे कब कहना है, "मैं इस बारे में निश्चित नहीं हूँ।" यह स्वास्थ्य सेवा और वित्त जैसे उच्च-जोखिम वाले स्थितियों में AI को सुरक्षित और अधिक भरोसेमंद बनाने की दिशा में एक कदम है, जिसमें अतिरिक्त चरणों या AI से शब्दों में अपना आत्मविश्वास पूछने की आवश्यकता नहीं होती है। लेखकों ने पाया कि यह सिमुलेशन और वास्तविक दुनिया के डेटासेट में अच्छी तरह काम करता है, हालांकि वे अभी भी यह पता लगाने की कोशिश कर रहे हैं कि यह बड़े मॉडलों तक कैसे स्केल (विस्तारित) होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।