Escaping the Verifier: Learning to Reason via Demonstrations
यह शोधपत्र RARO को प्रस्तुत करता है, जो एक नवीन इनवर्स रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो एक पॉलिसी और एक रिलेटिस्टिक क्रिटिक के बीच एक एडवरसेरियल गेम का उपयोग करके केवल विशेषज्ञ प्रदर्शनों (expert demonstrations) के माध्यम से लार्ज लैंग्वेज मॉडल्स को प्रभावी ढंग से तर्क करने के लिए प्रशिक्षित करता है, जिससे कार्य-विशिष्ट सत्यापनकर्ताओं (task-specific verifiers) पर निर्भर रहे बिना तर्क संबंधी कार्यों पर मजबूत प्रदर्शन प्राप्त किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को जटिल पहेलियाँ सुलझाना या सुंदर कविताएँ लिखना सिखाने की कोशिश कर रहे हैं। आमतौर पर, एक रोबोट को सिखाने के लिए, आपको एक "रेफरी" (referee) की आवश्यकता होती है जो तुरंत कह सके, "हाँ, यह सही उत्तर है," या "नहीं, यह गलत है।"
- गणित में, रेफरी आसान है: आप बस यह देखते हैं कि क्या संख्याएँ सही कुल योग जोड़ती हैं।
- कविता या वित्तीय विश्लेषण में, कोई रेफरी नहीं होता। कोई एक "सही" कविता नहीं होती, और न ही कोई कैलकुलेटर है जो बता सके कि कोई वित्तीय रणनीति एकदम सटीक है।
लंबे समय तक, वैज्ञानिकों ने सोचा कि बिना रेफरी के, रोबोट केवल उदाहरणों को रटने (जैसे कि एक छात्र पाठ्यपुस्तक की नकल करता है) के माध्यम से ही सीख सकता है। लेकिन इस पेपर के लेखक, RARO, कहते हैं: "रुको, हम रोबोट को बिना किसी रेफरी के भी सोचना और तर्क करना सिखा सकते हैं, बस विशेषज्ञों के उदाहरण दिखाकर।"
उन्होंने इसे यहाँ कैसे किया है, एक सरल उपमा (analogy) का उपयोग करते हुए:
"स्वाद-परीक्षण" (Taste-Test) खेल
एक ऐसे रेफरी के बजाय जो पूर्ण सत्य जानता हो, लेखकों ने एक ही रोबोट मस्तिष्क द्वारा निभाए जाने वाले दो भूमिकाओं के बीच एक खेल स्थापित किया:
- शेफ (The Policy): रोबोट का यह हिस्सा एक रेसिपी के आधार पर भोजन बनाने (समस्या हल करने या कविता लिखने) की कोशिश करता है। वह कुछ ऐसा बनाना चाहता है जो इतना अच्छा हो कि लगे कि वह एक विश्व-प्रसिद्ध मास्टर शेफ (विशेषज्ञ डेटा) द्वारा बनाया गया है।
- फूड क्रिटिक (The Relativistic Critic): रोबोट का यह हिस्सा एक जज के रूप में कार्य करता है। लेकिन यहाँ एक मोड़ है: क्रिटिक को एक साथ दो व्यंजन दिए जाते हैं: एक मास्टर शेफ द्वारा बनाया गया और एक शेफ (रोबोट) द्वारा बनाया गया।
खेल के नियम:
- क्रिटिक को अंक मिलते हैं यदि वह सही ढंग से अनुमान लगा पाता है कि कौन सी प्लेट मास्टर शेफ की है और कौन सी रोबोट की।
- शेफ को अंक मिलते हैं यदि वह क्रिटिक को यह विश्वास दिलाने में सफल रहता है कि उसका व्यंजन मास्टर शेफ द्वारा बनाया गया था।
यह क्यों विशेष है
अतीत में, यदि रोबोट बहुत अच्छा हो जाता, तो क्रिटिक भ्रमित हो जाता। यदि रोबोट का उत्तर एकदम सटीक होता, तो क्रिटिक शायद केवल रैंडम अनुमान लगाता, और रोबोट कुछ भी नया नहीं सीख पाता।
लेखकों ने एक चतुर "टाई" (tie) विकल्प जोड़ा। यदि क्रिटिक रोबोट के उत्तर और विशेषज्ञ के उत्तर के बीच अंतर नहीं कर पाता, तो वह टाई घोषित कर सकता है।
- यह क्रिटिक के ऐसा कहने जैसा है, "ये दोनों व्यंजन इतने समान हैं कि मैं उनमें अंतर नहीं कर सकता।"
- यह खेल को जारी रखता है। रोबोट सीखता है कि जीतने के लिए, उसे केवल "ठीक" होने की आवश्यकता नहीं है; उसे विशेषज्ञ के समान अपरिहार्य (indistinguishable) होना होगा।
उन्होंने क्या खोजा
शोधकर्ताओं ने इस "स्वाद-परीक्षण खेल" का परीक्षण तीन अलग-अलग प्रकार की चुनौतियों पर किया:
गणित की पहेली (Countdown): एक खेल जहाँ आपको चार संख्याओं को मिलाकर 24 प्राप्त करना होता है।
- परिणाम: रोबोट ने कई संयोजनों के माध्यम से "सोचना", अपने काम की जाँच करना और गलत होने पर वापस पीछे जाना (backtracking) सीखा। वह लगभग उतना ही अच्छा हो गया जितना कि एक परफेक्ट गणित रेफरी के साथ प्रशिक्षित रोबोट होते हैं, और केवल उत्तर रटने वाले रोबोटों से बहुत बेहतर।
कठिन गणित (DeepMath): जटिल समस्याएँ जहाँ उत्तर की जाँच करना उसे हल करने जितना ही कठिन है।
- परिणाम: जैसे-जैसे रोबोट बड़ा और स्मार्ट होता गया, वह तर्क करने में बेहतर होता गया, जिससे पता चलता है कि यह तरीका अच्छी तरह से स्केल (scale up) होता है।
कविता लेखन: एक ऐसा कार्य जिसमें कोई "सही" उत्तर नहीं होता।
- परिणाम: यह सबसे बड़ी परीक्षा थी। रोबोट ने ऐसी कविताएँ लिखना सीखा जो केवल उदाहरणों को रटने वाले रोबोटों की तुलना में काफी अधिक रचनात्मक और प्रॉम्प्ट के अनुरूप थीं। उसने कविता लिखने से पहले अपनी योजना बनाना सीखा (जैसे, "मुझे संवेदी विवरणों पर ध्यान केंद्रित करने की आवश्यकता है")।
मुख्य निष्कर्ष (The Bottom Line)
यह पेपर दिखाता है कि रोबोट को तर्क करना सिखाने के लिए आपको एक आदर्श "उत्तर कुंजी" (answer key) की आवश्यकता नहीं है। आपको बस विशेषज्ञों के उदाहरणों का एक संग्रह और उन विशेषज्ञों के विरुद्ध "अंतर पहचानो" का खेल खेलने का एक तरीका चाहिए।
ऐसा करके, रोबोट अपना स्वयं का आंतरिक "रेफरी" विकसित करना सीख जाता है जो उसे अपना काम जाँचने, अपनी गलतियों को सुधारने और उन कार्यों के लिए उच्च गुणवत्ता वाले समाधान खोजने में मदद करता है जहाँ पहले से किसी को सटीक सही उत्तर नहीं पता होता। यह रोबोट को एक साधारण नकलची से एक विचारशील समस्या-समाधानकर्ता में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।