CATPO: Critique-Augmented Tree Policy Optimization
CATPO (Critique-Augmented Tree Policy Optimization) अनइंफॉर्मेटिव सैंपल्स को फ़िल्टर करने के लिए ट्री-लेवल इन्फॉर्मेटिवनेस स्कोर पेश करके, विफल पेड़ों से सिग्नल को रिकवर करने के लिए क्रिटीक-गाइडेड हीलिंग लागू करके, और मौजूदा ट्री-आधारित तरीकों जैसे कि TreeRPO की तुलना में बेहतर गणितीय तर्क प्रदर्शन प्राप्त करने के लिए इन्फॉर्मेटिवनेस-वेटेड लॉस का उपयोग करके, सत्यापन योग्य रिवॉर्ड्स के साथ सुदृढीकरण शिक्षण (reinforcement learning) को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन कभी-कभी जिद्दी छात्र को जटिल गणित के सवाल हल करना सिखा रहे हैं। आप उसे हर एक कदम पर ग्रेड देने के लिए कोई शिक्षक नहीं देते; इसके बजाय, आप उसे कोशिश करने देते हैं, और आप उसे केवल अंत में बताते हैं कि अंतिम उत्तर सही है या गलत। आधुनिक AI मॉडल इसी तरह से तर्क करना सीखते हैं।
यह शोध पत्र एक नई विधि पेश करता है जिसे CATPO (क्रिटिक-ऑगमेंटेड ट्री पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। यह समझने के लिए कि यह क्यों विशेष है, आइए देखें कि वर्तमान तरीके कैसे काम करते हैं और वे कहाँ समय बर्बाद करते हैं।
समस्या: "डेड" (मृत) पेड़ों पर समय बर्बाद करना
वर्तमान विधियाँ (जैसे TREERPO) एक रणनीति का उपयोग करती हैं जिसे "ट्री रोलआउट्स" (Tree Rollouts) कहा जाता है। कल्पना कीजिए कि आप छात्र को एक समस्या हल करने के लिए कह रहे हैं, लेकिन एक लंबा उत्तर लिखने के बजाय, वे एक पेड़ की तरह शाखाएँ निकालते हैं:
- शाखा A: विधि 1 आज़माती है।
- शाखा B: विधि 2 आज़माती है।
- शाखा C: विधि 3 आज़माती है।
दिन के अंत में, आप पेड़ की पत्तियों की जाँच करते हैं। यदि किसी भी शाखा ने सही उत्तर प्राप्त कर लिया, तो पूरा पेड़ एक सफलता है। यदि सभी शाखाएँ विफल रहीं, तो पेड़ एक विफलता है।
बर्बादी:
शोध पत्र का तर्क है कि कंप्यूटर उन पेड़ों पर प्रशिक्षण देकर बहुत अधिक ऊर्जा बर्बाद करता है जो उसे कुछ भी नहीं सिखाते:
- "डेड-करेक्ट" (Dead-Correct) पेड़: प्रत्येक शाखा ने सही उत्तर प्राप्त किया। छात्र इसे पहले से ही जानता है। यहाँ सीखने के लिए कुछ नहीं है; यह पियानो का वह गाना बजाने जैसा है जिसे आपने पहले ही पूरी तरह से मास्टर कर लिया है।
- "डेड-रॉन्ग" (Dead-Wrong) पेड़: प्रत्येक शाखा विफल रही। छात्र पूरी तरह से खो गया है। बिना किसी शिक्षक के जो यह बता सके कि वे कहाँ गलत हुए, कंप्यूटर बस "0% सफलता" देखता है और भ्रमित हो जाता है। यह बिना किसी निर्देश के पूल में डूबने की कोशिश करने जैसा है।
- "स्टेल" (Stale) पेड़: छात्र अंदाज़ा लगा रहा है, और परिणाम उसके आत्मविश्वास से मेल नहीं खाते। यह एक अव्यवस्थित, अनुपयोगी मिश्रण है।
वर्तमान विधियाँ इन सभी पेड़ों के साथ एक जैसा व्यवहार करती हैं, जिससे उनकी कंप्यूटिंग शक्ति बर्बाद होती है।
समाधान: CATPO
CATPO एक स्मार्ट कोच की तरह है जो छात्र के प्रयासों के "पेड़" को देखता है और यह तय करता है कि उसे ठीक से कैसे प्रतिक्रिया देनी है, जिससे समय और ऊर्जा की बचत होती है। यह तीन चरणों में ऐसा करता है:
1. "इन्फॉर्मेटिवनेस स्कोर" (कोच की नज़र)
कोच के सिखाना शुरू करने से पहले, वे पेड़ को देखते हैं और उसे एक स्कोर देते हैं।
- कैसे? वे दो चीजों की जाँच करते हैं:
- विविधता (Diversity): क्या छात्र ने अलग-अलग चीजें आज़माईं? (यदि सभी शाखाएँ एक जैसी हैं, तो यह उबाऊ है)।
- आश्चर्य (Surprise): क्या छात्र का आत्मविश्वास परिणाम से मेल खाता था? (यदि वे 100% सुनिश्चित थे और गलत निकले, तो यह सीखने का एक शानदार क्षण है। यदि वे अनिश्चित थे और सही निकले, तो यह भाग्य है)।
- परिणाम: यदि कोई पेड़ "डेड-करेक्ट" या "डेड-रॉन्ग" है, तो कोच उसे कम स्कोर देता है। यदि यह एक "गोल्डिलॉक्स" (Goldilocks) पेड़ है (कुछ सही, कुछ गलत, सीखने की बहुत क्षमता), तो इसे उच्च स्कोर मिलता है। कंप्यूटर फिर अपनी ऊर्जा उच्च-स्कोर वाले पेड़ों पर केंद्रित करता है।
2. "क्रिटिक-गाइडेड हीलिंग" (बचाव अभियान)
यह सबसे रचनात्मक हिस्सा है। जब कोच एक "डेड-रॉन्ग" पेड़ (जहाँ हर शाखा विफल रही) देखता है, तो उसे फेंकने के बजाय, वे उसे ठीक करने की कोशिश करते हैं।
- चरण 1: कोच उस सबसे पहले कदम को ढूंढता है जहाँ छात्र पटरी से उतर गया था ("शैलोएस्ट फेलियर")।
- चरण 2: कोच छात्र (स्वयं AI मॉडल) से पूछता है, "हे, इस विशिष्ट कदम को देखो। तुम्हें क्यों लगता है कि तुमने यहाँ गलती की?" छात्र एक क्रिटीक (critique) उत्पन्न करता है (त्रुटि की आत्म-व्याख्या)।
- चरण 3: इस क्रिटीक के साथ लैस होकर, कोच छात्र को केवल उस टूटे हुए बिंदु से फिर से प्रयास करने के लिए कहता है, जिससे नए, सुधरे हुए शाखाएं उत्पन्न होती हैं।
- जादू: अचानक, एक पेड़ जो 100% विफलता था, अब उसमें कुछ सफल शाखाएं हैं। एक "डेड" पेड़ को "हील" (ठीक) किया जाता है और एक उपयोगी प्रशिक्षण उदाहरण में बदल दिया जाता है।
3. वेटेड लर्निंग (स्मार्ट ग्रेडिंग)
अंत में, जब कंप्यूटर अपने मस्तिष्क (पॉलिसी) को अपडेट करता है, तो वह हर पेड़ को समान नहीं मानता।
- उच्च स्कोर वाले पेड़: इन्हें "भारी वजन" (heavy weight) दिया जाता है। कंप्यूटर इनसे बहुत कुछ सीखता है।
- कम स्कोर वाले पेड़: इन्हें "हल्का वजन" (light weight) दिया जाता है। कंप्यूटर इन पर बहुत कम ध्यान देता है।
- हील्ड (Healed) पेड़: इन्हें विशेष ध्यान दिया जाता है क्योंकि उन्होंने एक विफलता को सफलता की कहानी में बदल दिया।
परिणाम: क्या यह काम करता है?
लेखकों ने एक गणित मॉडल Qwen2.5-Math-1.5B पर एक मानक गणित डेटासेट का उपयोग करके इसका परीक्षण किया।
- लक्ष्य: गणित के सवालों को सही ढंग से हल करना।
- प्रतियोगिता: उन्होंने CATPO की तुलना मानक फ्लैट विधि (GRPO) और मानक ट्री विधि (TREERPO) से की।
- परिणाम: CATPO जीत गया। इसने मानक ट्री विधि की तुलना में सटीकता में 4.8% और फ्लैट विधि की तुलना में 1.9% का सुधार किया।
- यह सबसे अधिक क्यों मायने रखता है: सुधार सबसे कठिन समस्याओं पर सबसे अधिक था। यह समझ में आता है क्योंकि कठिन समस्याएं अधिक "डेड-रॉन्ग" पेड़ बनाती हैं। CATPO की इन पेड़ों को "हील" करने की क्षमता ने इसे एक बड़ा लाभ दिया जहाँ अन्य विधियाँ हार मान लेती थीं।
सारांश उपमा
कल्पना कीजिए कि एक छात्र बहुविकल्पीय परीक्षा दे रहा है।
- पुराना तरीका: छात्र परीक्षा देता है। यदि वह सब कुछ सही करता है, तो वह कुछ नहीं सीखता। यदि वह सब कुछ गलत करता है, तो वह भ्रमित हो जाता है और कुछ नहीं सीखता।
- CATPO तरीका: शिक्षक परीक्षा को देखता है।
- "तुमने सब कुछ सही किया? बहुत बढ़िया, इसे छोड़ दो।"
- "तुमने सब कुछ गलत किया? चलो देखते हैं कि तुम पहले किस प्रश्न में चूके। चलो बात करते हैं कि तुम गलत क्यों हुए, और फिर चलो सिर्फ उस हिस्से को ठीक करने की कोशिश करते हैं।"
- "अब, आइए हम अपना अध्ययन समय उन प्रश्नों पर केंद्रित करें जहाँ आप अनिश्चित थे लेकिन आपने कुछ नया सीखा।"
केवल उन क्षणों पर ध्यान केंद्रित करके जो वास्तव में छात्र को कुछ सिखाते हैं, CATPO प्रशिक्षण प्रक्रिया को तेज़ और परिणामी AI को स्मार्ट बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।