← नवीनतम पेपर
💬 NLP

CATPO: Critique-Augmented Tree Policy Optimization

CATPO (Critique-Augmented Tree Policy Optimization) अनइंफॉर्मेटिव सैंपल्स को फ़िल्टर करने के लिए ट्री-लेवल इन्फॉर्मेटिवनेस स्कोर पेश करके, विफल पेड़ों से सिग्नल को रिकवर करने के लिए क्रिटीक-गाइडेड हीलिंग लागू करके, और मौजूदा ट्री-आधारित तरीकों जैसे कि TreeRPO की तुलना में बेहतर गणितीय तर्क प्रदर्शन प्राप्त करने के लिए इन्फॉर्मेटिवनेस-वेटेड लॉस का उपयोग करके, सत्यापन योग्य रिवॉर्ड्स के साथ सुदृढीकरण शिक्षण (reinforcement learning) को बढ़ाता है।

मूल लेखक: Ayush Singh, Umang Goyal, Ankur Dahiya

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ayush Singh, Umang Goyal, Ankur Dahiya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन कभी-कभी जिद्दी छात्र को जटिल गणित के सवाल हल करना सिखा रहे हैं। आप उसे हर एक कदम पर ग्रेड देने के लिए कोई शिक्षक नहीं देते; इसके बजाय, आप उसे कोशिश करने देते हैं, और आप उसे केवल अंत में बताते हैं कि अंतिम उत्तर सही है या गलत। आधुनिक AI मॉडल इसी तरह से तर्क करना सीखते हैं।

यह शोध पत्र एक नई विधि पेश करता है जिसे CATPO (क्रिटिक-ऑगमेंटेड ट्री पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। यह समझने के लिए कि यह क्यों विशेष है, आइए देखें कि वर्तमान तरीके कैसे काम करते हैं और वे कहाँ समय बर्बाद करते हैं।

समस्या: "डेड" (मृत) पेड़ों पर समय बर्बाद करना

वर्तमान विधियाँ (जैसे TREERPO) एक रणनीति का उपयोग करती हैं जिसे "ट्री रोलआउट्स" (Tree Rollouts) कहा जाता है। कल्पना कीजिए कि आप छात्र को एक समस्या हल करने के लिए कह रहे हैं, लेकिन एक लंबा उत्तर लिखने के बजाय, वे एक पेड़ की तरह शाखाएँ निकालते हैं:

  • शाखा A: विधि 1 आज़माती है।
  • शाखा B: विधि 2 आज़माती है।
  • शाखा C: विधि 3 आज़माती है।

दिन के अंत में, आप पेड़ की पत्तियों की जाँच करते हैं। यदि किसी भी शाखा ने सही उत्तर प्राप्त कर लिया, तो पूरा पेड़ एक सफलता है। यदि सभी शाखाएँ विफल रहीं, तो पेड़ एक विफलता है।

बर्बादी:
शोध पत्र का तर्क है कि कंप्यूटर उन पेड़ों पर प्रशिक्षण देकर बहुत अधिक ऊर्जा बर्बाद करता है जो उसे कुछ भी नहीं सिखाते:

  1. "डेड-करेक्ट" (Dead-Correct) पेड़: प्रत्येक शाखा ने सही उत्तर प्राप्त किया। छात्र इसे पहले से ही जानता है। यहाँ सीखने के लिए कुछ नहीं है; यह पियानो का वह गाना बजाने जैसा है जिसे आपने पहले ही पूरी तरह से मास्टर कर लिया है।
  2. "डेड-रॉन्ग" (Dead-Wrong) पेड़: प्रत्येक शाखा विफल रही। छात्र पूरी तरह से खो गया है। बिना किसी शिक्षक के जो यह बता सके कि वे कहाँ गलत हुए, कंप्यूटर बस "0% सफलता" देखता है और भ्रमित हो जाता है। यह बिना किसी निर्देश के पूल में डूबने की कोशिश करने जैसा है।
  3. "स्टेल" (Stale) पेड़: छात्र अंदाज़ा लगा रहा है, और परिणाम उसके आत्मविश्वास से मेल नहीं खाते। यह एक अव्यवस्थित, अनुपयोगी मिश्रण है।

वर्तमान विधियाँ इन सभी पेड़ों के साथ एक जैसा व्यवहार करती हैं, जिससे उनकी कंप्यूटिंग शक्ति बर्बाद होती है।

समाधान: CATPO

CATPO एक स्मार्ट कोच की तरह है जो छात्र के प्रयासों के "पेड़" को देखता है और यह तय करता है कि उसे ठीक से कैसे प्रतिक्रिया देनी है, जिससे समय और ऊर्जा की बचत होती है। यह तीन चरणों में ऐसा करता है:

1. "इन्फॉर्मेटिवनेस स्कोर" (कोच की नज़र)

कोच के सिखाना शुरू करने से पहले, वे पेड़ को देखते हैं और उसे एक स्कोर देते हैं।

  • कैसे? वे दो चीजों की जाँच करते हैं:
    • विविधता (Diversity): क्या छात्र ने अलग-अलग चीजें आज़माईं? (यदि सभी शाखाएँ एक जैसी हैं, तो यह उबाऊ है)।
    • आश्चर्य (Surprise): क्या छात्र का आत्मविश्वास परिणाम से मेल खाता था? (यदि वे 100% सुनिश्चित थे और गलत निकले, तो यह सीखने का एक शानदार क्षण है। यदि वे अनिश्चित थे और सही निकले, तो यह भाग्य है)।
  • परिणाम: यदि कोई पेड़ "डेड-करेक्ट" या "डेड-रॉन्ग" है, तो कोच उसे कम स्कोर देता है। यदि यह एक "गोल्डिलॉक्स" (Goldilocks) पेड़ है (कुछ सही, कुछ गलत, सीखने की बहुत क्षमता), तो इसे उच्च स्कोर मिलता है। कंप्यूटर फिर अपनी ऊर्जा उच्च-स्कोर वाले पेड़ों पर केंद्रित करता है।

2. "क्रिटिक-गाइडेड हीलिंग" (बचाव अभियान)

यह सबसे रचनात्मक हिस्सा है। जब कोच एक "डेड-रॉन्ग" पेड़ (जहाँ हर शाखा विफल रही) देखता है, तो उसे फेंकने के बजाय, वे उसे ठीक करने की कोशिश करते हैं।

  • चरण 1: कोच उस सबसे पहले कदम को ढूंढता है जहाँ छात्र पटरी से उतर गया था ("शैलोएस्ट फेलियर")।
  • चरण 2: कोच छात्र (स्वयं AI मॉडल) से पूछता है, "हे, इस विशिष्ट कदम को देखो। तुम्हें क्यों लगता है कि तुमने यहाँ गलती की?" छात्र एक क्रिटीक (critique) उत्पन्न करता है (त्रुटि की आत्म-व्याख्या)।
  • चरण 3: इस क्रिटीक के साथ लैस होकर, कोच छात्र को केवल उस टूटे हुए बिंदु से फिर से प्रयास करने के लिए कहता है, जिससे नए, सुधरे हुए शाखाएं उत्पन्न होती हैं।
  • जादू: अचानक, एक पेड़ जो 100% विफलता था, अब उसमें कुछ सफल शाखाएं हैं। एक "डेड" पेड़ को "हील" (ठीक) किया जाता है और एक उपयोगी प्रशिक्षण उदाहरण में बदल दिया जाता है।

3. वेटेड लर्निंग (स्मार्ट ग्रेडिंग)

अंत में, जब कंप्यूटर अपने मस्तिष्क (पॉलिसी) को अपडेट करता है, तो वह हर पेड़ को समान नहीं मानता।

  • उच्च स्कोर वाले पेड़: इन्हें "भारी वजन" (heavy weight) दिया जाता है। कंप्यूटर इनसे बहुत कुछ सीखता है।
  • कम स्कोर वाले पेड़: इन्हें "हल्का वजन" (light weight) दिया जाता है। कंप्यूटर इन पर बहुत कम ध्यान देता है।
  • हील्ड (Healed) पेड़: इन्हें विशेष ध्यान दिया जाता है क्योंकि उन्होंने एक विफलता को सफलता की कहानी में बदल दिया।

परिणाम: क्या यह काम करता है?

लेखकों ने एक गणित मॉडल Qwen2.5-Math-1.5B पर एक मानक गणित डेटासेट का उपयोग करके इसका परीक्षण किया।

  • लक्ष्य: गणित के सवालों को सही ढंग से हल करना।
  • प्रतियोगिता: उन्होंने CATPO की तुलना मानक फ्लैट विधि (GRPO) और मानक ट्री विधि (TREERPO) से की।
  • परिणाम: CATPO जीत गया। इसने मानक ट्री विधि की तुलना में सटीकता में 4.8% और फ्लैट विधि की तुलना में 1.9% का सुधार किया।
  • यह सबसे अधिक क्यों मायने रखता है: सुधार सबसे कठिन समस्याओं पर सबसे अधिक था। यह समझ में आता है क्योंकि कठिन समस्याएं अधिक "डेड-रॉन्ग" पेड़ बनाती हैं। CATPO की इन पेड़ों को "हील" करने की क्षमता ने इसे एक बड़ा लाभ दिया जहाँ अन्य विधियाँ हार मान लेती थीं।

सारांश उपमा

कल्पना कीजिए कि एक छात्र बहुविकल्पीय परीक्षा दे रहा है।

  • पुराना तरीका: छात्र परीक्षा देता है। यदि वह सब कुछ सही करता है, तो वह कुछ नहीं सीखता। यदि वह सब कुछ गलत करता है, तो वह भ्रमित हो जाता है और कुछ नहीं सीखता।
  • CATPO तरीका: शिक्षक परीक्षा को देखता है।
    • "तुमने सब कुछ सही किया? बहुत बढ़िया, इसे छोड़ दो।"
    • "तुमने सब कुछ गलत किया? चलो देखते हैं कि तुम पहले किस प्रश्न में चूके। चलो बात करते हैं कि तुम गलत क्यों हुए, और फिर चलो सिर्फ उस हिस्से को ठीक करने की कोशिश करते हैं।"
    • "अब, आइए हम अपना अध्ययन समय उन प्रश्नों पर केंद्रित करें जहाँ आप अनिश्चित थे लेकिन आपने कुछ नया सीखा।"

केवल उन क्षणों पर ध्यान केंद्रित करके जो वास्तव में छात्र को कुछ सिखाते हैं, CATPO प्रशिक्षण प्रक्रिया को तेज़ और परिणामी AI को स्मार्ट बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →