← नवीनतम पेपर
💻 computer science

On-Policy Distillation with Best-of-N Teacher Rollout Selection

यह शोध पत्र BRTS को प्रस्तुत करता है, जो ऑन-पॉलिसी डिस्टिलेशन (on-policy distillation) के लिए एक 'बेस्ट-ऑफ-एन रोलआउट टीचर सिलेक्शन' (Best-of-N Rollout Teacher Selection) फ्रेमवर्क है, जो कई टीचर ट्रेजेक्टरीज को सैंपल करने और सबसे सटीक एवं स्टूडेंट-अलाइन्ड (student-aligned) ट्रेजेक्टरी को चुनने के माध्यम से रीजनिंग प्रदर्शन में सुधार करता है ताकि विश्वसनीय सुपरविजन प्रदान किया जा सके, जिससे मानक विधियों की उच्च-विचलन (high-variance) सीमाओं पर विजय प्राप्त की जा सके।

मूल लेखक: Ke Zhang, Yunjie Tian, Dongdi Zhao, Yijiang Li, Yuanye Liu, Vishal M Patel, Di Fu

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ke Zhang, Yunjie Tian, Dongdi Zhao, Yijiang Li, Yuanye Liu, Vishal M Patel, Di Fu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक युवा प्रशिक्षु (छात्र) को जटिल गणित की पहेलियाँ हल करना सिखाने की कोशिश कर रहे हैं। आपके पास एक मास्टर गणितज्ञ (शिक्षक) है जो अविश्वसनीय रूप से बुद्धिमान है लेकिन कभी-कभी विचलित हो जाता है, मूर्खतापूर्ण गलतियाँ करता है, या चीजों को इस तरह समझाता है कि प्रशिक्षु उसे समझ ही नहीं पाता।

AI की दुनिया में, इसे On-Policy Distillation कहा जाता है। आमतौर पर, प्रशिक्षु एक समस्या को हल करने का प्रयास करता है, और मास्टर उसे देखता है और चरण-दर-चरण सुधार करता है। समस्या यह है कि यदि प्रशिक्षु एक भ्रमित करने वाले रास्ते पर निकल जाता है, तो मास्टर भी भ्रमित हो सकता है, या मास्टर बस एक रैंडम, अनुपयोगी उत्तर दे सकता है क्योंकि वे भी समाधान खोजने के लिए "पासा फेंक रहे" होते हैं।

यह पेपर एक नई विधि पेश करता है जिसे BRTS (Best-of-N Rollout Teacher Selection) कहा जाता है। इसे एक "स्मार्ट कोच" सिस्टम के रूप में सोचें जो पुराने शिक्षण तरीके के दोषों को ठीक करता है। यह कैसे काम करता है, इसके सरल उपमाओं का उपयोग करके यहाँ दिया गया है:

1. समस्या: "पासे का बुरा उछाल"

पुराने तरीके में, जब प्रशिक्षु पूछता है, "मैं इसे कैसे हल करूँ?", तो मास्टर एक सिक्का उछालता है और एक उत्तर देता है।

  • जोखिम: कभी-कभी मास्टर का "बुरा दिन" चल रहा होता है और वह गलत उत्तर दे देता है। कभी-कभी मास्टर सही उत्तर देता है, लेकिन उसे ऐसे तरीके से समझाता है जो प्रशिक्षु के सोचने के तरीके से बिल्कुल अलग होता है।
  • परिणाम: प्रशिक्षु एक बुरे उदाहरण या एक भ्रमित करने वाले उदाहरण से सीखता है, जिससे वह समस्याओं को हल करने में और भी खराब हो जाता है।

2. समाधान: "कुछ प्रयास करें, सबसे अच्छा चुनें" रणनीति

BRTS खेल बदल देता है। केवल एक उत्तर के लिए मास्टर से पूछने के बजाय, सिस्टम मास्टर को कई अलग-अलग प्रयास (उत्तरों का एक छोटा समूह) एक साथ उत्पन्न करने के लिए कहता है।

फिर, एक स्मार्ट फ़िल्टर (Selector) इन प्रयासों को देखता है और प्रशिक्षु को दिखाने के लिए इनमें से एक को चुनता है, जो दो सरल नियमों पर आधारित है:

  • नियम #1: क्या यह सही है? पहले, सिस्टम जाँच करता है: "क्या मास्टर ने वास्तव में सही उत्तर दिया?" यदि कोई प्रयास गलत है, तो उसे कचरे में डाल दिया जाता है।
  • नियम #2: क्या यह छात्र से मेल खाता है? यदि मास्टर ने तीन अलग-अलग तरीकों से सही उत्तर दिया है, तो सिस्टम उस एक को चुनता है जो प्रशिक्षु के सोचने के सामान्य तरीके के सबसे करीब दिखता है। यह सुनिश्चित करता है कि प्रशिक्षु के लिए पाठ समझना आसान हो।

3. "आपातकालीन बैकअप" (Tier-2 Recovery)

क्या होगा यदि मास्टर तीन बार प्रयास करता है और सभी गलत होते हैं? (यह बहुत कठिन पहेलियों के साथ होता है)।

  • पुराना तरीका: सिस्टम हार मान लेता है या प्रशिक्षु को गलत उत्तर से सीखने के लिए मजबूर करता है।
  • BRTS का तरीका: सिस्टम के पास एक गुप्त चीट शीट (Ground Truth) होती है। यह मास्टर को चुपचाप सही उत्तर बताता है और कहता है, "ठीक है, अब जब आप उत्तर जानते हैं, तो कृपया एक आदर्श, प्राकृतिक स्पष्टीकरण लिखें कि आप वहां तक कैसे पहुँचे।"
  • मास्टर फिर एक उच्च-गुणवत्ता वाला, सही स्पष्टीकरण तैयार करता है जिसे प्रशिक्षु सीख सकता है। यह एक कोच के हस्तक्षेप करने जैसा है जो कहता है, "यहाँ सही रास्ता है, अब देखो मैं कैसे चलता हूँ।"

4. परिणाम: तेज़ और स्मार्ट लर्निंग

पेपर ने कठिन गणित प्रतियोगिताओं (जैसे AIME और AMC) पर इसका परीक्षण किया।

  • निष्कर्ष: इस "सबसे अच्छा चुनें" विधि का उपयोग करके, प्रशिक्षु ने पुराने "रैंडम सिंगल आंसर" तरीके की तुलना में बहुत तेज़ी से सीखा और अधिक समस्याओं को सही ढंग से हल किया।
  • यह क्यों काम करता है: यह प्रशिक्षु को मास्टर की गलतियों या भ्रमित करने वाले स्पष्टीकरणों से सीखने से रोकता है। यह सुनिश्चित करता है कि प्रशिक्षु केवल सर्वश्रेष्ठ और सबसे प्रासंगिक उदाहरण देखे कि कैसे सोचा जाए।

सारांश उपमा

कल्पना कीजिए कि आप एक प्रसिद्ध शेफ से खाना बनाना सीख रहे हैं।

  • पुराना तरीका: आप शेफ से पूछते हैं, "मैं यह सूप कैसे बनाऊं?" शेफ एक सिक्का उछालता है। हेड आता है, तो वे आपको नमक वाला रेसिपी देते हैं। टेल्स आता है, तो वे आपको चीनी वाला रेसिपी देते हैं। आप जो भी उन्होंने चुना है उससे सीखने की कोशिश करते हैं, भले ही वह चीनी वाला ही क्यों न हो।
  • BRTS तरीका: आप शेफ को पाँच अलग-अलग सूप रेसिपी लिखने के लिए कहते हैं। आप जाँच करते हैं: "ठीक है, इसमें चीनी है (बुरा), इसमें पानी कम है (बुरा)। यह एकदम सही है, और यह भी सही है लेकिन इसमें ऐसी तकनीक है जिसे आप पहले से जानते हैं।" आप परफेक्ट और परिचित वाले को चुनते हैं और उससे सीखते हैं। यदि शेफ अपने आप में कोई अच्छा विकल्प नहीं सोच पाते हैं, तो आप चुपके से उन्हें "सही" रेसिपी कार्ड दिखाते हैं और उनसे फिर से समझाने के लिए कहते हैं।

पेपर का दावा है कि यह सरल बदलाव—कई विकल्पों की जाँच करना और सबसे अच्छे को चुनना—AI मॉडल को बिना किसी महंगे नए प्रशिक्षण तकनीकों के बहुत बेहतर तर्क करने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →