← नवीनतम पेपर
🤖 machine learning

Trust-Region Behavior Blending for On-Policy Distillation

यह शोध पत्र ट्रस्ट-रीजन बिहेवियर ब्लेंडिंग (TRB) का प्रस्ताव देता है, जो ऑन-पॉलिसी डिस्टिलेशन के लिए एक वॉर्मअप विधि है जो एक KL ट्रस्ट रीजन के भीतर छात्र की पॉलिसी को शिक्षक के साथ ब्लेंड करके शुरुआती प्रशिक्षण को स्थिर करती है और फिर शुद्ध छात्र रोलआउट्स की ओर एनेलिंग (annealing) करती है, जिससे गणितीय-तर्क कार्यों में प्रदर्शन में सुधार होता है।

मूल लेखक: Daniil Plyusov, Alexey Gorbatovski, Alexey Malakhov, Nikita Balagansky, Boris Shaposhnikov, Daria Korotyshova, Daniil Gavrilov

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daniil Plyusov, Alexey Gorbatovski, Alexey Malakhov, Nikita Balagansky, Boris Shaposhnikov, Daria Korotyshova, Daniil Gavrilov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Trust-Region Behavior Blending for On-Policy Distillation" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: एक छात्र को सोचना सिखाना

कल्पना कीजिए कि आप एक युवा छात्र (Student AI) को एक बुद्धिमान प्रोफेसर (Teacher AI) के अध्ययन के माध्यम से जटिल गणित के सवाल हल करना सिखाने की कोशिश कर रहे हैं।

पुराने तरीके में (Offline Distillation), आप छात्र को प्रोफेसर के सटीक उत्तरों से भरी एक पाठ्यपुस्तक देते हैं। छात्र उन्हें रट लेता है। लेकिन एक समस्या है: जब छात्र वास्तविक परीक्षा देता है, तो उसे अपने उत्तर खुद से बनाने होते हैं। चूंकि उन्होंने कभी अपने स्वयं के चरणों (steps) को उत्पन्न करने का अभ्यास नहीं किया, इसलिए वे भ्रमित हो जाते हैं और शुरुआत में गलतियाँ करते हैं।

इसे ठीक करने के लिए, शोधकर्ताओं ने On-Policy Distillation (OPD) विकसित किया। पाठ्यपुस्तक के बजाय, छात्र अपने उत्तर खुद चरण-दर-चरण बनाता है, और प्रोफेसर वास्तविक समय में उसे सुधारता है। यह बेहतर है क्योंकि यह वास्तविक परीक्षा की स्थितियों से मेल खाता है।

हालाँकि, OPD में एक दोष है: शुरुआत में, छात्र बहुत कमजोर होता है। यदि आप उन्हें तुरंत अपने उत्तर खुद बनाने देते हैं, तो वे एक बहुत ही खराब, निरर्थक पहला वाक्य बना सकते हैं। यदि प्रोफेसर एक खराब वाक्य को सुधारने की कोशिश करता है, तो यह एक ऐसे घर को ठीक करने जैसा है जो अभी तक बना ही नहीं है। "सिग्नल" इतना कमजोर है कि वह उपयोगी नहीं हो पाता।

समाधान: Trust-Region Behavior Blending (TRB)

लेखकों ने एक नई विधि प्रस्तावित की है जिसे Trust-Region Behavior Blending (TRB) कहा जाता है। इसे "स्मार्ट गाइड के साथ ट्रेनिंग व्हील्स" वाले दृष्टिकोण के रूप में सोचें।

1. "Trust Region" (सुरक्षा बुलबुला/Safety Bubble)

कल्पना कीजिए कि छात्र एक खेत में चल रहा है। Student Policy वह रास्ता है जिसे छात्र स्वाभाविक रूप से लेना चाहता है। Teacher Policy वह रास्ता है जिसे प्रोफेसर लेगा।

यदि छात्र रास्ते से बहुत दूर भटक जाता है, तो प्रोफेसर की सलाह का कोई अर्थ नहीं रह जाता। TRB एक "Trust Region" बनाता है—छात्र के वर्तमान पथ के चारों ओर एक सुरक्षा बुलबुला।

  • नियम: छात्र को प्रोफेसर के पथ की ओर थोड़ा आगे बढ़ने की अनुमति है, लेकिन वे अपने स्वयं के प्राकृतिक अंदाज से बहुत दूर नहीं भटक सकते।
  • लक्ष्य: प्रोफेसर के पथ का वह सबसे करीबी संभव संस्करण खोजना जो अभी भी छात्र के सुरक्षा बुलबुले के भीतर रहता है।

2. "Blending" (एक सुचारू मिश्रण)

छात्र को प्रोफेसर की पूरी तरह नकल करने के लिए मजबूर करने (जो बहुत कठिन है) या उन्हें बिना किसी दिशा के भटकने देने (जो बहुत अव्यवस्थित है) के बजाय, TRB दोनों को ब्लेंड (blend) करता है।

  • यह एक "हाइब्रिड" पथ बनाता है जो काफी हद तक छात्र जैसा दिखता है लेकिन इसमें प्रोफेसर का पर्याप्त ज्ञान होता है ताकि छात्र एक ऐसे ट्रैक पर रहे जिससे वास्तव में सीखा जा सके।
  • यह एक डांस इंस्ट्रक्टर द्वारा एक नौसिखिए का मार्गदर्शन करने जैसा है: "अपना पैर यहाँ चलाओ (मेरी तरह), लेकिन अपना संतुलन वहाँ बनाए रखो (तुम्हारी तरह)।"

3. "Warmup" (ट्रेनिंग व्हील्स को हटाना)

TRB का सबसे महत्वपूर्ण हिस्सा यह है कि यह अस्थायी है।

  • शुरुआती दिन: "Trust Region" चौड़ा होता है। यह सुनिश्चित करने के लिए कि पहले कुछ कदम उच्च गुणवत्ता वाले हों, छात्र को प्रोफेसर से बहुत मदद मिलती है।
  • फीका पड़ना (The Fade): जैसे-जैसे प्रशिक्षण जारी रहता है, "Trust Region" छोटा होता जाता है। प्रोफेसर पीछे हट जाता है।
  • अंत: अंततः, क्षेत्र पूरी तरह से गायब हो जाता है। छात्र अब अपने दम पर चल रहा है, लेकिन उसने शुरुआत से ही सही आदतें सीख ली हैं।

यह बेहतर क्यों काम करता है (परिणाम)

पेपर ने गणितीय तर्क कार्यों (जैसे बीजगणित या ज्यामिति के सवालों को हल करना) पर विभिन्न आकारों के AI मॉडल का उपयोग करके इस पद्धति का परीक्षण किया।

  • तुलना: उन्होंने TRB की तुलना इनसे की:
    • Vanilla OPD: छात्र को तुरंत अकेले भटकने देना।
    • SKD: प्रोफेसर को कभी-कभी नियंत्रण लेने और छात्र को विशिष्ट शब्द बोलने के लिए मजबूर करने देना।
    • SFT Warmup: शुरू करने से पहले मानक पर्यवेक्षित शिक्षण (supervised learning) का एक छोटा दौर।
  • परिणाम: TRB औसतन जीत गया।
    • इसने "Vanilla OPD" की तुलना में छात्र को बेहतर गुणवत्ता वाले चरणों के साथ शुरुआत करने में मदद की।
    • यह इस बात पर निर्भर नहीं था कि प्रोफेसर पूरी तरह से नियंत्रण ले ले (जैसा कि SKD में होता है), जो कभी-कभी छात्र को भ्रमित कर सकता है कि उन्हें वास्तव में क्या होना चाहिए।
    • इसने केवल "वार्मअप" करने या एक छोटा मानक पाठ देने की तुलना में बेहतर काम किया।

ट्रेड-ऑफ (Trade-off)

इसमें एक छोटी सी लागत है। क्योंकि TRB के लिए शुरुआती चरण के दौरान प्रोफेसर को छात्र के साथ "ऑनलाइन" (सोचते हुए और डिकोड करते हुए) होना आवश्यक है, इसलिए इसमें प्रशिक्षण चलाने के लिए थोड़े अधिक कंप्यूटर पावर और समय की आवश्यकता होती है। हालाँकि, चूंकि यह केवल "warmup" चरण के दौरान होता है, इसलिए अतिरिक्त लागत अस्थायी है, और अंतिम परिणाम एक स्मार्ट छात्र होता है।

सारांश उपमा (Summary Analogy)

  • पुराना तरीका (Offline): एक छात्र को उस शहर का नक्शा देना जिसे उसने कभी देखा ही नहीं है। वे सड़कों को रट लेते हैं लेकिन जब उन्हें खुद गाड़ी चलानी पड़ती है तो वे खो जाते हैं।
  • OPD (On-Policy): छात्र को गाड़ी चलाने देना, जिसमें एक को-पायलट उन्हें सुधार रहा है। लेकिन अगर छात्र सीधे झील में गाड़ी चलाने लगे, तो को-पायलट के सुधार बेकार हैं।
  • TRB: को-पायलट पहले कुछ मिनटों के दौरान स्टीयरिंग को धीरे से घुमाता है ताकि कार सड़क पर रहे (ट्रस्ट रीजन के अंदर), यह सुनिश्चित करने के लिए कि छात्र सही ढंग से गाड़ी चलाने का एहसास सीख सके। एक बार जब छात्र स्थिर हो जाता है, तो को-पायलट हाथ छोड़ देता है, और छात्र अपने आप बेहतरीन तरीके से गाड़ी चलाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →