Distribution Corrected Offline Data Distillation for Large Language Models
यह शोध पत्र एक सिद्धांत-आधारित ऑफलाइन रीजनिंग डिस्टिलेशन फ्रेमवर्क प्रस्तावित करता है जो शिक्षक-जनित और छात्र-जनित प्रीफिक्स के बीच वितरण संबंधी विचलन (distributional drift) को ठीक करता है, जिससे महंगी ऑनलाइन रोलआउट की आवश्यकता के बिना जटिल गणितीय तर्क कार्यों पर छोटे भाषा मॉडलों की सटीकता और स्थिरता में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक युवा प्रशिक्षु (छात्र) को एक मास्टर शेफ (शिक्षक) को खाना बनाते हुए देखकर जटिल गणित की पहेलियाँ हल करना सिखाने की कोशिश कर रहे हैं।
समस्या: "नकलची" का जाल (The "Copycat" Trap)
आमतौर पर, जब हम प्रशिक्षु को सिखाते हैं, तो हम उन्हें मास्टर शेफ द्वारा एक उत्तम व्यंजन बनाने का वीडियो दिखाते हैं। प्रशिक्षु वह वीडियो देखता है और हर कदम की हुबहू नकल करने की कोशिश करता है। इसे ऑफलाइन डिस्टिलेशन (Offline Distillation) कहा जाता है।
हालाँकि, इस पद्धति में एक छिपा हुआ दोष है:
- वीडियो में: मास्टर शेफ ताजी सामग्री से शुरुआत करते हैं और एक आदर्श मार्ग का अनुसरण करते हैं।
- वास्तविक जीवन में: प्रशिक्षु को शून्य से शुरुआत करनी पड़ती है। यदि वे शुरुआत में एक छोटी सी गलती कर देते हैं (जैसे प्याज को थोड़ा गलत तरीके से काटना), तो उन्हें उस गलती के आधार पर आगे का खाना बनाना पड़ता है।
- परिणाम: क्योंकि उन्हें केवल परफेक्ट वीडियो की नकल करने के लिए प्रशिक्षित किया गया था, इसलिए उन्हें यह नहीं पता कि गलती होने पर सुधार कैसे किया जाए। जैसे-जैसे वे एक लंबी, जटिल समस्या को हल करने की कोशिश करते हैं, उनकी छोटी-छोटी गलतियाँ बढ़ती जाती हैं, और अंतिम व्यंजन बहुत खराब बनता है। इसे डिस्ट्रीब्यूशन ड्रिफ्ट (Distribution Drift) कहा जाता है।
अन्य विधियाँ प्रशिक्षु को अपने आप खाना बनाने का अभ्यास करने देने (ऑनलाइन लर्निंग) की कोशिश करती हैं, लेकिन यह धीमा है, महंगा है, और प्रशिक्षु अक्सर सीखने के दौरान बहुत ही खराब व्यंजन बनाते हैं।
समाधान: "स्मार्ट कोच" (DISCORD)
इस शोध पत्र के लेखक सिखाने का एक नया तरीका प्रस्तावित करते हैं जिसे DISCORD (डिस्ट्रीब्यूशन-करेक्टेड डिस्टिलेशन) कहा जाता है।
केवल प्रशिक्षु को "वीडियो की नकल करने" के लिए कहने के बजाय, DISCORD एक स्मार्ट कोच की तरह काम करता है जो वीडियो और प्रशिक्षु के वर्तमान कौशल स्तर को एक साथ देखता है।
यह एक सरल उपमा का उपयोग करके इस प्रकार काम करता है:
- वीडियो (शिक्षक का डेटा): मास्टर शेफ की एक आदर्श रेसिपी रिकॉर्ड की गई है।
- कौशल की जाँच: किसी विशिष्ट चरण को सिखाने से पहले, कोच पूछता है: "यदि प्रशिक्षु अभी इस चरण को बनाएगा, तो इस बात की कितनी संभावना है कि वे इसे सही ढंग से करेंगे?"
- भारित पाठ (The Weighted Lesson):
- यदि वह चरण ऐसा है जिसे प्रशिक्षु अपने आप सही ढंग से करने की संभावना रखता है, तो कोच कहता है, "बहुत अच्छा! इस हिस्से को ध्यान से देखने के लिए मास्टर को देखें। यह एक उच्च-मूल्य वाला पाठ है।"
- यदि वह चरण ऐसा है जिसे प्रशिक्षु सही ढंग से करने की संभावना नहीं रखता (क्योंकि यह बहुत उन्नत या उनके वर्तमान स्टाइल के हिसाब से अजीब है), तो कोच कहता है, "इस सटीक चाल की हूबहू नकल करने की ज्यादा चिंता न करें। यह वह चरण नहीं है जिसे आप अपनी कुकिंग स्टाइल में वास्तव में अनुभव करेंगे, इसलिए आइए उन हिस्सों पर ध्यान केंद्रित करें जिन्हें आप वास्तव में महारत हासिल कर सकते हैं।"
तकनीकी शब्दों में, शोध पत्र इसे रीवेटिंग (reweighting) कहता है। यह शिक्षक के निर्देशों के महत्व को प्रशिक्षु की वास्तविक क्षमता के आधार पर समायोजित करता है। यह प्रशिक्षु का ध्यान शिक्षक के तर्क के उन हिस्सों पर केंद्रित करता है जो प्रशिक्षु की अपनी "आवाज़" और क्षमताओं के अनुकूल होते हैं।
परिणाम: बेहतर व्यंजन, कम बर्बादी
शोधकर्ताओं ने गणित की समस्याओं (जैसे हाई स्कूल प्रतियोगिताओं और ओलंपियाड में पाई जाने वाली समस्याएं) पर इस पद्धति का परीक्षण किया।
- बेहतर सटीकता: DISCORD के साथ प्रशिक्षित छात्रों ने केवल अंधे होकर शिक्षक की नकल करने वालों की तुलना में अधिक सही उत्तर प्राप्त किए।
- स्थिर सोच: भले ही प्रशिक्षु ने अपने तर्क के शुरुआती चरणों में छोटी गलतियाँ की हों, वे अराजकता में नहीं घिरे। वे ट्रैक पर बने रहे।
- कोई अतिरिक्त लागत नहीं: "अपने आप अभ्यास करने" वाली विधि के विपरीत, DISCORD को हजारों अतिरिक्त अभ्यास समस्याओं को उत्पन्न करने की आवश्यकता नहीं थी। इसने शिक्षक के उसी निश्चित वीडियो का उपयोग किया लेकिन उसे अधिक बुद्धिमानी से सिखाया।
मुख्य निष्कर्ष (The Bottom Line)
DISCORD को शिक्षक के आदर्श तर्क और छात्र की अपूर्ण वास्तविकता के बीच एक अनुवादक के रूप में समझें। छात्र को उस आदर्श मार्ग की नकल करने के लिए मजबूर करने के बजाय जिसे वे चल नहीं सकते, यह उन हिस्सों को उजागर करता है जिन्हें वे चल सकते हैं, जिससे यह सुनिश्चित होता है कि वे उन विवरणों में खोए बिना सबसे उपयोगी कौशल सीख सकें जिनके लिए वे अभी तैयार नहीं हैं।
यह छोटे, सस्ते AI मॉडल को बिना किसी महंगे, समय लेने वाले प्रशिक्षण सत्र के बहुत स्मार्ट बनने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।