← नवीनतम पेपर
💬 NLP

Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution

यह शोध पत्र वोकैबुलरी ड्रॉपआउट (vocabulary dropout) प्रस्तुत करता है, जो एक हल्का तंत्र है जो को-इवोल्यूशनरी सेल्फ-प्ले में विविधता के पतन को रोकने के लिए एक प्रपोजर मॉडल के आउटपुट लॉजिट्स पर एक रैंडम, नॉन-स्टेशनरी मास्क लागू करता है, जिससे करिकुलम विविधता बनी रहती है और गणितीय तर्क बेंचमार्क पर सॉल्वर के प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Jacob Dineen, Aswin RRV, Zhikun Xu, Ben Zhou

प्रकाशित 2026-04-07
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jacob Dineen, Aswin RRV, Zhikun Xu, Ben Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र (Solver) को जटिल गणित की समस्याएं हल करना सिखाने की कोशिश कर रहे हैं। एक मानव शिक्षक के बजाय, आपके पास एक AI शिक्षक (Proposer) है जो खुद भी सीख रहा है।

एक आदर्श दुनिया में, शिक्षक लगातार नई, थोड़ी कठिन समस्याएं बनाता रहेगा ताकि छात्र को चुनौती मिलती रहे। इसे सह-विकास (Co-evolution) कहा जाता है: शिक्षक समस्याएं बनाने में बेहतर होता जाता है, और छात्र उन्हें हल करने में बेहतर होता जाता है, जिससे वे एक-दूसरे को आगे बढ़ाते हैं।

समस्या: "ब्रोकन रिकॉर्ड" (Broken Record) शिक्षक

शोध में इस प्रणाली में एक बड़ी खामी पाई गई। बिना मदद के, AI शिक्षक जल्दी ही आलसी हो जाता है। वह कुछ "ट्रिक्स" या टेम्पलेट्स खोज लेता है जो छात्र को बस इतना भ्रमित करने के लिए पर्याप्त हैं कि शिक्षक को एक उच्च स्कोर मिल सके।

इसे एक ऐसे DJ की तरह समझें जिसे पता चलता है कि भीड़ को एक विशिष्ट गाना बहुत पसंद है। विविध प्लेलिस्ट चलाने के बजाय, DJ बस उसी गाने को बार-बार बजाता रहता है, बस उसकी आवाज़ को थोड़ा कम या ज्यादा कर देता है।

  • परिणाम: छात्र ऊब जाता है और सीखना बंद कर देता है क्योंकि "पाठ्यक्रम" (प्रश्नों की सूची) वास्तव में उसे कुछ नया नहीं सिखा रहा है। शिक्षक एक संकीर्ण लूप में फंस गया है जहाँ प्रश्न दोहराव वाले और निम्न-गुणवत्ता वाले हैं।

समाधान: "वोकैबुलरी ड्रॉपआउट" (Vocabulary Dropout)

लेखकों ने "वोकैबुलरी ड्रॉपआउट" नामक एक सरल सुधार पेश किया।

कल्पना कीजिए कि शिक्षक व्हाइटबोर्ड पर एक समस्या लिख रहा है, लेकिन हर बार जब वह मार्कर उठाता है, तो कोई रैंडम तरीके से उन शब्दों के 20% को मिटा देता है जिनका उपयोग करने की उसे अनुमति है।

  • नियम: यदि इस दौर के लिए "त्रिकोण" (triangle) शब्द को मिटा दिया गया है, तो शिक्षक "त्रिकोण" नहीं लिख सकता, भले ही वह यह लिखना चाहता हो। उसे उस आकार का वर्णन करने का कोई दूसरा तरीका खोजना होगा, शायद "तीन भुजाओं वाला बहुभुज" (three-sided polygon) का उपयोग करना या एक चित्र बनाना।
  • ट्विस्ट: हर बार एक नई समस्या लिखते समय प्रतिबंधित शब्दों की सूची बदल जाती है।

यह क्यों काम करता है (उपमा)

पुराने सिस्टम में, शिक्षक ने एक "सुरक्षित रास्ता" (शब्दों का एक विशिष्ट सेट) खोज लिया था और उसी पर टिका रहा। उन सुरक्षित रास्तों को रैंडम तरीके से ब्लॉक करके, शिक्षक को मजबूर किया जाता है कि वह:

  1. रचनात्मक रूप से सोचे: वह अपने पसंदीदा शॉर्टकट पर निर्भर नहीं रह सकता।
  2. नए क्षेत्रों का अन्वेषण करे: उसे एक ही अवधारणा को समझाने के लिए अलग-अलग शब्दों और संरचनाओं का उपयोग करना होगा।
  3. ताज़ा बना रहे: क्योंकि "प्रतिबंधित सूची" हर बार बदलती है, शिक्षक कभी भी एक उबाऊ दिनचर्या में नहीं जम सकता।

परिणाम

शोधकर्ताओं ने दो AI मॉडलों (एक छोटा और एक मध्यम आकार का) पर इसका परीक्षण किया जो गणित सीख रहे थे।

  • सुधार के बिना: शिक्षक एक लूप में फंस गया, और छात्र की प्रगति रुक गई।
  • सुधार के साथ: शिक्षक विविध, दिलचस्प समस्याएं उत्पन्न करता रहा। नतीजतन, छात्र (Solver) कठिन प्रतियोगिता-स्तर की गणित समस्याओं को हल करने में काफी बेहतर हो गया, और उसके स्कोर में औसतन 4.4 अंकों का सुधार हुआ।

बड़ी तस्वीर

पेपर का तर्क है कि जिस तरह एक बोर्ड गेम को दिलचस्प और रणनीतिक बनाने के लिए नियमों (जैसे "आप अपने नाइट को तिरछा नहीं चला सकते") की आवश्यकता होती है, उसी तरह AI भाषा मॉडलों को अपनी सीख को उत्पादक बनाए रखने के लिए बाधाओं (constraints) की आवश्यकता होती है।

वोकैबुलरी ड्रॉपआउट एक नए, रैंडम नियम को हर टर्न में जोड़ने जैसा है। यह AI को दोहरावदार होने के बजाय रचनात्मक होने के लिए मजबूर करता है, जिससे यह सुनिश्चित होता है कि "पाठ्यक्रम" एक समृद्ध, चुनौतीपूर्ण और उपयोगी प्रशिक्षण मैदान बना रहे।

संक्षेप में: एक AI शिक्षक को आलसी और दोहराव वाला होने से रोकने के लिए, आप कभी-कभी उनके पसंदीदा शब्द छीन लेते हैं। यह उन्हें अधिक रचनात्मक होने के लिए मजबूर करता है, जो बदले में उनके छात्र को बहुत अधिक स्मार्ट बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →