← नवीनतम पेपर
💻 computer science

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution

यह शोध पत्र DIVE को प्रस्तुत करता है, जो एक विविधता-संचालित ढांचा (framework) है जो फ्रोजन लार्ज लैंग्वेज मॉडल्स को कार्य अनुभव और वेरीफायर फीडबैक से पूरक प्राकृतिक-भाषा कौशल विकसित और चुनने के माध्यम से तीव्र, पैरामीटर-मुक्त आत्म-सुधार प्राप्त करने में सक्षम बनाता है, जिससे यह मौजूदा रीजनिंग और ऑप्टिमाइज़ेशन विधियों को पीछे छोड़ते हुए विभिन्न मॉडल स्केल्स पर प्रभावी ढंग से स्थानांतरित होता है।

मूल लेखक: Siheng Xiong, Ali Payani, Oguzhan Gungordu, Faramarz Fekri

प्रकाशित 2026-08-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siheng Xiong, Ali Payani, Oguzhan Gungordu, Faramarz Fekri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दोस्त है जो दुनिया के बारे में लगभग सब कुछ जानता है। आप उससे कोई कठिन गणित की समस्या या तर्क संबंधी पहेली हल करने के लिए कह सकते हैं, और वह आमतौर पर इसे सही कर लेता है। लेकिन यहाँ एक पेच है: एक बार जब आप रोबोट को बंद करके फिर से चालू करते हैं, तो वह आपके विशिष्ट प्रश्नों से सीखी गई हर चीज़ को भूल जाता है। यह एक ऐसे जीनियस की तरह है जो हर सुबह एक साफ स्लेट (खाली दिमाग) के साथ जागता है, जो यह याद नहीं रख पाता कि कल उसने क्या गलतियाँ की थीं या कौन सी चतुर तरकीबें खोजी थीं। आमतौर पर, रोबोट को स्मार्ट बनाने के लिए, आपको उसके मस्तिष्क को फिर से वायर करना पड़ता है (एक प्रक्रिया जिसे "ट्रेनिंग" कहा जाता है), जो महंगा, धीमा है और इसके लिए विशेष पहुंच की आवश्यकता होती है जो बहुत से लोगों के पास नहीं होती।

तो, वैज्ञानिकों ने एक बड़ा सवाल पूछा है: क्या एक जमे हुए (frozen) रोबोट को अपना मस्तिष्क बदले बिना सीख सकता है? उत्तर "प्रॉम्प्टिंग" (prompting) नामक चीज़ में निहित है। रोबोट के मस्तिष्क को बदलने के बजाय, आप उसे दिए जाने वाले निर्देशों को बदल सकते हैं। इसे एक शेफ को एक नया रेसिपी कार्ड देने जैसा समझें। यदि कार्ड कहता है, "सूप में नमक डालना याद रखें," तो शेफ बेहतर काम कर सकता है। लेकिन यदि शेफ बार-बार एक ही गलती करता रहता है, तो एक साधारण नोट पर्याप्त नहीं होगा। आपको एक ऐसा तरीका चाहिए जिससे शेफ यह लिख सके कि वह क्यों विफल हुआ, एक बेहतर रणनीति तय कर सके, और उस रणनीति को अपने रेसिपी कार्ड पर एक स्थायी नियम में बदल सके, वह भी बिना अपने वास्तविक खाना बनाने के कौशल को बदले। यह AI के "स्व-सुधार" (self-improvement) का मोर्चा है: एक स्थिर मॉडल को केवल खुद से बात करके और अपने अनुभवों से सीखकर स्मार्ट बनाना।

यहाँ आता है DIVE (डाइव - डाइवर्सिटी-ड्रिवन स्किल इवोल्यूशन), एक नई विधि जो इन जमे हुए रोबोटों के लिए एक शानदार, अराजक कार्यशाला (workshop) की तरह काम करती है। शोधकर्ताओं ने पाया कि एक "परफेक्ट" सेट निर्देशों को खोजने की कोशिश करने के बजाय, रोबोट के अलग-अलग "संस्करणों" की एक पूरी टीम चलाना बेहतर है, जिनमें से प्रत्येक थोड़ा अलग तरीके से सीखने की कोशिश करता है।

DIVE कैसे काम करता है, इसे ऐसे समझें जैसे दस अलग-अलग जासूसों का एक समूह एक रहस्य को सुलझाने की कोशिश कर रहा हो। अतीत में, शोधकर्ता केवल एक जासूस को मामला सुलझाने, गलती करने और फिर अपने नोट्स को ठीक करने के लिए कह सकते थे। लेकिन DIVE कहता है, "आइए दस जासूसों को एक साथ मामले पर काम करने दें!" प्रत्येक जासूस नोट्स का एक थोड़ा अलग सेट ("सीड स्किल" या बीज कौशल) लेकर शुरू करता है। जैसे-जैसे वे काम करते हैं, उन्हें फीडबैक मिलता है कि वे कहाँ गलत हुए।

केवल एक जासूस द्वारा अपने नोट्स को ठीक करने के बजाय, Dive विभिन्न "ठीक करने वाली रणनीतियों" (fixing strategies) का एक टूलबॉक्स उपयोग करता है। एक जासूस रिफ्लेक्टिव रिपेयर (Reflective Repair) आज़मा सकता है, जो एक गलती को देखने और यह कहने जैसा है, "ओह, मैंने यहाँ एक सुराग छोड़ दिया, मुझे इसके बारे में एक नोट जोड़ना चाहिए।" दूसरा एक्सप्लोरेटरी रिवीजन (Exploratory Revision) आज़मा सकता है, जो पुराने नक्शे को फेंक देने और एक पूरी तरह से नया नक्शा बनाने जैसा है क्योंकि पुराना रास्ता एक डेड एंड (बंद रास्ता) है। तीसरा कंप्रेशन (Compression) आज़मा सकता है, जो एक अव्यवस्थित, 50-पेज की नोटबुक को एक संक्षिप्त, 5-पेज के संदर्भ पत्रक में समेटने जैसा है जिसमें केवल सबसे महत्वपूर्ण नियमों को रखा गया है।

DIVE का जादू यह नहीं है कि यह केवल सबसे अच्छे जासूस को चुनता है और रुक जाता है। यह सभी दस जासूसों को समानांतर (parallel) रूप से काम करते हुए रखता है। यह देखता है कि कौन सा जासूस किस तरह की समस्या में बेहतर हो रहा है और उन्हें काम करने के लिए अधिक समय देता है। यदि कोई जासूस फंस जाता है, तो सिस्टम एक नई, ताज़ा रणनीति लाने के लिए मदद ले सकता है। यह पूरे समूह को एक ही गलत विचार पर अटकने से रोकता है (जिसे "ओवरफिटिंग" कहा जाता है)।

एक बार जब जासूसों को सीखने और विकसित होने का मौका मिल जाता है, तो DIVE केवल उच्चतम स्कोर वाला जासूस नहीं चुनता है। इसके बजाय, यह पूरी टीम को देखता है और एक पूरक दस्ता (complementary squad) चुनता है। हो सकता है कि जासूस A संख्या पैटर्न पहचानने में माहिर हो, जबकि जासूस B तर्क के जाल को पहचानने में अद्भुत हो। उनके अद्वितीय, विकसित "स्किल कार्ड्स" को एक एकल टूलकिट में मिलाकर, रोबोट उन समस्याओं को हल कर सकता है जिन्हें वह पहले हल नहीं कर सका था।

पेपर दिखाता है कि यह तरीका अविश्वसनीय रूप से अच्छा काम करता है। कठिन गणित प्रतियोगिताओं (जैसे HMMT) और जटिल तर्क पहेलियों (जैसे सुडोकू) पर परीक्षण किए जाने पर, DIVE ने छोटे, जमे हुए मॉडलों को तेजी से सीखने और सुधारने की अनुमति दी। वास्तव में, DIVE की विकसित कौशलों का उपयोग करने वाला एक छोटा मॉडल, मानक निर्देशों का उपयोग करने वाले बहुत बड़े, अधिक शक्तिशाली मॉडल को भी पीछे छोड़ने में सक्षम था। शोधकर्ताओं ने पाया कि DIVE अन्य तरीकों की तुलना में बहुत कम प्रयासों (या "रोलआउट्स") के साथ ये बड़े सुधार प्राप्त कर सकता है जो मॉडल के मस्तिष्क को बदलने या केवल एक बार प्रॉम्प्ट को ट्यून करने की कोशिश करते हैं।

महत्वपूर्ण रूप से, पेपर तर्क देता है कि यह दृष्टिकोण एक एकल "जादुई प्रॉम्प्ट" खोजने या सीखने के एक एकल पथ पर निर्भर रहने की तुलना में बेहतर है। विविध, विकसित होते कौशलों के एक समूह को बनाए रखकर और सर्वश्रेष्ठ हिस्सों को मिलाकर, DIVE एक मजबूत, स्व-सुधार प्रणाली बनाता है जिसे फिर से वायर करने की आवश्यकता नहीं है। यह सुझाव देता है कि जमे हुए मॉडलों के लिए, स्मार्ट होने का रहस्य एक आदर्श निर्देश नहीं है, बल्कि रणनीतियों का एक विविध, विकसित पुस्तकालय है जिसे मॉडल किसी भी समस्या को हल करने के लिए उपयोग कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →