OpenSkill: Open-World Self-Evolution for LLM Agents
यह शोध पत्र OpenSkill को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो LLM एजेंटों को लक्षित-कार्य पर्यवेक्षण (target-task supervision) पर निर्भर रहे बिना, बाहरी संसाधनों से हस्तांतरणीय कौशल और सत्यापन संकेतों को संश्लेषित करके ओपन-वर्ल्ड डिप्लॉयमेंट में स्वायत्त रूप से स्व-विकास (self-evolution) को बूटस्ट्रैप करने में सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक जटिल पहेली को हल करने के लिए एक प्रतिभाशाली लेकिन अनुभवहीन प्रशिक्षु (apprentice) को काम पर रखा है। आमतौर पर, उन्हें सिखाने के लिए, आप उन्हें एक पाठ्यपुस्तक, "क्या करें और क्या न करें" की एक सूची, या एक शिक्षक देंगे जो पास खड़ा होकर कहेगा, "अच्छा काम किया!" या "फिर से कोशिश करो।"
OpenSkill इन AI "प्रशिक्षुओं" (जिन्हें LLM एजेंट कहा जाता है) को प्रशिक्षित करने का एक नया तरीका है जब आपके पास इनमें से कोई भी चीज़ उपलब्ध न हो। आप उन्हें केवल पहेली का प्रॉम्प्ट और इंटरनेट देते हैं। उन्हें खुद को सिखाना होगा, यह समझना होगा कि क्या सीखना है, और यहाँ तक कि अपना काम जाँचने के लिए अपना खुद का "शिक्षक" भी बनाना होगा, वह भी उत्तर कुंजी (answer key) को देखे बिना।
यहाँ यह शोध पत्र इन उपमाओं (analogies) का उपयोग करके इस प्रक्रिया को सरल तरीके से समझाता है:
समस्या: "शांत कमरा" (The Silent Room)
अधिकांश वर्तमान AI प्रशिक्षण विधियाँ मानती हैं कि AI के पास एक सहायक लूप होता है: वह कुछ प्रयास करता है, उसे एक स्कोर मिलता है, और फिर से प्रयास करता है। लेकिन वास्तविक दुनिया में ("ओपन वर्ल्ड"), आपको अक्सर केवल एक कार्य और बहुत सारे बिखरे हुए संसाधन (वेबसाइटें, मैनुअल, कोड रिपॉजिटरी) मिलते हैं। आपके पास कोई उत्तर कुंजी नहीं होती, और न ही उनके काम को ग्रेड देने के लिए कोई इंसान होता है।
यदि AI अपने स्वयं के अनुमानों से सीखने की कोशिश करता है, तो वह खुद को यह समझाने की कोशिश कर सकता है कि वह सही है, भले ही वह गलत हो। यह बिना किसी शब्दकोश के केवल खुद से बात करके एक नई भाषा सीखने की कोशिश करने जैसा है।
समाधान: OpenSkill
शोधकर्ताओं ने OpenSkill नामक एक ढांचा (framework) बनाया है जो AI के लिए एक आत्मनिर्भर सर्वाइवल गाइड की तरह काम करता है। यह तीन मुख्य चरणों में काम करता है:
1. "लाइब्रेरियन" चरण (ज्ञान प्राप्ति - Knowledge Acquisition)
AI जो पहले से याद रखता है (जो पुराना या गलत हो सकता है) उस पर निर्भर रहने के बजाय, OpenSkill AI को "ओपन वर्ल्ड" (इंटरनेट, डॉक्यूमेंटेशन, कोड रिपॉजिटरी) में भेजता है।
- उपमा: कल्पना कीजिए कि AI एक जासूस है। अपराधी का अनुमान लगाने के बजाय, वह लाइब्रेरी में जाता है, मामले से संबंधित हर पुलिस रिपोर्ट, तकनीकी मैनुअल और समाचार लेख को पढ़ता है। वह एक योजना बनाने के लिए आवश्यक कच्चे तथ्यों को इकट्ठा करता है।
2. "वर्चुअल डोजो" चरण (लीकेज-मुक्त विकास - Leakage-Free Evolution)
यह सबसे चतुर हिस्सा है। AI को अभ्यास करने की आवश्यकता है, लेकिन वह वास्तविक उत्तर कुंजी का उपयोग नहीं कर सकता। इसलिए, OpenSkill एक वर्चुअल वेरीफायर (Virtual Verifier) बनाता है।
- उपमा: इसे एक "डोजो" या अभ्यास जिम की तरह समझें। AI पहेली को हल करने के लिए नियमों (कौशल/skills) का एक सेट लिखता है। फिर, एक अलग, स्वतंत्र AI एक सख्त रेफरी की भूमिका निभाता है।
- रेफरी कैसे काम करता है: रेफरी को उत्तर कुंजी का पता नहीं होता। इसके बजाय, वह लाइब्रेरी में पहले से मिले ठोस तथ्यों (hard facts) के विरुद्ध AI के काम की जाँच करता है।
- उदाहरण: यदि कार्य एक डेटासेट का विश्लेषण करना है, तो रेफरी जाँच करेगा: "क्या AI ने पंक्तियों (rows) को सही ढंग से गिना? क्या संख्याओं का योग ज्ञात कुल योग से मेल खाता है?"
- यह एक गणित के शिक्षक की तरह है जो यह जाँच रहा है कि आपका उत्तर एक सम संख्या (even number) है या नहीं, या क्या वह एक यथार्थवादी सीमा के भीतर आता है, बिना यह जाने कि आपको विशिष्ट संख्या क्या दी जानी थी।
- यदि AI विफल होता है, तो रेफरी कहता है, "आपने एक चरण छोड़ दिया," या "आपको इस विशिष्ट नियम को फिर से देखना होगा।" इसके बाद AI अपने नियमों को ठीक करता है और फिर से प्रयास करता है। यह लूप तब तक चलता है जब तक कि AI सभी "वर्चुअल" परीक्षणों को पास नहीं कर लेता।
3. "फाइनल एग्जाम" चरण (जीरो-शॉट इवैल्यूएशन - Zero-Shot Evaluation)
एक बार जब AI वर्चुअल डोजो में अपने कौशल को निखार लेता है, तो उसे वास्तविक कार्य को हल करने के लिए वास्तविक दुनिया में भेजा जाता है।
- उपमा: AI अंतिम परीक्षा देता है। वास्तविक उत्तर कुंजी परीक्षा समाप्त होने के बाद ही प्रकट की जाती है। शोधकर्ताओं ने पाया कि AI ने, अपने स्वयं के बनाए "रेफरी" के साथ अभ्यास करने के बाद, अविश्वसनीय रूप से अच्छा प्रदर्शन किया, और अक्सर उन तरीकों को भी पीछे छोड़ दिया जो पूर्व-लिखित कौशल या मानवीय प्रतिक्रिया पर निर्भर थे।
यह क्यों महत्वपूर्ण है (परिणाम)
शोधकर्ताओं ने दो अलग-अलग AI मॉडल का उपयोग करके तीन अलग-अलग प्रकार की चुनौतियों (सॉफ्टवेयर कोडिंग, सामाजिक तर्क, और विज्ञान प्रयोग) पर इसका परीक्षण किया।
- यह बिना धोखाधड़ी के काम करता है: AI ने अपने प्रशिक्षण के दौरान वास्तविक उत्तर कभी नहीं देखे। उसने सार्वजनिक तथ्यों से अपना स्वयं का "सत्य" बनाया।
- यह पोर्टेबल है: AI द्वारा सीखे गए "कौशल" (नियम जो उसने लिखे) एक भौतिक पुस्तक की तरह हैं। आप एक AI द्वारा लिखी गई पुस्तक को दूसरे, कमजोर AI को दे सकते हैं, और यह अभी भी काम करती है। AI ने केवल उत्तर को "रटा" नहीं; उसने एक विधि सीखी।
- यह प्रतिस्पर्धा को हरा देता है: लगभग हर परीक्षण में, OpenSkill ने अन्य तरीकों से बेहतर स्कोर प्राप्त किया जो इस विशिष्ट "वर्चुअल रेफरी" सेटअप के बिना सीखने की कोशिश कर रहे थे।
निष्कर्ष (The Bottom Line)
OpenSkill एक ऐसा सिस्टम है जो AI एजेंटों को आत्मनिर्भर बनना सिखाता है। यह दिखाता है कि एक AI किसी विशिष्ट कार्य के बारे में कुछ भी न जानने से लेकर विशेषज्ञ बनने तक का सफर तय कर सकता है, केवल:
- मैनुअल पढ़कर (Open World)।
- तथ्यों पर आधारित अपना स्वयं का परीक्षण (Virtual Verifier) बनाकर।
- उस परीक्षण को पास होने तक अभ्यास करके।
- और फिर वास्तविक समस्या को हल करके।
यह साबित करता है कि AI को बेहतर होने के लिए सिखाने के लिए आपको किसी मानव शिक्षक या छिपी हुई उत्तर कुंजी की आवश्यकता नहीं है; आपको बस उसे अपने काम की जाँच करने के लिए सही उपकरण देने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।