SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback
SkillEvo एक ऐसा फ्रेमवर्क है जो मल्टी-टर्न यूजर सिमुलेशन को लक्षित सुधारों के लिए निरंतर फीडबैक जनरेटर में बदलकर और संरचनात्मक गिरावट को ठीक करने के लिए एक सक्रिय गवर्नेंस लेयर पेश करके एजेंट कौशल के निरंतर विकास को सक्षम बनाता है, जिससे यह मौजूदा सिंगल-टर्न या सेल्फ-रिफ्लेक्शन-आधारित दृष्टिकोणों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक टूटे हुए टोस्टर को ठीक करना सिखा रहे हैं। पुराने दिनों में, आपको हर एक कदम हाथ से लिखना पड़ता था: "प्लग की जाँच करें," "जले हुए तारों को देखें," "रीसेट बटन दबाएं।" यदि रोबोट कोई गलती करता, तो आपको त्रुटि ढूंढनी पड़ती, मैनुअल को फिर से लिखना पड़ता और फिर से शुरुआत करनी पड़ती। यह धीमा और महंगा था, और रोबोट वास्तव में अपनी विफलताओं से मौके पर कुछ नहीं सीख पाता था।
हाल ही में, वैज्ञानिकों ने रोबोट्स को चीजें ठीक करने की कोशिश करने दी और फिर उनसे पूछा, "आपने यह कैसे किया?" रोबोट अपने काम को देखता, महसूस करता कि उसने कोई कदम छोड़ दिया है, और फिर अपने स्वयं के निर्देशों को फिर से लिखने की कोशिश करता। इसे "स्व-विकास" (self-evolution) कहा जाता है। लेकिन इसमें एक पेंच है: अधिकांश रोबोट्स को खुद को समझाने का केवल एक ही मौका मिलता है। वे टोस्टर को ठीक करने की कोशिश करते हैं, एक त्वरित "अच्छा काम" या "बुरा काम" का स्कोर प्राप्त करते हैं, और फिर रुक जाते हैं। वे उन सूक्ष्म गलतियों को मिस कर देते हैं जो तभी सामने आती हैं जब आप पूछते हैं, "रुकिए, क्या होगा अगर प्लग ढीला है और तार भी जला हुआ है?" वे अटक जाते हैं क्योंकि वे समस्या की गहरी परतों को देख नहीं पाते।
यहीं पर SkillEvo नामक एक नया विचार आता है। यह एक ऐसा फ्रेमवर्क है जिसे AI "एजेंट्स" (स्मार्ट कंप्यूटर प्रोग्राम) को उनके काम में बेहतर होने में मदद करने के लिए डिज़ाइन किया गया है, जो केवल एक त्वरित जांच के बजाय लंबी, आगे-पीछे की बातचीत से सीखते हैं। इस कार्य के पीछे के शोधकर्ताओं ने, जो Tencent Cloud और Zhejiang University से हैं, एक विशिष्ट समस्या को हल करना चाहा: आप AI के ज्ञान आधार (knowledge base) को कैसे बढ़ा सकते हैं और बेहतर बना सकते हैं बिना इसके कि वह अस्त-व्यस्त, भ्रमित या झूठ से भरा हो जाए? उन्होंने पाया कि रहस्य केवल एक स्मार्ट संपादक होने में नहीं है; बल्कि एक स्मार्ट शिक्षक होने में है जो छिपी हुई गलतियों को उजागर करने के लिए अनुवर्ती प्रश्न पूछता रहता है, और एक सख्त निरीक्षक होने में है जो यह सुनिश्चित करता है कि रोबोट नए उत्तर जोड़ने के प्रयास में गलती से सही उत्तरों को डिलीट न कर दे।
समस्या: वह रोबोट जो सीखना बंद कर देता है
कल्पना कीजिए कि आप एक नए पात्र (character) के साथ वीडियो गेम खेल रहे हैं। पहले राउंड में, पात्र एक गड्ढे के ऊपर से कूदने की कोशिश करता है और असफल हो जाता है। आप उसे कहते हैं, "तुम्हें ऊँचा कूदना चाहिए।" वे इसे ठीक करते हैं, और अगले राउंड में, वे ठीक से कूदते हैं। लेकिन फिर, वे एक आग के गोले (fireball) से बचते हुए गड्ढे के ऊपर से कूदने की कोशिश करते हैं, और वे फिर से असफल होते हैं। यदि आपका शिक्षक केवल पहले कूदने पर फीडबैक देता, तो पात्र कभी भी फायरबॉल को संभालने के लिए नहीं सीख पाता। वे एक ऐसे "सीलिंग" (छत) पर पहुँच जाते जहाँ वे और बेहतर नहीं हो सकते क्योंकि उन्हें कठिन चीजों पर परखा नहीं जा रहा है।
यह वर्तमान AI कौशल के साथ बिल्कुल वैसा ही है। अधिकांश सिस्टम "सिंगल-टर्न" (एक बार की) जांच का उपयोग करते हैं। AI एक समस्या को हल करने की कोशिश करता है, एक स्कोर प्राप्त करता है, और फिर से प्रयास करता है। लेकिन एक बार जब स्पष्ट गलतियाँ ठीक हो जाती हैं, तो फीडबैक उपयोगी होना बंद हो जाता है। AI एक दीवार से टकरा जाता है। यह एक भाषा सीखने जैसा है जहाँ आप केवल सरल प्रश्नों के "हाँ" या "ना" में उत्तर देते हैं; आप कभी भी जटिल बातचीत करना नहीं सीख पाएंगे।
इसके अलावा, जब ये AI खुद को ठीक करने की कोशिश करते हैं, तो वे अक्सर चीजों को बिगाड़ देते हैं। वे इतनी सारी नई जानकारी जोड़ सकते हैं कि उनके निर्देश एक अव्यवset, विरोधाभासों से भरी 100 पन्नों की कहानी बन जाते हैं। वे उन मूल नियमों को भूल सकते हैं जिनका उन्हें पालन करना था। इसे "डिग्रेडेशन" (क्षरण) कहा जाता है। वे जितना अधिक विकसित होने की कोशिश करते हैं, उतने ही अविश्वसनीय होते जाते हैं।
समाधान: SkillEvo का दो-भाग वाला जादू
इस पेपर के लेखकों ने SkillEvo (स्किल इवोल्यूशन) नामक एक नया सिस्टम प्रस्तावित किया है। उनका तर्क है कि AI को बेहतर बनाने की कुंजी केवल उसे अपना कोड एडिट करने के लिए अधिक समय देना नहीं है, बल्कि उसे बेहतर फीडबैक और बेहतर नियम देना है। उन्होंने एक सिस्टम बनाया जिसमें दो मुख्य भाग हैं: एक विश्वसनीय फीडबैक जनरेटर (Trustworthy Feedback Generator) और एक नियंत्रणीय शासन परत (Controllable Governance Layer)।
भाग 1: जिज्ञासु सिम्युलेटर (विश्वसनीय फीडबैक)
केवल AI से एक सवाल पूछने के बजाय, SkillEvo एक "सिम्युलेटर" का उपयोग करता है जो एक वास्तविक, थोड़े कठिन मानव ग्राहक की तरह व्यवहार करता है। यह सिम्युलेटर केवल एक सवाल पूछकर नहीं जाता। यह "20 Questions" का खेल खेलता है।
- सेटअप: सिम्युलेटर एक वास्तविक, अस्त-व्यस्त ग्राहक शिकायत (एक "टिकट") को पढ़ता है और एक वास्तविक परिदृश्य बनाता है। वह जानता है कि ग्राहक क्या चाहता है, उसने पहले क्या कोशिश की है, और वह कैसे निराश भी हो सकता है।
- बातचीत: AI मदद करने की कोशिश करता है। सिम्युलेटर अनुवर्ती प्रश्न पूछता है: "ठीक है, लेकिन क्या होगा अगर मैंने वह आजमाया और वह काम नहीं किया?" या "रुकिए, अब मेरे पास एक अलग एरर कोड है।"
- खुलासा: यह आगे-पीछे की बातचीत समस्या की परतों को हटा देती है। ठीक वैसे ही जैसे वीडियो गेम में, बातचीत का पहला दौर आसान चीजों को ठीक कर सकता है, लेकिन दूसरा और तीसरा दौर छिपी हुई, जटिल गलतियों को उजागर करता है।
- फ़िल्टर: हर गलती AI की गलती नहीं होती। कभी-कभी सिम्युलेटर अजीब व्यवहार कर रहा होता है, या AI द्वारा उपयोग किया जाने वाला टूल टूटा हुआ होता है। SkillEvo के पास एक विशेष "एट्रीब्यूटर" (Attributor) है जो जाँचता है: "क्या यह AI के ज्ञान में कमी है, या यह कुछ और है?" केवल वास्तविक ज्ञान अंतराल (knowledge gaps) को ही फीडबैक में बदला जाता है।
यह एक "स्व-नवीनीकरण" ग्रेडिएंट बनाता है। हर बार जब AI एक गलती ठीक करता है, सिम्युलेटर एक कठिन सवाल पूछ सकता है, जिससे दोष की अगली परत सामने आती है। AI के पास सीखने के लिए कभी भी चीज़ें खत्म नहीं होतीं।
भाग 2: सख्त निरीक्षक (नियंत्रणीय शासन)
बेहतरीन फीडबैक के साथ भी, एक AI अव्यवस्थित हो सकता है। यदि आप एक छात्र को हर दिन अपनी पाठ्यपुस्तक को फिर से लिखने की अनुमति देते हैं, तो वह कला का अध्याय जोड़ते समय गणित का अध्याय गलती से डिलीट कर सकता है। वह अपनी जानकारी को दोहराते हुए उसे बहुत लंबा बना सकता है।
SkillEvo इसे रोकने के लिए एक "गवर्नेंस" (शासन) परत जोड़ता है। इसे एक सख्त संपादक के रूप में सोचें जिसके दो नियम हैं:
- सत्य को डिलीट न करें: AI को उन सभी स्थिर, सही तथ्यों को बनाए रखना चाहिए जिनके साथ वह शुरू हुआ था। यदि वह किसी ज्ञात तथ्य को हटाने की कोशिश करता है, तो सिस्टम कहता है "नहीं!" और उसे तुरंत ठीक करता है।
- किताब को फालतू न होने दें: सिस्टम यह जाँचता है कि क्या AI अनावश्यक बातें जोड़ रहा है या अपने ज्ञान के विभिन्न हिस्सों के बीच के लिंक तोड़ रहा है। यदि AI का "नॉलेज ग्राफ" उलझ जाता है या बहुत बड़ा हो जाता है, तो सिस्टम सक्रिय रूप से उसकी मरम्मत करता है, मृत अंतों (dead ends) को काटता है और संरचना को सुव्यवस्थित करता है।
यह सुनिश्चित करता है कि जैसे-जैसे AI स्मार्ट होता है, वह अव्यवस्थित न हो। यह व्यवस्थित और विश्वसनीय बना रहता है।
उन्होंने क्या पाया: संख्याएँ
शोधकर्ताओं ने क्लाउड सेवाओं (जैसे डेटाबेस समस्याओं को ठीक करना या सर्वर प्रबंधित करना) में उपयोग किए जाने वाले 9 वास्तविक दुनिया के कौशलों पर इस प्रणाली का परीक्षण किया। उन्होंने SkillEvo की तुलना तीन अन्य तरीकों से की:
- मूल कौशल (Original Skills): शुरुआती बिंदु, जिसे कभी अपडेट नहीं किया गया।
- स्व-चिंतन (Self-Reflection): AI बिना किसी बाहरी फीडबैक के खुद को ठीक करने की कोशिश करता है।
- सिंगल-टर्न QA: AI को केवल एक प्रश्न-उत्तर सत्र से फीडबैक मिलता है।
परिणाम स्पष्ट थे। "Self-Reflection" विधि ने बहुत कम सुधार किया; वह बस एक ही जगह घूम रही थी। "Single-Turn QA" विधि पहले तो बेहतर हुई, लेकिन फिर एक दीवार से टकरा गई, और लगभग 66.4% सफलता दर पर रुक गई।
हालाँकि, SkillEvo ऊपर चढ़ता रहा। गहरी समस्याओं को खोजने के लिए मल्टी-टर्न बातचीत का उपयोग करके और चीजों को साफ रखने के लिए गवर्नेंस लेयर का उपयोग करके, इसने 81.8% की सफलता दर हासिल की। यह सिंगल-टर्न पद्धति की तुलना में 15.4-पॉइंट का सुधार है और मूल, अपडेट न किए गए कौशलों की तुलना में भारी 51.8-पॉइंट का सुधार है।
उन्होंने यह भी मापा कि AI की "ज्ञान पुस्तक" कितनी बढ़ी। गवर्नेंस लेयर के बिना, पुस्तक का आकार 16.2% बढ़ गया, जो बोझिल और अव्यवस्थित हो गई। गवर्नेंस लेयर के साथ, यह केवल 2.8% बढ़ी, जो साबित करता है कि AI अनावश्यक कचरा जोड़े बिना कुशलतापूर्वक सीख रहा था।
यह क्यों महत्वपूर्ण है
यह पेपर सुझाव देता है कि भविष्य के AI के बारे में केवल बड़े मॉडल बनाने या उन्हें खुद को एडिट करने देने के बारे में नहीं है। यह इस बारे में है कि हम उनसे कैसे बात करते हैं और हम उनके काम की जाँच कैसे करते हैं। एक साधारण "परीक्षण" को एक लंबी, प्रकट करने वाली बातचीत में बदलकर, और एक सख्त "गवर्नेंस" सिस्टम जोड़कर, जो AI को भ्रमित होने से रोकता है, हम एक ऐसा AI बना सकते हैं जो वास्तव में समय के साथ सीखता और बेहतर होता है।
लेखकों ने इसे Tencent Cloud में एक वास्तविक प्रोडक्शन वातावरण में टेस्ट किया है, जिसका अर्थ है कि यह केवल एक सिद्धांत नहीं है; यह एक ऐसा सिस्टम है जो वास्तव में काम करता है जब वास्तविक ग्राहक शामिल होते हैं। उन्होंने दिखाया कि यदि आप एक AI को एक ऐसा शिक्षक देते हैं जो सही अनुवर्ती प्रश्न पूछता है और एक सख्त संपादक देता है जो उसे ईमानदार रखता है, तो AI वास्तव में एक अधिक सक्षम और विश्वसनीय सहायक के रूप में विकसित हो सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।