EvoTest: Evolutionary Test-Time Learning for Self-Improving Agentic Systems
यह शोधपत्र EvoTest को प्रस्तुत करता है, जो एक विकासवादी टेस्ट-टाइम लर्निंग फ्रेमवर्क है जो एक इवॉल्वर एजेंट के माध्यम से अपने सिस्टम कॉन्फ़िगरेशन को विकसित करके AI एजेंटों को बिना ग्रेडिएंट्स या फाइन-ट्यूनिंग के गेमप्ले के दौरान स्वयं को बेहतर बनाने में सक्षम बनाता है, जो मौजूदा अनुकूलन विधियों की तुलना में नए जेरिको टेस्ट-टाइम लर्निंग (J-TTL) बेंचमार्क पर उत्कृष्ट प्रदर्शन प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ EvoTest पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) में विभाजित किया गया है।
बड़ी समस्या: "चतुर लेकिन अज्ञानी इंटर्न" (The "Clever but Clueless Intern")
कल्पना कीजिए कि आपने एक जटिल रहस्य सुलझाने के लिए एक बहुत ही बुद्धिमान नए इंटर्न को काम पर रखा है। वे स्मार्ट हैं और निर्देशों को पूरी तरह से पढ़ सकते हैं। लेकिन, यदि वे एक गलियारे में फंस जाते हैं क्योंकि वे बार-बार दीवार के आर-पार जाने की कोशिश कर रहे हैं, तो वे अगले 50 दिनों तक उसी दीवार के आर-पार जाने की कोशिश करते रहेंगे। वे अपनी गलतियों से नहीं सीखते; वे बस उन्हें दोहराते रहते हैं।
वर्तमान AI एजेंट ऐसे ही इंटर्न की तरह हैं। वे "चतुर" हैं (वे बात कर सकते हैं और नियमों का पालन कर सकते हैं) लेकिन "अज्ञानी" हैं (वे वास्तविक समय में अपने अनुभवों से सीख नहीं सकते)। एक बार तैनात होने के बाद, उनका "मस्तिष्क" स्थिर (frozen) हो जाता है। वे बेहतर होने के लिए अपने स्वयं के निर्देशों को फिर से नहीं लिख सकते।
समाधान: "विकासवादी" दृष्टिकोण (The "Evolutionary" Approach)
इस पेपर के लेखकों ने EvoTest के माध्यम से इसे ठीक करने का प्रयास किया। उन्होंने एक ऐसा सिस्टम बनाया जहाँ AI केवल अधिक गहराई से "सोचता" नहीं है; बल्कि वह हर प्रयास के बाद वास्तव में अपनी खुद की नियम पुस्तिका (rulebook) को फिर से लिखता है।
इसे एक वीडियो गेम कैरेक्टर की तरह समझें जो किसी बॉस से हारने के बाद, केवल उसी रणनीति के साथ दोबारा प्रयास नहीं करता। इसके बजाय, वह पात्र खुद के लिए एक नया मैनुअल लिखता है, अपने उपकरण सेटिंग्स (equipment settings) को बदलता है, और फिर से प्रयास करता है।
यह कैसे काम करता है: दो-पात्रों वाला नाटक (The Two-Actor Play)
यह सिस्टम दो अलग-अलग "एजेंटों" (AI व्यक्तित्वों) का उपयोग करता है जो एक लूप में मिलकर काम करते हैं:
द एक्टर (खिलाड़ी - The Player):
- भूमिका: यह वह है जो खेल खेल रहा है (विशेष रूप से, Zork या Detective जैसे टेक्स्ट-आधारित एडवेंचर गेम्स)।
- क्रिया: यह पहेली को सुलझाने की कोशिश करता है, कहीं फंस जाता है, या जीत जाता है। यह एक "ट्रांसक्रिप्ट" (उस घटना का विवरण) बनाता है।
- उपमा: कल्पना कीजिए कि एक रेस कार ड्राइवर एक लैप (lap) चला रहा है। वह दुर्घटनाग्रस्त हो सकता है, या उसे कोई शॉर्टकट मिल सकता है।
द इवॉल्वर (कोच/इंजीनियर - The Evolver):
- भूमिका: यह एजेंट कभी खेल नहीं खेलता। यह केवल एक्टर के रन का ट्रांसक्रिप्ट देखता है।
- क्रिया: यह कहानी का विश्लेषण करता है। "ओह, ड्राइवर दुर्घटनाग्रस्त हुआ क्योंकि उसने एक बंद गली में बाएं मुड़ने की कोशिश की। साथ ही, वह बहुत अधिक सतर्क था और एक शॉर्टकट चूक गया।"
- जादू: इवॉल्वर अगले लैप के लिए पूरे सिस्टम को फिर से लिख देता है। यह केवल ड्राइवर के दिमाग को नहीं बदलता; यह निम्नलिखित को बदलता है:
- रणनीति (प्रॉम्प्ट/Prompt): "बाएं न मुड़ें, दाएं जाएं।"
- स्मृति (Memory): "याद रखें कि चाबी रसोई में है।"
- सेटिंग्स (हाइपरपैरामीटर्स/Hyperparameters): "आज थोड़ा साहसी बनें; अधिक जोखिम लें।"
- टूल्स (Tools): "हर मोड़ से पहले अपना नक्शा देखें।"
- उपमा: यह पिट क्रू और इंजीनियर है जो दुर्घटना के डेटा को देखते हैं, कार का मैनुअल फिर से लिखते हैं, कार के सस्पेंशन को एडजस्ट करते हैं, और ड्राइवर को बताते हैं, "अगली बार, बिल्कुल ऐसा ही करें।"
बेंचमार्क: "जेरिको" टेस्ट (The "Jericho" Test)
यह साबित करने के लिए कि यह काम करता है, उन्होंने J-TTL (जेरिको टेस्ट-टाइम लर्निंग) नामक एक नया परीक्षण बनाया।
- सेटअप: AI एक ही कठिन टेक्स्ट गेम को बार-बार (50 बार) खेलता है।
- लक्ष्य: इसे पिछले रन के अनुभव का उपयोग करके हर प्रयास के साथ बेहतर होना चाहिए।
- परिणाम: अन्य अधिकांश AI विधियाँ (जैसे साधारण मेमोरी या मानक सुदृढीकरण सीखना/reinforcement learning) विफल रहीं। वे लूप में फंस गए या पहेलियों को नहीं सुलझा सके। हालाँकि, EvoTest लगातार स्मार्ट होता गया। कुछ खेलों में, यह 0% जीत से बढ़कर लगभग हर बार जीतने तक पहुँच गया।
यह अन्य तरीकों से बेहतर क्यों है?
यह पेपर EvoTest की तुलना तीन अन्य तरीकों से करता है जिनसे AI आमतौर पर सीखता है:
मेमोरी/रिफ्लेक्शन (द "डायरी" मेथड - The "Diary" Method):
- यह कैसे काम करता है: AI अपने पुराने नोट्स पढ़ता है और कहता है, "मैं यहाँ असफल हुआ, इसलिए मैं कुछ और कोशिश करूँगा।"
- क्यों विफल होता है: यह डायरी पढ़ने जैसा है लेकिन अपनी आदतों को कभी न बदलने जैसा। आप जानते हैं कि आप असफल हुए, लेकिन आप यह नहीं जानते कि उस विशिष्ट नियम को कैसे ठीक किया जाए जिसके कारण विफलता हुई।
- EvoTest क्यों जीतता है: यह केवल डायरी नहीं पढ़ता; यह नियम पुस्तिका को संपादित (edit) करता है।
ऑनलाइन फाइन-ट्यूनिंग (द "स्कूल" मेथड - The "School" Method):
- यह कैसे काम करता है: AI हर गेम के बाद वापस स्कूल जाता है (अपने न्यूरल नेटवर्क वेट्स को फिर से प्रशिक्षित करता है)।
- क्यों विफल होता है: यह बहुत धीमा और महंगा है। यह रेस के हर लैप के बीच पीएचडी करने जैसा है। साथ ही, यदि AI विफल होता है, तो उसके पास सीखने के लिए अच्छा डेटा नहीं होता है, इसलिए वह "पढ़ाई" नहीं कर सकता।
- EvoTest क्यों जीतता है: यह अपने निर्देशों को फिर से लिखकर तुरंत सीख जाता है। किसी भारी गणित या महंगे हार्डवेयर की आवश्यकता नहीं है।
प्रॉम्प्ट ऑप्टिमाइज़ेशन (द "एडिट" मेथड - The "Edit" Method):
- यह कैसे काम करता है: AI खुद को बताने के लिए एक आदर्श वाक्य खोजने की कोशिश करता है।
- क्यों विफल होता है: यह बहुत सीमित है। यह केवल शब्दों को बदलता है, सेटिंग्स या मेमोरी संरचना को नहीं।
- EvoTest क्यों जीतता है: यह सब कुछ बदलता है: शब्द, सेटिंग्स और टूल्स। यह एक "संपूर्ण-सिस्टम" अपग्रेड है।
गुप्त सूत्र: "नैरेटिव क्रेडिट असाइनमेंट" (The "Secret Sauce: Narrative Credit Assignment")
पारंपरिक AI लर्निंग में, AI को एक साधारण स्कोर मिलता है: "अच्छा काम (+1)" या "बुरा काम (-1)"।
- समस्या: जटिल खेलों में, आप 100 चीजें सही कर सकते हैं और एक चीज गलत, और स्कोर अभी भी शून्य हो सकता है। AI को यह नहीं पता चलता कि उन 100 चीजों में से कौन सी अच्छी थी और कौन सी बुरी।
- EvoTest का समाधान: इवॉलर गेम की पूरी कहानी पढ़ता है। यह कथानक (narrative) को समझता है।
- उदाहरण: "एजेंट एक लूप में फंस गया क्योंकि वह बार-बार एक बंद दरवाजा खोलने की कोशिश कर रहा था।"
- सुधार: इवॉल्वर एक नियम लिखता है: "यदि दरवाजा बंद है, तो पहले चाबी खोजें।"
- यह केवल स्कोर से नहीं, बल्कि कहानी से सीखता है। यह बहुत अधिक कुशल है।
निष्कर्ष (The Takeaway)
EvoTest एक ऐसा फ्रेमवर्क है जो AI एजेंटों को जीवित जीवों की तरह विकसित होने की अनुमति देता है। स्थिर रोबोट बनकर गलतियाँ दोहराने के बजाय, वे एक ड्राइवर और एक कोच की टीम के रूप में कार्य करते हैं। हर रेस के बाद, कोच फुटेज का विश्लेषण करता है, प्लेबुक को फिर से लिखता है, कार की सेटिंग्स को एडजस्ट करता है, और ड्राइवर को एक नई, बेहतर रणनीति के साथ वापस भेजता है।
यह AI एजेंटों को ऑन-द-फ्लाई (तुरंत) सीखने में सक्षम बनाता है, जिससे वे "अज्ञानी इंटर्न" से बदलकर स्व-सुधार करने वाले विशेषज्ञों में बदल जाते हैं जो बिना मानव पुन: प्रशिक्षण के जटिल, बदलते परिवेश का सामना कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।