CASCADE: Cumulative Agentic Skill Creation through Autonomous Development and Evolution
यह शोध पत्र CASCADE को प्रस्तुत करता है, जो एक स्व-विकसित एजेंटिक फ्रेमवर्क है जो बड़े भाषा मॉडलों (large language models) को निरंतर सीखने और आत्म-चिंतन के माध्यम से जटिल वैज्ञानिक कौशल को स्वायत्त रूप से प्राप्त करने और संहिताबद्ध करने में सक्षम बनाता है, जो सामग्री विज्ञान (materials science) के कार्यों पर 93.3% सफलता दर प्राप्त करता है और स्केलेबल AI-सहायता प्राप्त वैज्ञानिक अनुसंधान के लिए महत्वपूर्ण क्षमता प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन अनुभवहीन शोध सहायक है। वर्तमान में, अधिकांश AI सहायक टूलकिट (औजारों के पिटारे) की तरह हैं: आप उन्हें एक विशिष्ट रिंच, एक हथौड़ा या एक पेचकश देते हैं (पूर्व-निर्धारित उपकरण), और वे उस समस्या को ठीक करने की कोशिश करते हैं। यदि काम के लिए ऐसे उपकरण की आवश्यकता है जो उनके पास नहीं है, या यदि निर्देश अस्पष्ट हैं, तो वे अटक जाते हैं। वे मौके पर ही नया उपकरण उपयोग करना नहीं सीख सकते; वे बस आपके द्वारा सही उपकरण थमाए जाने का इंतज़ार करते हैं।
यह पेपर CASCADE को पेश करता है, जो एक नए प्रकार का AI सहायक है जो केवल उपकरणों का उपयोग ही नहीं करता—बल्कि काम करते समय उन्हें बनाना और उनमें महारत हासिल करना भी सीखता है। इसे एक ऐसे व्यक्ति के अंतर के रूप में सोचें जो केवल एक बने-बनाए मानचित्र का उपयोग करना जानता है बनाम एक ऐसा व्यक्ति जो अपना स्वयं का मानचित्र बना सकता है, नए क्षेत्रों का पता लगा सकता है, यह महसूस कर सकता है कि उसने गलत मोड़ ले लिया है, और फिर वापस पटरी पर आने के लिए अपने मानचित्र को फिर से बना सकता है।
यहाँ बताया गया है कि CASCADE कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:
1. एक बड़ा बदलाव: "उपकरणों के उपयोग" से "कौशल सीखने" तक
लेखकों का तर्क है कि मनुष्य केवल उपकरणों का उपयोग नहीं करते; हम कौशल (skills) संचित करते हैं। एक बढ़ई केवल हथौड़ा पकड़ना ही नहीं जानता; वह समय के साथ नई तकनीकें सीखकर एक बढ़ई बनना जानता है।
- पुराना तरीका (LLM + टूल यूज़): AI को अनुमत कार्यों की एक सूची दी जाती है। यदि कार्य उस सूची में नहीं है, तो वह विफल हो जाता है।
- CASCADE का तरीका (LLM + स्किल एक्विजिशन): AI को एक लक्ष्य दिया जाता है। यदि उसे यह नहीं पता कि कैसे करना है, तो वह बाहर जाता है, निर्देश खोजता है (वेब सर्च के माध्यम से), कोड लिखता है (वह "उपकरण"), उसे आजमाता है, और यदि वह टूट जाता है, तो वह समझता है कि क्यों हुआ और उसे ठीक करता है। वह उस अनुभव को एक स्थायी कौशल में बदल देता है जिसे वह बाद में फिर से उपयोग कर सकता है।
2. दो महाशक्तियाँ (Meta-Skills)
CASCADE अपने AI एजेंटों को इसे संभव बनाने के लिए दो मुख्य "महाशक्तियाँ" देता है:
- निरंतर सीखना (Continuous Learning): जब AI अटक जाता है, तो वह केवल अनुमान नहीं लगाता। वह ऑनलाइन जाता है, दस्तावेज़ पढ़ता है, कोड उदाहरण ढूँढता है, और यह सीखता है कि किसी ऐसे नए सॉफ़्टवेयर पैकेज का उपयोग कैसे किया जाए जिसे उसने पहले कभी नहीं देखा है।
- आत्म-चिंतन (Self-Reflection): यदि AI कोई गलती करता है, तो वह केवल दोबारा प्रयास नहीं करता। वह रुकता है, अपने स्वयं के कोड को देखता है, पूछता है, "यह क्यों विफल हुआ?" और समस्या का निदान करने के लिए एक "नॉलेज ग्राफ" (उसकी जानकारी का मानसिक मानचित्र) का उपयोग करता है। यह एक छात्र की तरह है जो, परीक्षा में असफल होने के बाद, केवल अगली बार अनुमान लगाने के बजाय, यह समझने के लिए अपने नोट्स की समीक्षा करता है कि उसने उत्तर गलत क्यों दिया।
3. टीम संरचना
CASCADE केवल एक रोबोट नहीं है; यह मिलकर काम करने वाली एक छोटी टीम है:
- ऑर्केस्ट्रेटर (Orchestrator): प्रोजेक्ट मैनेजर। यह मानव वैज्ञानिक की बात सुनता है, जाँच करता है कि कार्य आसान है या कठिन, और निर्णय लेता है कि काम कौन करेगा।
- सिंपलसॉल्वर (SimpleSolver): "त्वरित समाधान" वाला कार्यकर्ता। यदि कार्य आसान है या टीम ने पहले ऐसा कुछ किया है, तो यह कार्यकर्ता इसे तेज़ी से संभालता है।
- डीपसॉल्वर (DeepSolver): कठिन समस्याओं के लिए "गहन अध्ययन" करने वाली टीम। इस टीम में चार विशिष्ट भूमिकाएँ हैं:
- रिसर्चर (Researcher): जानकारी खोजता है और समाधान का पहला ड्राफ्ट लिखता है।
- कोड एजेंट (Code Agent): कोड चलाने का प्रयास करता है।
- डिबग एजेंट (तीन Debug Agents): यदि कोड क्रैश होता है, तो तीन अलग-अलग "जासूस" एक ही समय में अलग-अलग रणनीतियों का उपयोग करके इसे ठीक करने का प्रयास करते हैं।
- आउटपुट प्रोसेसर (Output Processor): सबसे अच्छा समाधान चुनता है और अंतिम उत्तर प्रस्तुत करता है।
4. प्रमाण: "साइंस जिम" (SciSkillBench)
यह सिद्ध करने के लिए कि यह काम करता है, शोधकर्ताओं ने SciSkillBench नामक एक जिम बनाया है। इसमें मैटेरियल्स साइंस और केमिस्ट्री के लिए 116 अलग-अलग चुनौतियाँ शामिल हैं, जो "आसान" (जैसे डेटाबेस में विशिष्ट संख्या ढूँढना) से लेकर "कठिन" (जैसे जटिल सिमुलेशन चलाना या नए डेटा का विश्लेषण करना जिसे AI ने पहले कभी नहीं देखा) तक हैं।
परिणाम:
- CASCADE के सीखने के कौशल के बिना: AI ने लगभग 35% कार्य सही किए। यह एक ऐसे छात्र की तरह था जिसने कुछ उत्तर रट लिए थे लेकिन नए प्रश्नों को नहीं संभाल सका।
- CASCADE के साथ: AI ने 93.3% कार्य सही किए।
- "कठिन" चीजें: सबसे कठिन कार्यों पर भी जहाँ अन्य AI पूरी तरह विफल रहे, CASCADE ने अच्छा प्रदर्शन बनाए रखा। इसने दिखाया कि सीखकर और चिंतन करके, यह जटिल, वास्तविक दुनिया की समस्याओं को संभाल सकता है।
5. वास्तविक दुनिया के उदाहरण
पेपर दिखाता है कि CASCADE वास्तविक विज्ञान का काम कर रहा है, न कि केवल सामान्य ज्ञान के उत्तर दे रहा है:
- क्रिस्टल डिटेक्टिव (The Crystal Detective): इसने एक क्रिस्टल संरचना को देखा और सही ढंग से निर्धारित किया कि यह पीज़ोइलेक्ट्रिक (एक गुण जो दबाव से बिजली उत्पन्न करता है) नहीं हो सकता क्योंकि इसकी समरूपता (symmetry) ऐसी थी, यहाँ तक कि इसने एक पेचीदा अपवाद को भी पकड़ा जिसे मानव विशेषज्ञ भी कभी-कभी मिस कर देते हैं।
- लैब रोबोट (The Lab Robot): इसने एक वास्तविक, स्वचालित प्रयोगशाला से संपर्क किया। इसने एक नए, बिना दस्तावेजीकृत (undocumented) सॉफ़्टवेयर सिस्टम का उपयोग करने का तरीका सीखा जिससे रसायनों को मिलाया जा सके, उन्हें गर्म किया जा सके और उन्हें पाउडर बनाने के लिए पीसा जा सके ताकि एक नई बैटरी सामग्री बनाई जा सके। जब सॉफ़्टवेयर का एक फंक्शन खराब हुआ, तो इसने काम पूरा करने के लिए एक 'वर्कअराउंड' लिखा।
- मेमोरी कीपर (The Memory Keeper): एक मानव के साथ बातचीत में, इसने चैट के शुरुआती विवरणों को याद रखा। यदि किसी इंसान ने कहा, "वास्तव में, इसे इस तरह से करें," तो AI ने उस नियम को पूरे सत्र के लिए याद रखा और भविष्य के सत्रों के लिए भी इसे सहेज लिया, जिससे यह एक सच्चे शोध भागीदार की तरह व्यवहार करता है जो आपके साथ काम करने पर और स्मार्ट होता जाता है।
निष्कर्ष
पेपर का दावा है कि CASCADE एक बड़ा कदम है क्योंकि यह AI को एक स्थिर उपकरण (static tool) (जिसे आपको सावधानी से प्रोग्राम करना पड़ता है) से बदलकर एक गतिशील शिक्षार्थी (dynamic learner) (जो अनुकूलित हो सकता है, अपनी गलतियों को सुधार सकता है, और कौशल अर्जित कर सकता है) में बदल देता है। इसे एक "सह-वैज्ञानिक" (co-scientist) के रूप में डिज़ाइन किया गया है जो वैज्ञानिक अनुसंधान की अव्यवस्थित, अप्रत्याशित प्रकृति को संभाल सकता है, कोड लिखने से लेकर लैब में भौतिक प्रयोग चलाने तक।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।