OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems
यह शोध पत्र एजेंटिक एआई (Agentic AI) के लिए एक व्यापक स्तरीय आर्किटेक्चर का प्रस्ताव करता है जो पूर्णतः स्वायत्त और स्केलेबल एजेंट बनाने के लिए इन्फरेंस हेतु ओलामा (Ollama) और ऑर्केस्ट्रेशन हेतु ओपनक्लॉ (OpenClaw) को एकीकृत करता है, और प्रयोगात्मक सत्यापन के माध्यम से यह प्रदर्शित करता है कि निरंतर स्मृति (persistent memory) और अनुकूलन योग्य निर्णय लेने जैसी आवश्यक क्षमताएं स्टैंडअलोन मॉडलों के बजाय सिस्टम-स्तरीय एकीकरण से उभरती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अभी-अभी एक सुपर-स्मार्ट रोबोट दिमाग बनाया है जो कविता लिख सकता है, गणित की समस्याएं हल कर सकता है और किसी भी अन्य व्यक्ति से बेहतर क्वांटम भौतिकी समझा सकता है। आप सोचेंगे कि यह परम आविष्कार है, है ना? लेकिन यहाँ एक पेंच है: यदि आप इस दिमाग से कोई प्रश्न पूछते हैं, तो यह उत्तर देता है, और फिर तुरंत सब कुछ भूल जाता है। इसे आपकी कही हुई बातों का कोई विवरण याद नहीं रहता, यह आपके लिए दरवाजा नहीं खोल सकता, और न ही इसे पाँच मिनट पहले आपकी पसंदीदा पिज्जा टॉपिंग याद रहती है। यह एक ऐसे जीनियस की तरह है जो पूरी तरह से "वर्तमान" में जीता है, जो कल के लिए योजना बनाने या बीते कल से सीखने में असमर्थ है। इसी तरह शुरुआती "रिएक्टिव" (प्रतिक्रियात्मक) AI काम करता है—यह क्षण भर के लिए शानदार है लेकिन किसी भी ऐसी चीज़ के लिए बेकार है जिसमें दीर्घकालिक योजना या 'टू-डू लिस्ट' की आवश्यकता हो।
वैज्ञानिकों ने "एजेंटिक AI" (Agentic AI) बनाकर इसे ठीक करने की कोशिश की है। इसे केवल एक मस्तिष्क के रूप में नहीं, बल्कि श्रमिकों की एक पूरी टीम के रूप में सोचें। आपके पास एक "मस्तिष्क" (वह मॉडल जो सोचता है) है, लेकिन आपको एक "मैनेजर" (जो लक्ष्यों और स्मृति को ट्रैक रखता है) की भी आवश्यकता है, एक "टूलबेल्ट" (फाइलें खोलने या API कॉल करने के लिए) और एक "घड़ी" (ताकि जब आप उससे बात न कर रहे हों तब भी वह काम करता रहे)। बड़ा सवाल जो हर कोई पूछ रहा है वह यह है: क्या जादू इसलिए होता है क्योंकि मस्तिष्क अधिक स्मार्ट है, या इसलिए होता है क्योंकि हमने आखिरकार उसके चारों ओर सही टीम बनाई है? यह शोध पत्र ठीक इसी प्रश्न की जांच करता है, कि क्या एक वास्तव में स्वायत्त एजेंट बनने के लिए एक स्मार्ट मस्तिष्क को एक फुल-टाइम मैनेजर और एक मेमोरी बैंक की आवश्यकता होती है।
शोध पत्र का बड़ा विचार: यह केवल मस्तिष्क नहीं, बल्कि पूरा शरीर है
कॉन्स्टेंटिनोस आई. रूमेलियोटिस और रंजन सपकोटा द्वारा लिखा गया यह शोध पत्र तर्क देता है कि एक वास्तव में स्वायत्त AI एजेंट बनाने के लिए, आप केवल एक शक्तिशाली लार्ज लैंग्वेज मॉडल (LLM) पर निर्भर नहीं रह सकते। इसके बजाय, आपको एक स्तरित प्रणाली (layered system) की आवश्यकता है जहाँ विभिन्न भाग अलग-अलग कार्य करते हैं। इसे सिद्ध करने के लिए, लेखकों ने दो विशिष्ट तकनीकों को एक साथ जोड़ा है: Ollama और OpenClaw।
Ollama को "मस्तिष्क" के रूप में समझें। यह एक ऐसा टूल है जो आपको इंटरनेट की आवश्यकता के बिना अपने स्वयं के कंप्यूटर (जैसे लैपटॉप या सर्वर) पर एक सुपर-स्मार्ट AI मॉडल चलाने की अनुमति देता है। यह भाषा समझने और सोचने में बहुत अच्छा है, लेकिन अपने आप में, यह एक जार में रखे मस्तिष्क की तरह है: यह सोच तो सकता है, लेकिन यह हिल-डुल नहीं सकता, इसे याद नहीं रहता, और यह किसी चीज़ को छू नहीं सकता।
OpenClaw, "शरीर और मैनेजर" के रूप में कार्य करता है। यह वह सॉफ्टवेयर है जो मस्तिष्क के विचारों को लेता है और उन्हें क्रिया में बदल देता है। यह याद रखता है कि कल क्या हुआ था, यह जानता है कि उपकरणों (जैसे फाइल खोलना या गणित करना) का उपयोग कैसे करना है, और यह तब भी लक्ष्य पर काम करना जारी रखता है जब आप इसे देख नहीं रहे होते हैं।
लेखक देखना चाहते थे कि जब आप इन दोनों को मिलाते हैं तो क्या होता है। क्या आपको एक सुपरहीरो मिलता है? या यह केवल एक फैंसी चैटबॉट है?
प्रयोग: "अद्भुतता" के तीन स्तर
यह पता लगाने के लिए, शोधकर्ताओं ने 15 अलग-अलग चुनौतियों के साथ एक वीडियो-गेम जैसा परीक्षण सेटअप किया। उन्होंने यह देखने के लिए कि टीम का प्रत्येक हिस्सा कितना योगदान देता है, अपने सिस्टम का तीन अलग-अलग "मोड्स" में परीक्षण किया।
स्तर 1: अकेला मस्तिष्क (C1)। उन्होंने AI मॉडल (Ollama) को कार्यों को अकेले हल करने की कोशिश करने दी। कोई स्मृति नहीं, कोई उपकरण नहीं, कोई मैनेजर नहीं। बस कच्चा मस्तिष्क।
- परिणाम: यह एक आपदा थी। मस्तिष्क लगभग 46.7% कार्यों को सही ढंग से कर पाया। जब फाइल पढ़ने के लिए कहा गया, तो वह नहीं पढ़ सका क्योंकि उसके पास इसे खोलने के लिए टूल नहीं था। जब कुछ याद रखने के लिए कहा गया, तो वह तुरंत भूल गया। यह एक जीनियस को घर बनाने के लिए कहने जैसा था लेकिन उन्हें हथौड़ा या ब्लूप्रिंट देने से मना कर दिया गया।
स्तर 2: टूलबेल्ट के साथ मस्तिष्क (C2)। उन्होंने मैनेजर के रूप में OpenClaw को जोड़ा। अब मस्तिष्क उपकरणों (जैसे फाइल पढ़ना या गणित करना) का उपयोग कर सकता था, लेकिन मैनेजर की ध्यान अवधि बहुत कम थी। हर बार जब एक नया कार्य शुरू होता था, तो मैनेजर स्मृति को साफ कर देता था।
- परिणाम: वाह! सफलता दर बढ़कर लगभग 91.1% (एक मॉडल के लिए) और 95.5% (दूसरे के लिए) हो गई। अचानक, एजेंट फाइल पढ़ सकता था और गणित कर सकता था क्योंकि उसके पास उपकरण थे। लेकिन यदि आपने इसे पिछले कार्य से कुछ याद रखने के लिए कहा, तो यह विफल हो गया क्योंकि इसकी स्मृति मिटा दी गई थी।
स्तर 3: पूरी टीम (C3)। यह पूर्ण सेटअप था: मस्तिष्क (Ollama) + मैनेजर (OpenClaw) + एक स्थायी मेमोरी बैंक। मैनेजर पिछले कार्यों से सब कुछ याद रख सकता था और नए कार्यों में मदद करने के लिए इसका उपयोग कर सकता था।
- परिणाम: यह विजेता था। सफलता दर और भी ऊपर चढ़कर 93.3% और 97.8% हो गई। एजेंट अब कार्य #1 में दिए गए नियम को याद रख सकता था और कार्य #10 में उसका पूरी तरह से उपयोग कर सकता था। यह अपनी स्मृति को अपडेट भी कर सकता था जब आपने नियम बदला, और यह कभी भ्रमित नहीं हुआ।
उन्होंने क्या पाया (और क्या नहीं)
सबसे रोमांचक बात जो शोध पत्र ने पाई वह यह है कि एक स्वायत्त एजेंट होने का "जादू" सिस्टम से आता है, न कि केवल मस्तिष्क से।
जब शोधकर्ताओं ने आंकड़ों को देखा, तो उन्होंने एक स्पष्ट, सीधी रेखा में सुधार देखा: स्तर 1 < स्तर 2 < स्तर 3। इसने सिद्ध किया कि केवल एक स्मार्ट मस्तिष्क होना एक बेहतर एजेंट नहीं बनाता है। वास्तव में, दो बहुत अलग AI मस्तिष्क (Qwen3.5 और Gemma4) पूर्ण "स्तर 3" सिस्टम में रखने पर लगभग एक जैसा प्रदर्शन करते हैं। यह सुझाव देता है कि आर्किटेक्चर—जिस तरह से मस्तिष्क, स्मृति और उपकरण जुड़े हुए हैं—वही वास्तव में एजेंट को स्मार्ट और सक्षम बनाता है, न कि केवल मॉडल की कच्ची शक्ति।
उन्होंने स्मृति के बारे में भी कुछ दिलचस्प पाया। अंतिम स्तर में, एजेंट ने सभी परीक्षणों में 100% सटीकता और शून्य गलतियों के साथ चीजों को याद रखा। यदि आपने उसे कहा, "याद रखें कि बुलेट पॉइंट्स का उपयोग करें," तो उसने हर बार इसे पूरी तरह से किया, घंटों बाद भी। उसे यह भी पता था कि यदि आप उसे अपनी स्मृति बदलने के लिए कहें, "वास्तव में, बुलेट पॉइंट्स को भूल जाओ, अब नंबरों का उपयोग करो," तो उसे कैसे बदलना है।
हालाँकि, शोध पत्र सावधानी से यह भी बताता है कि यह कोई "हल की गई" समस्या नहीं है। यह सिस्टम केवल एक मस्तिष्क से सवाल पूछने की तुलना में धीमा है। पूर्ण सिस्टम को प्रति कार्य लगभग 11,000 से 12,000 मिलीसेकंड (लगभग 11-12 सेकंड) का समय लगा, जबकि अकेला मस्तिष्क 1,000 मिलीसेकंड से कम में बहुत तेज़ था। अतिरिक्त समय मैनेजर द्वारा टूल्स की जाँच करने, स्मृति पढ़ने और योजना बनाने में खर्च होता है। लेकिन यह समझौता सार्थक है: धीमा सिस्टम वास्तव में काम पूरा करता है, जबकि तेज़ सिस्टम केवल गलत उत्तर (hallucinations) देता है।
आगे की कठिन राह
लेखक यह भी चेतावनी देते हैं कि इन पूर्ण-शरीर वाले एजेंटों को बनाने के साथ नई चुनौतियाँ भी आती हैं। क्योंकि एजेंट अब फाइलें खोल सकता है, कोड चला सकता है और चीजें याद रख सकता है, इसलिए वह बड़ी गलतियाँ भी कर सकता है। यदि कोई एजेंट को "प्रॉम्प्ट इंजेक्शन" (एक चालाकी भरा संदेश जो उसे बुरे काम करने के लिए प्रेरित करता है) के माध्यम से धोखा देता है, तो वह बुरा निर्देश उसकी स्थायी स्मृति में फंस सकता है, जिससे वह हमेशा के लिए अजीब व्यवहार करने लगेगा। वे सुझाव देते हैं कि हमें मजबूत "सुरक्षा गार्ड" की आवश्यकता है जैसे कि सैंडबॉक्स (एजेंट के खेलने के लिए सुरक्षित कमरे) और उन उपकरणों के लिए सख्त नियम जिन्हें वह छू सकता है।
निष्कर्ष
सरल शब्दों में, यह शोध पत्र हमें बताता है कि AI का भविष्य केवल बड़े, स्मार्ट मस्तिष्क बनाने के बारे में नहीं है। यह उन मस्तिष्कों के लिए बेहतर शरीर और मैनेजर बनाने के बारे में है। आपके पास दुनिया का सबसे स्मार्ट मस्तिष्क हो सकता है, लेकिन बिना मेमोरी बैंक और टूलबेल्ट के, वह एक ऐसे जीनियस की तरह है जो कुछ भी नहीं कर सकता। एक स्थानीय मस्तिष्क (Ollama) को एक स्थायी मैनेजर (OpenClaws) के साथ जोड़कर, लेखकों ने दिखाया है कि हम ऐसे एजेंट बना सकते हैं जो वास्तव में याद रख सकते हैं, योजना बना सकते हैं और अपने आप कार्य कर सकते हैं। यह उस AI की ओर एक बड़ा कदम है जो केवल हमारे साथ चैट नहीं करता, बल्कि वास्तव में हमें काम पूरा करने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।