← नवीनतम पेपर
🤖 AI

HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents

HaReCAP, ReCAP फ्रेमवर्क का एक लो-इंट्रूजन एक्सटेंशन है जो लंबी अवधि के एम्बोडीड कार्यों में बार-बार होने वाले सफल लीफ निर्णयों को ऑफलाइन रिफ्लेक्स नियमों में संकलित करके टोकन खपत और LLM कॉल्स को कम करता है ताकि नियमित कार्यों के लिए अनावश्यक पुनरावर्ती संदर्भ प्रसंस्करण (रिकर्सिव कॉन्टेक्स्ट प्रोसेसिंग) को बायपास किया जा सके।

मूल लेखक: Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang

प्रकाशित 2026-08-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट को एक व्यस्त रसोई में एक जटिल भोजन तैयार करने का कार्य सौंपा गया है। वह केवल "रात का खाना बनाओ" नहीं सुन सकता; उसे उस लक्ष्य को छोटे चरणों की एक लंबी श्रृंखला में तोड़ना होगा, जैसे प्याज ढूंढना, उन्हें काटना, पैन को गर्म करना और इसी तरह। ऐसा करने के लिए, आधुनिक आर्टिफिशियल इंटेलिजेंस (AI) बड़े भाषा मॉडल (Large Language Models) का उपयोग करते हैं, जो रोबोट के मस्तिष्क के रूप में कार्य करते हैं। ये मॉडल तर्क करने और योजना बनाने में उत्कृष्ट हैं, लेकिन उन्हें भौतिक दुनिया के साथ बातचीत करने में एक विशिष्ट चुनौती का सामना करना पड़ता है। उन्हें अपने उच्च-स्तरीय विचारों को सटीक, वैध कमांड में अनुवादित करना होता है जिसे रोबोट का सॉफ़्टवेयर समझ सके। यदि रोबोट सोचता है "प्याज उठाओ," तो सिस्टम को इसे एक सटीक निर्देश में बदलना होगा जैसे "robot1 का उपयोग करके board1 से onion1 उठाओ।" यह अनुवाद चरण हर बार आवश्यक है जब रोबोट एक बुनियादी क्रिया करता है।

लंबे समय से, शोधकर्ताओं ने इन AI एजेंटों को भ्रमित होने या अपने लक्ष्यों को भूलने से बचाने के तरीके विकसित किए हैं। एक सफल विधि, जिसे 'रिकर्सिव प्लानिंग' (recursive planning) के रूप में जाना जाता है, एक मैनेजर द्वारा कार्य सौंपने (delegation) की तरह काम करती है। AI एक बड़े लक्ष्य को छोटे उप-लक्ष्यों में तोड़ता है, पहले एक को पूरा करता है, और फिर जो कुछ भी हुआ उसके आधार पर योजना को अपडेट करने के लिए मैनेजर के पास वापस आता है। यह लूप AI को बदलते परिवेश में जटिल, बहु-चरणीय कार्यों को संभालने की अनुमति देता है। हालाँकि, इस प्रक्रिया की एक छिपी हुई लागत है। हर बार जब AI एक उप-कार्य के बिल्कुल अंत में एक सरल क्रिया करने के लिए पहुँचता है, तो उसे अपने विचार को कमांड में अनुवादित करने के लिए अपने शक्तिशाली मस्तिष्क से फिर से पूछना पड़ता है। भले ही विचार सरल हो, मस्तिष्क को यह सुनिश्चित करने के लिए पूरी बातचीत के इतिहास और वर्तमान स्थिति को फिर से पढ़ना पड़ता है कि कमांड सही है। यह पुनरावृत्ति कंप्यूटिंग शक्ति और समय की महत्वपूर्ण बर्बादी पैदा करती है, विशेष रूप से उन कार्यों के लिए जिनमें सैकड़ों चरण शामिल होते हैं।

शोधकर्ताओं की एक टीम ने इस दोहराव वाले अनुवाद को अक्षमता के एक प्रमुख स्रोत के रूप में पहचाना और 'HaReCAP' नामक एक समाधान प्रस्तावित किया। उनका कार्य प्रक्रिया के "अंतिम मील" (last mile) पर केंद्रित है: वह क्षण जब AI एक विशिष्ट, परमाणु (atomic) क्रिया का निर्णय लेता है। बड़े भाषा मॉडल से हर बार इस अनुवाद के लिए पूछने के बजाय, शोधकर्ताओं ने सिस्टम को यह पहचानने के लिए प्रशिक्षित किया कि कब कोई स्थिति परिचित और सुरक्षित है और कब भारी सोच को छोड़ दिया जा सकता है। उन्होंने हजारों सफल प्रयासों का विश्लेषण किया जहाँ AI ने कार्यों को सही ढंग से पूरा किया। इन सफलताओं से, उन्होंने सरल नियमों की एक लाइब्रेरी निकाली। ये नियम अनिवार्य रूप से शॉर्टकट हैं जो कहते हैं, "जब कार्य किसी विशिष्ट स्थान से एक विशिष्ट वस्तु को उठाना हो, और रोबोट को ऐसा करने की अनुमति हो, तो क्रिया हमेशा X होती है।"

यह सिस्टम मुख्य AI मस्तिष्क से मदद मांगने से पहले इन शॉर्टकट की जांच करता है। जब रोबोट एक लीफ-लेवल (leaf-level) उप-कार्य—यानी योजना में एक छोटा, अंतिम चरण—पर पहुँचता है, तो सिस्टम पहले यह देखता है कि क्या उसकी लाइब्रेरी में कोई नियम वर्तमान स्थिति से मेल खाता है। यदि नियम पूरी तरह से फिट बैठता है और क्रिया चुनने में कोई अस्पष्टता नहीं है, तो सिस्टम बड़े भाषा मॉडल को बुलाए बिना तुरंत क्रिया को निष्पादति करता है। इसे शोधकर्ता "हैबिटुअल-एक्शन ग्राउंडिंग" (habitual-action grounding) कहते हैं। यह ठीक वैसा ही है जैसे कोई इंसान दरवाजे को खोलने के यांत्रिकी (mechanics) के बारे में सोचने की आवश्यकता के बिना, बस दरवाजा खुला होने पर स्वचालित रूप से दरवाजे के हैंडल की ओर हाथ बढ़ाता है। यदि स्थिति नई या जटिल है, या यदि नियम पूरी तरह से फिट नहीं बैठता है, तो सिस्टम सुरक्षित रूप से मूल पद्धति पर वापस जाता है, और क्रिया की योजना बनाने और अनुवाद करने के लिए बड़े भाषा मॉडल से पूछता है। यह सुनिश्चित करता है कि AI कठिन समस्याओं को हल करने की अपनी क्षमता कभी नहीं खोता है, लेकिन यह साधारण, नियमित चरणों के लिए अनावश्यक ओवरहेड से बचता है।

शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण दो अलग-अलग सिम्युलेटेड वातावरण में किया: एक रसोई जहाँ एक रोबोट को भोजन तैयार करना है, और एक घरेलू वातावरण जहाँ उसे वस्तुओं को व्यवस्थित करना है। उन्होंने कार्यों को चलाने के लिए एक शक्तिशाली भाषा मॉडल का उपयोग किया और मानक पद्धति बनाम उनके नए शॉर्टकट सिस्टम के प्रदर्शन की तुलना की। परिणामों ने दिखाया कि शॉर्टकट सिस्टम ने सफलता दर को नहीं बदला; रोबोटों ने पहले की तरह ही उतने ही कार्य सफलतापूर्वक पूरे किए। हालाँकि, दक्षता में लाभ काफी अधिक था। रसोई के वातावरण में, सिस्टम ने डेटा प्रोसेसिंग की मात्रा को औसतन लगभग 15 प्रतिशत कम कर दिया। घरेलू वातावरण में, यह कमी और भी अधिक थी, जो 20 प्रतिशत से अधिक तक पहुँच गई। इसका अर्थ है कि AI एजेंट पहले की तुलना में बहुत कम कंप्यूटिंग शक्ति और समय का उपयोग करके समान संख्या में सफल कार्य पूरे कर सके।

महत्वपूर्ण रूप से, शोधकर्ताओं ने पाया कि यह सुधार किसी एक प्रकार के 'रोबोट ब्रेन' या विशिष्ट कार्यों तक सीमित नहीं था। उन्होंने विभिन्न आकारों के विभिन्न मॉडलों और विभिन्न वातावरणों के साथ इस प्रणाली का परीक्षण किया, और बचत निरंतर बनी रही। यह अध्ययन दर्शाता है कि इन उन्नत AI एजेंटों को चलाने की लागत का एक बड़ा हिस्सा जटिल योजना बनाने से नहीं, बल्कि सरल विचारों को क्रियाओं में बार-बार किए जाने वाले नियमित अनुवाद से आता है। इन बार-बार होने वाले निर्णयों को नियमों की एक छोटी, ऑडिट योग्य लाइब्रेरी में बदलकर, शोधकर्ताओं ने एक ऐसा तरीका बनाया है जो कम जोखिम वाला और एकीकृत करने में आसान है। सिस्टम जटिल तर्क और अप्रत्याशित परिवर्तनों को संभालने में पूरी तरह सक्षम रहता है, लेकिन यह हर साधारण चरण के लिए पहिए का पुन: आविष्कार करने में ऊर्जा बर्बाद नहीं करता है। यह दृष्टिकोण विश्वसनीयता या बुद्धिमत्ता से समझौता किए बिना लंबे समय तक चलने वाले (long-horizon) AI एजेंटों को तेज़ और अधिक कुशल बनाने का एक व्यावहारिक तरीका प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →