Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution
यह शोध पत्र एलुना (Eluna) का परिचय देता है, जो एक प्रोडक्शन-डिप्लॉयड एजेंटिक सिस्टम है जो मानक संचालन प्रक्रियाओं (SOPs) को ग्राफ-गाइडेड मल्टी-एजेंट वर्कफ़्लो में एनकोड करके और उच्च सटीकता तथा कम विलंबता (लो लेटेंसी) प्राप्त करने के लिए एसिमेट्रिक एपिसोडिक डिस्टिलेशन (asymmetric episodic distillation) का उपयोग करके, बिना इन्फरेंस-टाइम ओवरहेड के जटिल वेयरहाउस ऑपरेशन्स को स्वचालित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक विशाल, उच्च-तकनीकी गोदाम की कल्पना करें जो एक विशाल, हलचल भरे शहर की तरह है जहाँ रोबोट कन्वेयर बेल्ट पर दौड़ रहे हैं और हर सेकंड हज़ारों पैकेज छाँटे जा रहे हैं। इस शहर में, सख्त नियम पुस्तिकाएं हैं जिन्हें स्टैंडर्ड ऑपरेटिंग प्रोसीजर (SOPs) कहा जाता है। ये केवल साधारण सूचियाँ नहीं हैं; ये जटिल, शाखाओं वाले मानचित्र हैं जिनमें दर्जनों "यदि यह होता है, तो वह होगा" जैसे निर्णय शामिल हैं, जैसे कि एक 'चूज़-योर-ओन-एडवेंचर' (अपनी पसंद का रोमांच चुनें) वाली किताब, जहाँ एक गलत मोड़ पूरे शहर को जाम कर सकता है।
लंबे समय तक, इंसानों को इन नियम पुस्तिकाओं को पढ़ना पड़ता था, डेटा की जांच करनी पड़ती थी और निर्णय लेने पड़ते थे। यह धीमा था, और इंसान थक जाते थे और गलतियाँ करते थे। फिर, लोगों ने इन कामों को करने के लिए सुपर-स्मार्ट AI रोबोट्स (लार्ज लैंग्वेज मॉडल्स) का उपयोग करने की कोशिश की। लेकिन समस्या यह थी: जब आप एक विशाल, 100 पन्नों की नियम पुस्तिका एक साथ एक स्मार्ट AI को सौंप देते हैं, तो वह घबरा जाता है। यह एक पूरी लाइब्रेरी को पढ़ते हुए गणित की समस्या हल करने जैसा है; AI भ्रमित हो जाता है, नियमों को भूल जाता है, या गलत रास्ता चुन लेता है।
यहाँ आता है एलूना (Eluna), एक नया सिस्टम जिसे अमेज़न द्वारा इस उलझन को सुलझाने के लिए बनाया गया है। एलूना को एक अकेले सुपर-ब्रेन के रूप में नहीं, बल्कि एक अत्यधिक संगठित निर्माण दल (construction crew) के रूप में सोचें।
दल और ब्लूप्रिंट (The Crew and the Blueprint)
पूरे नियमबुक को एक व्यक्ति को देने के बजाय, एलूना काम को छोटे हिस्सों में बाँट देता है।
- ब्लूप्रिंट: जटिल नियम पुस्तिका को एक डिजिटल मानचित्र (ग्राफ) में बदल दिया जाता है। लेकिन एलूना एक बार में पूरा मानचित्र नहीं दिखाता है। यह "प्रोग्रेसिव डिस्क्लोजर" (क्रमिक प्रकटीकरण) की तकनीक का उपयोग करता है: यह केवल अगले कुछ कदम दिखाता है जिनकी दल को आवश्यकता होती है, ठीक वैसे ही जैसे एक GPS जो पूरी यात्रा के बजाय केवल अगला मोड़ दिखाता है। यह AI को भटकने से बचाता है।
- फोरमैन (The Foreman): एक मुख्य "फोरमैन" एजेंट होता है जो मानचित्र को संभालता है और तय करता है कि आगे कौन से कार्य करने हैं।
- विशेषज्ञ (The Specialists): फोरमैन विशिष्ट कार्यों को संभालने के लिए छोटे, विशेषज्ञ "सब-एजेंट्स" को भेजता है। एक तापमान की जाँच करता है, दूसरा रोबोट की गति देखता है, और तीसरा इन्वेंट्री की तलाश करता है। ये विशेषज्ञ अपने स्वयं के शांत कमरों (अलग संदर्भों) में काम करते हैं ताकि वे दूसरे कार्यों से विचलित न हों। वे तुरंत कोड भी चला सकते हैं और लाइव डेटा की जाँच कर सकते हैं।
- स्किल पैक्स (The Skill Packs): हर नए प्रकार की समस्या (जैसे जाम हुए रोबोट को ठीक करना या क्षतिग्रस्त पैकेज को प्रोसेस करना) के साथ अपना एक अलग "स्किल पैक" आता है। आप बस पैक लोड करते हैं, और दल जानता है कि किन उपकरणों का उपयोग करना है। आपको हर नए काम के लिए पूरे दल को फिर से प्रशिक्षित करने की आवश्यकता नहीं है।
सफलता का रहस्य: गलतियों से सीखना
एलूना का सबसे स्मार्ट हिस्सा यह है कि यह कैसे सीखता है। टीम ने केवल AI को यह नहीं बताया कि "ये रहे नियम।" उन्होंने एक चतुर प्रशिक्षण पद्धति का उपयोग किया जिसे एसिमेट्रिक एपिसोडिक डिस्टिलेशन (asymmetric episodic distillation) कहा जाता है।
कल्पना करें कि एक मास्टर शेफ (शिक्षक) है जो अविश्वसनीय रूप से स्मार्ट लेकिन धीमा है। शेफ एक जटिल व्यंजन बनाने की कोशिश करता है, कुछ गलतियाँ करता है, और फिर उन्हें सुधारने के लिए एक विशेष नोटबुक (एपिसोडिक मेमोरी) में लिख लेता है। शेफ इस नोटबुक को देखकर बेहतर होता जाता है।
फिर, एक तेज़, युवा प्रशिक्षु (छात्र) उस सुधारित खाना बनाने की प्रक्रिया को देखता है। प्रशिक्षु रेसिपी को इतनी अच्छी तरह से सीख लेता है कि उसे अब नोटबुक की आवश्यकता नहीं होती। उसने सबक को आत्मसात कर लिया है। जब प्रशिक्षु वास्तविक रसोई में काम करने जाता है, तो वह बिना नोटबुक चेक किए, बिना रुके, तेज़ी से और पूर्णता के साथ खाना बनाता है।
पेपर में, "शिक्षक" एक विशाल AI मॉडल है जो अपनी गलतियों को सुधारकर सटीक 'ट्रैजेक्टरीज' (मार्ग) बनाता है। "छात्र" एक छोटा, तेज़ मॉडल (जैसे 32-बिलियन पैरामीटर वाला संस्करण) है जो उन सटीक रास्तों से सीखता है। पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि छात्र को काम करते समय नोटबुक पढ़ने के लिए दी जाए; इससे सिस्टम धीमा और नाजुक हो जाता है। इसके बजाय, छात्र को सुधारों को याद करना होता है।
क्या यह वास्तव में काम करता है?
टीम ने एलूना का परीक्षण केवल काल्पनिक पहेलियों पर नहीं, बल्कि वास्तविक दुनिया के वेयरहाउस कार्यों पर किया।
- रोबोट रेस्क्यू: एक परीक्षण में, सिस्टम को निदान करना था कि एक रोबोटिक कन्वेयर बेल्ट क्यों विफल हो रही है। पुराने, सामान्य AI मॉडल भ्रमित हो गए और विफल रहे। हालाँकि, एलूना ने विशाल "शिक्षक" मॉडल के प्रदर्शन के बराबर प्रदर्शन किया और वह बहुत तेज़ था। इसने सही ढंग से समस्या की पहचान की और वास्तविक समय में इसे ठीक किया।
- टिकट ट्राइएज (Ticket Triage): दूसरे परीक्षण में, सिस्टम को क्षतिग्रस्त पैकेज के बारे में अस्पष्ट मानवीय नोट्स को पढ़ना था और निर्णय लेना था कि क्या करना है। एलूना के एक विशाल 355-बिलियन पैरामीटर वाले संस्करण ने मानव विशेषज्ञों के साथ 94% सहमति दिखाई। ऐसे कठिन काम के लिए यह लगभग पूर्ण है।
- गति: सिस्टम न केवल स्मार्ट हुआ, बल्कि तेज़ भी हुआ। इसने रोबोट की समस्याओं के निदान में लगने वाले समय को बड़े मॉडल्स की तुलना में आधे से अधिक कम कर दिया।
पेपर क्या कहता है (और क्या नहीं कहता)
लेखक बहुत स्पष्ट हैं कि उन्होंने क्या पाया। उन्होंने दिखाया कि इन विशिष्ट, नियम-आधारित वेयरहाउस कार्यों के लिए, एक छोटा, अच्छी तरह से प्रशिक्षित AI, एक विशाल, अप्रशिक्षित AI को हरा देता है। उन्होंने साबित किया कि यदि AI को एक साथ बहुत सारी जानकारी से अभिभूत कर दिया जाए, तो केवल AI को बड़ा बनाना मदद नहीं करता है।
हालाँकि, वे यह भी बताते हैं कि यह सिस्टम जादुई नहीं है। यदि मूल नियम पुस्तिका (SOP) में कमियाँ हैं, या यदि वेयरहाउस सेंसर से आने वाला डेटा खराब है, तो AI अभी भी गलतियाँ करेगा। समस्या AI के दिमाग की नहीं है; यह निर्देशों और डेटा की गुणवत्ता की है।
पेपर सुझाव देता है कि यह दृष्टिकोण वेयरहाउस संचालन के लिए बहुत अच्छा है, लेकिन उन्होंने अभी तक यह साबित नहीं किया है कि क्या यह पूरी तरह से अलग प्रकार के कार्यों के लिए भी काम करता है। वे यह भी स्वीकार करते हैं कि इस सिस्टम को प्रशिक्षित करने के लिए बहुत अधिक कंप्यूटिंग पावर और एक बहुत ही स्मार्ट "शिक्षक" मॉडल की आवश्यकता होती है, जो छोटी कंपनियों के लिए जुटाना कठिन हो सकता है।
संक्षेप में, एलूना इस बात का प्रमाण है कि सही संरचना के साथ—बड़ी समस्याओं को छोटे, प्रबंधनीय टुकड़ों में तोड़कर और AI को सुधारा गया उदाहरणों से सीखने के लिए प्रशिक्षित करके—आप एक ऐसा सिस्टम बना सकते हैं जो अविश्वसनीय रूप से स्मार्ट और वास्तविक दुनिया के वेयरहाउस चलाने के लिए पर्याप्त तेज़ दोनों है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।