From Human Guidance to Autonomy: Agent Skill System for End-to-End LLM Deployment on Spatial NPUs
यह शोध पत्र एक दो-चरणीय कार्यप्रणाली प्रस्तुत करता है जो मानव-निर्देशित विकास से एक स्वायत्त एजेंट कौशल प्रणाली में परिवर्तित होती है, जो AMD XDNA 2 स्थानिक NPU पर कई LLM को न्यूनतम मानवीय हस्तक्षेप के साथ महत्वपूर्ण प्रदर्शन लाभों के साथ एंड-टू-एंड सफलतापूर्वक तैनात करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बिल्कुल नया, अविश्वसनीय रूप से शक्तिशाली, लेकिन बहुत ही नखरेबाज रसोई उपकरण (Spatial NPU) है। इसे भोजन पकाने (AI मॉडल चलाने) के लिए डिज़ाइन किया गया है जो ऊर्जा दक्षता में अद्भुत है, जो छोटे, पोर्टेबल उपकरणों के लिए एकदम सही है। हालाँकि, इस उपकरण के साथ कोई रेसिपी बुक (व्यंजन पुस्तिका) नहीं आती है, और इसके निर्देश एक गुप्त कोड में लिखे गए हैं जिसे केवल कुछ विशेषज्ञ शेफ ही समझते हैं।
वर्षों तक, इस मशीन पर "लार्ज लैंग्वेज मॉडल" (LLM) जैसा जटिल व्यंजन बनाना करने के लिए एक मानव मास्टर शेफ को हर एक कदम को मैन्युअल रूप से ट्यून करने में हफ्तों का समय देना पड़ता था, यह समझने में कि समय और ऊर्जा बर्बाद किए बिना रसोई में सामग्रियों को कैसे इधर-उधर ले जाया जाए।
यह शोध पत्र इस समस्या को हल करने का एक नया तरीका बताता है, जिसमें एक दो-चरणीय "रोबोट शेफ" प्रणाली का उपयोग किया गया है जो एक इंसान से सीखती है और फिर अपने आप खाना बनाना शुरू कर देती है।
चरण 1: मानव और प्रशिक्षु (Apprentice)
सबसे पहले, शोधकर्ताओं ने एक AI कोडिंग एजेंट ( "प्रशिक्षु") को एक विशिष्ट व्यंजन: Llama-3.2-1B पकाना सिखाया।
- प्रक्रिया: एक मानव शेफ ने केवल देखा ही नहीं; वे एक मार्गदर्शक के रूप में कार्य करते थे। उन्होंने प्रशिक्षु से कहा, "यह रही योजना। चलिए इस कदम को आजमाते हैं। ओह, यह विफल हो गया? चलिए लिखते हैं कि यह क्यों विफल हुआ और हमने इसे कैसे ठीक किया।"
- परिणाम: साथ मिलकर, उन्होंने एक ऐसी रेसिपी बनाई जो पिछले सबसे अच्छे मैन्युअल प्रयास की तुलना में खाना पकाने की प्रक्रिया शुरू करने में 2.2 गुना तेज़ और भोजन परोसने में 4.0 गुना तेज़ थी।
- सीक्रेट सॉस (गुप्त नुस्खा): महत्वपूर्ण रूप से, उन्होंने केवल भोजन ही नहीं पकाया; उन्होंने हर गलती, हर सुधार और हर "अहा!" क्षण का एक विस्तृत कुकबुक (दस्तावेज़ीकरण) भी लिखा। यह केवल एक लॉग नहीं था; यह एक संरचित पाठ योजना (lesson plan) थी।
चरण 2: ऑटोपायलट शेफ
दूसरे चरण में, शोधकर्ताओं ने उस विस्तृत कुकबुक को रोबोट कौशल (Robot Skills) के एक सेट में बदल दिया।
- कौशल प्रणाली: उन्होंने आठ विशिष्ट चरणों (जैसे "प्याज काटें," "मांस को भूनें," "सॉस में मसाला डालें") के साथ एक प्रणाली बनाई। प्रत्येक चरण का एक सख्त "स्वाद परीक्षण" (एक संख्यात्मक जांच) होता है ताकि यह सुनिश्चित किया जा सके कि अगला कदम उठाने से पहले भोजन का स्वाद बिल्कुल सही है। यदि स्वाद सही नहीं है, तो रोबोट स्वचालित रूप रूप से अपने कौशल सूची से एक अलग तकनीक आजमाता है।
- स्वायत्तता (Autonomy): एक बार जब यह प्रणाली तैयार हो गई, तो शोधकर्ताओं ने रोबोट शेफ को अकेले काम करने दिया। उन्होंने उसे आठ नई, अलग-अलग रेसिपी (अन्य LLMs जैसे Qwen और SmolLM) दीं जिन्हें उसने पहले कभी नहीं देखा था।
- परिणाम: बिना किसी मानवीय सहायता के, रोबोट शेफ ने सभी आठ नए व्यंजनों को 0.5 से 4 घंटे में सफलतापूर्वक पका लिया।
- इनमें से तीन नए व्यंजन उतने ही कुशलता से पकाए गए जितने कि मूल व्यंजन को, जिसमें इंसान ने मदद की थी।
- सिस्टम ने साबित किया कि वह सामान्यीकरण (generalize) कर सकता है: उसने केवल पहली रेसिपी को रटा नहीं; उसने इस विशिष्ट उपकरण के लिए खाना पकाने के सिद्धांतों को सीखा और उन कौशलों को नई सामग्रियों पर लागू किया।
यह क्यों मायने रखता है (सरल शब्दों में)
सोचिए कि Spatial NPU एक हाई-टेक, ऊर्जा-बचत कार इंजन है।
- पहले: कार को चलाने के लिए, आपको एक मैकेनिक की आवश्यकता होती थी जो हर स्पार्क प्लग और फ्यूल इंजेक्टर को हाथ से वायर करे। इसमें बहुत समय और पैसा लगता था।
- अब: शोधकर्ताओं ने एक "सेल्फ-ड्राइविंग मैकेनिक" बनाया है। पहले, एक इंसान ने मैकेनिक को उसी प्रकार के एक विशिष्ट इंजन मॉडल को ठीक करना सिखाया। फिर, मैकेनिक ने उसी प्रकार के इंजन को ठीक करने के सिद्धांतों को सीखा। अब, मैकेनिक उसी इंजन के एक अलग मॉडल वाली गैरेज में जा सकता है और कुछ ही घंटों में उसे पूरी तरह से ठीक कर सकता है, और यह सुनिश्चित करने के लिए अपने काम की जांच कर सकता है कि वह सुरक्षित रूप से चल रहा है।
मुख्य निष्कर्ष (The Bottom Line)
शोध पत्र का दावा है कि मानवीय मार्गदर्शन को एक ऐसे AI के साथ जोड़कर जो विस्तृत नोट्स रखता है और उन नोट्स को पुन: प्रयोज्य "कौशलों" में बदल देता है, वे अब जटिल AI मॉडलों को स्वायत्त रूप से विशेष, ऊर्जा-कुशल हार्डवेयर पर तैनात कर सकते हैं। उन्होंने सफलतापूर्वक आठ नए मॉडल तैनात किए जो पहले कभी इस हार्डवेयर पर नहीं चलाए गए थे, जिससे यह सिद्ध होता है कि सिस्टम सीख सकता है, अनुकूलित हो सकता है और निरंतर मानवीय पर्यवेक्षण के बिना काम कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।