← नवीनतम पेपर
🤖 AI

An LLM-Driven Closed-Loop Autonomous Learning Framework for Robots Facing Uncovered Tasks in Open Environments

यह शोध पत्र एक LLM-संचालित क्लोज्ड-लूप फ्रेमवर्क का प्रस्ताव करता है जो रोबोटों को स्व-निष्पादन और अवलोकन से नए कौशल सीखने और उन्हें एक स्थानीय विधि लाइब्रेरी में समेकित करने में सक्षम बनाता है, जिससे बाहरी LLM इंटरैक्शन पर निर्भरता कम होती है और खुले वातावरण में दक्षता में सुधार होता है।

मूल लेखक: Hong Su

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Hong Su

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक व्यक्तिगत सहायक रोबोट है। आज के अधिकांश रोबोट एक ऐसे शेफ की तरह हैं जो केवल पाँच विशिष्ट व्यंजन बनाना जानते हैं। यदि आप उनसे कुछ और मांगते हैं, तो वे या तो ठप हो जाते हैं या हर बार अपने बॉस (एक विशाल, महंगे सुपरकंप्यूटर जिसे LLM कहा जाता है) को फोन करके पूछना पड़ता है, "प्याज कैसे काटूं?" या "अंडा कैसे उबालूं?"

यह पेपर उस "ठप" होने वाले रोबोट को एक स्व-शिक्षित प्रशिक्षु (self-taught apprentice) में बदलने का एक तरीका पेश करता है।

यह एक सरल उपमा (analogy) का उपयोग करके बताता है कि यह कैसे काम करता है।

समस्या: "फोन-अ-फ्रेंड" रोबोट

वर्तमान में, जब रोबोट किसी नए कार्य का सामना करता है, तो उसे दो समस्याओं का सामना करना पड़ता है:

  1. निर्भरता का जाल (The Dependency Trap): उन्हें हर कदम के लिए "दोस्त को कॉल" (LLM) करना पड़ता है। यह धीमा, महंगा है, और यदि इंटरनेट चला जाए, तो रोबट बेकार है।
  2. गोल्डफिश जैसी याददाश्त (The Goldfish Memory): भले ही रोबोट मदद के साथ किसी कार्य को सफलतापूर्वक पूरा कर ले, वह तुरंत भूल जाता है कि उसने इसे कैसे किया था। अगली बार जब आप उससे वही चीज़ मांगते हैं, तो वह फिर से दोस्त को कॉल करता है।

समाधान: "प्रशिक्षु" ढांचा (The "Apprentice" Framework)

शोधकर्ताओं ने एक "क्लोज्ड-लूप" सिस्टम बनाया है। केवल एक mindless निष्पादक होने के बजाय, अब रोबोट एक स्मार्ट छात्र की तरह काम करता है। यह प्रक्रिया तीन चरणों में काम करती है:

1. "रेसिपी बुक चेक करने" का चरण (Retrieval)

कुछ भी करने से पहले, रोबोट अपनी आंतरिक "रेसिपी बुक" (Local Method Library) की जांच करता है।

  • उपमा: यदि आप रोबोट से टोस्ट बनाने के लिए कहते हैं, तो वह बॉस को कॉल नहीं करता। वह सोचता है, "रुको, मेरी किताब में टोस्ट बनाने की रेसिपी पहले से ही है!" और बस उसे बना देता है। यह तेज़ और कुशल है।

2. "लर्निंग मोड" का चरण (LLM-Driven Planning)

यदि कार्य किताब में नहीं है (जैसे, "एक शानदार ऑमलेट बनाना"), तो रोबोट घबराता नहीं है। वह "बॉस" (LLM) को कॉल करता है, लेकिन काम करने के लिए नहीं। वह बॉस को एक शिक्षक (Teacher) के रूप में कार्य करने के लिए कॉल करता है।

  • उपमा: रोबोट पूछता है, "हे, मुझे नहीं पता कि ऑमलेट कैसे बनाया जाता है। क्या आप मुझे एक लेसन प्लान दे सकते हैं? मुझे किन औजारों की जरूरत है? मुझे किन बातों का ध्यान रखना चाहिए?" LLM रणनीति प्रदान करता है, लेकिन वास्तविक "हाथों-हाथ" अभ्यास रोबोट ही करता है।

3. "लिखने" का चरण (Consolidation)

यह सबसे महत्वपूर्ण हिस्सा है। एक बार जब रोबोट सफलतापूर्वक ऑमलेट बना लेता है, तो वह केवल आगे नहीं बढ़ जाता। वह जो अभी सीखा है, उसके आधार पर एक नई रेसिपी लिखता है, और उसे अपनी रेसिपी बुक में जोड़ देता है।

  • उपमा: अगली सुबह, जब आप उससे वही ऑमलेट मांगते हैं, तो रोबोट बॉस को कॉल नहीं करता। वह बस अपनी किताब खोलता है, अपने नोट्स पढ़ता है, और काम शुरू कर देता है।

"सीक्रेट सॉस": देखकर सीखना

शोधकर्ताओं ने एक शानदार फीचर जोड़ा है: सक्रिय अवलोकन (Active Observation)।
कल्पना कीजिए कि रोबोट रसोई में बैठा है और देखता है कि आप सैंडविच बना रहे हैं। केवल एक मूर्ति की तरह देखने के बजाय, रोबोट सोचता है, "यह उपयोगी लग रहा है। मेरे पास इसकी रेसिपी नहीं है, लेकिन मैं करीब से देखूंगा, चरणों को समझूंगा और अपनी खुद की रेसिपी लिखूंगा ताकि मैं इसे बाद में कर सकूं।" वह आपके कार्यों को अपने कौशल में बदल देता है।

क्या यह वास्तव में काम करता है? (परिणाम)

शोधकर्ताओं ने इसका परीक्षण किया, और परिणाम एक छात्र के स्नातक होने जैसा थे:

  • यह तेज़ होता जाता है: पहली बार जब वह कोई कार्य करता है, तो वह थोड़ा धीमा होता है क्योंकि वह "पढ़ाई" कर रहा होता है। लेकिन दूसरी या तीसरी बार तक, यह उस रोबोट की तुलना में बहुत तेज़ होता है जिसे हर बार बॉस को कॉल करना पड़ता है।
  • यह स्मार्ट/स्वतंत्र बनता है: रोबोट द्वारा "बॉस को कॉल" करने की संख्या काफी कम हो गई (एक परीक्षण में, प्रति कार्य 1 कॉल से घटकर केवल 0.2 कॉल रह गई)।
  • यह "ब्रेन पावर" बचाता है: यह बाहरी निर्देशों के लिए प्रतीक्षा करने में कम समय बिताता है और वास्तव में काम करने में अधिक समय लगाता है।

एक वाक्य में सारांश:

एक ऐसे रोबोट के बजाय जो लगातार मदद मांगता रहता है, यह पेपर एक ऐसा रोबोट बनाता है जो खुद को सिखाने के लिए मदद का उपयोग करता है, अपने स्वयं के निर्देश लिखता है, और हर बीतते दिन के साथ अधिक स्वतंत्र होता जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →