A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World
यह शोध पत्र PragmaBot को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो रोबोटों को विजुअल सेल्फ-रिफ्लेक्शन के लिए विजन-लैंग्वेज मॉडल और रिट्रीवल-ऑगमेंटेड जनरेशन के माध्यम से सफलता दर में निरंतर सुधार करने के लिए एक दोहरी मेमोरी प्रणाली (शॉर्ट-टर्म और लॉन्ग-टर्म) का उपयोग करके वास्तविक दुनिया के अनुभव के माध्यम से टास्क प्लानिंग सीखने में सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने आपके लिए एक जटिल भोजन पकाने के लिए एक प्रतिभाशाली, विश्व स्तरीय शेफ को काम पर रखा है। इस शेफ ने अस्तित्व में मौजूद हर कुकबुक को पढ़ा है और खाना पकाने के सिद्धांत को पूरी तरह से जानता है। हालांकि, इसमें एक पेच है: इस शेफ ने वास्तव में कभी चाकू नहीं पकड़ा है, पैन का वजन महसूस नहीं किया है, या यह नहीं देखा है कि क्या होता है जब आप एक फिसलन वाले प्याज को काटने की कोशिश करते हैं।
यदि आप इस शेफ से कहते हैं कि "प्याज को काटो," तो वे आत्मविश्वास से कह सकते हैं, "आसान है! बस ऊपर से पकड़ें और काट दें!" लेकिन वास्तव में, प्याज लुढ़क जाएगा, या चाकू फिसल जाएगा क्योंकि शेफ को काउंटर के भौतिक घर्षण (friction) की समझ नहीं है।
यही वह समस्या है जिसका सामना वर्तमान रोबोट करते हैं जो लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग करते हैं। वे स्मार्ट "दिमाग" हैं जो शब्दों को जानते हैं, लेकिन उनके पास वह "शरीर" का अनुभव नहीं है जिससे पता चले कि वास्तव में दुनिया में क्या काम करता है।
PRAGMABOT इस समस्या का समाधान है। यह एक ऐसा फ्रेमवर्क है जो रोबोट को करने, असफल होने और याद रखने से सिखाता है, बिल्कुल वैसे ही जैसे एक मानव बच्चा चलना सीखता है।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. "दिमाग" और "आंखें" (VLM)
केवल टेक्स्ट पढ़ने के बजाय, PRAGMABOT एक विज़न-लैंग्वेज मॉडल (VLM) का उपयोग करता है। इसे एक सुपर-स्मार्ट सहायक के रूप में सोचें जो रोबोट के कैमरे के माध्यम से दुनिया को देख भी सकता है और भाषा को समझ भी सकता है।
- दिमाग: यह चरणों की योजना बनाता है (जैसे, "सेब उठाओ")।
- आंखें: यह देखती हैं कि रोबोट के हिलने के बाद क्या हुआ। क्या सेब वास्तव में हिला? क्या वह गिर गया?
2. "अल्पकालिक स्मृति" (स्टिकी नोट)
जब रोबोट किसी कार्य को करने की कोशिश करता है और असफल होता है, तो वह केवल हार नहीं मानता। वह रुकता है और जोर से सोचता है (एक प्रक्रिया जिसे स्व-चिंतन/Self-Reflection कहा जाता है)।
- उपमा: कल्पना कीजिए कि आप एक जार खोलने की कोशिश कर रहे हैं, लेकिन वह फंसा हुआ है। आप सोचते हैं, "ठीक है, यह काम नहीं किया। शायद मुझे पहले ढक्कन को थपथपाना चाहिए।" आप इस विचार को एक स्टिकी नोट पर लिखते हैं और इसे अपने ठीक सामने चिपका देते हैं।
- रोबोट में: यह अल्पकालिक स्मृति (STM) है। यदि रोबोट एक सेब उठाने की कोशिश करता है लेकिन एक कैन उसे रोक रहा है, तो रोबोट महसूस करता है, "मैं सेब तक नहीं पहुँच सकता।" वह अपने स्टिकी नोट पर अपनी योजना अपडेट करता है: "पहले, कैन को दूर धकेलो, फिर सेब उठाओ।" यह रोबोट को बिना किसी इंसान के बताए, उसी कार्य के दौरान अपनी गलतियों को सुधारने की अनुमति देता है।
3. "दीर्घकालिक स्मृति" (डायरी)
एक बार जब रोबोट सफलतापूर्वक कोई कार्य पूरा कर लेता है, तो वह उस स्टिकी नोट को लेता है और उसके डायरी (दीर्घकालिक स्मृति या LTM) में एक परिष्कृत प्रविष्टि लिखता है।
- उपमा: आप सीखते हैं कि "जार खोलना आसान होता है यदि आप ढक्कन को थपथपाते हैं।" आप इसे अपनी डायरी में लिखते हैं। अगली बार जब आप कोई जार देखते हैं, तो आपको इसे शून्य से समझने की आवश्यकता नहीं होती; आप बस अपनी डायरी देखते हैं।
- रोबोट में: रोबोट अपने सबक का सारांश देता है: "जब कोई वस्तु किसी कंटेनर द्वारा बाधित होती है, तो पहले कंटेनर को धकेलें।" यह सबक हमेशा के लिए सुरक्षित हो जाता है।
4. "लाइब्रेरियन" (RAG)
जब रोबोट के सामने कोई नया कार्य आता है, तो वह शून्य से शुरुआत नहीं करता है। वह अपने आंतरिक लाइब्रेरियन से अपने डायरी के प्रासंगिक पन्ने खोजने के लिए कहता है।
- उपमा: आपसे एक नए, अजीब आकार के जार को खोलने के लिए कहा जाता है। आप अनुमान नहीं लगाते; आप अपने लाइब्रेरियन से पूछते हैं, "क्या हमारे पास अजीब जार खोलने के बारे में कोई नोट्स हैं?" लाइब्रेरियन आपको "ढक्कन को थपथपाने" वाला पन्ना थमा देता है।
- रोबोट में: इसे RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) कहा जाता है। रोबोट अपने पिछले अनुभवों को खोजता है ताकि समान स्थिति को ढूंढ सके। यदि उसने पहले सेब पाने के लिए कैन को हटाया था, और अब उसे एक तौलिए द्वारा बाधित पेंच (screw) को हटाना है, तो उसे याद आता है: "हे, मैंने पहले एक कैन को धकेला था; शायद मुझे पहले इस तौलिए को धकेलना चाहिए!"
5. "हाइलाइटर" (इमेज एनोटेशन)
कभी-कभी, रोबोट की आंखें भ्रमित हो जाती हैं। वह एक ड्रमस्टिक देख सकता है और सोच सकता है, "मुझे मांस पकड़ना चाहिए," लेकिन मांस फिसलन भरा है और गिर जाएगा।
- उपमा: कल्पना कीजिए कि आप किसी जटिल वस्तु के एक विशिष्ट भाग को पकड़ने की कोशिश कर रहे हैं, जैसे कि मग का हैंडल। आप सही हिस्से को पकड़ने के लिए हैंडल पर एक हाइलाइटर लगाते हैं ताकि आप गलत हिस्सा न पकड़ लें।
- रोबोट में: PRAGMABOT कैमरा इमेज पर "मास्क" (डिजिटल हाइलाइटर) बना सकता है ताकि रोबोट को ठीक से बताया जा सके कि कहाँ पकड़ना है या धकेलना है। यह उसे वस्तु के गलत हिस्से को पकड़ने से रोकता है।
परिणाम: अनाड़ी से चतुर तक
पेपर का परीक्षण वास्तविक रोबोटों पर कठिन कार्यों के लिए किया गया था, जैसे:
- पंखे के पीछे छिपी हुई टेनिस बॉल को उठाना।
- पास के स्पंज को गिराए बिना एक छोटे कैंडी को हिलाना।
- एक कटोरा उठाना जिसके अंदर एक सेब है (ताकि आपको पहले सेब को हटाना पड़े)।
PRAGMABOT के बिना: रोबोट लगभग 35% बार विफल रहा क्योंकि वह बार-बार एक ही गलत चीज़ करने की कोशिश करता रहा।
PRAGMABOT के साथ: सफलता दर बढ़कर 84% हो गई।
इससे भी अधिक प्रभावशाली बात यह है कि जब रोबोट को एक बिल्कुल नए कार्य का सामना करना पड़ा जिसे उसने पहले कभी नहीं देखा था, तो वह पहली ही कोशिश में 80% बार अपने "डायरी" का उपयोग करके सफल रहा। उसने सामान्य सबक (जैसे "पहले रास्ता साफ करें") सीख लिए थे जो नई स्थितियों पर भी लागू होते थे।
बड़ी तस्वीर
PRAGMABOT एक ऐसा रोबोट है जिसे हर बार गलती करने पर इंजीनियरों द्वारा फिर से प्रशिक्षित करने की आवश्यकता नहीं है। इसके बजाय, यह एक जिज्ञासु मानव की तरह कार्य करता है:
- यह कुछ करने की कोशिश करता है।
- यह असफल होता है और सोचता है, "यह क्यों विफल हुआ?"
- यह एक नई योजना के साथ फिर से प्रयास करता है।
- यह सबक लिख लेता है ताकि यह दोबारा वही गलती न करे।
यह रोबोट को कोड का पालन करने वाली एक कठोर मशीन से बदलकर एक व्यावहारिक शिक्षार्थी (pragmatic learner) में बदल देता है जो वास्तविक, अप्रत्याशित दुनिया के अनुकूल हो जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।