Hierarchical Prompting with Dual LLM Modules for Robotic Task and Motion Planning
यह शोध पत्र एक पदानुक्रमित भाषा-संचालित ढांचे को प्रस्तुत करता है जो विविध सेवा परिदृश्यों में रोबोटिक कार्य और गति नियोजन के लिए 86% सफलता दर प्राप्त करने हेतु एक उच्च-स्तरीय LLM प्लानिंग एजेंट को लो-लेवल स्थानिक तर्क उप-मॉड्यूल और ऑब्जेक्ट डिटेक्शन टूल्स के साथ एकीकृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को यह सिखाने की कोशिश कर रहे हैं कि वह आपकी रसोई में आपकी मदद कैसे करे। यदि आप बस कहेंगे, "मेरे लिए एक फलों का कटोरा बनाओ," तो एक मानक रोबोट भ्रमित हो सकता है। वह जानता है कि "फल" क्या है, लेकिन उसे यह नहीं पता कि फल कहाँ हैं, उन्हें बिना कुचले कैसे उठाना है, या कटोरे के बगल में ठीक कहाँ रखना है।
यह शोध पत्र रोबोट से बात करने का एक नया तरीका प्रस्तुत करता है जिसमें एक "दो-मस्तिष्क" (two-brain) प्रणाली का उपयोग किया गया है। एक ही सुपर-स्मार्ट कंप्यूटर से सब कुछ एक साथ करने के बजाय, शोधकर्ताओं ने काम को दो विशिष्ट कार्यों में विभाजित कर दिया है, जो "लार्ज लैंग्वेज मॉडल्स" (LLMs) हैं, जो उन्नत AI चैटबॉट्स की तरह हैं।
यह प्रणाली कैसे काम करती है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
दो-मस्तिष्क प्रणाली
1. "जनरल मैनेजर" (उच्च-स्तरीय एजेंट)
इस AI को एक प्रोजेक्ट मैनेजर के रूप में समझें। आप इसे एक स्वाभाविक निर्देश देते हैं जैसे, "मेज से सभी फलों को हटा दो।"
- यह क्या करता है: यह बड़े लक्ष्य को एक 'टू-डू लिस्ट' (करने योग्य कार्यों की सूची) में तोड़ देता है। यह तय करता है, "पहले, मुझे सेब ढूँढने की जरूरत है। फिर, मुझे उन्हें उठाना होगा। फिर, मुझे उन्हें कूड़ेदान में डालना होगा।"
- यह कैसे सोचता है: यह "ReAct" (Reason + Act - तर्क + कार्य) नामक एक विधि का उपयोग करता है। यह सोचता है, "मुझे एक सेब चाहिए," फिर यह रोबोट की आँखों से एक को खोजने के लिए कहता है, सेब को देखता है, और फिर कहता है, "ठीक है, इसे पकड़ो।" यह एक लॉग रखता है कि इसने क्या किया है ताकि यह भूल न जाए।
- इसकी सीमा: जबकि यह मैनेजर तर्क में बहुत अच्छा है, यह गणित में बहुत खराब है। यदि आप इसे कहते हैं, "कप को प्लेट के बाईं ओर रखें," तो यह शब्दों को समझ सकता है, लेकिन इसे वास्तव में यह नहीं पता कि रोबोट के हाथ को ले जाने के लिए सटीक 3D निर्देशांक (coordinates) क्या होने चाहिए। यह अनुमान लगा सकता है, और उसका वह अनुमान शारीरिक रूप से असंभव हो सकता है।
2. "स्पेशियल आर्किटेक्ट" (निम्न-स्तरीय उप-मॉड्यूल)
यह एक विशेषज्ञ इंजीनियर है जो ज्यामिति (geometry) को संभालता है। जनरल मैनेजर सीधे रोबोट के हाथ से बात नहीं करता है; वह इस आर्किटेक्ट से बात करता है।
- यह क्या करता है: जब मैनेजर कहता है, "मग को प्लेट के पास रखें," तो आर्किटेक्ट कमान संभाल लेता है। यह मग और प्लेट के 3D आकार को देखता है (YOLOX-GDRNet नामक कैमरा सिस्टम का उपयोग करके) और सटीक गणित की गणना करता है: "प्लेट X, Y, Z निर्देशांक पर है। इसके 'पास' होने के लिए, मग को X + 5cm पर होना चाहिए।"
- इन्हें अलग क्यों किया गया? यदि आप जनरल मैनेजर को योजना बनाने और गणित करने दोनों के लिए एक साथ व्यस्त करते हैं, तो वह घबरा जाता है और गलतियाँ करता है (जैसे कि मग को एक ठोस मेज के अंदर रखने की कोशिश करना)। "क्या करना है" को "ठीक कहाँ रखना है" से अलग करके, यह प्रणाली बहुत अधिक विश्वसनीय हो जाती है।
उन्होंने इसका परीक्षण कैसे किया
शोधकर्ताओं ने इस प्रणाली को एक सिमुलेशन और एक वास्तविक रोबोट (एक PAL Robotics Tiago आर्म) में 24 अलग-अलग परीक्षणों के माध्यम से परखा।
- परिणाम: प्रणाली 86% कार्यों में सफल रही।
- सरल बनाम कठिन: यह सरल निर्देशों (जैसे "केला उठाओ") में बहुत अच्छी थी और असंभव कार्यों (जैसे "केले को ठोस मेज के अंदर रखो") को पहचानने में इससे भी बेहतर थी। उन असंभव मामलों में, रोबोट ने 100% समय सही ढंग से कहा, "मैं यह नहीं कर सकता।"
- मानवीय प्रतिक्रिया: जब मनुष्यों ने अंतिम परिणामों को देखा, तो उन्होंने इसे 10 में से लगभग 6.9 का स्कोर दिया। उन्हें तब अच्छा लगा जब रोबोट ने स्पष्ट कार्य किए (जैसे बर्तनों को एक के ऊपर एक रखना), लेकिन वे अस्पष्ट निर्देशों (जैसे "एक नमकीन स्नैक बनाओ") के मामले में कम आश्वस्त थे, क्योंकि "नमकीन स्नैक" की व्याख्या अलग-अलग हो सकती है।
वास्तविक दुनिया का परीक्षण
उन्होंने इसे एक वास्तविक कमरे में एक वास्तविक रोबोट आर्म पर भी आजमाया।
- सफलता: रोबोट वस्तुओं (जैसे सरसों की बोतल या सेब) को खोजने में बहुत अच्छा था, भले ही मेज बिखरी हुई हो। उसने योजना को पूरी तरह से समझा।
- विफलताएं: कुछ बार जब यह विफल हुआ, तो ऐसा इसलिए नहीं था क्योंकि AI योजना को लेकर भ्रमित था। यह इसलिए विफल हुआ क्योंकि भौतिक हार्डवेयर संबंधी समस्याएं थीं, जैसे कि कैमरा थोड़ा गलत संरेखित (misaligned) था या रोबोट का हाथ किसी चीज़ से टकरा गया था। "मस्तिष्क" काम कर रहा था; "शरीर" में बस एक मामूली खराबी थी।
मुख्य निष्कर्ष
यह शोध पत्र दिखाता है कि काम को एक मैनेजर (जो तर्क और बातचीत संभालता है) और एक आर्किटेक्ट (जो 3D गणित और प्लेसमेंट संभालता है) में विभाजित करके, रोबोट भाषा और स्थान को बहुत बेहतर तरीके से समझ सकते हैं।
हालाँकि, लेखक उनकी सीमाओं के बारे में ईमानदार हैं: हालांकि रोबोट भाषा और स्थान को समझने में स्मार्ट हो रहे हैं, फिर भी वे भौतिक दुनिया की जटिलताओं के साथ संघर्ष करते हैं। यह रोबोट्स को घर पर हमारी मदद करने के योग्य बनाने की दिशा में एक बड़ा कदम है, बिना हमें "रोबोट कोड" बोलने की आवश्यकता के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।