← नवीनतम पेपर
💻 computer science

SHRIMP: Iterative Refinement of Robot Task Plans

SHRIMP एक ऐसा सिस्टम है जो गैर-विशेषज्ञ उपयोगकर्ताओं को प्राकृतिक भाषा का उपयोग करके पदानुक्रमित रोबोट कार्य योजनाओं को उत्पन्न करने और उन्हें पुनरावृत्ति से परिष्कृत करने में सक्षम बनाता है, जिसमें भौतिक रोबोटों पर कार्यों को निष्पादित करने से पहले कथित नियंत्रण और पारदर्शिता में सुधार के लिए सिमुलेशन-आधारित सत्यापन शामिल है।

मूल लेखक: Mya Schroder, Yuna Hwang, Callie Y. Kim, Leqian Cheng, Jeffrey Li-cheng Liu, Chenchen Zheng, Xinning He, Bilge Mutlu

प्रकाशित 2026-08-11
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mya Schroder, Yuna Hwang, Callie Y. Kim, Leqian Cheng, Jeffrey Li-cheng Liu, Chenchen Zheng, Xinning He, Bilge Mutlu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ आप एक रोबोट से कह सकते हैं कि "रसोई की गंदगी साफ कर दो" और वह बिल्कुल जान जाएगा कि उसे क्या करना है, हर कप और कटोरे को पूरी सटीकता के साथ हिलाना। यह कोलाबोरेटिव रोबोट्स, या "कोबॉट्स" (cobots) का सपना है, जो कारखानों, खेतों और अस्पतालों में हमारे साथ मिलकर काम करने के लिए डिज़ाइन किए गए हैं। लेकिन यहाँ एक पेंच है: रोबोट को यह बताना कि क्या करना है, आश्चर्यजनक रूप से कठिन है। यदि आप सिर्फ कहते हैं "कप को हिलाओ," तो रोबोट को शायद पता नहीं चलेगा कि कौन सा कप, उसे कितनी दूर ले जाना है, या उसे धीरे से उठाना चाहिए या जोर से धकेलना चाहिए। यहीं पर लार्ज लैंग्वेज मॉडल्स (LLMs) काम आते हैं। इन उन्हें सुपर-स्मार्ट AI दिमाग समझें जो मानवीय शब्दों को समझने में माहिर हैं। वैज्ञानिक इन AI को हमारे अस्पष्ट और उलझे हुए वाक्यों को सटीक रोबोट निर्देशों में अनुवाद करना सिखाने की कोशिश कर रहे हैं। हालाँकि, एक बड़ी समस्या है: ये AI दिमाग अक्सर "ब्लैक बॉक्स" होते हैं। आप एक अनुरोध टाइप करते हैं, और एक योजना बाहर निकल आती है, लेकिन आपको पता नहीं चलता कि AI ने इसे कैसे तय किया, या क्या वह योजना वास्तव में काम करेगी या बिना कटोरा गिराए या दीवार से टकराए। यदि योजना गलत है, तो आपको तब तक पता नहीं चल सकता जब तक कि रोबोट कुछ तोड़ न दे। यह शोध उस डरावनी अनिश्चितता को इस सवाल के साथ हल करता है: हम आम लोगों को रोबोट के हिलने से पहले ही रोबोटिक योजनाओं को देखने, समझने और ठीक करने की अनुमति कैसे दे सकते हैं?

यहाँ SHRIMP आता है, जो विस्कॉन्सिन-मैडिसन विश्वविद्यालय के शोधकर्ताओं द्वारा बनाया गया एक नया सिस्टम है जो रोबोटिक कार्यों के लिए "फ्लाइट सिम्युलेटर" की तरह काम करता है। इसका नाम सिमुलेशन-ड्रिवन ह्यूमन-इन-द-लूप रिफाइनमेंट इंटरफेस फॉर मैनिपुलेशन प्लानिंग (Simulation-driven Human-in-the-loop Refinement Interface for Manipulation Planning) है, लेकिन आप इसे "रोबोट प्लान प्लेग्राउंड" के रूप में देख सकते हैं। AI के पहले अनुमान पर भरोसा करने के बजाय, SHRIMP आपको वास्तविक दुनिया को छूने से पहले ही रोबोट की योजना को छोटे-छोटे चरणों की सूची (जैसे "पकड़ना", "हिलाना", "झुकाना") में विभाजित करके देखने देता है। यदि योजना अजीब दिखती है—मान लीजिए, रोबोट गलत कोण से कटोरा उठाने की कोशिश करता है—तो आप इसे कंप्यूटर सिमुलेशन में वहीं ठीक कर सकते हैं। आप नंबरों को बदल सकते हैं, चरणों को फिर से व्यवस्थित कर सकते हैं, या बस AI से बेहतर निर्देशों के साथ फिर से प्रयास करने के लिए कह सकते हैं। एक बार जब सिमुलेशन में योजना एकदम सही दिखने लगे, तभी इसे वास्तविक रोबोट को भेजा जाता है।

शोधकर्ताओं ने इस विचार का परीक्षण 35 लोगों के साथ किया जिन्हें मेज सजाने या रसोई साफ करने जैसे कार्यों की योजना बनानी थी। उन्होंने सिस्टम का उपयोग करने के तीन अलग-अलग तरीकों की तुलना की: एक जहाँ लोग हर सूक्ष्म चरण को देख और संपादित कर सकते थे (पूर्ण SHRIMP अनुभव), एक जहाँ वे केवल बड़े चित्र वाले चरणों को देख सकते थे, और एक जहाँ उन्हें केवल निर्देश टाइप करने थे और उम्मीद करनी थी ( "ब्लैक बॉक्स" विधि)। परिणाम स्पष्ट थे: जब लोग विस्तृत चरणों को देख और संपादित कर सकते थे, तो वे अधिक नियंत्रण महसूस करते थे और रोबट की क्रियाओं को बहुत बेहतर समझते थे। यह एक नक्शा होने जैसा था बनाम केवल यह सुने कि "उत्तर की ओर जाओ।" हालाँकि, एक ट्रेड-ऑफ भी था: उन सभी विवरणों को जांचने और ठीक करने से कार्य थोड़ा मानसिक रूप से थकाऊ महसूस हुआ, विशेष रूप से सरल कार्यों के लिए जहाँ रोबोट को वास्तव में मदद की आवश्यकता नहीं थी। लेकिन जटिल कार्यों के लिए, वह अतिरिक्त नियंत्रण जीवन रक्षक था। अध्ययन बताता है कि जबकि AI काम शुरू करने में महान है, हमें ऐसे उपकरणों की आवश्यकता है जो हमें इंजन के नीचे झांकने और यह सुनिश्चित करने की अनुमति दें कि रोबोट अपने ही पैरों में नहीं फंस रहा है।

मूल विचार: "ब्लैक बॉक्स" से "ग्लास बॉक्स" तक

यह पेपर तर्क देता है कि हालांकि AI रोबोटिक योजनाएं लिख सकता है, हम आँख मूंदकर इस पर भरोसा नहीं कर सकते। लेखक SHRIMP को एक समाधान के रूप में प्रस्तावित करते हैं जो AI प्लानिंग के "ब्लैक बॉक्स" को "ग्लास बॉक्स" में बदल देता है जहाँ सब कुछ दृश्यमान है। सिस्टम एक लूप में काम करता है:

  1. आप बोलते हैं: आप एक प्राकृतिक भाषा प्रॉम्प्ट टाइप करते हैं, जैसे "मेज साफ करो।"
  2. AI सोचता है: सिस्टम आपके शब्दों को एक पदानुक्रमित (hierarchical) योजना में बदलने के लिए एक लार्ज लैंग्वेज मॉडल का उपयोग करता है। यह योजना केवल एक पैराग्राफ नहीं है; यह "प्रिमिटिव्स" की एक सूची है, जो रोबोटिक क्रियाओं के लेगो ब्लॉक्स की तरह हैं। कुछ ब्लॉक बड़े होते हैं (जैसे "कटोरा उठाएं"), और कुछ छोटे होते हैं (जैसे "हाथ को विशिष्ट निर्देशांकों तक ले जाएं")।
  3. आप जांचते हैं: रोबोट के हिलने से पहले, आप इसे एक भौतिकी-आधारित सिमुलेशन में देखते हैं। यह वास्तविक रोबोट और वास्तविक मेज का एक डिजिटल जुड़वां (digital twin) है। आप रोबोट को कटोरा उठाने की कोशिश करते हुए देख सकते हैं। यदि सिमुलेशन दिखाता है कि कटोरा मेज से गिर रहा है, तो आप जानते हैं कि कुछ गलत है।
  4. आप ठीक करते हैं: आप दो तरीकों से योजना को ठीक कर सकते हैं। आप एक नया निर्देश टाइप कर सकते हैं (री-प्रॉम्प्टिंग) या आप योजना में सीधे नंबरों को संपादित कर सकते हैं (जैसे रोबोट के हाथ की ऊंचाई बदलना)।
  5. आप निष्पादित करते हैं: एक बार जब सिमुलेशन एकदम सही दिखने लगे, तो आप योजना को वास्तविक रोबोट को भेज देते हैं।

अध्ययन ने क्या पाया

शोधकर्ताओं ने एक प्रयोग चलाया जिसमें 35 प्रतिभागियों ने तीन अलग-अलग कार्यों को पूरा करने का प्रयास किया: मेज सजाना, नाश्ता तैयार करना और मेज साफ करना। प्रत्येक व्यक्ति ने तीन अलग-अलग "मोड्स" में सिस्टम का उपयोग किया:

  • प्लान+एडिट (Plan+Edit): पूर्ण SHRIMP अनुभव जहाँ वे प्रत्येक चरण को देख और संपादित कर सकते थे।
  • प्लान-ओनली (Plan-Only): वे उच्च-स्तरीय चरणों को देख सकते थे लेकिन विवरणों को संपादित नहीं कर सकते थे।
  • नो-प्लान (No-Plan): बेसलाइन जहाँ उन्होंने केवल निर्देश टाइप किए और रोबोट ने बिना किसी दृश्य योजना या संपादन के इसे करने का प्रयास किया ( "ब्लैक बॉक्स")।

परिणामों ने दिखाया कि प्लान+एडिट मोड दो मुख्य कारणों से विजेता था:

  1. नियंत्रण: लोग रोबोट पर बहुत अधिक नियंत्रण महसूस करते थे। वे देख सकते थे कि रोबोट वास्तव में क्या करने जा रहा है और यदि उन्हें पसंद नहीं आया तो वे इसे बदल सकते थे। एक प्रतिभागी ने कहा, "रोबोट की गतिविधियों के विशिष्ट हिस्सों को संपादित करने में सक्षम होना... मुझे लगा कि मेरा नियंत्रण अधिक है।"
  2. पारदर्शिता: लोग रोबोट की योजना को बहुत बेहतर समझते थे। वे देख सकते थे कि रोबोट कुछ क्यों कर रहा है। जब वे योजना नहीं देख पा रहे थे ( "नो-प्लान" मोड में), तो वे भ्रमित महसूस करते थे और उन्हें नहीं पता था कि रोबोट द्वारा गलती करने पर इसे कैसे ठीक किया जाए।

हालाँकि, अध्ययन में एक कमी भी मिली। प्लान+एडिट मोड ने लोगों को अधिक मानसिक रूप से थका हुआ (उच्च "टास्क लोड") महसूस कराया। यह एक बहुत ही विस्तृत मानचित्र रखने जैसा था: जटिल मंजिल तक पहुँचने के लिए यह बहुत अच्छा है, लेकिन यदि आप केवल कोने की दुकान तक जा रहे हैं, तो हर एक सड़क का नाम देखने वाला नक्शा देखना बहुत अधिक काम लग सकता है। सरल कार्यों के लिए, अतिरिक्त सुविधाएँ अनावश्यक लगीं। लेकिन कठिन कार्यों के लिए, वह अतिरिक्त नियंत्रण अनिवार्य था।

लोग वास्तव में इसका उपयोग कैसे करते हैं

शोधकर्ताओं ने देखा कि लोग सभी ने एक ही तरह से सिस्टम का उपयोग नहीं किया। उन्होंने तीन मुख्य रणनीतियाँ पाईं:

  • स्टेपवाइज (Stepwise): लोग एक समय में एक छोटा हिस्सा बनाकर योजना बनाते थे। वे कहते, "कप को हिलाओ," उसकी जाँच करते, फिर कहते, "कटोरा हिलाओ," और फिर उसकी जाँच करते।
  • क्युमुलेटिव (Cumulative): वे एक हिस्से से शुरू करते थे और उसमें और जोड़ते जाते थे। "कप को हिलाओ," फिर "कप और कटोरे को हिलाओ," फिर "कप, कटोरा और चम्मच को हिलाओ।"
  • वनशॉट (Oneshot): वे शुरुआत में ही एक बड़े, विस्तृत वाक्य में पूरी योजना लिखने का प्रयास करते थे।

दिलचस्प बात यह है कि भले ही लोगों के पास नंबरों को ठीक करने के लिए क्लिक और ड्रैग करने की क्षमता थी ( "एडिट" वाला हिस्सा), कई लोगों ने फिर भी चीजों को ठीक करने के लिए केवल नए शब्द टाइप करना पसंद किया। यह सुझाव देता है कि भले ही उपकरण मौजूद हैं, लोग अक्सर जटिल नंबरों के साथ छेड़छाड़ करने के बजाय रोबोट से फिर से बात करना आसान पाते हैं।

निष्कर्ष

पेपर निष्कर्ष निकालता है कि रोबोटों के लिए वास्तव में आम लोगों के लिए मददगार होने के लिए, हम केवल सोचने के लिए AI पर निर्भर नहीं रह सकते। हमें ऐसे इंटरफेस की आवश्यकता है जो हमें रोबोट की "विचार प्रक्रिया" देखने और गड़बड़ी होने से पहले इसे ठीक करने की अनुमति दें। SHRIMP सिस्टम साबित करता है कि लोगों को रोबोट की योजना देखने और संपादित करने की क्षमता देने से वे अधिक आत्मविश्वास और नियंत्रण महसूस करते हैं। लेकिन यह हमें यह भी चेतावनी देता है कि हमें बहुत अधिक जानकारी देकर लोगों को अभिभूत करने के प्रति सावधान रहना चाहिए, विशेष रूप से सरल कार्यों के लिए। रोबोटिक प्लानिंग का भविष्य केवल स्मार्ट AI के बारे में नहीं है; यह मानवीय इरादे और रोबोटिक क्रिया के बीच बेहतर पुल बनाने के बारे में है, जो हमें 'हुड के नीचे' झांकने और यह सुनिश्चित करने की अनुमति दे कि सड़क पर उतरने से पहले इंजन सुचारू रूप से चल रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →