← नवीनतम पेपर
💻 computer science

A Conversational Framework for Human-Robot Collaborative Manipulation with Distributed Generative AI models

यह शोध पत्र एक वितरित, ROS 2-आधारित संवादात्मक ढांचे को प्रस्तुत करता है जो मुक्त-रूप मानवीय आदेशों को फ्रैंका FR3 प्लेटफॉर्म पर सत्यापित रोबोटिक हेरफेर क्रियाओं में अनुवादित करने के लिए स्थानीय भाषा और विजन-लैंग्वेज मॉडलों को एकीकृत करता है, जिसमें स्पष्ट ऑपरेटर पुष्टि और मध्यवर्ती इरादे के दृश्यता के लिए एक वेब डैशबोर्ड शामिल है।

मूल लेखक: Arash Ghasemzadeh Kakroudi, Roel Pieters

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arash Ghasemzadeh Kakroudi, Roel Pieters

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोटिक हाथ एक बहुत ही शक्तिशाली, बहुत सटीक, लेकिन थोड़ी शाब्दिक (literal-minded) समझ रखने वाला सहायक है। आप उसे कहना चाहते हैं, "वह लाल पासा उठाओ," लेकिन यदि आप बस चिल्लाकर कह देंगे, तो रोबोट भ्रमित हो सकता है, गलत चीज़ पकड़ सकता है, या यह समझने की कोशिश में खुद को चोट पहुँचा सकता है कि आपका क्या मतलब है।

यह शोध पत्र रोबोट से बात करने का एक नया तरीका प्रस्तुत करता है जो एक साथ सब कुछ करने वाले एक विशाल मस्तिष्क के बजाय, एक साथ काम करने वाले विशेषज्ञों की एक सुपर-संगठित टीम की तरह कार्य करता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. दिमागों की "असेंबली लाइन" (The "Assembly Line" of Brains)

एक ही विशाल कंप्यूटर द्वारा आपकी आवाज़ समझने, कमरे को देखने और रोबोट को चलाने की कोशिश करने के बजाय, लेखकों ने इस काम को चार अलग-अलग "स्टेशनों" (जिन्हें नोड्स कहा जाता है) में विभाजित कर दिया है जो एक-दूसरे से बात करते हैं। इसे एक रेस्टोरेंट की रसोई की तरह समझें:

  • वेटर (भाषा मॉडल - Language Model): आप वेटर को बताते हैं, "मुझे पीला पासा चाहिए।" वेटर को यह नहीं पता कि पासा कैसा दिखता है, लेकिन वे आपके शब्दों को समझने में माहिर हैं। वे एक स्पष्ट आदेश लिखते हैं: "क्रिया: उठाना (Pick)। वस्तु: पीला पासा (Yellow Dice)।"
  • नेत्र-विशेषज्ञ (विज़न मॉडल - Vision Model): वेटर आदेश को नेत्र-विशेषज्ञ को सौंप देता है। यह व्यक्ति कैमरा फीड को देखता है और कहता है, "आह, मुझे पीला पासा दिख रहा है। यह ठीक यहाँ इन विशिष्ट निर्देशांकों (coordinates) पर है।" वे स्क्रीन पर इसके चारों ओर एक छोटा घेरा बना देते हैं।
  • प्रबंधक (समन्वयक - Coordinator): यह सबसे महत्वपूर्ण व्यक्ति है। वे वेटर का आदेश और नेत्र-विशेषज्ञ का स्थान लेते हैं, सब कुछ दोबारा जांचते हैं, और फिर रुक जाते हैं। वे रोबोट को अभी हिलने नहीं देते।
  • शेफ (मोशन निष्पादक - Motion Executor): केवल प्रबंधक के "जाओ" कहने के बाद ही शेफ (रोबोटिक हाथ) वास्तव में आगे बढ़कर वस्तु को पकड़ता है।

2. "सुरक्षा द्वार" (The "Safety Gate" - सबसे महत्वपूर्ण हिस्सा)

AI रोबोट के साथ सबसे बड़ा जोखिम यह है कि वे "भ्रम" (hallucinate) का शिकार हो सकते हैं—यानी, वे आत्मविश्वास के साथ गलत चीज़ कह सकते हैं। यदि नेत्र-विशेषज्ञ एक लाल ब्लॉक को पीला पासा समझ लेता है, तो रोबट गलत चीज़ पकड़ सकता है।

इसे ठीक करने के लिए, सिस्टम में एक सेफ्टी गेट है। रोबोट के एक भी मांसपेशी हिलाने से पहले, "प्रबंधक" आपको एक वेब डैशबोर्ड पर एक तस्वीर दिखाता है। इसमें उस चीज़ को हाइलाइट किया जाता है जिसे रोबोट पकड़ने की सोच रहा है।

  • आप देखते हैं: "मैं इस स्थान पर पीले पासे को उठाने जा रहा हूँ।"
  • आप क्लिक करते हैं: "हाँ, यह सही है।"
  • रोबोट चलता है।

यदि आप देखते हैं कि यह गलत है, तो आप "नहीं" कह सकते हैं, और रोबोट रुक जाता है। यह सुनिश्चित करता है कि एक भ्रमित AI कभी भी शारीरिक दुर्घटना का कारण न बने।

3. "वितरित" सेटअप (The "Distributed" Setup)

लेखकों ने यह देखने के लिए कि क्या काम करता है, विभिन्न प्रकार के कंप्यूटरों पर इस सेटअप का परीक्षण किया।

  • भाषा वाला भाग (शब्दों को समझना) इतना हल्का है कि इसे रोबोट के पास स्थित एक छोटे, पोर्टेबल कंप्यूटर (जैसे एक हाई-टेक टैबलेट) पर चलाया जा जा सकता है।
  • विज़न वाला भाग (छवियों को देखना) भारी है और इसे छवियों को तेज़ी से प्रोसेस करने के लिए एक शक्तिशाली, बड़े कंप्यूटर की आवश्यकता होती है जिसमें एक फैंसी ग्राफिक्स कार्ड (जैसे एक गेमिंग पीसी) हो।

इन्हें अलग करके, वे "भारी काम" को बड़े कंप्यूटर पर और "सुनने" के काम को छोटे वाले पर रख सकते हैं, जिससे पूरा सिस्टम तेज़ और अधिक लचीला बन जाता है।

4. उन्होंने क्या परीक्षण किया

उन्होंने फ्रैंका (Franka) रोबोट आर्म और कुछ पासों के साथ इस सिस्टम का परीक्षण किया। उन्होंने तीन परिदृश्य आजमाए:

  1. एकल वस्तु (Single Object): मेज पर केवल एक पासा।
  2. कई वस्तुएं (Multiple Objects): चारों ओर बिखरे हुए कई पासे।
  3. एक दूसरे के ऊपर रखी वस्तुएं (Overlapped Objects): एक के ऊपर एक रखे हुए पासे (सबसे कठिन परिदृश्य)।

परिणाम:

  • जब उन्होंने कंप्यूटरों के अपने सबसे अच्छे संयोजन और AI मॉडलों का उपयोग किया, तो रोबोट ने पासे को सफलतापूर्वक उठाया, रखा और थमाया—100% बार, तब भी जब पासे एक दूसरे के ऊपर रखे हुए थे।
  • जब उन्होंने अलग-अलग, कमजोर AI मॉडलों का उपयोग किया या सब कुछ एक ही धीमे कंप्यूटर पर डाला, तो रोबोट ने गलतियाँ कीं या बहुत धीरे चला।
  • सिस्टम इतना तेज़ था कि वह प्रतिक्रियाशील महसूस होता था, जिसमें कमांड समझने, वस्तु खोजने और हिलने के लिए तैयार होने में लगभग 5 से 10 सेकंड का समय लगा।

5. यह अभी क्या नहीं कर सकता

लेखक अपनी सीमाओं के प्रति ईमानदार हैं। रोबोट सरल कमांड जैसे "लाल पासा उठाओ" या "इसे नीले वाले के बाईं ओर रखो" के लिए बहुत अच्छा है।

  • यह जटिल तर्क (complex logic) में संघर्ष करता है, जैसे "पासा तभी उठाएं यदि इसमें उस पासे की तुलना में अधिक संख्या हो जो इसके बगल में है।"
  • यह पिछली बातचीत को याद नहीं रखता। यदि आप कहते हैं "पासा उठाओ," और फिर कहते हैं "इसे फिर से करो," तो रोबोट को तब तक पता नहीं चलता कि आपका मतलब उसी पासे से है जब तक कि आप दोबारा न कहें।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र एक ऐसे रोबोट के बारे में नहीं है जो अपने आप पूरी तरह से सोच सके। यह एक सुरक्षित, पारदर्शी और लचीला सिस्टम बनाने के बारे में है जहाँ मनुष्य नियंत्रण में रहते हैं। कार्यों को अलग-अलग कंप्यूटरों के बीच विभाजित करके और रोबोट को हिलने से पहले मानव द्वारा उसके प्लान की दोबारा जांच करने के लिए मजबूर करके, उन्होंने एक ऐसा तरीका बनाया है जिससे रोबोट बिना किसी खतरनाक गलती के हमारे रोज़मर्रा की भाषा को समझ सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →