← नवीनतम पेपर
💻 computer science

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

DeicticVLA भाषा, विजन-लैंग्वेज और विजुअल इंस्ट्रक्शन मोड को टेक्स्ट प्रॉम्प्ट्स और डिक्टिक मास्क में कैनोनिकलाइज़ करके एक एकल विजन-लैंग्वेज-एक्शन मॉडल में एकीकृत करता है, जो केवल भाषा-आधारित बेसलाइन्स की तुलना में अनदेखी वस्तुओं और अभिव्यक्तियों के प्रति बेहतर सामान्यीकरण प्रदर्शित करता है।

मूल लेखक: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

प्रकाशित 2026-08-31
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोटिक हाथ रसोई में बैठा है, मदद के लिए तैयार। उसे यह बताने के लिए कि क्या करना है, एक इंसान कह सकता है, "बाईं ओर वाला लाल कप उठाओ।" यह सरल लगता है, लेकिन एक मशीन के लिए, दुनिया में कई लाल कप हो सकते हैं, या ऐसे कप जो लगभग एक जैसे दिखते हों। यदि इंसान अधिक विशिष्ट होने की कोशिश करता है, जैसे, "बाईं ओर से तीसरा लाल कप उठाओ, वह जो नीले नैपकिन के बगल में है," तो रोबोट अभी भी भ्रमित हो सकता है। आधुनिक रोबोट भाषा समझने में बेहतर हो रहे हैं, लेकिन वे अक्सर तब संघर्ष करते हैं जब निर्देश बहुत विस्तृत होते हैं या जब उनके सामने मौजूद वस्तुएं प्रशिक्षण के दौरान सीखी गई सटीक तस्वीरों से मेल नहीं खातीं। वे किसी गलत वस्तु को उठा सकते हैं क्योंकि वह देखने में थोड़ी अधिक परिचित लगती है, और इस प्रक्रिया में वे इंसान द्वारा बोले गए विशिष्ट शब्दों को अनदेखा कर देते हैं।

इसे हल करने के लिए, शोधकर्ता मशीनों से बात करने का एक अलग तरीका तलाश रहे हैं: इशारा करने का संकेत (pointing gesture)। ठीक वैसे ही जैसे एक इंसान कह सकता है, "इसे उठाओ," जबकि वह किसी वस्तु की ओर उंगली से इशारा करता है, एक रोबोट को स्क्रीन पर एक क्लिक को सीधे कमांड के रूप में समझने के लिए सिखाया जा सकता है। यह दृष्टिकोण, जिसे 'डेक्टिक जेस्चर' (deictic gesture) कहा जाता है, भाषा के भ्रम को दूर कर देता है क्योंकि यह रोबोट को दिखाता है कि वास्तव में क्या अर्थ है। हालाँकि, अब तक, रोबोट आमतौर पर केवल शब्दों को सुनने के लिए प्रशिक्षित किए जाते थे, या शब्दों को सुनते हुए इशारा करने के लिए, लेकिन शायद ही कभी इन सभी तरीकों को एक साथ संभालने के लिए। एक नया अध्ययन इन तरीकों को एकीकृत करता है, जिससे एक एकल रोबोट मस्तिष्क वाक्य सुनने, वाक्य सुनते हुए इशारा किए जाने को सुनने, या बिना किसी शब्द के केवल इशारे का पालन करने के बीच सहजता से स्विच कर सकता है।

शोधकर्ताओं ने, जो 'विज़न-लैंग्वेज-एक्शन' (Vision-Language-Action) मॉडल नामक एक प्रकार के कृत्रिम बुद्धिमत्ता के साथ काम कर रहे थे, एक प्रणाली विकसित की जिसे वे 'डेक्टिकवीएलए' (DeicticVLA) कहते हैं। ये मॉडल रोबोट के मस्तिष्क की तरह हैं जिन्होंने लाखों किताबें पढ़ी हैं और लाखों चित्र देखे हैं, जिससे यह सीखने में मदद मिलती है कि जो वे देखते हैं उसे अपने कार्यों से कैसे जोड़ना है। चुनौती इस मस्तिष्क को इतना लचीला बनाने की थी कि वह तीन अलग-अलग प्रकार के इनपुट स्वीकार कर सके: एक टेक्स्ट कमांड, एक टेक्स्ट कमांड जिसमें इशारा भी शामिल हो, या केवल एक इशारा। पहले मोड में, उपयोगकर्ता एक पूरा वाक्य टाइप करता है। दूसरे में, उपयोगकर्ता एक वाक्य टाइप करता है जिसमें "यह" (this) या "वहाँ" (there) जैसे शब्द शामिल होते हैं और उस शब्द को परिभाषित करने के लिए स्क्रीन पर क्लिक करता है। तीसरे में, उपयोगकर्ता उस वस्तु पर क्लिक करता है जिसे हिलाना है और उस स्थान पर क्लिक करता है जहाँ उसे ले जाना है, बिना कुछ कहे।

इसे काम करने के योग्य बनाने के लिए, टीम ने एक अनुवाद चरण बनाया जो इन तीनों अलग-अलग इनपुट्स को एक ही आंतरिक प्रारूप में बदल देता है। जब कोई उपयोगकर्ता स्क्रीन पर क्लिक करता है, तो सिस्टम एक शक्तिशाली इमेज-एनालिसिस टूल का उपयोग करके उस एकल क्लिक को एक सटीक रूपरेखा (outline) में बदल देता है, एक 'मास्क' (mask) जो ठीक उस हिस्से को उजागर करता है जिसे इंसान छू रहा है। इस मास्क को फिर एक टेक्स्ट प्रॉम्प्ट के साथ जोड़ा जाता है। यदि उपयोगकर्ता ने बोला था, तो टेक्स्ट प्रॉम्प्ट उनके शब्द होते हैं। यदि उन्होंने केवल क्लिक किया, तो सिस्टम एक डिफ़ॉल्ट वाक्यांश जैसे "विजुअल निर्देश का पालन करें" का उपयोग करता है। इस प्रकार, रोबोट का मस्तिष्क हमेशा एक सुसंगत पैकेज प्राप्त करता है: एक टेक्स्ट निर्देश और लक्ष्य का एक विजुअल हाइलाइट। शोधकर्ताओं ने इस विजुअल हाइलाइट को रोबोट के मस्तिष्क में फीड करने के विभिन्न तरीकों का परीक्षण किया। उन्होंने कैमरा इमेज पर वस्तु के चारों ओर एक बॉक्स बनाने, बाकी दृश्य को धुंधला करने ताकि वस्तु उभर कर आए, या रूपरेखा को एक अलग परत के रूप में फीड करने का प्रयास किया जिसे रोबोट इमेज के साथ प्रोसेस करता है।

टीम ने पहले इन विचारों का परीक्षण एक सिम्युलेटेड वातावरण में किया, जो एक डिजिटल दुनिया है जहाँ रोबोट बिना कुछ तोड़े हजारों बार अभ्यास कर सकते हैं। उन्होंने पाया कि सिस्टम एक साथ तीनों निर्देश मोड को सफलतापूर्वक संभालने के लिए सीख सकता है। जब रोबोट को उन कार्यों को करने के लिए कहा गया जो उसने पहले कभी नहीं देखे थे, जैसे कि फर्नीचर की नई व्यवस्था में किसी वस्तु को उठाना या किसी नए स्थानिक विवरण (spatial description) द्वारा किसी वस्तु की पहचान करना, तो इशारा करने वाले तरीके केवल शब्दों के मुकाबले काफी बेहतर रहे। काले कटोरे वाले एक परीक्षण में, जहाँ रोबोट को एक विशिष्ट संदर्भ वस्तु के बगल वाला कटोरा चुनना था, भाषा-आधारित दृष्टिकोण ज्यादातर समय विफल रहा। हालाँकि, जब उपयोगकर्ता ने सही कटोरे की ओर इशारा किया, तो रोबोट लगभग हर बार सफल रहा। अध्ययन ने दिखाया कि दो-चरणीय प्रशिक्षण पद्धति महत्वपूर्ण थी: रोबोट ने पहले टेक्स्ट कमांड का पालन करना सीखा, और फिर उसने उन कमांड्स को इशारा करने के संकेतों के साथ जोड़ना सीखा। इस क्रम ने रोबोट को भाषा समझने की अपनी क्षमता बनाए रखते हुए इशारा करने का नया कौशल हासिल करने में मदद की।

यह देखने के लिए कि क्या यह वास्तविक दुनिया में काम करता है, शोधकर्ताओं ने एक रोबोटिक आर्म, एक कैमरा और एक टैबलेट के साथ एक भौतिक सेटअप बनाया। उन्होंने रोबोट को ब्लॉक उठाने, कटोरे में रखने और खिलौनों को व्यवस्थित करने के लिए सिखाया। उन्होंने रोबोट को उन निर्देशों के साथ परीक्षण किया जो उसने पहले कभी नहीं सुने थे, जैसे कि केवल "दाएं छोर वाले" (rightmost) निर्देशों पर प्रशिक्षित होने के बावजूद "सबसे बाएं" (leftmost) ब्लॉक को उठाने के लिए कहना, या किसी ऐसे विशिष्ट प्रकार के खिलмौने को हिलाने के लिए कहना जिसे उसने पहले कभी नहीं देखा था। इन कठिन परिदृश्यों में, केवल भाषा पर निर्भर रहने वाला रोबोट संघर्ष करता रहा, अक्सर गलत अनुमान लगाता या असफल रहता। लेकिन जब उपयोगकर्ता ने लक्ष्य की ओर इशारा किया, तो रोबोट की सफलता दर बहुत बढ़ गई। स्टफ्ड टॉयज (stuffed toys) की पूरी तरह से नई श्रेणियों वाले एक परीक्षण में, भाषा-आधारित रोबोट केवल छठा हिस्सा ही सफल हुआ। हालाँकि, इशारा करने वाले तरीकों ने शत-प्रतिशत सफलता दर हासिल की। रोबोट को खिलौने का नाम या उसकी श्रेणी जानने की आवश्यकता नहीं थी; उसे बस यह देखने की आवश्यकता थी कि इंसान कहाँ इशारा कर रहा है।

परिणाम बताते हैं कि मानव-रोबोट संवाद का भविष्य यह नहीं है कि बात करने और इशारा करने में से किसी एक को चुना जाए, बल्कि यह है कि दोनों एक ही समय में उपलब्ध हों। यह प्रणाली उपयोगकर्ता को एक वाक्य से शुरू करने की अनुमति देती है, और यदि रोबोट भ्रमित होता है, तो स्पष्ट करने के लिए बस इशारा करने की सुविधा देती है। या, किसी त्वरित, नियमित कार्य के लिए, उपयोगकर्ता बिना कुछ कहे बस इशारा कर सकता है। शोध इंगित करता है कि जबकि जटिल विचारों का वर्णन करने के लिए भाषा शक्तिशाली है, इशारा करना एक अस्त-व्यस्त और बदलती दुनिया में विशिष्ट वस्तुओं की पहचान करने का अधिक विश्वसनीय तरीका है। इन तरीकों को एक एकल प्रणाली में एकीकृत करके, शोधकर्ताओं ने मशीनों को निर्देशित करने के लिए मनुष्यों के लिए एक अधिक लचीला और मजबूत तरीका बनाया है, यह सुनिश्चित करते हुए कि रोबोट न केवल वह समझे जो हम कहते हैं, बल्कि वह भी जो हमारा अर्थ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →