← नवीनतम पेपर
🤖 machine learning

MARVL: Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models

यह शोध पत्र MARVL को प्रस्तुत करता है, जो एक बहु-चरणीय मार्गदर्शन ढांचा (multi-stage guidance framework) है जो स्थानिक और अर्थ संबंधी निरंतरता (spatial and semantic consistency) के लिए विजन-लैंग्वेज मॉडल्स को फाइन-ट्यून करता है ताकि स्वचालित रूप से डेंस रिवॉर्ड्स (dense rewards) उत्पन्न किए जा सकें, जो मौजूदा तरीकों की तुलना में रोबोटिक सुदृढीकरण लर्निंग (robotic reinforcement learning) कार्यों में सैंपल दक्षता और मजबूती में महत्वपूर्ण सुधार करता है।

मूल लेखक: Xunlan Zhou, Xuanlin Chen, Shaowei Zhang, ShengHua Wan, Xiaohai Hu, Lei Yuan, De-chuan Zhan

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xunlan Zhou, Xuanlin Chen, Shaowei Zhang, ShengHua Wan, Xiaohai Hu, Lei Yuan, De-chuan Zhan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक आर्म को एक जटिल कार्य करना सिखाने की कोशिश कर रहे हैं, जैसे कि बटन दबाना या दराज खोलना। रोबोटिक्स की दुनिया में, रोबोट अनुभव और त्रुटि (trial and error) के माध्यम से सीखता है, जिसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है। प्रभावी ढंग से सीखने के लिए, रोबोट को एक "शिक्षक" की आवश्यकता होती है जो उसे तत्काल फीडबैक दे सके: जब वह कुछ सही करता है तो एक "पुरस्कार" (जैसे कि डिजिटल हाई-फाइव) और जब वह कुछ गलत करता है तो एक "दंड"।

समस्या यह है कि हाथ से पुरस्कार के नियम लिखना अविश्वसनीय रूप से कठिन, समय लेने वाला और विस्तार योग्य नहीं है। यदि आप रोबोट को एक नया कार्य सिखाना चाहते हैं, तो आपको सभी नियमों को शुरू से फिर से लिखना होगा।

हाल ही में, वैज्ञानिकों ने विज़न-लैंग्वेज मॉडल्स (VLMs) का उपयोग करने का प्रयास किया—जो ऐसे AI सिस्टम हैं जो चित्रों और शब्दों दोनों को समझते हैं—इन शिक्षकों के रूप में। विचार सरल था: AI को रोबोट का वर्तमान दृश्य दिखाएं और टेक्स्ट निर्देश (जैसे, "बटन दबाएं") दिखाएं, और AI से पूछें कि निर्देश के आधार पर चित्र कितना सटीक है, इसके लिए एक स्कोर दें।

हालांकि, यह शोध पत्र तर्क देता है कि इन AI शिक्षकों का "आउट ऑफ द बॉक्स" उपयोग करना एक बहुत ही बुद्धिमान लेकिन आसानी से भ्रमित होने वाले मार्गदर्शक को काम पर रखने जैसा है। यह पेपर तीन मुख्य कारणों की पहचान करता है कि क्यों यह सहज दृष्टिकोण विफल हो जाता है:

  1. "कैमरा एंगल" की समस्या (कमजोर स्थानिक ग्राउंडिंग - Weak Spatial Grounding): AI इस बात से बहुत अधिक विचलित हो जाता है कि कैमरा कहाँ देख रहा है। यदि कैमरा थोड़ा सा भी हिल जाता है, तो AI को लगता है कि कार्य पूरी तरह से बदल गया है, भले ही रोबोट बिल्कुल वही काम कर रहा हो। यह एक ऐसे शिक्षक की तरह है जो इसलिए गुस्सा हो जाता है क्योंकि आपने अपना सिर हिलाया, न कि इसलिए कि आपने गलत उत्तर दिया।
  2. "कोई प्रगति नहीं" की समस्या (प्रगति जागरूकता का अभाव - Lack of Progress Awareness): AI का स्कोर बहुत अधिक ऊपर-नीचे होता है। रोबोट बटन के करीब पहुँच सकता है, लेकिन किसी यादृच्छिक छाया या प्रकाश में मामूली बदलाव के कारण AI का स्कोर गिर सकता है। रोबotong भ्रमित हो जाता है क्योंकि फीडबैक उसकी वास्तविक प्रगति से मेल नहीं खाता।
  3. "गलत अर्थ" की समस्या (सिमेंटिक मिसअलाइनमेंट - Semantic Misalignment): AI कभी-कभी निर्देश का अर्थ गलत समझ लेता है। उसे लग सकता है कि "बटन दबाएं" का कार्य केवल इसलिए पूरा हो गया क्योंकि रोबोट किसी भी बटन के पास है, या वह पृष्ठभूमि में अप्रासंगिक वस्तुओं से विचलित हो सकता है।

समाधान: MARVL

इसे ठीक करने के लिए, लेखकों ने MARVL (Multi-stAge guidance for Robotic manipulation via Vision-Language models) नामक एक नया फ्रेमवर्क बनाया। MARVL को एक विशेष प्रशिक्षण कार्यक्रम के रूप में समझें जो उस भ्रमित AI मार्गदर्शक को एक तेज, विश्वसनीय कोच में बदल देता है। यह तीन चरणों में ऐसा करता है:

1. "डिक्ल्टरिंग" फ़िल्टर (दृश्य-दृश्य अपघटन - Scene-View Decomposition)
कल्पना कीजिए कि आप फोन कॉल पर किसी को एक दृश्य का वर्णन करने की कोशिश कर रहे हैं, लेकिन कनेक्शन खराब है और बैकग्राउंड का शोर बार-बार बदल रहा है। MARVL AI को दृश्य (रोबोट और बटन) को व्यू (कैमरा एंगल) से अलग करना सिखाता है।

  • यह कैसे काम करता है: यह AI को कैमरे के परिप्रेक्ष्य (perspective) को अनदेखा करने और केवल रोबोट और वस्तु की भौतिक वास्तविकता पर ध्यान केंद्रित करने के लिए प्रशिक्षित करता है।
  • परिणाम: अब AI समझता है कि "बटन दबाना" वही कार्य है चाहे कैमरा बाईं ओर, दाईं ओर या ऊपर से देख रहा हो। यह एंगल से विचलित होना बंद कर देता है।

2. "चरण-दर-चरण" मानचित्र (बहु-चरणीय अपघटन और कार्य दिशा प्रक्षेपण - Multi-Stage Decomposition & Task Direction Projection)
रोबोट को "शुरुआत" से "समाप्ति" तक एक बड़ी छलांग लगाने के बजाय, MARVL कार्य को छोटे, प्रबंधनीय उप-चरणों में तोड़ देता है (जैसे, "बटन की ओर बढ़ें," फिर "नीचे दबाएं")।

  • समस्या जिसे यह हल करता है: एक अच्छे कैमरे के बावजूद, AI का स्कोर अभी भी अस्थिर हो सकता है। MARVL एक "कार्य दिशा" (Task Direction) पेश करता है। कल्पना कीजिए कि रोबлот की शुरुआती स्थिति से बटन तक फर्श पर एक सीधी रेखा खींची गई है। MARVL AI को केवल उस रेखा के अनुदिश प्रगति देखने के लिए मजबूर करता है।
  • परिणाम: यह सभी पार्श्व शोर (sideways noise) को फ़िल्टर कर देता है। यदि रोबोट बटन की ओर आगे बढ़ता है, तो स्कोर बढ़ता है। यदि वह बगल में या पीछे की ओर जाता है, तो स्कोर स्थिर रहता है या नीचे गिर जाता है। यह रोबोट के अनुसरण के लिए एक सुचारू, विश्वसनीय पथ बनाता है।

3. "आत्मविश्वास की जाँच" (कॉन्फिडेंस-थ्रेशोल्ड शेपिंग - Confidence-Thresholded Shaping)
कभी-कभी AI केवल इसलिए एक छोटा, आकस्मिक "थम्स अप" दे सकता है क्योंकि रोबोट किसी ऐसी चीज़ के पास है जो देखने में धुंधली सी बटन जैसी लगती है। इसे "फॉल्स पॉजिटिव" कहा जाता है।

  • यह कैसे काम करता है: MARVL एक सख्त आत्मविश्वास सीमा (confidence threshold) निर्धारित करता है। यह कहता है, "यदि AI शत-प्रतिशत सुनिश्चित नहीं है कि रोबोट वास्तव में प्रगति कर रहा है, तो शून्य पुरस्कार दें।"
  • परिणाम: यह रोबोट को आकस्मिक पुरस्कारों द्वारा "धोखा" दिए जाने से रोकता है। उसे केवल तभी प्रशंसा मिलती है जब वह वास्तव में सही काम कर रहा होता है, जिससे सीखने की प्रक्रिया बहुत तेज़ और स्थिर हो जाती है।

परिणाम

पेपर ने रोबोट के कार्यों के एक मानक सेट (जैसे दरवाजे खोलना, खिड़कियां धकेलना और बटन दबाना) पर MARVL का परीक्षण किया।

  • प्रदर्शन: MARVL ने पिछले तरीकों की तुलना में, जो कच्चे AI पुरस्कारों का उपयोग करते थे, इन कार्यों को बहुत तेज़ी से और अधिक विश्वसनीयता के साथ सीखा।
  • तुलना: कई मामलों में, MARVL ने एक "परफेक्ट" शिक्षक (एक ओरेकल/Oracle) के समान प्रदर्शन किया, जिसके पास रोबोट के आंतरिक कोड और सटीक निर्देशांकों (coordinates) तक पहुंच थी। यह एक बड़ी बात है क्योंकि इसका मतलब है कि रोबोट केवल अपनी आँखों और भाषा का उपयोग करके, जटिल, हाथ से लिखे गए नियमों की आवश्यकता के बिना, लगभग उतना ही अच्छा सीख सकता है।
  • मजबूती (Robustness): यहाँ तक कि जब कैमरा एंगल बदला या रोबोट का स्वरूप अलग हुआ (एक अलग आर्म मॉडल), MARVL ने अच्छी तरह से काम करना जारी रखा, जिससे यह साबित हुआ कि इसने कार्य की अवधारणा को सीखा, न कि केवल एक विशिष्ट सेटअप के दृश्य ट्रिक्स को।

संक्षेप में, MARVL एक शक्तिशाली लेकिन अव्यवस्त AI टूल को लेकर उसे एक सटीक, चरण-दर-चरण कोच में बदल देता है जो साधारण भाषा का उपयोग करके रोबोट को जटिल भौतिक कार्य सिखा सकता है, और इसके लिए मनुष्यों को हजारों लाइनों का रिवॉर्ड कोड लिखने की आवश्यकता नहीं होती।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →