← नवीनतम पेपर
🤖 machine learning

ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models

यह शोध पत्र ROAD-VLA प्रस्तुत करता है, जो एक विज़न-लैंग्वेज-एक्शन मॉडल के लिए एक सुदृढ़ ऑनलाइन अनुकूलन ढांचा है, जो एक प्रॉक्सिमल टीचर से डेंस, एक्शन-स्पेस सुपरविजन उत्पन्न करने के लिए एक एडवांटेज-गाइडेड सेल्फ-डिस्टिलेशन तंत्र का उपयोग करके स्पार्स रिवार्ड्स और सिम्बोलिक गाइडेंस की सीमाओं को दूर करता है, जिससे यह विविध रोबोटिक मैनिपुलेशन कार्यों में PPO से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Kejing Wang, Toan Nguyen, Minh Hoang Nguyen, Simon Khan, Flora D. Salim

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kejing Wang, Toan Nguyen, Minh Hoang Nguyen, Simon Khan, Flora D. Salim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ROAD-VLA पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: रोबोट की "खाली नज़र" (The Blank Stare)

कल्पना कीजिए कि आपके पास एक अत्यधिक प्रशिक्षित रोबोट शेफ है (जिसे VLA मॉडल कहा जाता है)। इस रोबोट ने लाखों कुकबुक्स पढ़ी हैं और लोगों को खाना बनाते हुए हज़ारों वीडियो देखे हैं। वह एक साफ़ और मानक रसोई में काटने, मिलाने और परोसने का काम पूरी तरह से जानता है।

लेकिन फिर, आप उस रोबोट को एक वास्तविक दुनिया की रसोई में रख देते हैं जहाँ:

  • रोशनी अजीब है।
  • मेज का आकार अलग है।
  • रोबोट गलती से किसी चीज़ से टकरा जाता है।

रोबोट सुन्न हो जाता है। उसे समझ नहीं आता कि क्या करना है क्योंकि उसने पहले कभी ठीक ऐसी ही स्थिति नहीं देखी है।

इसे ठीक करने के लिए, हम आमतौर पर रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करते हैं। यह ऐसा है जैसे रोबोट को चीज़ें आज़माने देना, असफल होना, और केवल तभी एक छोटा सा "डिंग" (पुरस्कार/रिवॉर्ड) मिलना जब वह अंततः सफल हो जाए। समस्या क्या है? रोबोट को उस एक "डिंग" तक पहुँचने के लिए लाखों बार अंदाज़ा लगाना पड़ता है। यह एक नया भाषा सीखने जैसा है जहाँ आपको केवल तब "सही!" की आवाज़ सुनाई देती है जब आपने पूरा वाक्य पूरी तरह से बोल लिया हो। यह बहुत धीमा और निराशाजनक है।

विफल विचार: "पाठ्यपुस्तक" शिक्षक (The "Textbook" Teacher)

शोधकर्ताओं ने पहले एक चतुर विचार आज़माया: सेल्फ-डिस्टिलेशन (Self-Distillation)

  • विचार: रोबट को खुद को सिखाने दें। जब वह सीख रहा हो, तो उसे एक "विशेषाधिकार प्राप्त" संकेत दें (जैसे एक टेक्स्ट नोट: "गाजर को बाईं ओर ले जाओ") जो उसके पास वास्तविक काम के दौरान नहीं होता।
  • परिणाम: यह बुरी तरह विफल रहा।
  • क्यों? पेपर में पाया गया कि रोबोट टेक्स्ट संकेतों (text hints) को शारीरिक गतिविधियों (physical movements) में बदलने में खराब हैं। यह एक पायलट को विमान उतारने के बारे में लिखित मैनुअल देने जैसा है जबकि वह पहले से ही आसमान से गिर रहा हो। शब्दों और शारीरिक क्रिया के बीच का अंतर बहुत अधिक है। रोबोट का दिमाग (LLM) भाषा में अच्छा है, लेकिन एक बार जब इसे रोबोटिक हाथ चलाने के लिए प्रशिक्षित किया जाता है, तो यह टेक्स्ट के साथ तर्क करना भूल जाता है।

समाधान: ROAD-VLA (द "मसल मेमोरी" कोच)

लेखक ROAD-VLA का प्रस्ताव करते हैं, जो रोबोट को सिखाने का एक नया तरीका है जो टेक्स्ट को छोड़कर सीधे "मसल मेमोरी" (मांसपेशियों की स्मृति) पर ध्यान केंद्रित करता है।

यह कैसे काम करता है, एक जिम कोच की उपमा का उपयोग करते हुए:

  1. छात्र (रोबोट): रोबोट अपने हाथ को हिलाने की कोशिश करता है।
  2. स्कोरकार्ड (एडवांटेज): कार्य के अंत में "सफलता!" या "विफलता!" का इंतज़ार करने के बजाय, सिस्टम रोबोट द्वारा किए गए हर एक छोटे से मूवमेंट के लिए एक स्कोर की गणना करता है।
    • क्या उस छोटे से मूवमेंट ने मदद की? (सकारात्मक स्कोर)।
    • क्या उस छोटे से मूवमेंट ने नुकसान पहुँचाया? (नकारात्मक स्कोर)।
  3. कोच (प्रॉक्सिमल टीचर): यह जादुई हिस्सा है। सिस्टम रोबोट का एक "कोच" संस्करण बनाता है।
    • कोच रोबोट की वर्तमान योजना को देखता है।
    • यदि रोबोट ने एक अच्छा मूव किया, तो कोच कहता है, "इसे फिर से करो, लेकिन अधिक मजबूती से।"
    • यदि रोबोट ने बुरा मूव किया, तो कोच कहता है, "इसे कम करो, या कुछ और आज़माओ।"
    • महत्वपूर्ण रूप से: कोच शब्दों का उपयोग नहीं करता है। वह बस रोबोट के "मसल सिग्नल्स" (मूवमेंट के पीछे का गणित) को स्कोर के आधार पर ऊपर या नीचे धकेलता है।

यह बेहतर क्यों है?

  • स्पार्स से डेंस तक (From Sparse to Dense): सामान्य प्रशिक्षण में, रोबोट को 10 सेकंड के कार्य के अंत में एक "डिंग" मिलता है। ROAD-VLA में, रोबोट को 10 सेकंड के हर एक कदम के लिए एक "डिंग" (या "डिंग-डाउन") मिलता है। यह हर सेकंड आपके कान में कोच के फुसफुसाने जैसा है, न कि सेमेस्टर के अंत में ग्रेड मिलने का इंतज़ार करने जैसा।
  • किसी बाहरी शिक्षक की आवश्यकता नहीं: रोबोट खुद को सिखाता है। उसे रास्ता दिखाने के लिए किसी मानव विशेषज्ञ की आवश्यकता नहीं है। वह बस अपने स्वयं के "अंतर्ज्ञान" (एडवांटेज स्कोर) का उपयोग करके अपने अगले प्रयास को बेहतर बनाता है।
  • स्थिरता (Stability): सिस्टम में एक "सुरक्षा द्वार" है। यदि रोबोट का आंतरिक स्कोर और बैकअप स्कोर असहमत होते हैं, तो सिस्टम भ्रमित करने वाले सिग्नल को अनदेखा कर देता है। यह रोबोट को भ्रमित होने या जो वह पहले से जानता है उसे भूलने से रोकता है।

परिणाम

शोधकर्ताओं ने रोबोटों पर वस्तुओं को इधर-उधर ले जाने जैसे कार्यों के लिए इसका परीक्षण किया। उन्होंने रोबोटों का परीक्षण निम्नलिखित स्थितियों में किया:

  • सामान्य स्थितियाँ (In-Distribution)।
  • अजीब स्थितियाँ (Out-of-Distribution): अलग बैकग्राउंड, शोर वाले कैमरे, या रोबोट की अजीब शुरुआती स्थिति।

परिणाम:
ROAD-VLA मानक विधि (PPO) की तुलना में काफी बेहतर था।

  • इसने तेज़ी से सीखा।
  • इसने कम गलतियाँ कीं।
  • सबसे महत्वपूर्ण बात यह है कि जब वातावरण अजीब या शोर वाला हो गया, तो ROAD-VLA काम करता रहा, जबकि मानक रोबोट अक्सर हार मान लेता या विफल हो जाता।

सारांश

ROAD-VLA एक ऐसी विधि है जो रोबोट को वास्तविक समय में अपनी गलतियों से सीखने में मदद करती है। अंतिम ग्रेड या टेक्स्ट मैनुअल पढ़ने के बजाय, यह रोबोट को हर एक छोटे कदम के आधार पर एक निरंतर, स्टेप-बाय-स्टेप "धक्का" (nudge) देता है कि वह कितनी अच्छी तरह से आगे बढ़ रहा है। यह रोबोट को बहुत अधिक मजबूत बनाता है और इसे अव्यवस्थित, अप्रत्याशित वास्तविक दुनिया को संभालने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →