← नवीनतम पेपर
💻 computer science

A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models

यह शोध पत्र एक मॉडल-अज्ञेय (model-agnostic), प्रशिक्षण-मुक्त "अनुमान-निदान-परिष्करण" (infer-diagnose-refine) ढांचे का प्रस्ताव करता है जो काउंटरफैक्चुअल (counterfactual) क्रियाओं का अनुमान लगाकर, उनके कारण संबंधी प्रभावों का निदान करके और भविष्यवाणियों को परिष्कृत करके गतिशील रोबोटिक कार्यों में विविध विजन-लैंग्वेज-एक्शन (VLA) मॉडलों में प्रदर्शन सुधारने के लिए टेस्ट टाइम पर दृश्य अवलोकनों के महत्व को गतिशील रूप से समायोजित करता है।

मूल लेखक: Haoyu Zhang, Yuwei Wu, Jin Chen, Gao Zhi, Zhenxin Diao, Mingyang Gao, Kun Wu, Yongchun Liu, Fan Li

प्रकाशित 2026-07-29
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoyu Zhang, Yuwei Wu, Jin Chen, Gao Zhi, Zhenxin Diao, Mingyang Gao, Kun Wu, Yongchun Liu, Fan Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। आप उसे एक वॉयस कमांड देते हैं, "एक सैंडविच बनाओ," और वह अपने कैमरों से रसोई की ओर देखता है। लेकिन यहाँ एक पेचीदा बात है: रोबोट केवल एक सीधी रेखा में "देखते" और "चलते" नहीं हैं। कभी-कभी, उन्हें कमरे के आर-पार चलना पड़ता है (लंबी दूरी की गति), जहाँ ब्रेड पर ध्यान केंद्रित करने के बजाय फर्श या अपने जोड़ों (joints) को देखना अधिक महत्वपूर्ण होता है। अन्य समय में, उन्हें चाकू पकड़ना होता है (निकट-दूरी की अंतःक्रिया), जहाँ उनकी आँखें हैंडल पर पूरी तरह से केंद्रित होनी चाहिए।

यह विज़न-लैंग्वेज-एक्शन (VLA) मॉडल्स की दुनिया है। इन्हें "आधुनिक रोबोटों के दिमाग" के रूप में सोचें। वे तीन चीजें लेते हैं: वे क्या देखते हैं (विज़न), उनका शरीर कैसा महसूस करता है (प्रोपियोसेप्शन, या यह जानना कि उनके हाथ और जोड़ कहाँ हैं बिना देखे), और आप उन्हें क्या करने के लिए कहते हैं (भाषा)। सबसे बड़ी समस्या जिसे वैज्ञानिक हल करने की कोशिश कर रहे हैं, वह यह है कि इन तीन सामग्रियों को आपस में बिल्कुल सही तरीके से कैसे मिलाया जाए। क्या रोबोट को अपनी आँखों पर अधिक भरोसा करना चाहिए? या स्पर्श की भावना पर? जवाब बदल जाता है कि रोबोट उस सटीक सेकंड में क्या कर रहा है। यदि रोबोट इस मिश्रण को गलत करता है, तो वह सैंडविच देखते हुए दीवार से टकरा सकता है, या चाकू देखते हुए फर्श को घूरने के कारण उसे गिरा सकता है।

यह शोध पत्र एक चतुर नया तरीका पेश करता है जो इन रोबोटों को बिना दोबारा प्रशिक्षित किए या नए सबक सिखाए, काम करते समय यह समझने में मदद करता है कि मिश्रण क्या है। यह एक छोटे, सुपर-स्मार्ट सह-पायलट को देने जैसा है जो सही क्षण पर फुसफुसाता है, "हे, अभी, अपने हाथों को देखो!" या "नहीं, वस्तु को देखो!"

समस्या: रोबोट के "ब्लाइंड स्पॉट्स" (अंध बिंदु)

लेखकों ने देखा कि सबसे स्मार्ट रोबोट दिमागों में भी एक दोष होता है। एक बार जब रोबोट प्रशिक्षित हो जाता है, तो वह एक ही ढर्रे में फंस जाता है। वह कमरे में चलते समय अपने कैमरों पर बहुत अधिक निर्भर हो सकता है, या किसी छोटी वस्तु को उठाने के दौरान अपने कैमरों को पूरी तरह से अनदेखा कर सकता है। यह एक ऐसे ड्राइवर की तरह है जो कार पार्क करने की कोशिश करते समय भी रियरव्यू मिरर (पीछे देखने वाले दर्पण) को देखते रहने की आदत रखता है।

शोधकर्ताओं ने एक सरल प्रश्न पूछा: क्या हम कार के इंजन को फिर से बनाने के लिए उसे खोलने के बिना, गाड़ी चलाते समय इस रोबोट की बुरी आदतों को ठीक कर सकते हैं? अधिकांश पिछले तरीकों ने रोबोट को फिर से प्रशिक्षित करने की कोशिश की, जो धीमा और महंगा है। यह शोध पत्र एक अलग दृष्टिकोण प्रस्तावित करता है: टेस्ट-टाइम अडैप्टेशन (Test-Time Adaptation)। इसका अर्थ है कि रोबोट के व्यवहार को ठीक उसी क्षण समायोजित करना जब वह कोई कार्य करने की कोशिश कर रहा हो, उस डेटा का उपयोग करके जो उसके पास अभी उपलब्ध है।

समाधान: "इन्फर-डायग्नोस-रिफाइन" (IDR) फ्रेमवर्क

लेखकों ने IDR (इन्फर-डायग्नोस-रिफाइन) नामक एक तीन-चरणीय प्रक्रिया बनाई है। कल्पना कीजिए कि रोबोट एक परीक्षा दे रहा छात्र है।

  1. इन्फर (The "What If" Game - "क्या होगा अगर" का खेल):
    सबसे पहले, रोबोट अगला कदम उठाने के बारे में अपना सामान्य अनुमान लगाता है। लेकिन फिर, वह "क्या होगा अगर?" का खेल खेलता है। वह खुद से दो सवाल पूछता है:
  • "अगर मैं अभी कुछ भी न देख पाऊं तो क्या होगा?" (वह कल्पना करता है कि उसकी आँखें बंद हैं)।
  • "अगर मैं अपने हाथ-पैर महसूस न कर पाऊं तो क्या होगा?" (वह कल्पना करता है कि उसके शरीर के सेंसर खराब हैं)।
    रोबोट अपने दिमाग में तुरंत इन "क्या होगा अगर" परिदृश्यों को चलाता है।
  1. डायग्नोस (The Detective Work - जासूसी कार्य):
    इसके बाद, रोबोट अपने "वास्तविक" अनुमान की तुलना अपने "क्या होगा अगर" वाले अनुमानों से करता है।
  • यदि रोबोट का अनुमान बहुत अधिक बदल जाता है जब वह कल्पना करता है कि उसकी आँखें बंद हैं, तो इसका मतलब है कि विज़न अभी बहुत महत्वपूर्ण है। (शायद वह एक फिसलते हुए कुकी को पकड़ने की कोशिश कर रहा है)।
  • यदि रोबोट का अनुमान बहुत कम बदलता है जब वह कल्पना करता है कि उसकी आँखें बंद हैं, तो इसका मतलब है कि विज़न की अभी ज्यादा आवश्यकता नहीं है। (शायद वह बस एक खाली कमरे में चल रहा है)।
    यह चरण "निदान" (diagnose) करता है कि रोबोट को उस सटीक पल में अपनी आँखों पर कितना भरोसा करना चाहिए या अपने शरीर के सेंसरों पर।
  1. रिफाइन (The Gentle Nudge - हल्का सा सुधार):
    अंत में, रोबोट इस निदान का उपयोग अपने एक्शन को ठीक करने के लिए करता है। यदि रोबोट को एहसास होता है कि वह अपनी आँखों को अनदेखा कर रहा है जब उसे वास्तव में उनकी आवश्यकता है, तो सिस्टम उसे अधिक ध्यान से देखने के लिए एक हल्का सा धक्का (nudge) देता है। यदि रोबोट पहले से ही बिल्कुल सही देख रहा है, तो सिस्टम उसे अकेला छोड़ देता है। यह एक "गेटेड" तंत्र के माध्यम से होता है, जो एक स्मार्ट वाल्व की तरह है जो केवल तभी खुलता है जब सुधार की वास्तव में आवश्यकता होती है।

उन्होंने क्या पाया

टीम ने कंप्यूटर सिमुलेशन और वास्तविक दुनिया के रोबोटों दोनों में चार अलग-अलग प्रकार के रोबोट दिमागों (जिन्हें बैकबोन कहा जाता है) पर इस विचार का परीक्षण किया।

  • यह हर जगह काम करता है: IDR फ्रेमवर्क ने उनके द्वारा परीक्षण किए गए सभी रोबलेट मॉडल्स के प्रदर्शन में सुधार किया। LIBERO सिमुलेशन (एक लोकप्रिय रोबोट टास्क टेस्ट) में, सुधार स्पष्ट थे। उदाहरण के लिए, π0.5 नामक एक छोटे रोबोट मॉडल पर, सफलता दर 96.25% से बढ़कर 97.50% हो गई। VLA-Adapter नामक दूसरे मॉडल पर, यह 95.10% से बढ़कर 96.50% हो गई।
  • यह वास्तविक दुनिया को संभालता है: जब उन्होंने दो हाथों वाले वास्तविक रोबोट (एक ARX5 प्लेटफॉर्म) पर कपड़े तह करने, कोला पकड़ने और मेज व्यवस्थित करने जैसे कार्यों का परीक्षण किया, तो परिणाम और भी नाटकीय थे। वास्तविक दुनिया के कार्यों में रोबोट की सफलता दर 56.5% से बढ़कर 75.3% हो गई।
  • यह समय बचाता है: आश्चर्यजनक रूप से, भले ही रोबोट को अतिरिक्त "क्या होगा अगर" गणनाएं करनी पड़ीं, फिर भी उसने कार्य तेजी से पूरे किए। वास्तविक दुनिया के प्रयोगों में, कार्य पूरा करने का औसत समय 53.6 सेकंड से घटकर 41.5 सेकंड हो गया। ऐसा इसलिए हुआ क्योंकि रोबोट ने मूर्खतापूर्ण गलतियां और बेकार हरकतें करना बंद कर दिया।

यह क्या नहीं है (और उन्होंने इसे खारिज कर दिया)

यह शोध पत्र बहुत सावधानी से बताता है कि यह विधि क्या नहीं करती है।

  • यह हर चीज़ के लिए जादुई समाधान नहीं है: लेखकों ने पाया कि "क्या होगा अगर" का खेल केवल तभी काम करता है जब इसे सही तरीके से किया जाए। उन्होंने रोबोट की आँखों को "बंद करने" के विभिन्न तरीकों का परीक्षण किया (जैसे शोर/noise जोड़ना या औसत रंग का उपयोग करना), लेकिन जीरो-पैडिंग (छवि को पूरी तरह से काला करना) सबसे अच्छा काम कर गया। अन्य तरीके उतने प्रभावी नहीं रहे।
  • यह रोबोट के दिमाग को बदलने के बारे में नहीं है: रोबोट का मूल प्रशिक्षण (उसका "दिमाग") स्थिर रहता है। IDR सिस्टम एक एड-ऑन है जो इसके ऊपर बैठता है, जैसे कि एक स्मार्ट हेलमेट।
  • यह हमेशा विज़न के बारे में नहीं है: शोधकर्ताओं ने उन रोबोटों के लिए एक संस्करण बनाने की कोशिश की जो आमतौर पर स्पर्श (proprioception) पर निर्भर करते हैं, जो विफल रहा। स्पर्श पर ध्यान केंद्रित करने वाला मॉडल सफलता दर को 77.35% तक गिरा देता है, जबकि विज़न पर ध्यान केंद्रित करने से 96.50% प्राप्त हुआ। यह सुझाव देता है कि भले ही रोबोट स्पर्श पर निर्भर हों, गलतियों को ठीक करने के लिए "आंखें" ही मुख्य कुंजी हैं।

निष्कर्ष

लेखक सुझाव देते हैं कि यह विधि एक शक्तिशाली और लचीला उपकरण है। इसके लिए रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है, जिससे समय और धन की बचत होती है। यह केवल रोबोट को एक अलग वास्तविकता की कल्पना करने, यह देखने के लिए कि इससे उसके निर्णय में क्या बदलाव आता है, और फिर उस अंतर्दृष्टि का उपयोग बेहतर चाल चलने के लिए करने के माध्यम से काम करता है।

हालाँकि इस पद्धति के लिए रोबोट को हर एक चाल के लिए तीन गुना अधिक सोचना पड़ता है (तीन "फॉरवर्ड पासेज"), शोध पत्र दिखाता है कि अतिरिक्त सोच का फल मिलता है। रोबोट अधिक सटीक हो जाता है, कार्य तेजी से पूरे करता है, और कठिन स्थितियों—जैसे शर्ट तह करना या अव्यवस्थित मेज को व्यवस्थित करना—को पहले की तुलना में बहुत बेहतर तरीके से संभालता है। यह उन रोबोटों की ओर एक कदम है जो अपने पैरों पर खड़े होकर सोच सकते हैं, और दुनिया के आसपास बदलते परिवेश के अनुसार तुरंत अपना ध्यान केंद्रित कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →