← नवीनतम पेपर
💻 computer science

Inference-time Policy Steering via Vision and Touch

ViTaL एक नवीन विज़ुओ-टैक्टाइल इन्फरेंस-टाइम स्टीयरिंग फ्रेमवर्क है जो उच्च-स्तरीय विज़ुअल मोड चयन को निम्न-स्तरीय टैक्टाइल-गाइडेड एक्शन रिफाइनमेंट के साथ जोड़कर संपर्क-समृद्ध हेरफेर (कॉन्टैक्ट-रिच मैनिपुलेशन) के लिए प्री-ट्रेंड रोबोट नीतियों को उन्नत करता है, जिससे यूनिमोडल और नैव फ्यूजन बेसलाइन की तुलना में सफलता दर में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Yilin Wu, Zilin Si, Zeynep Temel, Oliver Kroemer, Andrea Bajcsy

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilin Wu, Zilin Si, Zeynep Temel, Oliver Kroemer, Andrea Bajcsy

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को नाजुक कार्य करना सिखा रहे हैं, जैसे कि एक पिपेट से किसी विशिष्ट कप में तरल डालना या बिना निशान छोड़े मेज को पोंछना। आपके पास एक ऐसा रोबोट है जो पहले से ही हिलने-डुलने में काफी अच्छा है (इसका "बेस पॉलिसी"), लेकिन यह कभी-कभी गलतियाँ करता है क्योंकि यह "महसूस" नहीं कर पाता कि यह क्या कर रहा है या यह बहुत दूर तक नहीं देख पाता।

यह शोध पत्र ViTaL (विज़ुओ-टैक्टाइल लेटेंट स्टीयरिंग) नामक एक नई प्रणाली पेश करता है ताकि इन गलतियों को बिना रोबोट को शुरू से फिर से प्रशिक्षित किए, वास्तविक समय में ठीक किया जा सके। ViTaL को एक स्मार्ट को-पायलट के रूप में समझें जो रोबोट के बगल में बैठता है, उसकी हर हरकत को देखता है, और रोबोट द्वारा क्रिया निष्पादित करने से पहले ही सुधार की सलाह देता है।

ViTaL कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: आँखें बनाम हाथ

लेखकों ने पाया कि जटिल कार्यों के लिए केवल एक इंद्रिय पर निर्भर रहना पर्याप्त नहीं है:

  • दृष्टि (आँखें) "बड़ी तस्वीर" के लिए अच्छी हैं: यह रोबोट को बता सकती है, "आप लाल कप के बजाय नीले कप की ओर बढ़ रहे हैं।" लेकिन आँखें यह नहीं बता सकतीं कि रोबोट ड्रॉपर को कितनी जोर से दबा रहा है या उसकी पकड़ ढीली हो रही है।
  • स्पर्श (हाथ) "विवरण" के लिए अच्छे हैं: यह महसूस कर सकता है कि रोबोट कितना दबाव डाल रहा है। लेकिन स्पर्श अकेले यह नहीं जानता कि रोबोट किस कप की ओर लक्षित है; वह बस इतना जानता है कि "मैं कुछ पकड़े हुए हूँ।"

यदि आप केवल आँखों का उपयोग करते हैं, तो रोबोट सही कप की ओर लक्ष्य तो रख सकता है लेकिन ड्रॉपर को कुचल सकता है। यदि आप केवल स्पर्श का उपयोग करते हैं, तो रोबोट ड्रॉपर को बिल्कुल सही तरीके से पकड़ सकता है लेकिन तरल को गलत कप में डाल सकता है।

2. समाधान: एक दो-चरणीय "को-पायलट" प्रणाली

ViTaL इस काम को दो स्तरों में विभाजित करके हल करता है, जैसे कि एक जनरल और एक विशेषज्ञ:

  • स्तर 1: जनरल (दृष्टि)
    सिस्टम पहले भविष्य में बहुत दूर तक देखता है (जैसे लंबी सड़क की ओर देखना)। यह पूछता है: "यदि रोबोट ऐसा करता है, तो क्या वह सही गंतव्य पर पहुँचेगा?" यह जो कुछ भी देखता है उसके आधार पर सबसे अच्छी समग्र योजना चुनता है। इसे विजुअल मोड सिलेक्शन कहा जाता है।

    • उपमा: कल्पना कीजिए कि एक GPS आपको बता रहा है, "शहर पहुँचने के लिए हाईवे लें।" उसे अभी गड्ढों की चिंता नहीं है; उसे बस गंतव्य की चिंता है।
  • स्तर 2: विशेषज्ञ (स्पर्श)
    एक बार जब "जनरल" हाईवे चुन लेता है, तो "विशेषist" तुरंत अगले कुछ कदमों पर ध्यान केंद्रित करता है। वह पूछता है: "क्या रोबोट स्टीयरिंग व्हील को बहुत कसकर पकड़ रहा है? क्या वह किसी झटके से टकराने वाला है?" यह सुनिश्चित करने के लिए रोबोट की गतिविधियों को सूक्ष्म रूप से बदलता है कि संपर्क कैसा महसूस हो रहा है। इसे टैक्टाइल रिफाइनमेंट कहा जाता है।

    • उपमा: अब कल्पना कीजिए कि आपके बगल में एक ड्राइविंग इंस्ट्रक्टर बैठा है, जो कह रहा है, "एक्सीलेटर को थोड़ा कम करें, आप इस मोड़ के लिए बहुत तेज़ जा रहे हैं।" वे आपका गंतव्य नहीं बदलते; वे बस वहां सुरक्षित रूप से पहुँचने के लिए आपको बेहतर तरीके से चलाने में मदद करते हैं।

3. गुप्त सूत्र: "इमेजिनेशन इंजन"

बिना रोबोट को वास्तव में टकराए या नुकसान पहुँचाए, ViTaL एक लेटेंट वर्ल्ड मॉडल का उपयोग करता है। इसे रोबोट की कल्पना के रूप में समझें।

  • रोबोट के हिलने से पहले, वह "कल्पना" करता है कि आगे क्या होगा।
  • यह भविष्य की एक मानसिक फिल्म बनाता है, जिसमें कैमरा क्या देखेगा (कप) और सेंसर क्या महसूस करेंगे (दबाव) दोनों शामिल होते हैं।
  • फिर यह मानसिक फिल्म की निर्देशों के साथ जाँच करता है। यदि फिल्म दिखाती है कि रोबोट तरल गिरा रहा है, तो यह उस योजना को खारिज कर देता है और एक अलग योजना आज़माता है।

4. "टेक्स्ट-टू-फीलिंग" ट्रांसलेटर

एक नए तरीके से निर्देश देने के बारे में एक अनूठी दावा है। रोबोट को यह बताने के लिए जटिल गणितीय कोड लिखने के बजाय कि "5 न्यूटन का बल लगाएँ," यह प्रणाली साधारण अंग्रेजी को समझती है।

  • आप रोबोट को कह सकते हैं: "हल्के से पकड़ें" या "ज़ोर से पकड़ें।"
  • सिस्टम इन शब्दों को सीधे रोबोट की "महसूस करने वाली" भाषा में अनुवादित करता है। यह जाँचता है कि क्या रोबोट की कल्पित पकड़ "हल्के" या "भारी" के अहसास से मेल खाती है। यह पहली बार है जब लेखकों ने रोबोटिक स्पर्श के लिए ऐसा करने का दावा किया है।

5. परिणाम: क्या यह काम करता है?

टीम ने वास्तविक दुनिया के तीन कार्यों पर ViTaL का परीक्षण किया:

  1. पिपेटिंग: कपों के बीच तरल स्थानांतरित करना।
  2. पोंछना (Wiping): सतह को साफ करना।
  3. इंसर्शन (Insertion): एक पेग को छेद में डालना।

निष्कर्ष थे:

  • बेहतर सफलता: ViTaL ने रोबोट की मूल "बेस" पॉलिसी की तुलना में सफलता दर में 51% का सुधार किया।
  • एकल इंद्रियों से बेहतर: इसने केवल आँखों या केवल स्पर्श का उपयोग करने वाले सिस्टम को कम से कम 33% से पीछे छोड़ा।
  • केवल मिलाने से बेहतर: इसने एक "नाइव" (naive) सिस्टम को भी पीछे छोड़ा जिसने केवल आँखों और स्पर्श को एक साथ मिलाने की कोशिश की थी, और इसे कम से कम 20% से बेहतर प्रदर्शन किया।

सारांश

संक्षेप में, ViTaL एक स्मार्ट प्रणाली है जो रोबोट को सही लक्ष्य चुनने के लिए आगे देखने और कार्य को कोमलता से करने के लिए वर्तमान को महसूस करने की अनुमति देती है। यह एक आदर्श टीम की तरह कार्य करता है: एक साथी रास्ता तय करता है, और दूसरा साथी कार को सुचारू रूप से चलाता है, यह सुनिश्चित करता है कि रोबोट न केवल ऐसा दिखे कि वह सही काम कर रहा है, बल्कि वास्तव में वह इसे सही ढंग से महसूस भी करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →