← नवीनतम पेपर
💻 computer science

FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation

FAVLA एक फोर्स-एडेप्टिव विजन-लैंग्वेज-एक्शन मॉडल है जो यूनिफाइड-फ्रीक्वेंसी फ्यूजन की सीमाओं को दूर करने और कॉन्टैक्ट-रिच रोबोटिक मैनिपुलेशन में रिएक्टिविटी और सफलता दर को महत्वपूर्ण रूप से सुधारने के लिए स्लो परसेप्शन प्लानिंग को फास्ट, वेरिएबल-फ्रीक्वेंसी कॉन्टैक्ट-अवेयर कंट्रोल से अलग करता है।

मूल लेखक: Yao Li, Peiyuan Tang, Wuyang Zhang, Chengyang Zhu, Yifan Duan, Weikai Shi, Xiaodong Zhang, Zijiang Yang, Jianmin Ji, Yanyong Zhang

प्रकाशित 2026-03-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yao Li, Peiyuan Tang, Wuyang Zhang, Chengyang Zhu, Yifan Duan, Weikai Shi, Xiaodong Zhang, Zijiang Yang, Jianmin Ji, Yanyong Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक नाजुक कार्य करना सिखाने की कोशिश कर रहे हैं, जैसे कि कंप्यूटर में USB ड्राइव लगाना या एक बहुत छोटे गियर को अपनी जगह पर पेंच (screw) से कसना। ये कार्य "कॉन्टैक्ट-रिच" (contact-rich) होते हैं, जिसका अर्थ है कि रोबोट को वास्तव में चीजों को छूना होगा, प्रतिरोध को महसूस करना होगा, और अगर कुछ अटक जाए तो तुरंत खुद को ढालना होगा।

यह पेपर एक नया रोबोटिक मस्तिष्क पेश करता है जिसे FAVLA कहा जाता है। यह समझने के लिए कि यह क्यों विशेष है, आइए देखते हैं कि पहले रोबोट कैसे सोचते थे बनाम FAVLA कैसे सोचता है।

पुराना तरीका: "स्लो-मोशन" रोबोट

एक ऐसे रोबोट की कल्पना करें जो एक फोटो लेता है, उसके बारे में सोचता है, और फिर हिलता है। लेकिन पेच यह है कि वह उसी धीमी गति से सोचता और चलता है।

  • समस्या: कैमरे स्लो-मोशन कैमरों की तरह होते हैं (एक सेकंड में 15 तस्वीरें लेना), लेकिन फोर्स सेंसर (जो दबाव महसूस करते हैं) हाई-स्पीड कैमरों की तरह होते हैं (एक सेकंड में 1,000 रीडिंग लेना)।
  • परिणाम: इन दोनों को एक साथ काम करने के लिए, पुराने रोबोटों को फोर्स सेंसरों की गति को कैमरे की गति के बराबर धीमा करना पड़ता था। यह एक तेज़ ड्रम सोलो सुनने की कोशिश करने जैसा है जहाँ आप केवल हर तीसरी बीट ही सुन पाते हैं। जब तक रोबोट को पता चलता है कि वह बहुत अधिक दबाव डाल रहा है और गियर को तोड़ सकता है, तब तक बहुत देर हो चुकी होती है। यह "ओपन-लूप" (open-loop) है, जिसका अर्थ है कि वह वास्तविक समय के फीडबैक के बिना केवल अनुमान लगाकर काम कर रहा है।

FAVLA समाधान: "मस्तिष्क और रिफ्लेक्स" की टीम

FAVLA इसे दो अलग-अलग गति से काम करने वाले हिस्सों में विभाजित करके हल करता है, ठीक वैसे ही जैसे इंसान करते हैं।

1. धीमा मस्तिष्क (VLM)

इसे एक रणनीतिकार (Strategist) के रूप में समझें।

  • यह क्या करता है: यह बड़ी तस्वीर देखता है। यह निर्देशों को पढ़ता है ("USB लगाओ"), दृश्य को देखता है, और सामान्य रास्ता तय करता है।
  • गति: यह धीरे और सोच-समझकर काम करता है। इसे हर छोटी कंपन पर प्रतिक्रिया देने की आवश्यकता नहीं है; इसे बस लक्ष्य का पता होना चाहिए।
  • सुपरपावर: यह भविष्य की भविष्यवाणी कर सकता है। यह वर्तमान स्थिति को देखता है और अनुमान लगाता है, "हे, एक पल में, हम एक कठोर सतह से टकराने वाले हैं। तैयार हो जाओ!"

2. तेज़ रिफ्लेक्स (एक्शन एक्सपर्ट)

इसे रिफ्लेक्स (Reflex) के रूप में समझें।

  • यह क्या करता है: यह वास्तविक मूवमेंट और "महसूस करने" को संभालता है। यह शरीर का वह हिस्सा है जो आपके हाथ को पीछे खींच लेता है यदि आप किसी गर्म चीज़ को छू लेते हैं।
  • गति: यह अविश्वसनीय रूप से तेज़ काम करता है, हजारों बार प्रति सेकंड फोर्स सेंसरों पर प्रतिक्रिया देता है।
  • सुपरपावर: यह केवल आदेशों का इंतज़ार नहीं करता। यह योजना के लिए "रणनीतिकार" की बात सुनता है, लेकिन फिर यह अपने उच्च-गति वाले "कानों" (फोर्स सेंसर) का उपयोग करके तुरंत सूक्ष्म समायोजन (micro-adjustments) करता है।

असली मंत्र: "फोर्स अडैप्टर" और "स्मार्ट शेड्यूलिंग"

FAVLA के पास दो चतुर तरीके हैं जो इस टीम को पूरी तरह से काम करने में मदद करते हैं:

  • फोर्स अडैप्टर (सीधी रेखा): पुराने रोबोटों में, फोर्स डेटा केवल रोबोट के "विचारों" में जोड़ा गया एक टेक्स्ट मात्र था। FAVLA में, फोर्स डेटा सीधे रिफ्लेक्स की मांसपेशियों में इंजेक्ट किया जाता है। यह रिफ्लेक्स को नसों तक एक सीधी फोन लाइन देने जैसा है, जो मस्तिष्क की धीमी प्रोसेसिंग को बायपास करता है। यह रोबोट को आपदा बनने से पहले गलती सुधारने की अनुमति देता है।
  • स्मार्ट शेड्यूलर (ट्रैफिक पुलिस): यह सबसे रचनात्मक हिस्सा है। "रणनीतिकार" भविष्यवाणी करता है कि रोबोट कब किसी चीज़ से टकराने वाला है।
    • हवा में उड़ते समय? रिफ्लेक्स आराम करता है और धीरे चलता है (ऊर्जा बचाता है)।
    • गियर को छूने ही वाला है? रणनीतिकार चिल्लाता है, "संपर्क निकट है!" और रिफ्लेक्स तुरंत अपनी अधिकतम संवेदनशीलता पर पहुँच जाता है।
    • यह क्यों मायने रखता है: यह एक ऐसे ड्राइवर की तरह है जो खाली हाईवे पर 60 मील प्रति घंटे की रफ्तार से चलता है लेकिन भीड़भाड़ वाले पार्किंग स्थल में प्रवेश करते ही तुरंत 10 मील प्रति घंटे की गति और अत्यधिक ध्यान (hyper-focus) पर स्विच कर जाता है। रोबोट केवल तभी "फास्ट मोड" में जाता है जब उसे वास्तव में इसकी आवश्यकता होती है।

वास्तविक दुनिया का परिणाम

शोधकर्ताओं ने वास्तविक रोबोटों पर जटिल कार्य जैसे गियर असेंबल करना और बोर्ड पोंछना जैसे परीक्षण किए।

  • सफलता दर: नए रोबोट ने 80.8% बार सफलता प्राप्त की, जबकि सबसे अच्छे पिछले रोबोट केवल लगभग 67% ही सफल हो पाए।
  • सुरक्षा: नया रोबोट बहुत कोमल था। इसने कम बल लगाया, जिसका अर्थ है कि इसके उन नाजुक हिस्सों को कुचलने की संभावना कम थी जिन्हें यह असेंबल करने की कोशिश कर रहा था।

संक्षेप में

FAVLA एक रोबोट को मानव जैसा तंत्रिका तंत्र (nervous system) देने जैसा है। इसमें योजना बनाने के लिए एक धीमा, विचारशील मस्तिष्क है और महसूस करने और समायोजन करने के लिए एक तेज़, प्रतिक्रियाशील शरीर है। केवल आवश्यकता होने पर ही अपने "रिफ्लेक्स" को उच्च गति पर चलाकर, रोबोट उन नाजुक, स्पर्श-प्रधान कार्यों को सटीकता और सुरक्षा के उस स्तर के साथ संभाल सकता है जिसे पिछले रोबोट हासिल नहीं कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →