← नवीनतम पेपर
🤖 AI

FurnitureVLA: Learning Long-Horizon Bimanual Furniture Assembly with Vision-Language-Action Model

यह शोधपत्र FurnitureVLA प्रस्तुत करता है, जो एक विजन-लैंग्वेज-एक्शन मॉडल है जो वास्तविक-पैमाने के, दीर्घ-अवधि वाले द्विपक्षीय फर्नीचर असेंबली को सक्षम बनाता है, जो सिमुलेशन और वास्तविक दुनिया के सत्यापन दोनों में बेसलाइन की तुलना में सफलता दर में महत्वपूर्ण सुधार प्राप्त करने के लिए एक प्रोग्रेस-एन्हांस्ड आर्किटेक्चर और उच्च-गुणवत्ता वाले टेलीऑपरेटेड प्रदर्शनों का लाभ उठाता है।

मूल लेखक: Chenyang Ma, Yue Yang, Radu Corcodel, Siddarth Jain, Andrew Wu, Chiori Hori, Diego Romeres

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenyang Ma, Yue Yang, Radu Corcodel, Siddarth Jain, Andrew Wu, Chiori Hori, Diego Romeres

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप फर्नीचर का एक जटिल हिस्सा बनाने की कोशिश कर रहे हैं, जैसे कि एक IKEA कुर्सी, लेकिन अपने हाथों के बजाय, आप दो विशाल रोबोटिक भुजाओं (arms) को नियंत्रित कर रहे हैं। अब, कल्पना कीजिए कि आप यह बिना किसी मैनुअल के कर रहे हैं, बस एक वीडियो देखकर और अगले कदम का अनुमान लगाने की कोशिश करके। यही वह चुनौती है जिसे यह शोध पत्र (paper) हल करता है।

शोधकर्ताओं ने FurnitureVLA नामक एक नया सिस्टम बनाया है ताकि रोबट को दो भुजाओं का एक साथ उपयोग करके वास्तविक आकार के फर्नीचर को असेंबल करना सिखाया जा सके। उन्होंने इसे कैसे किया, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: रोबोट की "लॉन्ग मेमोरी" (Long Memory) की समस्या

अधिकांश रोबोट छोटे कार्यों में अच्छे होते हैं, जैसे कप उठाना और उसे रखना। लेकिन फर्नीचर बनाना एक "लॉन्ग-होराइजन" (long-horizon) कार्य है। यह एक ही सांस में पूरा उपन्यास लिखने की कोशिश करने जैसा है। यदि रोबोट कदम 1 में एक छोटी सी गलती करता है (जैसे कि पैर को थोड़ा टेढ़ा रखना), तो वह त्रुटि कदम 10 तक बढ़ती जाएगी, जिससे पूरी संरचना ढह सकती है।

पिछले प्रयास केवल खिलौने के आकार के फर्नीचर या केवल एक रोबोटिक हाथ पर काम करते थे। यह शोध पत्र पहली बार वास्तविक आकार के फर्नीचर और दो भुजाओं के मिलकर काम करने की कोशिश करता है।

2. समाधान: मूवी को दृश्यों (Scenes) में तोड़ना

रोबोट को भ्रमित होने से रोकने के लिए, शोधकर्ताओं ने इसे एक बार में पूरा फर्नीचर बनाना नहीं सिखाया। इसके बजाय, उन्होंने काम को छोटे, प्रबंधनीय "दृश्यों" या उप-कार्यों (subtasks) में विभाजित किया, जैसे कि एक मूवी स्क्रिप्ट।

  • दृश्य 1: बायां पैर उठाएं।
  • दृश्य 2: बायां पैर डालें।
  • दृश्य 3: पीछे हटें।

उन्होंने डेटा एकत्र करने के लिए एक VR टेलीऑपरेशन सिस्टम का उपयोग किया। इसे ऐसे समझें जैसे कोई इंसान हेडसेट पहनकर वीडियो गेम खेल रहा हो और अपने हाथों से दो रोबोटिक भुजाओं को नियंत्रित कर रहा हो। इसने उन्हें उच्च-गुणवत्ता वाले "डेमोंस्ट्रेशन" (demonstrations) एकत्र करने की अनुमति दी कि एक मानव विशेषज्ञ फर्नीचर कैसे बनाता है।

3. गुप्त मंत्र (Secret Sauce): "प्रोग्रेस मीटर" (Progress Meter)

सबसे बड़ा नवाचार कुछ है जिसे वे Progress-Enhanced VLA कहते हैं।

कल्पना कीजिए कि आप एक लंबी यात्रा पर कार चला रहे हैं। यदि आप कार को सिर्फ यह बताते हैं कि "न्यूयॉर्क जाओ," तो वह 50 मील के बाद रास्ता भटक सकती है। लेकिन यदि आप उसे कहते हैं, "अगले गैस स्टेशन तक जाओ," फिर "अगले शहर तक जाओ," तो वह ट्रैक पर रहती है।

शोधकर्ताओं ने रोबोट को एक निरंतर प्रोग्रेस मीटर (एक संकेत जो प्रत्येक चरण के लिए 0% से 100% तक जाता है) दिया।

  • जैसे-जैसे रोबोट काम करता है, वह लगातार अपनी प्रगति की जांच करता रहता है।
  • जब मीटर 100% पर पहुँचता है, तो रोबोट को स्वचालित रूप से पता चल जाता है, "ठीक है, मैं इस चरण को पूरा कर चुका हूँ। अब मैं अगले निर्देश पर स्विच करता हूँ।"
  • यह रोबोट को इस बारे में उलझने या भ्रमित होने से रोकता है कि वह वर्तमान में असेंबली के किस भाग पर काम कर रहा है।

4. प्रशिक्षण का मैदान: एक डिजिटल सैंडबॉक्स

असली धातु की भुजाओं पर परीक्षण करने से पहले, उन्होंने एक विशाल सिमुलेशन पाइपलाइन बनाई।

  • उन्होंने एक डिजिटल दुनिया बनाई जहाँ वे कंप्यूटर एल्गोरिदम का उपयोग करके हजारों आदर्श "एक्सपर्ट" बिल्ड बना सकते थे।
  • उन्होंने तीन अलग-अलग फर्नीचर के टुकड़ों का परीक्षण किया: एक छोटा साइड टेबल (आसान), एक शेल्फ (मध्यम), और एक जटिल कुर्सी (कठिन)।
  • कुर्सी का कार्य सबसे कठिन था, जिसमें पूरा करने के लिए 1,550 व्यक्तिगत नियंत्रण चरण (जैसे 1,550 सूक्ष्म गतिविधियाँ) की आवश्यकता थी।

5. परिणाम: विफलता से सफलता तक

  • उनके नए तरीके के बिना: रोबोट जटिल कुर्सी पर लगभग 100% बार विफल रहा। यह एक छात्र की तरह था जो बुनियादी गणित जाने बिना कैलकुलस की समस्या हल करने की कोशिश कर रहा हो।
  • FurnitureVLA के साथ: उन्होंने सिमुलेशन में सफलता दर को 48% से बढ़ाकर 80% कर दिया।
  • वास्तविक दुनिया का परीक्षण: उन्होंने लैब में एक असली रोबोट पर इसका परीक्षण किया। वास्तविक दुनिया की अव्यवस्था (प्रकाश, घर्षण, मामूली त्रुटियों) के बावजूद, प्रदर्शन में सिमुलेशन की तुलना में केवल लगभग 16% की गिरावट आई। इसने अधिकांश समय सफलतापूर्वक जटिल कुर्सी को असेंबल किया।

6. यह कैसे काम कर पाया? (फाइन-ट्यूनिंग)

शोधकर्ताओं ने विभिन्न "नॉब्स" (knobs) का भी परीक्षण किया ताकि यह देखा जा सके कि रोबोट को अधिक सटीक क्या बनाता है:

  • अधिक कैमरे: पीछे एक कैमरा जोड़ने से रोबोट को उन हिस्सों को देखने में मदद मिली जो सामने से छिपे हुए थे।
  • मोशन को स्मूथ करना: उन्होंने पाया कि रोबोट के नियोजित मूव्स को कुछ सेकंड के औसत (जैसे एक हिलते हुए वीडियो को स्मूथ करना) के रूप में लेने से उसे भारी फर्नीचर को संभालने में मदद मिली।
  • उच्च रिज़ॉल्यूशन: रोबोट को तेज़ आँखें (उच्च इमेज क्वालिटी) देने से उसे छोटे छेदों और मैग्नेट को सटीक रूप से संरेखित करने में मदद मिली।

सारांश

संक्षेप में, यह शोध पत्र एक ऐसे रोबोट को पेश करता है जो निम्नलिखित द्वारा वास्तविक फर्नीचर बना सकता है:

  1. VR में किए गए मानव प्रदर्शनों से सीखना।
  2. विशाल कार्य को छोटे, प्रबंधनीय चरणों में तोड़ना।
  3. यह जानने के लिए कि अगले चरण पर कब स्विच करना है, एक "प्रोग्रेस मीटर" का उपयोग करना।
  4. भागों को बिना तोड़े आपस में जोड़ने के लिए अपनी दृष्टि और गति को सटीक बनाना।

यह रोबोट को दो हाथों और बहुत धैर्य की आवश्यकता वाले जटिल, बहु-चरणीय घरेलू कार्यों को करने के लिए सिखाने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →