← नवीनतम पेपर
💻 computer science

DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization

यह शोध पत्र DyGRO-VLA प्रस्तुत करता है, जो एक दो-चरणीय अनुकूलन ढांचा (two-stage optimization framework) है जो क्रॉस-टास्क लेटेंट रिप्रेजेंटेशन्स को कैप्चर करके और 'मिक्सचर-ऑफ-आरएल-रेसिडुअल्स' के माध्यम से पॉलिसी ऑप्टिमाइज़ेशन को गतिशील रूप से परिष्कृत करके विभिन्न कार्यों में विजन-लैंग्वेज-एक्शन मॉडल्स की सामान्यीकरण क्षमता को बढ़ाता है, जिससे हस्तक्षेप कम होता है और वितरण बदलाव (distribution shifts) के तहत प्रदर्शन में सुधार होता है।

मूल लेखक: Sixu Lin, Yunpeng Qing, Litao Liu, Ming Zhou, Ruixing Jin, Xiaoyi Fan, Guiliang Liu

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sixu Lin, Yunpeng Qing, Litao Liu, Ming Zhou, Ruixing Jin, Xiaoyi Fan, Guiliang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को "हर काम में माहिर" (master of all trades) बनने के लिए सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह खाना बना सके, सफाई कर सके, नल की लीकेज ठीक कर सके और एक शेल्फ बना सके, और यह सब एक ही दिमाग का उपयोग करके कर सके। यही VLA (Vision-Language-Action) मॉडल्स का लक्ष्य है: ऐसे रोबोट जो देख सकते हैं, भाषा समझ सकते हैं और काम करने के लिए अपने हाथों को हिला सकते हैं।

हालाँकि, एक बड़ी समस्या है। जब शोधकर्ता Reinforcement Learning (RL) का उपयोग करके रोबोट को बेहतर बनाने की कोशिश करते हैं—जो कि एक ऐसी विधि है जहाँ रोबोट 'ट्रायल एंड एरर' (प्रयास और त्रुटि) से सीखता है, और सफलता मिलने पर उसे एक "इनाम" मिलता है—तो वे अक्सर एक विरोधाभास का सामना करते हैं।

समस्या: "स्पेशलिस्ट" का जाल (The "Specialist" Trap)

सोचिए कि रोबोट का दिमाग ज्ञान का एक पुस्तकालय (library) है। जब आप इसे पहली बार प्रशिक्षित करते हैं, तो यह सामान्य नियम सीखता है (जैसे "किसी वस्तु को पकड़ना")। लेकिन जब आप RL का उपयोग करके इसे एक विशिष्ट कार्य सिखाना शुरू करते हैं, जैसे "लाल ब्लॉक को एक के ऊपर एक रखना," तो रोबोट उस एक काम पर इतना केंद्रित हो जाता है कि वह अपने स्वयं के पुस्तकालय को ही फिर से लिखना शुरू कर देता है।

यह एक ऐसे छात्र की तरह है जो गणित की परीक्षा के लिए इतनी मेहनत से पढ़ाई करता है कि वह पढ़ना ही भूल जाता है। इस शोध पत्र में इसे "Catastrophic Forgetting" (विनाशकारी विस्मृति) कहा गया है।

  • पुराना तरीका: यदि आप रोबोट को 10 अलग-अलग कार्यों पर प्रशिक्षित करते हैं, तो वह एक काम में तो अच्छा हो जाता है लेकिन बाकी नौ काम भूल जाता है। जैसे-जैसे आप कार्य जोड़ते जाते हैं, समग्र रूप से उसका प्रदर्शन खराब होता जाता है। यह 20 गेंदों को हवा में उछालने (juggle) की कोशिश करने जैसा है; अंततः, आप उन सभी को गिरा देते हैं क्योंकि आपका दिमाग एक साथ बहुत सारी चीजों में विशेषज्ञ बनने की कोशिश कर रहा होता है।

समाधान: DyGRO-VLA

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे DyGRO-VLA कहा जाता है। यह कैसे काम करता है, इसे समझने के लिए, एक व्यस्त रसोई चलाने वाले "मास्टर शेफ" की कल्पना करें।

चरण 1: "मास्टर शेफ" (Offline Pre-training)

सबसे पहले, रोबोट एक विशाल वीडियो लाइब्रेरी से सीखता है जिसमें मनुष्यों को विभिन्न प्रकार के कार्य करते हुए दिखाया गया है।

  • चाल (The Trick): केवल हर वीडियो को रटने के बजाय, रोबोट यह सीखना सीखता है कि "शोर" (noise) को कैसे फ़िल्टर किया जाए। यह उन चीजों को अनदेखा कर देता है जो हिलने-डुलने के लिए महत्वपूर्ण नहीं हैं (जैसे दीवारों का रंग या रोशनी) और केवल आवश्यक जानकारी पर ध्यान केंद्रित करता है (कप कहाँ है, वह कितना भारी है)।
  • उपमा (The Analogy): यह मास्टर शेफ के खाना पकाने के बुनियादी सिद्धांतों सीखने जैसा है। वे सीखते हैं कि "गर्मी चीज़ को पिघला देती है" और "चाकू काटते हैं," चाहे वे पिज्जा बना रहे हों या सूप। यह एक साझा आधार (shared foundation) बनाता है जो हर चीज़ के लिए काम करता है।

चरण 2: "विशेषज्ञों की टीम" (Online Fine-tuning)

अब, रोबोट को वास्तविक दुनिया में विशिष्ट कार्यों में बेहतर होने की आवश्यकता है। मास्टर शेफ के दिमाग को फिर से लिखने के बजाय, DyGRO-VLA विशेषज्ञ सहायकों की एक टीम (जिन्हें "Residual Experts" कहा जाता है) जोड़ता है।

  • यह कैसे काम करता है: मास्टर शेफ (बेस मॉडल) क्या करना है, इस पर एक अनुमान लगाता है। फिर, एक "रूटर" (हेड शेफ की तरह) वर्तमान कार्य को देखता है और पूछता है, "इस विशिष्ट काम के लिए सबसे अच्छा सहायक कौन है?"
    • यदि कार्य "कटोरियाँ सजाना" है, तो रूटर "स्टैकिंग असिस्टेंट" को बुलाता है।
    • यदि कार्य "कील ठोकना" है, तो रूटर "हैमरिंग असिस्टेंट" को बुलाता है।
  • जादू: ये सहायक मास्टर शेफ की योजना में केवल छोटे सुधार (residuals) करते हैं। वे पूरी किताब को फिर से नहीं लिखते; वे बस एक स्टिकी नोट जोड़ते हैं जिसमें लिखा होता है, "अपना हाथ 2 इंच बाईं ओर ले जाएं।"
  • यह क्यों मदद करता है: क्योंकि मास्टर शेफ का दिमाग काफी हद तक अछूता रहता है, इसलिए रोबोट अन्य कार्यों को करना नहीं भूलता है। "स्टैकिंग असिस्टेंट" दूसरे "हैमरिंग असिस्टेंट" के काम में बाधा नहीं डालता है। वे एक-दूसरे के रास्ते में आए बिना मिलकर काम करते हैं।

परिणाम

शोधकर्ताओं ने दो प्रमुख रोबोट चुनौतियों पर इसका परीक्षण किया:

  1. LIBERO: एक डिजिटल टेस्ट सूट जिसमें 130 अलग-अलग कार्य हैं (जैसे वस्तुओं को हिलाना, सजाना, या कार्यों के लंबे क्रम)।
  2. RoboTwin2: एक वास्तविक दुनिया का परीक्षण जिसमें एक दोहरे हाथ वाला (dual-arm) रोबोट है।

परिणाम:

  • बाकी सबसे बेहतर: DyGRO-VLA ने सभी अन्य शीर्ष तरीकों को पछाड़ दिया। कठिन कार्यों (कार्यों के लंबे क्रम) पर, इसने सफलता की दर में लगभग 10% का सुधार किया।
  • वास्तविक दुनिया में सफलता: जब वे रोबोट को कंप्यूटर सिमुलेशन से एक वास्तविक भौतिक रोबोट में ले गए, तब भी इसने प्रतिस्पर्धा से बेहतर प्रदर्शन किया, और बोतलों को उठाने और कटोरियों को सजाने जैसे कार्यों को सफलतापूर्वक पूरा किया।

सारांश

सरल शब्दों में, पिछले तरीकों ने रोबोट को हर कार्य के लिए एक "सुपर-स्पेशलिस्ट" बनाने की कोशिश की, जिससे वह बाकी सब कुछ भूल गया। DyGRO-VLA रोबोट को एक "जनरलिस्ट" (मास्टर शेफ) बनाए रखता है और केवल आवश्यकता पड़ने पर मदद के लिए विशेषज्ञों की एक गतिशील टीम को नियुक्त करता है। इस तरह, रोबोट कुछ भी भूले बिना हर चीज़ में बेहतर होता जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →