← नवीनतम पेपर
🤖 AI

DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA

DIAL एक नवीन विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो एक डिफरेंशिएबल लेटेंट इंटेंट बॉटलनेक के माध्यम से उच्च-स्तरीय निर्णय लेने की प्रक्रिया को निम्न-स्तरीय मोटर नियंत्रण से अलग करता है, जिससे एक VLM-आधारित सिस्टम-2 को लेटेंट विजुअल फोरसाइट (दृश्य दूरदर्शिता) को संश्लेषित करने में सक्षम बनाया जाता है जो एक हल्के वजन वाले सिस्टम-1 पॉलिसी को निर्देशित करता है, जिससे काफी कम प्रदर्शनों (demonstrations) के साथ अत्याधुनिक प्रदर्शन और मजबूत ज़ीरो-शॉट सामान्यीकरण प्राप्त होता है।

मूल लेखक: Yi Chen, Yuying Ge, Hui Zhou, Mingyu Ding, Yixiao Ge, Xihui Liu

प्रकाशित 2026-04-01
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yi Chen, Yuying Ge, Hui Zhou, Mingyu Ding, Yixiao Ge, Xihui Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। आपके पास इसे करने के दो बहुत अलग तरीके हैं:

  1. पुराना तरीका (द "डिक्टेटर"): आप एक कमांड चिल्लाते हैं जैसे "सैंडविच बनाओ!" और रोबोट का दिमाग तुरंत यह समझने की कोशिश करता है कि ब्रेड पकड़ने, मेयोनेज़ फैलाने और टमाटर काटने के लिए हर एक मांसपेशी की हरकत (muscle movement) क्या होनी चाहिए। यह एक उपन्यास लिखने जैसा है जहाँ आप बिना सोचे-समझे एक साथ हर अक्षर टाइप करने की कोशिश करते हैं। रोबोट अक्सर भ्रमित हो जाता है, भूल जाता है कि "सैंडविच" का मतलब क्या है, या बस अपना हाथ टोस्टर में घुसा देता है।

  2. नया तरीका (DIAL): आप काम को दो अलग-अलग भूमिकाओं में बाँट देते हैं: एक रणनीतिकार (Strategist) और एक कर्ता (Doer)

यह पेपर DIAL को पेश करता है, जो एक नया फ्रेमवर्क है जो इस "रणनीतिकार बनाम कर्ता" दृष्टिकोण का उपयोग करता है ताकि रोबोट को अधिक स्मार्ट, सीखने में तेज़ और नई स्थितियों को संभालने में बेहतर बनाया जा सके।

यहाँ बताया गया है कि DIAL कैसे काम करता है, सरल उपमाओं (analogies) के माध्यम से:

1. दो मस्तिष्क: "योजनाकार" और "प्रतिवर्त" (The Planner and the Reflex)

DIAL रोबोट के मस्तिष्क को दो प्रणालियों में विभाजित करता है, जो मानव सोच से प्रेरित है:

  • सिस्टम 2 (रणनीतिकार / वास्तुकार): यह रोबोट का "धीमी सोच" वाला मस्तिष्क है। यह एक विशाल, प्री-ट्रेंड AI (एक सुपर-स्मार्ट लाइब्रेरियन की तरह) है जो भाषा और चित्रों को समझता है।

    • यह क्या करता है: रोबोट को यह बताने के बजाय कि अपना हाथ कैसे हिलाना है, रणनीतिकार निर्देश ("चाय डालें") और वर्तमान दृश्य को देखता है, फिर भविष्य की कल्पना करता है। यह एक "मानसिक मूवी" बनाता है कि चाय डालने के बाद मेज कैसी दिखेगी।
    • जादू: यह केवल अनुमान नहीं लगाता; यह एक विशेष, संकुचित कोड (एक "लेटेंट इंटेंट") में दृश्य परिणाम (visual outcome) की भविष्यवाणी करता है। यह एक वास्तुकार द्वारा एक ईंट भी रखने से पहले बने हुए घर का ब्लूप्रिंट बनाने जैसा है।
  • सिस्टम 1 (कर्ता / प्रतिवर्त): यह रोबोट का "तेज़ सोच" वाला मस्तिष्क है। यह एक हल्का, सुपर-फास्ट कंट्रोलर है।

    • यह क्या करता है: यह वर्तमान मेज को देखता है, रणनीतिकार के "ब्लूप्रिंट" (भविष्य की छवि) को देखता है, और पूछता है: "वर्तमान मेज को उस भविष्य के ब्लूप्रिंट में बदलने के लिए मुझे अभी कौन सी विशिष्ट हाथ की हरकतें करने की आवश्यकता है?"
    • जादू: यह एक लेटेंट इनवर्स डायनेमिक्स (Latent Inverse Dynamics) मॉडल की तरह कार्य करता है। सरल शब्दों में, यह एक "रिवर्स इंजीनियर" है जो "हम कहाँ हैं" और "हम कहाँ जाना चाहते हैं" के बीच के अंतर को पाटने के लिए सटीक कदम निर्धारित करता है।

2. सफलता का सूत्र: "डिफरेंशिएबल बॉटलनेक" (The Differentiable Bottleneck)

पुराने रोबोट सिस्टम में, रणनीतिकार और कर्ता अक्सर एक टूटी हुई फोन लाइन के माध्यम से बात करते थे। रणनीतिकार कहता था "चाय डालें," और कर्ता अनुमान लगाने की कोशिश करता था कि इसका क्या अर्थ है, और अक्सर रणनीतिकार की गहरी समझ को अनदेखा कर देता था।

DIAL एक सख्त बॉटलनेक (strict bottleneck) पेश करता है।

  • इसे एक फनल (कीप) की तरह सोचें। रणनीतिकार को अपना पूरा प्लान इस फनल ( "लेटेंट इंटेंट") में डालना ही होगा। कर्ता मूल निर्देश या कच्चे वीडियो को नहीं देख सकता; वह केवल वही देख सकता है जो इस फनल से बाहर आता है।
  • यह रणनीतिकार को बिल्कुल स्पष्ट होने के लिए मजबूर करता है। यदि ब्लूप्रिंट खराब है, तो कर्ता विफल हो जाएगा। यदि कर्ता विफल होता है, तो ब्लूपिंट को सुधारा जाएगा। उन्हें एक ही संकीर्ण चैनल द्वारा आपस में जुड़े रहने के कारण पूरी तरह से मिलकर काम करने के लिए मजबूर किया जाता है।

3. प्रशिक्षण: दौड़ से पहले "वार्म-अप"

रोबोट को प्रशिक्षित करने में सबसे बड़ी समस्याओं में से एक यह है कि जब आप उन्हें एक साथ सब कुछ सिखाने की कोशिश करते हैं, तो वे भ्रमित हो जाते हैं। DIAL एक चतुर दो-चरणीय प्रशिक्षण विधि का उपयोग करता है:

  • चरण 1: विच्छेदित वार्म-अप (अभ्यास ड्रिल)

    • पहले, रणनीतिकार अकेले अभ्यास करता है। वह मनुष्यों को काम करते हुए हजारों वीडियो देखता है और भविष्य कैसा दिखेगा इसकी भविष्यवाणी करना सीखता है, बिना रोबोटिक हाथ हिलाने की चिंता किए। वह "विजुअल फोरसाइट" (दृश्य दूरदर्शिता) का मास्टर बन जाता है।
    • साथ ही, कर्ता अकेले अभ्यास करता है। उसे एक परफेक्ट भविष्य का ब्लूप्रिंट (एक मानव शिक्षक द्वारा) दिया जाता है और वह हाथ को ब्लूप्रिंट से मिलाने के लिए हिलना सीखता है।
    • उपमा: यह एक फुटबॉल टीम की तरह है जो वास्तविक खेल खेलने से पहले अलग-अलग अपने प्लेबुक (रणनीतिकार) और अपने फुटवर्क (कर्ता) का अभ्यास करती है।
  • चरण 2: एंड-टू-एंड सिनर्जी (असली खेल)

    • अब, वे जुड़े हुए हैं। रणनीतिकार अपने स्वयं के ब्लूप्रिंट बनाता है, और कर्ता उनका पालन करने की कोशिश करता है। क्योंकि उन्होंने पहले अलग-अलग अभ्यास किया था, वे एक-दूसरे से टकराते नहीं हैं।
    • महत्वपूर्ण बात यह है कि यदि कर्ता कोई गलती करता है, तो त्रुटि का संकेत (error signal) फनल के माध्यम से वापस रणनीतिकार के पास जाता है, जो उसे बताता है: "हे, तुम्हारा ब्लूप्रिंट थोड़ा गलत था; अपनी मानसिक छवि को ठीक करो।" यह पूरे सिस्टम को अपनी गलतियों से सीखने की अनुमति देता है बिना वह जो पहले से जानता है उसे भूले।

4. यह एक बड़ी बात क्यों है (परिणाम)

पेपर दिखाता है कि DIAL तीन कारणों से गेम-चेंजर है:

  • 10 गुना अधिक डेटा कुशल: क्योंकि रणनीतिकार मानवीय वीडियो से सीखता है (जो सस्ते और आसानी से उपलब्ध हैं) और कर्ता रोबोट डेटा से सीखता है (जो महंगा है), DIAL पिछले तरीकों की तुलना में 10 गुना तेजी से सीखता है। यह एक ऐसे छात्र की तरह है जो विषय में महारत हासिल करने के लिए एक किताब पढ़ता है और फिर एक लैब प्रयोग करता है, बजाय इसके कि वह अकेले 100 लैब प्रयोग करे।
  • जीरो-शॉट जनरलाइजेशन (Zero-Shot Generalization): यदि आप एक रोबोट को लाल बोतल से पानी डालने के लिए प्रशिक्षित करते हैं, तो पुराने रोबोट अक्सर नीली बोतल मिलने पर विफल हो जाते हैं। हालाँकि, DIAL "डालने" के संकल्पना (concept) को समझता है क्योंकि इसका रणनीतिकार विशिष्ट रंग के बजाय इरादे (जैसे कप के भरने की भविष्य की स्थिति) पर ध्यान केंद्रित करता है। यह उन वस्तुओं, बैकग्राउंड और संयोजनों को भी संभाल सकता है जिन्हें उसने पहले कभी नहीं देखा है।
  • मजबूती (Robustness): वास्तविक दुनिया में, चीजें गलत होती हैं। DIAL विकर्षणों (जैसे किसी बिल्ली के गुजरने) को अनदेखा करने में बेहतर है क्योंकि इसका "ब्लूप्रिंट" लक्ष्य पर केंद्रित होता है, न कि शोर-शराबे पर।

सारांश

DIAL एक दूरदर्शी वास्तुकार (Visionary Architect) और एक कुशल निर्माता (Master Builder) को काम पर रखने जैसा है।

  • वास्तुकार (सिस्टम 2) औजारों को नहीं छूता; वह बस तैयार घर का एक विस्तृत चित्र बनाता है।
  • निर्माता (सिस्टम 1) डिजाइन की चिंता नहीं करता; वह बस चित्र और ईंटों के वर्तमान ढेर को देखता है और समझता है कि चित्र से मेल खाने के लिए उसे कैसे हिलना है।
  • वे एक सख्त नियम से जुड़े हैं: निर्माता केवल वास्तुकार के चित्र के आधार पर ही काम कर सकता है।

यह अलगाव रोबोट को तेजी से सीखने, निर्देशों को बेहतर ढंग से समझने और मानवीय गरिमा के साथ वास्तविक, अस्त-व्यस्त वास्तविक दुनिया की स्थितियों को संभालने की अनुमति देता है, और वह भी पिछले रोबोटों की तुलना में बहुत कम डेटा का उपयोग करके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →