← नवीनतम पेपर
💻 computer science

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

यह शोध पत्र DUST का प्रस्ताव करता है, जो एक डुअल-स्ट्रीम डिफ्यूजन फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन मॉडल्स को वर्ल्ड मॉडल्स के साथ संवर्धित करता है ताकि मोडैलिटी अंतराल को दूर किया जा सके और रोबोटिक पॉलिसी लर्निंग में सुधार किया जा सके, जो क्रॉस-मोडल कॉज़ल लर्निंग और एसिंक्रोनस सैंपलिंग के माध्यम से सिम्युलेटेड और वास्तविक दुनिया के कार्यों में महत्वपूर्ण प्रदर्शन लाभ प्राप्त करता है।

मूल लेखक: John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखा रहे हैं। आप चाहते हैं कि वह न केवल आपके वॉयस कमांड ("प्याज काटें") का पालन करे, बल्कि यह भी समझे कि प्याज काटने से क्या होगा। क्या प्याज उड़ जाएगा? क्या वह कटोरे में ही रहेगा?

वर्तमान रोबोटिक दिमाग (जिन्हें विज़न-लैंग्वेज-एक्शन मॉडल्स या VLAs कहा जाता है) देखने और सुनने में माहिर हैं, लेकिन वे अक्सर एक ऐसे ड्राइवर की तरह काम करते हैं जो केवल कार के ठीक सामने वाली सड़क को देखता है। वे जानते हैं कि स्टीयरिंग व्हील को कैसे घुमाना है, लेकिन वे वास्तव में भविष्य के दृश्य की "कल्पना" नहीं कर पाते। वे यह अनुमान लगाने में संघर्ष करते हैं कि उनके कार्यों से उनके आसपास की दुनिया कैसे बदल जाएगी।

अन्य शोधकर्ताओं ने इसे ठीक करने की कोशिश की, जिसमें उन्होंने रोबोट को भविष्य की भविष्यवाणी करने और ठीक उसी समय क्रियाएं (actions) तय करने के लिए मजबूर किया, जो एक ही मस्तिष्क का उपयोग करके किया जाता है। लेकिन यह एक ही हाथ से एक विस्तृत परिदृश्य (landscape) पेंट करने और साथ ही एक कविता लिखने की कोशिश करने जैसा है; ये दोनों कार्य इतने अलग हैं कि वे एक-दूसरे के काम में बाधा डालते हैं। रोबोट अपने हाथों की सहज, सरल गतिविधियों और वीडियो इमेज के जटिल विवरणों के बीच भ्रमित हो जाता है।

यहाँ DUST (डुअल-स्ट्रीम डिफ्यूजन) आता है, जो लेखकों द्वारा प्रस्तावित एक नया फ्रेमवर्क है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. दो-ट्रैक ट्रेन सिस्टम (डुअल-स्ट्रीम)

रोबोट को एक बड़े दिमाग में सब कुछ करने के लिए मजबूर करने के बजाय, DUST उसे दो अलग-अलग रेल ट्रैक देता है:

  • ट्रैक A (एक्शन स्ट्रीम): यह ट्रैक रोबोट की गतिविधियों को संभालता है। यह एक कंडक्टर की तरह है जो एक सुरीले और लयबद्ध नृत्य का प्रबंधन करता है। इसे मेज की बनावट या कमरे की रोशनी की चिंता करने की आवश्यकता नहीं है; इसे बस यह जानना है कि कैसे हिलना है।
  • ट्रैक B (विज़न स्ट्रीम): यह ट्रैक "भविष्य की तस्वीर" को संभालता है। यह एक फिल्म निर्देशक की तरह है जो अगले कुछ सेकंड में दृश्य कैसा दिखेगा, इसकी कल्पना करता है। यह जटिल, हाई-डेफिनिशन विवरणों से निपटता है।

आमतौर पर, ये दोनों ट्रैक समानांतर चलते हैं। लेकिन DUST के पास एक विशेष पुल (जिसे "क्रॉस-मोडल अटेंशन" लेयर कहा जाता है) है जो उन्हें जोड़ता है। यह "फिल्म निर्देशक" को "कंडक्टर" से कहने की अनुमति देता है, "हे, अगर तुम कप को वहाँ ले जाओगे, तो शायद वह गिर सकता है!" और कंडक्टर कह सकता है, "ठीक है, मैं धीरे चलूँगा।" वे आपस में उलझे बिना ज्ञान साझा करते हैं।

2. "शोर" का खेल (डिकपल्ड ट्रेनिंग)

इन दोनों ट्रैक्स को एक साथ काम करना सिखाने के लिए, शोधकर्ता शोर (static या fuzz) से जुड़ा एक चतुर प्रशिक्षण खेल उपयोग करते हैं।

  • कल्पना करें कि आप एक ही समय में किसी को चेहरा (Vision) और आवाज़ (Action) पहचानना सिखा रहे हैं।
  • पुराने तरीकों में, आप चेहरे को धुंधला करेंगे और आवाज़ को बिल्कुल उसी तरह विकृत करेंगे।
  • DUST में, वे "मिक्स एंड मैच" का खेल खेलते हैं। कभी-कभी वे एक एकदम स्पष्ट चेहरा दिखाते हैं लेकिन पूरी तरह से गड़बड़ आवाज़, और कभी-कभी वे एक स्पष्ट आवाज़ दिखाते हैं लेकिन एक धुंधला चेहरा।
  • यह रोबोट को कारण-और-प्रभाव (cause-and-effect) के संबंध को गहराई से सीखने के लिए मजबूर करता है। यह सीखता है: "यदि मैं इस विशिष्ट क्रिया को देखता हूँ, तो मुझे उस विशिष्ट दृश्य परिणाम की उम्मीद करनी चाहिए," भले ही डेटा अव्यवस्थित क्यों न हो। यह रोबोट को दुनिया के भौतिक विज्ञान (physics) को समझने के लिए प्रशिक्षित करता है, न कि केवल पैटर्न को रटने के लिए।

3. एसिंक्रोनस डांस (टेस्ट-टाइम स्केलिंग)

जब रोबोट वास्तव में काम करता है (inference), तो दोनों ट्रैक्स को एक ही गति से चलने की आवश्यकता नहीं होती है।

  • विज़न जटिल है। यह एक मास्टरपीस पेंट करने जैसा है; विवरणों को सही करने के लिए इसे कई छोटे, सावधानीपूर्ण ब्रशस्ट्रोक की आवश्यकता होती है।
  • एक्शन सरल है। यह ड्रम पर एक त्वरित थाप (tap) देने जैसा है; इसे लय को सही करने के लिए बहुत अधिक चरणों की आवश्यकता नहीं है।
  • DUST विज़न ट्रैक को भविष्य की अपनी भविष्यवाणी को परिष्कृत करने के लिए कई अधिक स्टेप्स लेने की अनुमति देता है, जबकि एक्शन ट्रैक को क्या करना है यह तय करने के लिए कम स्टेप्स लेने देता है। यह एक ऐसे नृत्य की तरह है जहाँ एक साथी एक धीमा, जटिल स्पिन करता है जबकि दूसरा एक त्वरित कदम चलता है। यह समय बचाता है और रोबोट को बहुत अधिक धीमा किए बिना स्मार्ट बनाता है।

उन्हें क्या मिला?

लेखकों ने इस "DUST" रोबोट का तीन तरीकों से परीक्षण किया:

  1. सिमुलेशन में (RoboCasa & GR-1): उन्होंने रोबोट को एक वर्चुअल किचन और एक वर्चुअल ह्यूमनॉइड बॉडी में रखा। DUST ने पिछले सभी सर्वश्रेष्ठ रोबोटों को एक महत्वपूर्ण अंतर से पीछे छोड़ दिया (6% तक बेहतर), विशेष रूप से तब जब उसे सीखने के लिए कम डेटा दिया गया।
  2. वास्तविक दुनिया में (Franka Robot Arm): उन्होंने इसे एक वास्तविक लैब में एक वास्तविक धातु के हाथ (arm) पर लगाया। DUST वस्तुओं को उठाने और औजारों का उपयोग करने जैसे कार्यों में प्रतिस्पर्धा की तुलना में 10% अधिक बार सफल रहा।
  3. वीडियो से सीखना: उन्होंने DUST को हजारों घंटों के वीडियो दिखाए जिनमें कोई रोबोटिक एक्शन नहीं था (केवल लोग चीजें हिला रहे थे)। DUST ने इन वीडियो से सीखा और फिर उस ज्ञान को वास्तविक रोबोट में स्थानांतरित किया, जिससे वह अपने काम में बहुत बेहतर हो गया।

मुख्य निष्कर्ष

DUST रोबोट को "आगे सोचने" का एक नया तरीका है। सब कुछ एक अव्यवस्थित दिमाग में भरने के बजाय, यह रोबोट को दो विशेषज्ञ सहायकों को देता है—एक हिलने-डुलने के लिए और दूसरा भविष्य की कल्पना करने के लिए—जो लगातार एक-दूसरे से बात करते हैं। यह रोबोट को भौतिक दुनिया को बेहतर ढंग से समझने, कम गलतियाँ करने और तेजी से सीखने में सक्षम बनाता है, चाहे वह कंप्यूटर सिमुलेशन में हो या वास्तविक रसोई में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →