← नवीनतम पेपर
🤖 machine learning

DADP: Domain Adaptive Diffusion Policy

यह शोध पत्र DADP का प्रस्ताव करता है, जो एक डोमेन एडेप्टिव डिफ्यूजन पॉलिसी है जो लैग्ड कॉन्टेक्स्ट डायनेमिकल प्रेडिक्शन (Lagged Context Dynamical Prediction) के माध्यम से स्थिर डोमेन निरूपणों को क्षणिक गुणों से अनसुपरवाइज्ड तरीके से अलग करके और इन निरूपणों को सीधे डिफ्यूजन जनरेशन प्रक्रिया में एकीकृत करके, अनदेखी ट्रांजिशन डायनेमिक्स के प्रति सुदृढ़ ज़ीरो-शॉट अनुकूलन प्राप्त करता है।

मूल लेखक: Pengcheng Wang, Qinghang Liu, Haotian Lin, Yiheng Li, Guojian Zhan, Masayoshi Tomizuka, Yixiao Wang

प्रकाशित 2026-03-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pengcheng Wang, Qinghang Liu, Haotian Lin, Yiheng Li, Guojian Zhan, Masayoshi Tomizuka, Yixiao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ DADP (डोमेन एडेप्टिव डिफ्यूजन पॉलिसी) पेपर का स्पष्टीकरण दिया गया है, जिसे सरल, रोज़मर्रा की भाषा में और कुछ रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

बड़ी समस्या: "एक-आकार-सभी-के-लिए-नहीं" वाला रोबोट

कल्पना कीजिए कि आपने एक रोबोट को एक चिकने, सपाट जिम के फर्श पर चलना सिखाया है। वह बिल्कुल सही तरीके से चलना सीख जाता है। लेकिन जैसे ही आप उसी रोबोट को बाहर एक रेतीले समुद्र तट या फिसलन भरे बर्फीले रास्ते पर ले जाते हैं, वह तुरंत गिर जाता है।

यह रोबोटिक्स और AI की क्लासिक समस्या है: डोमेन एडाप्टेशन (Domain Adaptation)। अधिकांश AI नीतियां "भंगुर" (brittle) होती हैं। वे उस चीज़ में बहुत अच्छी होती हैं जिस पर उन्हें प्रशिक्षित किया गया है, लेकिन जब वातावरण थोड़ा भी बदल जाता है (जैसे गुरुत्वाकर्षण का बदलना, या रोबोट के पैर भारी हो जाना), तो वे विफल हो जाती हैं।

वर्तमान तरीके इसे रोबोट को वातावरण का एक "चीट शीट" (प्रतिनिधित्व/representation) देकर ठीक करने की कोशिश करते हैं। लेकिन यह पेपर तर्क देता है कि इनमें से अधिकांश चीट शीटات अस्त-व्यस्त हैं। वे स्थायी तथ्यों (जैसे "इस रोबोट के पैर भारी हैं") को अस्थायी शोर/नॉइज़ (जैसे "रोबोट अभी बाईं ओर झुक रहा है क्योंकि वह लड़खड़ा गया है") के साथ मिला देते हैं। जब रोबोट इस अव्यवस्थित चीट शीट का उपयोग करने की कोशिश करता है, तो वह भ्रमित हो जाता है।

समाधान: DADP

लेखक DADP का प्रस्ताव करते हैं, जो रोबटों को बिना अतिरिक्त प्रशिक्षण के नए वातावरणों में तुरंत ढलने का एक नया तरीका है। वे इसे दो चतुर चरणों में करते हैं:

1. "टाइम ट्रैवल" ट्रिक (लैग्ड कॉन्टेक्स्ट/Lagged Context)

समस्या: यदि आप एक रोबोट से पूछते हैं, "हम किस तरह की दुनिया में हैं?" और वह अभी-अभी जो हुआ उसके आधार पर जवाब देता है, तो रोबोट भ्रमित हो जाता है। वह रोबोट के लड़खड़ाने को देखता है और सोचता है, "ओह, दुनिया अस्थिर है!" लेकिन दुनिया अस्थिर नहीं है; रोबोट ने बस एक गलती की है। वह स्थिर तथ्यों (दुनिया) को गतिशील शोर (लड़खड़ाना) के साथ मिला रहा है।

DADP का समाधान: लेखक "लैग्ड कॉन्टेक्स्ट" (Lagged Context) की अवधारणा पेश करते हैं।

  • उपमा: कल्पना कीजिए कि आप यह पता लगाने की कोशिश कर रहे हैं कि आप कौन सी कार चला रहे हैं।
    • सामान्य तरीका: आप अभी डैशबोर्ड देखते हैं। यदि कार लहरा रही है, तो आप सोचते हैं, "यह एक डगमगाती हुई कार है।"
    • DADP तरीका: आप 10 सेकंड पहले का डैशबोर्ड देखते हैं। यदि कार 10 सेकंड पहले सीधी चल रही थी, लेकिन अब लहरा रही है, तो आप समझते हैं: "आह, कार वास्तव में स्थिर है; मैं बस एक झटके से टकराया हूँ।"
  • यह कैसे काम करता है: AI को बहुत पीछे के इतिहास के आधार पर भविष्य की भविष्यवाणी करने के लिए मजबूर करके, यह "तत्काल शोर" (instantaneous noise) का उपयोग करके बेईमानी नहीं कर सकता। यह केवल वातावरण के स्थायी, अपरिवर्तनीय नियमों (जैसे गुरुत्वाकर्षण या घर्षण) को सीखने के लिए मजबूर होता है। यह वातावरण के लिए एक साफ, शुद्ध "ID कार्ड" बनाता है।

2. "गाइड के साथ पेंटिंग करना" ट्रिक (डिफ्यूजन इंजेक्शन/Diffusion Injection)

समस्या: एक बार जब रोबोट के पास वातावरण का एक साफ ID कार्ड होता है, तो वह इसका उपयोग कैसे करता है? अधिकांश तरीके बस ID कार्ड को रोबोट के दिमाग में एक अतिरिक्त इनपुट के रूप में चिपका देते हैं।

  • उपमा: कल्पना कीजिए कि एक चित्रकार (AI) बिल्ली का चित्र बनाने की कोशिश कर रहा है। यदि आप उन्हें बस बिल्ली की एक फोटो (ID कार्ड) देते हैं और कहते हैं, "इसे पेंट करो," तो वे संघर्ष कर सकते हैं। उन्हें एक खाली कैनवास (शुद्ध शोर) से शुरू करना होगा और फोटो को देखते हुए बिल्ली के आकार का अनुमान लगाना होगा। यह एक अव्यवस्थित, भ्रमित करने वाली प्रक्रिया है।

DADP का समाधान: केवल फोटो दिखाने के बजाय, DADP फोटो को पेंट में ही मिला देता है।

  • उपमा: कल्पना कीजिए कि चित्रकार अपना पेंट मिला रहा है। सफेद पेंट (शोर) से शुरू करने के बजाय, वे एक ऐसी बाल्टी से शुरू करते हैं जो पहले से ही बिल्ली के रंग से थोड़ी रंगी हुई है।
  • यह कैसे काम करता है: "डिफ्यूजन मॉडल्स" (जो क्रियाएं उत्पन्न करते हैं, जैसे एक चित्रकार छवि बनाता है) के गणित में, DADP शुरुआती बिंदु को बदल देता है। यह शुरुआती शोर को इस तरह से पक्षपाती (bias) बनाता है कि वह पहले से ही उस विशिष्ट वातावरण के लिए सही व्यवहार की ओर झुका हुआ हो।
    • यह केवल रोबोट को यह बताता नहीं है कि "आप बर्फ पर हैं।"
    • यह रोबोट की निर्णय लेने की प्रक्रिया को एक अंतर्निहित "फिसलन भरी" प्रवृत्ति के साथ शुरू करता है।
    • यह रोबोट के काम को बहुत आसान बना देता है। उसे अनुमान लगाने की ज़रूरत नहीं है; उसे बस एक ऐसे रास्ते को परिष्कृत (refine) करना है जो पहले से ही सही दिशा में है।

यह एक बड़ी बात क्यों है?

पेपर का परीक्षण रोबोट चलने (जैसे चीता या वॉकर) और रोबोट द्वारा नाजुक कार्य करने (जैसे हाथ से दरवाजा खोलना) पर किया गया।

  • परिणाम: DADP केवल थोड़ा बेहतर नहीं था; यह अत्याधुनिक (state-of-the-art) तरीकों की तुलना में काफी बेहतर था।
  • "मास्टरी" मेट्रिक: लेखकों ने एक शानदार अवधारणा "मास्टरी" (Mastery) पेश की। उच्च मास्टरी वाला रोबोट केवल जीवित नहीं रहता; वह तेज़ी से और आत्मविश्वास से दौड़ता है। DADP रोबोट उन वातावरणों में "एक्सपर्ट मास्टरी" प्राप्त करते हैं जहाँ अन्य रोबोट मुश्किल से रेंग रहे थे या गिर रहे थे।

संक्षेप में सारांश

  1. पुराना तरीका: रोबोट वातावरण का अनुमान लगाने के लिए तत्काल अतीत को देखता है, जिससे वह अपनी ही गलतियों के कारण भ्रमित हो जाता है। फिर वह शून्य से सही चाल का अनुमान लगाने की कोशिश करता है।
  2. DADP तरीका:
    • चरण 1: रोबोट वातावरण को समझने के लिए दूर के अतीत को देखता है, अपनी हालिया गलतियों को अनदेखा करता है। यह उसे दुनिया का एक साफ, सटीक "ID कार्ड" देता है।
    • चरण 2: रोबोट उस ID कार्ड का उपयोग अपने शुरुआती बिंदु को पहले से रंगने (pre-tinting) के लिए करता है। वह शून्य से अनुमान नहीं लगाता; वह एक बढ़त के साथ शुरू करता है, यह जानते हुए कि वह किस तरह की दुनिया में है।

यह एक छात्र को केवल उत्तर कुंजी (answer key) रटने के बजाय, परीक्षा के सिद्धांतों को इतनी अच्छी तरह से समझने के लिए सिखाने जैसा है कि वे पूरी तरह से अलग परीक्षा कक्ष में जाकर भी उत्कृष्ट प्रदर्शन कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →