← नवीनतम पेपर
🤖 machine learning

A Distributional Treatment of Real2Sim2Real for Object-Centric Agent Adaptation in Vision-Driven Deformable Linear Object Manipulation

यह शोध पत्र एक एंड-टू-एंड रियल2सिम2रियल (Real2Sim2Real) फ्रेमवर्क प्रस्तुत करता है जो विरूपणीय रैखिक वस्तु हेरफेर (deformable linear object manipulation) के लिए उपयोग किया जाता है, जो डोमेन-रैंडमाइज्ड सुदृढीकरण शिक्षण (reinforcement learning) के लिए भौतिक पैरामीटर वितरणों का अनुमान लगाने हेतु लाइकलीहुड-फ्री इन्फरेंस (likelihood-free inference) को नियोजित करता है, जिससे सिमुलेशन से वास्तविक दुनिया में विसुओमोटर नीतियों (visuomotor policies) की ज़ीरो-शॉट तैनाती संभव हो पाती है।

मूल लेखक: Georgios Kamaras, Subramanian Ramamoorthy

प्रकाशित 2026-03-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Georgios Kamaras, Subramanian Ramamoorthy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: एक रोबोट को "स्पैगेटी" संभालना सिखाना

कल्पना कीजिए कि आप एक रोबोट को जूते का फीता बांधना, रस्सी हिलाना, या एक नाजुक सर्जिकल टांका लगाना सिखाने की कोशिश कर रहे हैं। ये वस्तुएं डिफॉर्मेबल लीनियर ऑब्जेक्ट्स (DLOs) हैं। वे लचीली, टेढ़ी-मेढ़ी और अप्रत्याशित होती हैं। एक कठोर डिब्बे के विपरीत, जो हमेशा एक ही तरह से रहता है, एक रस्सी हर बार छूने पर अपना आकार बदल लेती है।

समस्या यह है कि रोबोट आमतौर पर सिमुलेशन (वीडियो गेम की दुनिया) में प्रशिक्षित किए जाते हैं। लेकिन यहाँ एक "रियलिटी गैप" (वास्तविकता का अंतर) है: वीडियो गेम में भौतिक विज्ञान (physics) वास्तविक दुनिया के भौतिक विज्ञान के बिल्कुल समान नहीं होता है। गेम में एक रस्सी वास्तविक रस्सी की तुलना में थोड़ी अधिक सख्त या हल्की हो सकती है। यदि आप एक रोबोट को गेम में प्रशिक्षित करते हैं और फिर उसे वास्तविक दुनिया में रखते हैं, तो वह अक्सर विफल हो जाता है क्योंकि वह वास्तविक वस्तु के विशिष्ट "व्यक्तित्व" को नहीं समझ पाता है।

यह पेपर एक चतुर तीन-चरणीय समाधान प्रस्तुत करता है जिसे Real2Sim2Real कहा जाता है। इसे "डिटेक्टिव (जासूस) -> कोच -> एथलीट" पाइपलाइन के रूप में समझें।


चरण 1: डिटेक्टिव (Real2Sim)

लक्ष्य: केवल उसके हिलने-डुलने को देखकर यह पता लगाना कि वास्तविक वस्तु किस चीज से बनी है।

उपमा: कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्यमय स्प्रिंग के वजन और कठोरता का अनुमान लगाने की कोशिश कर रहे हैं। आप उसे सीधे तौल या माप नहीं सकते। इसके बजाय, आप उसे कुछ बार खींचते हैं और देखते हैं कि वह कैसे उछलता है।

  • पेपर की विधि: रोबोट एक वास्तविक रस्सी को पकड़ता है और उसे हिलाता है। वह उसकी गति (संकेत/clues) को रिकॉर्ड करता है।
  • जादुई टूल (Likelihood-Free Inference): रोबोट एक स्मार्ट एल्गोरिदम (BayesSim) का उपयोग करके पीछे की ओर काम करता है। वह पूछता है, "यदि रस्सी इतनी सख्त होती, तो क्या वह इस तरह से हिलती? यदि वह इतनी लंबी होती, तो क्या वह इस तरह से हिलती?"
  • परिणाम: एक एकल उत्तर (जैसे, "यह 20 सेमी लंबी है") का अनुमान लगाने के बजाय, जासूस एक प्रोबेबिलिटी मैप (संभावना मानचित्र) बनाता है। वह कहता है, "यह शायद 20 सेमी है, लेकिन इसकी एक छोटी संभावना है कि यह 21 सेमी है, और एक बहुत कम संभावना है कि यह 19 सेमी है।" यह मानचित्र वस्तु के भौतिक गुणों की अनिश्चितता को पकड़ लेता है।

चरण 2: कोच (सिमुलेशन में प्रशिक्षण)

लक्ष्य: रोबोट को उस वस्तु के सभी संभावित संस्करणों का मास्टर बनने के लिए प्रशिक्षित करना, न कि केवल एक के लिए।

उपमा: कल्पना कीजिए कि एक कोच एक एथलीट को दौड़ के लिए प्रशिक्षित कर रहा है।

  • पुराना तरीका (मानक प्रशिक्षण): कोच कहता है, "इस विशिष्ट ट्रैक पर, इस विशिष्ट हवा की गति के साथ दौड़ो।" एथलीट उस विशिष्ट ट्रैक के लिए तो अच्छा हो जाता है, लेकिन अगर हवा बदल जाए तो वह विफल हो जाता है।
  • पेपर का तरीका (डोमेन रैंडमाइजेशन): कोच चरण 1 में डिटेक्टिव द्वारा बनाए गए प्रोबेबिलिटी मैप को देखता है। वे कहते हैं, "ठीक है, रस्सी संभवतः 20 सेमी की है, लेकिन शायद 21 सेमी भी हो सकती है। आइए एथलीट को 20 सेमी, 20.5 सेमी, 21 सेमी और यहाँ तक कि 19 सेमी की रस्सियों के साथ मिलाकर प्रशिक्षित करें।"
  • परिणाम: रोबोट एक "सुपर-स्किल" सीखता है। वह केवल एक रस्सी को हिलाना नहीं सीखता; वह यह सीखता है कि उस जैसी दिखने वाली किसी भी रस्सी को कैसे संभालना है। यह उसे "रियलिटी गैप" के विरुद्ध मजबूत बनाता है।

चरण 3: एथलीट (Sim2Real परिनियोजन)

लक्ष्य: रोबोट को वास्तविक दुनिया में भेजना और बिना किसी और अभ्यास के उसे सफल होते देखना।

उपमा: एथलीट को अब वास्तविक दौड़ के लिए भेजा जाता है। क्योंकि उन्होंने अभ्यास के दौरान ट्रैक और हवा की हर संभावित स्थिति पर प्रशिक्षण लिया था, इसलिए उन्हें वास्तविक ट्रैक देखते समय "वार्म-अप" करने या तालमेल बिठाने की आवश्यकता नहीं होती है। वे बस दौड़ते हैं।

  • परिणाम: रोबोट सिमुलेशन में सीखी गई पॉलिसी को वास्तविक रस्सी पर तुरंत लागू करता है (Zero-Shot)। वह उस विशिष्ट रस्सी की कठोरता और लंबाई के अनुसार अपनी गतिविधियों को पूरी तरह से ढाल लेता है, भले ही उसने पहले कभी उस सटीक रस्सी को न देखा हो।

यह एक बड़ी बात क्यों है?

  1. यह "ऑब्जेक्ट-सेंट्रिक" है: रोबोट केवल एक सामान्य ट्रिक नहीं सीखता। वह अपने सामने रखी विशिष्ट वस्तु के अनुकूल होना सीखता है। यदि रस्सी नरम है, तो वह धीरे से हिलती है। यदि रस्सी सख्त है, तो वह जोर से खींचती है।
  2. कोई "फाइन-ट्यूनिंग" आवश्यक नहीं: आमतौर पर, जब आप एक रोबोट को कंप्यूटर से वास्तविक दुनिया में ले जाते हैं, तो आपको घंटों तक सेटिंग्स को ट्यून करने में बिताने पड़ते हैं। यह विधि उस चरण को पूरी तरह से छोड़ देती है।
  3. "मेसी" (अव्यवस्थित) डेटा को संभालना: वास्तविक कैमरे शोर (noise) पैदा करते हैं। की-पॉइंट्स (डॉट्स जिन्हें रोबोट रस्सी पर ट्रैक करता है) डगमगाते और कूदते हैं। यह पेपर शोर को सुचारू बनाने के लिए RKHS (Reproducing Kernel Hilbert Space) नामक एक गणितीय ट्रिक का उपयोग करता है।
    • उपमा: कल्पना कीजिए कि आप धुंधले दर्पण में अपने दोस्त का चेहरा पहचानने की कोशिश कर रहे हैं। आप उनकी नाक या आंखों के सटीक पिक्सेल नहीं देख सकते, लेकिन आप उनके चेहरे के "आकार" को महसूस कर सकते हैं। इस पेपर का गणित रोबोट को रस्सी की गति के "आकार" को महसूस करने देता है, जिससे वह विजुअल स्टैटिक (दृश्य शोर) को अनदेखा कर देता है।

मुख्य निष्कर्ष

लेखकों ने एक ऐसा सिस्टम बनाया है जो रोबोट को सक्षम बनाता है:

  1. देखना: एक लचीली वस्तु को देखना और उसके भौतिक रहस्यों (लंबाई, कठोरता) का अनुमान लगाना।
  2. अभ्यास करना: उन अनुमानों के आधार पर उस वस्तु के हजारों थोड़े अलग संस्करणों को सिम्युलेट करके एक वीडियो गेम में अभ्यास करना।
  3. प्रदर्शन करना: वास्तविक दुनिया में तुरंत प्रदर्शन करना, मानव विशेषज्ञ की सटीकता के साथ वस्तु को हिलाना, बिना किसी री-ट्यूनिंग की आवश्यकता के।

यह एक रोबोट को एक विशिष्ट खिलौने के साथ खेलने के लिए सिखाने जैसा है—पहले यह समझने के बाद कि वह खिलौना वास्तव में किस चीज से बना है, फिर लगभग समान दिखने वाले खिलौनों के बॉक्स के साथ अभ्यास करना, ताकि वास्तविक खिलौना सामने आते ही वह तैयार रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →