← नवीनतम पेपर
💻 computer science

BEACON: Cross-Domain Co-Training of Generative Robot Policies via Best-Effort Adaptation

BEACON एक सिद्धांत-आधारित ढांचा है जो को-ट्रेनिंग (co-training) को एक विसंगति-जागरूक महत्व-पुनःभारण (discrepancy-aware importance-reweighting) समस्या के रूप में प्रस्तुत करके क्रॉस-डोमेन सेटिंग्स में जनरेटिव रोबोट नीतियों की सुदृढ़ता और डेटा दक्षता को बढ़ाता है, जो लक्ष्य-डोमेन सामान्यीकरण त्रुटि को न्यूनतम करने के लिए एक डिफ्यूजन-आधारित विज़ुओमोटर नीति और प्रति-नमूना स्रोत भार (per-sample source weights) को संयुक्त रूप से अनुकूलित करता है।

मूल लेखक: Antong Zhang, Han Qi, Heng Yang

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Antong Zhang, Han Qi, Heng Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक आर्म को ब्लॉक स्टैक करना (ब्लॉक एक के ऊपर एक रखना) सिखाने की कोशिश कर रहे हैं। आपके पास दो प्रकार का प्रशिक्षण डेटा (training data) है:

  1. "सोर्स" डेटा (The "Source" Data): एक कंप्यूटर-जनरेटेड दुनिया (सिमुलेशन) में रोबोटों द्वारा कार्य करने वाले वीडियो का एक विशाल पुस्तकालय। इनमें हजारों वीडियो हैं, लेकिन लाइटिंग, बनावट (textures) और भौतिकी (physics) वास्तविक दुनिया से थोड़ी अलग है।
  2. "टारगेट" डेटा (The "Target" Data): आपके वास्तविक किचन में एक असली रोबोट द्वारा कार्य करने वाले कुछ बहुत ही कम और कीमती वीडियो। इन्हें प्राप्त करना कठिन और महंगा है, लेकिन अंतिम काम के लिए केवल यही वास्तव में मायने रखते हैं।

समस्या:
यदि आप केवल कंप्यूटर वीडियो को कुछ वास्तविक वीडियो के साथ मिला देते हैं और रोबोट को उन सभी से समान रूप से सिखाते हैं, तो रोबोट भ्रमित हो जाता है। कंप्यूटर की दुनिया वास्तविक दुनिया से बहुत अलग है (अलग घर्षण, लाइटिंग, कैमरा एंगल)। रोबोट सिमुलेशन में ब्लॉक को पूरी तरह से स्टैक करना सीख सकता है, लेकिन आपके वास्तविक किचन में वह बुरी तरह विफल हो सकता है।

यदि आप केवल कुछ ही वास्तविक वीडियो का उपयोग करते हैं, तो रोबलेट पर्याप्त नहीं सीख पाता और सामान्यीकरण (generalize) करने में विफल रहता है।

समाधान: BEACON
यह पेपर एक नई विधि पेश करता है जिसे BEACON (Best-Effort Adaptation for Cross-Domain Co-Training) कहा जाता है। BEACON को एक शिक्षक के रूप में नहीं, बल्कि एक स्मार्ट एडिटर या क्यूरेटर के रूप में सोचें।

हर एक प्रशिक्षण वीडियो को समान मानने के बजाय, BEACON इस विशाल पुस्तकालय के हर एक वीडियो को एक "प्रासंगिकता स्कोर" (relevance score) या एक "वेट" (weight) देता है।

  • "बेस्ट-एफर्ट" (Best-Effort) का विचार: सिस्टम पूछता है, "इन हजारों कंप्यूटर वीडियो में से कौन से वीडियो मेरे पास मौजूद कुछ वास्तविक वीडियो की तरह दिखते और महसूस होते हैं?"
  • संपादन प्रक्रिया (The Editing Process):
    • यदि कोई कंप्यूटर वीडियो एक ऐसे तरीके से रोबोट की गति दिखाता है जो वास्तविक रोबोट के बहुत समान है, तो BEACON उसे एक उच्च स्कोर (high score) देता है। वह कहता है, "इसे इस्तेमाल करो! यह मददगार है!"
    • यदि कोई कंप्यूटर वीडियो कुछ अजीब या अवास्तविक दिखाता है (जैसे कि लकड़ी पर फिसलने के बजाय बर्फ पर ब्लॉक का फिसलना), तो BE কোন उसे एक कम स्कोर (low score) (या शून्य) देता है। वह कहता है, "इसे अनदेखा करें। यह रोबोट को भ्रमित कर देगा।"

यह कैसे काम करता है (जादुई ट्रिक):
आमतौर पर, लोग कंप्यूटर की दुनिया और वास्तविक दुनिया को एक जैसा दिखाने के लिए रंगों या बनावट को बदलने की कोशिश करते हैं (जैसे फोटो पर फिल्टर लगाना)। BEACON कुछ अलग करता है।

यह दुनियाओं को एक जैसा बनाने की कोशिश नहीं करता है। इसके बजाय, यह कंप्यूटर दुनिया के उन विशिष्ट क्षणों को चुनता (selects) है जो पहले से ही वास्तविक दुनिया के लिए उपयोगी हैं।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक विशिष्ट व्यंजन बनाना सीख रहे हैं। आपके पास अपनी दादी माँ का एक रेसिपी (वास्तविक डेटा) है और एक प्रसिद्ध टीवी शेफ के हजार रेसिपी हैं जो अलग-अलग सामग्री का उपयोग करते हैं (सोर्स डेटा)।
    • पुराना तरीका: आप टीवी शेफ की सामग्रियों को अपनी दादी की सामग्रियों से मिलाने की कोशिश करते हैं, या आप उन सभी को बस मिला देते हैं।
    • BEACON का तरीका: आप टीवी शेफ के हजार रेसिपी पढ़ते हैं और केवल उन चरणों को चुनते हैं जो आपकी दादी की तकनीक से मेल खाते हैं। आप बाकी सब को अनदेखा कर देते हैं। आप अपनी दादी के कुछ चरणों से सीखते हैं, लेकिन टीवी शेफ के सबसे अच्छे मैचिंग चरणों से अपनी कमियों को पूरा करते हैं।

चौंका देने वाला परिणाम:
पेपर में पाया गया कि इस "स्मार्ट सिलेक्शन" को करने से, रोबोट का मस्तिष्क (इसका न्यूरल नेटवर्क) स्वाभाविक रूप से वास्तविक दुनिया को बेहतर ढंग से समझने लगा। भले ही सिस्टम को स्पष्ट रूप से "फीचर्स को अलाइन करने" या "पैटर्न मिलाने" के लिए नहीं कहा गया था, लेकिन सही डेटा चुनने के कार्य ने रोबोट को अपने आप सही पैटर्न सीखने में मदद की। यह वैसा ही है जैसे एक छात्र जो केवल सबसे प्रासंगिक अभ्यास प्रश्नों का अध्ययन करता है, वह स्वाभाविक रूप से विषय के अंतर्निहित तर्क को समझने लगता है, बिना किसी अलग लॉजिक क्लास की आवश्यकता के।

उन्होंने क्या टेस्ट किया:
उन्होंने एक रोबोटिक आर्म पर तीन कार्यों के लिए इसका परीक्षण किया: ब्लॉक स्टैक करना, मग (mugs) साफ करना और सुई में धागा पिरोना। उन्होंने BEACON की तुलना निम्नलिखित से की:

  1. केवल कुछ वास्तविक वीडियो का उपयोग करना।
  2. सभी वीडियो को समान रूप से मिलाना।
  3. अन्य विधियाँ जो कंप्यूटर और वास्तविक दुनिया को एक जैसा दिखाने की कोशिश करती हैं।

परिणाम:
BEACON लगातार जीत हासिल करता रहा। रोबोट ने तेजी से सीखा, वास्तविक दुनिया के कम डेटा का उपयोग किया, और वातावरण बदलने (जैसे कैमरा हिलाने या टेबल की बनावट बदलने) पर बहुत अधिक मजबूत (robust) रहा। इसने साबित कर दिया कि डेटा का स्मार्ट क्यूरेटर होना डेटा को एक जैसा दिखाने के लिए मजबूर करने से कहीं अधिक शक्तिशाली है।

संक्षेप में:
BEACON एक ऐसा फ्रेमवर्क है जो रोबोट को यह सिखाता है कि, "हमारे पास बहुत सारा नकली डेटा है और थोड़ा सा वास्तविक डेटा है। आइए हम उस नकली चीज़ को अनदेखा करें जो फिट नहीं बैठती, और उस नकली चीज़ पर तीव्रता से ध्यान केंद्रित करें जो वास्तव में फिट बैठती है, ताकि हम वास्तविक कार्य को कुशलतापूर्वक सीख सकें।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →