← नवीनतम पेपर
💻 computer science

SynthICL: Scalable In-context Imitation Learning with Synthetic Data

SynthICL एक स्केलेबल फ्रेमवर्क है जो पूरी तरह से उच्च-सटीकता वाले RGB-ओनली सिंथेटिक डेटा से सामान्यीकरण योग्य इन-कॉन्टेक्स्ट इमिटेशन लर्निंग पॉलिसियों को प्रशिक्षित करता है, और बिना डेप्थ सेंसिंग, सटीक कैमरा कैलिब्रेशन, या वास्तविक दुनिया के प्रशिक्षण डेटा की आवश्यकता के, अनदेखे वास्तविक दुनिया के मैनिपुलेशन कार्यों पर 79% सफलता दर प्राप्त करता है।

मूल लेखक: Cheng Qian, Ruomeng Fan, Yifei Ren, Yilong Wang, Edward Johns

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cheng Qian, Ruomeng Fan, Yifei Ren, Yilong Wang, Edward Johns

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई नया काम करना सिखाना चाहते हैं, जैसे कपों को एक के ऊपर एक रखना या फोन को बेस पर रखना। आमतौर पर, आपको खुद को वह काम पूरी सटीकता से करते हुए हफ्तों तक रिकॉर्ड करना होगा, और फिर उस फुटेज से रोबोट को सिखाने में महीनों बिताने होंगे।

SynthICL एक नया तरीका है जो इस खेल को बदल देता है। असली दुनिया में असली रोबोटों को फिल्माने के बजाय, शोधकर्ताओं ने रोबोट को सिखाने के लिए एक सुपर-रियलिस्टिक वीडियो गेम (एक सिमुलेशन) बनाया। उन्होंने इस गेम के भीतर 3 मिलियन नकली ट्रेनिंग वीडियो जेनरेट किए और रोबोट को पूरी तरह से वहीं से सिखाया।

यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ समझाया गया है:

1. "वीडियो गेम" ट्रेनिंग (कोई असली कैमरा नहीं चाहिए)

रोबोट ट्रेनिंग के अधिकांश तरीकों में "पॉइंट क्लाउड्स" (point clouds) पर निर्भरता होती—जो डॉट्स से बने डिजिटल 3D स्केच की तरह होते हैं। ये एक साफ वीडियो गेम में तो अच्छे होते हैं, लेकिन असली दुनिया में बहुत अस्त-व्यस्त और शोर भरे हो जाते हैं (जैसे कांपते हाथ से चित्र बनाने की कोशिश करना)।

SynthICL डॉट्स को नजरअंदाज करता है और RGB इमेजेस का उपयोग करता है (बिल्कुल आपके फोन की तस्वीरों की तरह)।

  • उपमा: पॉइंट क्लाउड्स को एक ब्लूप्रिंट की तरह और RGB इमेजेस को एक फोटोग्राफ की तरह समझें। शोधकर्ताओं ने महसूस किया कि यदि वे रोबोट को एक वीडियो गेम से उच्च गुणवत्ता वाले "फोटोग्राफ्स" के माध्यम से प्रशिक्षित करते हैं, तो रोबोट वस्तुओं को उनके दिखने के तरीके (रंग, बनावट, आकार) से पहचानना सीख जाता है, न कि केवल उनके 3D निर्देशांकों (coordinates) से। यह रोबोट को दो एक जैसे दिखने वाले कपों के बीच अंतर करने में सक्षम बनाता है यदि उनमें से एक लाल है और दूसरा नीला, जिसे पॉइंट-क्लाउड विधियाँ अक्सर समझने में संघर्ष करती हैं।

2. "वन-शॉट" लर्निंग ट्रिक

SynthICL का सबसे बड़ा जादू इन-कॉन्टेक्स्ट लर्निंग (In-Context Learning) है।

  • उपमा: कल्पना कीजिए कि आप एक शेफ हैं जिसने एक आभासी रसोई (virtual kitchen) में लाखों अलग-अलग व्यंजन बनाने का अभ्यास किया है। आपने पहले कभी वह विशिष्ट नया व्यंजन नहीं देखा है। लेकिन, यदि आपका एक दोस्त आपको उस विशिष्ट व्यंजन को बनाने का एक एकल फोटो दिखाता है, तो आप तुरंत रसोई में जाकर उसे बिना किसी नई रेसिपी बुक के पूरी तरह से बना सकते हैं।
  • यह कैसे काम करता है: जब आप रोबोट को एक नया कार्य देते हैं, तो आप बस उसे एक प्रदर्शन वीडियो (एक "कॉन्टेक्स्ट") दिखाते हैं। रोबोट उस वीडियो को देखता है, वर्तमान दृश्य को देखता है, और तुरंत समझ जाता है कि आगे क्या करना है। इसे दोबारा ट्रेनिंग या अपने दिमाग को अपडेट करने की आवश्यकता नहीं होती; यह बस अपने विशाल वीडियो गेम प्रशिक्षण से पैटर्न को "याद" कर लेता है।

3. "सबगोल" (Subgoal) का गुप्त मंत्र

शोधकर्ताओं ने रोबोट को और भी स्मार्ट बनाने के लिए एक विशेष ट्रिक जोड़ी है: सबगोल प्रेडिक्शन (Subgoal Prediction)।

  • उपमा: कल्पना कीजिए कि आप एक बच्चे को लेगो (Lego) का किला बनाना सिखा रहे हैं। केवल "किला बनाओ" कहने के बजाय, आप कहते हैं, "पहले, टॉवर बनाओ। फिर, दीवार बनाओ।"
  • यह कैसे काम करता है: ट्रेनिंग के दौरान, रोबट को केवल यह नहीं बताया जाता कि "हाथ को यहाँ लाओ।" उससे यह भी पूछा जाता है कि अगला कदम कैसा दिखेगा (उदाहरण के लिए, "जब कप आधा स्टैक हो जाएगा, तब इमेज कैसी दिखेगी?")। यह रोबोट को केवल अंतिम परिणाम को ही नहीं, बल्कि कार्य की प्रगति को समझने के लिए मजबूर करता है। पेपर में पाया गया कि इस "अगली तस्वीर का अनुमान लगाने" वाले चरण ने रोबोट को वास्तविक दुनिया में बहुत अधिक विश्वसनीय बना दिया।

4. परिणाम: गेम से वास्तविकता तक

टीम ने एक वास्तविक रोबोट आर्म का उपयोग करके 16 विभिन्न वास्तविक कार्यों (जैसे दराज खोलना, कटोरे सजाना, या कूड़ेदान में कचरा डालना) पर इसका परीक्षण किया।

  • स्कोर: रोबोट केवल एक प्रदर्शन के साथ 79% बार सफल रहा।
  • तुलना: पिछले तरीकों ने, जो पॉइंट क्लाउड्स का उपयोग करते थे या जिनमें वास्तविक दुनिया में फिल्मांकन की आवश्यकता थी, केवल 45% से 72% की सफलता दर प्राप्त की।
  • यह क्यों महत्वपूर्ण है: क्योंकि रोबोट को पूरी तरह से सिंथेटिक (नकली) डेटा पर प्रशिक्षित किया गया था, इसलिए आपको महंगे डेप्थ सेंसर, सटीक कैमरा कैलिब्रेशन, या वास्तविक मनुष्यों के हजारों घंटों के फिल्मांकन की आवश्यकता नहीं है। आपको बस वीडियो गेम और टेस्ट के समय एक सिंगल डेमो की आवश्यकता है।

सारांश

SynthICL एक ऐसे रोबोट की तरह है जो अपने बचपन में "द सिम्स" (एक लाइफ सिमुलेशन गेम) के लाखों घंटों को खेलकर बिताता है। क्योंकि इसने गेम में उच्च गुणवत्ता वाली तस्वीरों के माध्यम से वस्तुओं और कार्यों को पहचानना सीखा है, इसलिए यह एक वास्तविक रसोई में जा सकता है, एक नया कार्य देख सकता है, आपको उसे एक बार करते हुए देख सकता है, और तुरंत उसे खुद करना शुरू कर सकता है। यह वास्तविक दुनिया के डेटा संग्रह की महंगी और जटिल प्रक्रिया को छोड़ देता है और सीधे काम पर लग जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →