← नवीनतम पेपर
🤖 AI

ExpertGen: Scalable Sim-to-Real Expert Policy Learning from Imperfect Behavior Priors

ExpertGen एक स्केलेबल सिम-टू-रियल फ्रेमवर्क है जो एक फ्रोजन डिफ्यूजन पॉलिसी को अपूर्ण व्यवहार पूर्वग्रहों (behavior priors) के साथ इनिशियलाइज़ करके और जटिल मैनिपुलेशन कार्यों पर बिना रिवॉर्ड इंजीनियरिंग के उच्च सफलता दर प्राप्त करने के लिए इसे सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से परिष्कृत करके विशेषज्ञ नीति सीखने को स्वचालित करता है।

मूल लेखक: Zifan Xu, Ran Gong, Maria Vittoria Minniti, Ahmet Salih Gundogdu, Eric Rosen, Kausik Sivakumar, Riedana Yan, Zixing Wang, Di Deng, Peter Stone, Xiaohan Zhang, Karl Schmeckpeper

प्रकाशित 2026-03-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zifan Xu, Ran Gong, Maria Vittoria Minniti, Ahmet Salih Gundogdu, Eric Rosen, Kausik Sivakumar, Riedana Yan, Zixing Wang, Di Deng, Peter Stone, Xiaohan Zhang, Karl Schmeckpeper

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई जटिल कार्य करना सिखाना चाहते हैं, जैसे फर्नीचर को असेंबल करना या एक डिब्बे पर केला रखना। आमतौर पर, आपको एक मानव विशेषज्ञ को काम पर रखना होगा जो रोबोट को हजारों बार ठीक से दिखा सके कि क्या करना है। लेकिन यह महंगा, धीमा और कठिन है।

EXPERTGEN एक नया "रोबोट शिक्षक" सिस्टम है जो इस समस्या को हल करता है। यह एक स्मार्ट, अथक कोच की तरह है जो किसी कार्य के कुछ अनाड़ी, अपूर्ण प्रयासों को लेता है और उन्हें वास्तविक दुनिया में रोबोट के छूने से पहले ही, एक आभासी दुनिया के भीतर, एक मास्टर-स्तरीय विशेषज्ञ प्रदर्शन में बदल देता है।

यह कैसे काम करता है, यहाँ इसे खाना बनाने के उदाहरण का उपयोग करके तीन सरल चरणों में समझाया गया है:

1. "खराब रेसिपी" (अपूर्ण व्यवहार पूर्ववृत्त - Imperfect Behavior Priors)

कल्पना कीजिए कि आपके पास केक की एक रेसिपी है, लेकिन वह थोड़ी अव्यवset है। शायद इसे किसी नौसिखिए ने लिखा है, या इसे एक ऐसे AI द्वारा बनाया गया है जिसने पहले बहुत कम बेकिंग की है।

  • समस्या: यदि आप इस रेसिपी का ठीक वैसे ही पालन करते हैं, तो केक टेढ़ा हो सकता है, या वह बिखर सकता है। यह "अपूर्ण" है।
  • पेपर का समाधान: इस "खराब रेसिपी" को फेंकने के बजाय, EXPERTGEN इस "खराब रेसिपी" को एक प्रारंभिक बिंदु के रूप में लेता है। यह एक विशेष प्रकार के AI (जिसे Diffusion Policy कहा जाता है) का उपयोग करके रेसिपी के सामान्य "अहसास" को सीखता है। यह बुनियादी गतिविधियों को सीखता है, जैसे "बैटर को मिलाना" या "इसे ओवन में रखना," भले ही समय या तापमान थोड़ा गलत हो।

2. "आभासी रसोई" (Massive Parallel Simulation)

अब, कल्पना कीजिए कि आपके पास एक जादुई रसोई है जहाँ आप एक ही समय में 1,000 सिमुलेशन चला सकते हैं।

  • समस्या: यदि आप केवल शून्य से सीखने के लिए रोबोट को इस रसोई में छोड़ देते हैं, तो वह दीवारों से टकरा जाएगा, केक गिरा देगा, और कभी समझ नहीं पाएगा कि बेकिंग कैसे करनी है। उसे एक मार्गदर्शक की आवश्यकता है।
  • पेपर का समाधान: यहीं पर जादू होता है। EXPERTGEN उस "खराब रेसिपी" (अपूर्ण पूर्ववृत्त) को लेता है और उसे आभासी रसोई में डाल देता है। यह Diffusion Steering नामक तकनीक का उपयोग करता है।
    • उपमा: रोबोट की गतिविधियों को एक पहाड़ी से नीचे बहती नदी के रूप में सोचें। "खराब रेसिपी" नदी की सामान्य दिशा तय करती है (उसे पता है कि उसे समुद्र/कार्य के लक्ष्य की ओर बहना है)। हालांकि, नदी बहुत चौड़ी हो सकती है या पत्थरों से टकरा सकती है।
    • समाधान: EXPERTGEN एक बांध ऑपरेटर की तरह कार्य करता है। यह नदी के पथ को पूरी तरह से नहीं बदलता (क्योंकि इससे रोबोट अपना "मानवीय" अंदाज भूल जाएगा)। इसके बजाय, यह केवल प्रवाह की शुरुआत में पानी को थोड़ा सा धकेलता है ताकि उसे पत्थरों के चारों ओर और लक्ष्य की ओर मोड़ा जा सके।
    • परिणाम: रोबोट अपने शुरुआती बिंदु में सूक्ष्म समायोजन करके सफल होना सीखता है, जिससे उसका "मानवीय" अंदाज भी बना रहता है और गलतियाँ भी सुधर जाती हैं। वह इसे आभासी रसोई में लाखों बार करता है जब तक कि वह एक मास्टर शेफ नहीं बन जाता।

3. "वास्तविक दुनिया में स्थानांतरण" (Sim-to-Real)

अब रोबोट आभासी रसोई में एक मास्टर शेफ है। लेकिन क्या वह वास्तविक रसोई में, वास्तविक रोशनी, वास्तविक धूल और वास्तविक डगमगाती मेजों के साथ खाना बना सकता है?

  • समस्या: आभासी दुनिया आदर्श होती है; वास्तविक दुनिया अव्यवस्थित होती है। एक रोबोट जिसे पूर्ण सिमुलेशन में प्रशिक्षित किया जाता है, वह अक्सर वास्तविक दुनिया की वस्तु देखते ही विफल हो जाता है।
  • पेपर का समाधान: EXPERTGEN DAgger नामक तकनीक का उपयोग करता है (जो सुनने में तलवार जैसा लगता है, लेकिन वास्तव में यह एक शिक्षण पद्धति है)।
    • उपमा: कल्पना कीजिए कि आभासी रोबोट (मास्टर शेफ) एक छात्र रोबोट (छात्र) को सिखा रहा है जिसके पास केवल एक कैमरा है और रसोई की "गुप्त स्थिति" (secret state) तक पहुंच नहीं है।
    • प्रक्रिया: छात्र खाना बनाने की कोशिश करता है। जब वह भ्रमित होता है या गलती करता है, तो मास्टर शेफ हस्तक्षेप करता है और कहता है, "नहीं, इसे इस तरह से करो।" छात्र इस सुधार को रिकॉर्ड करता है। वे इसे बार-बार दोहराते हैं।
    • परिणाम: छात्र वास्तविक दुनिया की रोशनी और कैमरा एंगल को संभालने के लिए लगातार मास्टर शेफ से चेक करते हुए सीखता है। अंततः, छात्र इतना अच्छा हो जाता है कि वह अपने आप पूरी तरह से खाना बना सकता है, भले ही रोशनी बदल जाए या मेज हिल जाए।

यह एक बड़ी बात क्यों है?

  1. "रिवॉर्ड इंजीनियरिंग" के सिरदर्द से मुक्ति: आमतौर पर, रोबोट को सिखाने के लिए आपको एक इंसान द्वारा जटिल नियम लिखने की आवश्यकता होती है जैसे कि "यदि रोबोट कप गिरा देता है, तो उसे -1 अंक दें।" इसे सही करना कठिन है। EXPERTGEN बस कहता है, "क्या आपने कार्य पूरा किया? हाँ? बहुत अच्छा। नहीं? फिर से प्रयास करें।" यह बाकी चीजें खुद ही समझ लेता है।
  2. यह विफलता से सीखता है: अधिकांश रोबोट असफल होने पर हार मान लेते हैं। EXPERTGEN विशेष रूप से गलतियों से उबरना सीखता है। यदि रोबोट केले को गिरा देता है, तो वह उसे वापस उठाने और फिर से रखने के बारे में सीखता है, न कि केवल रुक जाने के बारे में।
  3. यह सस्ता और तेज़ है: आपको हजारों घंटों का वीडियो रिकॉर्ड करने के लिए इंसानों को काम पर रखने की आवश्यकता नहीं है। आप कंप्यूटर स्क्रिप्ट या लार्ज लैंग्वेज मॉडल (LLM) के साथ "अपूर्ण" डेटा उत्पन्न कर सकते हैं, और फिर सिमुलेशन को भारी काम करने दें।

निचोड़ (The Bottom Line)

EXPERTGEN एक रोबोट के व्यवहार के रफ ड्राफ्ट को लेने, उसे एक सुपर-फास्ट, अनंत अभ्यास लूप से गुजारने, जहाँ वह अपनी गलतियों को खुद सुधारना सीखता है, और फिर एक कैमरा-आधारित छात्र को वास्तविक दुनिया में उस पूर्णता की नकल करने के लिए सिखाने जैसा है।

परिणाम? ऐसे रोबोट जो बिखरी हुई, वास्तविक दुनिया के कार्यों (जैसे औद्योगिक असेंबली या फल उठाना) को 90%+ सफलता दर के साथ संभाल सकते हैं, भले ही वे बहुत कम डेटा और बिना किसी मानव विशेषज्ञ के मार्गदर्शन के शुरू हुए हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →