← नवीनतम पेपर
🤖 machine learning

Provably Efficient Off-Policy Adversarial Imitation Learning with Convergence Guarantees

यह शोध पत्र ऑफ-पॉलिसी एडवरसेरियल इमिटेशन लर्निंग के लिए पहले सैद्धांतिक अभिसरण गारंटी (convergence guarantees) और सैंपल कॉम्प्लेक्सिटी बाउंड्स स्थापित करता है, जो यह प्रदर्शित करता है कि हालिया पॉलिसियों से नमूनों का इम्पोर्टेंस सैंपलिंग सुधार के बिना पुन: उपयोग करने से अभिसरण बनाए रखते हुए सैंपल दक्षता में वृद्धि होती है।

मूल लेखक: Yilei Chen, Vittorio Giammarino, James Queeney, Ioannis Ch. Paschalidis

प्रकाशित 2026-07-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilei Chen, Vittorio Giammarino, James Queeney, Ioannis Ch. Paschalidis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक उस्ताद को देखकर रोबोट को सिखाना

कल्पना कीजिए कि आप एक रोबोट को इंसान की तरह चलना सिखाना चाहते हैं। आपके पास न तो कोई मैनुअल है और न ही नियमों की कोई सूची (रिवॉर्ड्स) जो रोबोट को बताए कि क्या करना है। इसके बजाय, आपके पास केवल एक आदर्श मानव चलने वाले (एक्सपर्ट) का वीडियो है।

यह इमिटेशन लर्निंग (Imitation Learning) की समस्या है। रोबोट को केवल एक्सपर्ट को देखकर यह समझना होगा कि कैसे चलना है।

एडवर्सरियल इमिटेशन लर्निंग (AIL) इस समस्या को हल करने का एक लोकप्रिय तरीका है। इसे दो खिलाड़ियों के बीच एक खेल के रूप में सोचें:

  1. एजेंट (रोबोट): एक्सपर्ट की तरह जितना संभव हो सके चलने की कोशिश करता है।
  2. एडवर्सरी (क्रिटिक/आलोचक): रोबोट और एक्सपर्ट के बीच के अंतर को पकड़ने की कोशिश करता है। यदि रोबोट लड़खड़ाता है, तो क्रिटिक उसे "खराब स्कोर" देता है। यदि रोबोट अच्छा दिखता है, तो वह "अच्छा स्कोर" देता है।

वे यह खेल बार-बार खेलते हैं। क्रिटिक कमियों को पहचानने में बेहतर होता जाता है, और रोबोट उन्हें छिपाने में बेहतर होता जाता है, जब तक कि रोबोट एक्सपर्ट की तरह चलने लगता है।

समस्या: "ताज़ा डेटा" की बाधा

मानक AIL में, एक बड़ी अक्षमता (inefficiency) है। हर बार जब क्रिटिक अपने "स्कोरिंग नियम" अपडेट करता है, तो उसे रोबोट को अभी इसी वक्त चलते हुए देखने की आवश्यकता होती है (जिसे "ऑन-पॉलिसी" डेटा कहा जाता है)।

उपमा: कल्पना कीजिए कि एक कुकिंग क्लास है जहाँ एक छात्र (रोबोट) एक मास्टर शेफ (एक्सपर्ट) से खाना बनाना सीख रहा है।

  • मानक तरीका: हर बार जब शिक्षक (क्रिटिक) छात्र की तकनीक पर फीडबैक देना चाहता है, तो छात्र को शुरुआत से एक बिल्कुल नया व्यंजन बनाना पड़ता है। शिक्षक उसे चखता है, फीडबैक देता है, और फिर छात्र उस व्यंजन को फेंक देता है और अगले सबक के लिए दूसरा व्यंजन बनाता है।
  • परिणाम: यह अविश्वसनीय रूप से बर्बादी भरा है। सीखने के लिए बहुत अधिक समय और सामग्री (सैंपल्स) खर्च होते हैं। वास्तविक दुनिया में, वातावरण के साथ बातचीत करना (खाना बनाना, गाड़ी चलाना, उड़ना) महंगा या खतरनाक हो सकता है, इसलिए हम इतने सारे प्रयासों को फेंकने का खर्च नहीं उठा सकते।

समाधान: पुराने व्यंजनों का पुन: उपयोग (ऑफ-पॉलिसी लर्निंग)

लेखक एक स्मार्ट तरीका प्रस्तावित करते हैं: ऑफ-पॉलिसी एडवर्सरियल इमिटेशन लर्निंग

उपमा: छात्र को हर बार फीडबैक देने के लिए ताज़ा व्यंजन बनाने के बजाय, शिक्षक पिछले कुछ दिनों में छात्र द्वारा बनाए गए व्यंजनों के मिश्रण को देखता है।

  • शिक्षक कहता है, "ठीक है, मैं तुम्हारे प्रदर्शन का ग्रेड कल बनाए गए स्टू, दो दिन पहले बनाए गए सूप और तीन दिन पहले बनाए गए सलाद के आधार पर दूँगा।"
  • लाभ: छात्र बहुत तेज़ी से सीखता है क्योंकि वे फीडबैक पाने के लिए नया खाना बनाने में समय बर्बाद नहीं कर रहे हैं। वे अपने पास मौजूद पुराने डेटा का पुन: उपयोग करते हैं।

सावधानी: इसमें एक जोखिम है। यदि छात्र की कुकिंग स्टाइल कल और आज के बीच बहुत अधिक बदल गई है, तो शिक्षक भ्रमित हो सकता है। डेटा का "स्वाद" बदल गया है। तकनीकी शब्दों में, इसे डिस्ट्रीब्यूशन शिफ्ट एरर (distribution shift error) कहा जाता है।

पेपर की सफलता: यह साबित करना कि यह सुरक्षित रूप से काम करता है

वह बड़ा सवाल जिसका यह पेपर उत्तर देता है, वह है: "क्या हम सीखने की प्रक्रिया को खराब किए बिना पुराने डेटा का पुन: उपयोग कर सकते हैं?"

कई पिछले तरीकों ने जटिल गणितीय सुधारों (जैसे "इम्पॉर्टेंस सैंपलिंग") का उपयोग करके "फ्लेवर शिफ्ट" को ठीक करने की कोशिश की, लेकिन वे अक्सर गणित को अस्थिर या सीखने को धीमा बना देते थे।

लेखकों का दावा:
वे दिखाते हैं कि यदि आप इस बात पर ध्यान दें कि आप कितना पुराना डेटा उपयोग कर रहे हैं, तो आपको जटिल सुधारों की आवश्यकता नहीं है।

  1. "स्वीट स्पॉट" नियम: आप हाल के NN प्रयासों से डेटा का पुन: उपयोग कर सकते हैं। हालाँकि, NN बहुत बड़ा नहीं हो सकता। यदि आप बहुत पीछे देखते हैं (जैसे, एक महीने पुराना डेटा), तो रोबोट की शैली बहुत बदल चुकी होगी, और फीडबैक बेकार हो जाएगा।
  2. जादुई नंबर: पेपर गणितीय रूप से सिद्ध करता है कि यदि आप कुल पाठों की संख्या (K\sqrt{K}) के लगभग वर्गमूल (K\sqrt{K}) के बराबर डेटा का पुन: उपयोग करते हैं, तो आपको दोनों दुनियाओं का सर्वश्रेष्ठ मिलता है:
    • आपको पुराने डेटा के पुन: उपयोग का लाभ (स्पीड) मिलता है।
    • आपको यह गारंटी भी मिलती है कि रोबोट अंततः पूरी तरह से चलना सीख जाएगा (कन्वर्जेंस)।

रूपक:
कल्पना कीजिए कि रोबोट एक डांसर है।

  • यदि शिक्षक केवल अभी के डांस को देखता है, तो शिक्षक बहुत सटीक होता है लेकिन जल्दी थक जाता है क्योंकि उसे हर बार एक नए प्रदर्शन की आवश्यकता होती है।
  • यदि शिक्षक 10 साल पुराने डांस का वीडियो देखता है, तो शिक्षक भ्रमित हो जाता है क्योंकि डांसर बदल चुका है।
  • पेपर का समाधान: शिक्षक डांसर के पिछले 5 प्रदर्शनों की एक प्लेलिस्ट देखता है। यह वर्तमान शैली के पर्याप्त करीब है ताकि सटीक रहे, लेकिन यह डांसर को हर आलोचना के लिए एक नया रूटीन करने से बचाता है। पेपर यह सिद्ध करता है कि जब तक प्लेलिस्ट बहुत लंबी नहीं है, डांसर अभी भी सही रूटीन सीख जाएगा।

उन्होंने प्रयोगों में क्या पाया

लेखकों ने कंप्यूटर सिमुलेशन (जैसे ग्रिड में नेविगेट करने वाला रोबलेट या ट्रेडमिल पर दौड़ता हुआ वर्चुअल कैरेक्टर) पर परीक्षण किया।

  • परिणाम: "ऑफ-पॉलिसी" विधि (पुराने डेटा का पुन: उपयोग करना) मानक विधि की तुलना में बहुत तेज़ी से सीखी।
  • अवलोकन: कुछ कार्यों में, 32 हालिया प्रयासों से डेटा का पुन: उपयोग करना एकदम सही था। अन्य कार्यों में, 128 का पुन: उपयोग करना बेहतर था। यह उनके सिद्धांत की पुष्टि करता है: कितने पिछले प्रयासों का पुन: उपयोग करना है, इसका "परफेक्ट नंबर" कार्य की जटिलता पर निर्भर करता है।

सारांश

यह पेपर एक व्यावहारिक ट्रिक के लिए गणितीय सुरक्षा जाल प्रदान करता है। यह सिद्ध करता है कि यदि आप रोबोट को उसके हालिया पिछले प्रयासों को देखकर सिखाते हैं (हर बार नया डेटा उत्पन्न करने के लिए मजबूर करने के बजाय), तो आप सीखने की गारंटी से समझौता किए बिना इसे बहुत अधिक कुशल बना सकते हैं। यह एक "बर्बादी भरे" सीखने की प्रक्रिया को "रीसाइक्लिंग" प्रक्रिया में बदल देता है, जो ठोस गणित द्वारा समर्थित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →