← नवीनतम पेपर
🤖 machine learning

Zero-Shot Off-Policy Learning

यह शोध पत्र एक ज़ीरो-शॉट ऑफ-पॉलिसी लर्निंग विधि प्रस्तावित करता है जो इष्टतम महत्व नमूनाकरण (इम्पॉर्टेंस सैंपलिंग) अनुपातों को अनुमानित करने के लिए सक्सेसर मेजर्स और स्टेशनरी डेंसिटी रेश्यो के बीच एक सैद्धांतिक संबंध का लाभ उठाता है, जिससे विविध बेंचमार्क में नई कार्यों के लिए प्रशिक्षण-मुक्त अनुकूलन सक्षम होता है।

मूल लेखक: Arip Asadulaev, Maksim Bobrin, Salem Lahlou, Dmitry Dylov, Fakhri Karray, Martin Takac

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arip Asadulaev, Maksim Bobrin, Salem Lahlou, Dmitry Dylov, Fakhri Karray, Martin Takac

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया, जटिल व्यंजन बनाना सीख रहे हैं, लेकिन आपको भोजन चखने या नई सामग्री खरीदने से मना किया गया है। आपके पास केवल एक विशाल, धूल भरी कुकबुक (खाना पकाने की किताब) है जिसमें हजारों रेसिपी लिखी हुई हैं जो किसी और ने वर्षों पहले लिखी थीं। यही जीरो-शॉट ऑफ-पॉलिसी लर्निंग (Zero-Shot Off-Policy Learning) की चुनौती है।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, शोधकर्ता "बिहेवियरल फाउंडेशन मॉडल्स" (BFMs) बनाने की कोशिश कर रहे हैं। इन्हें ऐसे AI शेफ के रूप में समझें जिन्होंने लाखों रेसिपी बुक्स (ऑफलाइन डेटा) पढ़ ली हैं, लेकिन उन्होंने कभी किसी विशिष्ट ग्राहक के लिए कोई विशेष भोजन नहीं बनाया है (एक नया कार्य)। जब कोई ग्राहक कहता है, "मुझे स्पाइसी पास्ता चाहिए," तो AI को केवल अपने पुराने ज्ञान का उपयोग करके तुरंत यह समझना होगा कि खाना कैसे बनाया जाए, बिना किसी ट्रायल-एंड-एरर (प्रयास और त्रुटि) के।

समस्या: "आउट-ऑफ-बुक" ट्रैप (किताब से बाहर का जाल)

यह पेपर पहचान करता है कि वर्तमान में ये AI शेफ कैसे काम करते हैं, इसमें एक बड़ी खामी है।

कल्पना कीजिए कि आपका AI शेफ "स्पाइसी पास्ता" का अनुरोध देखता है। वह अपनी पुरानी किताबों को स्कैन करता है और उसे "स्पाइसी नूडल्स" की एक रेसिपी मिलती है। वह उस रेसिपी का पालन करने की कोशिश करता है। लेकिन यहाँ पेच यह है: पुरानी किताबें शायद ऐसे शेफ द्वारा लिखी गई थीं जिसने केवल एक बहुत ही विशिष्ट रसोई में खाना बनाया था। पुरानी किताबें "पानी उबालने" जैसे निर्देशों से भरी हो सकती हैं, लेकिन उनमें "लहसुन काटने" जैसे निर्देश पूरी तरह से गायब हो सकते हैं क्योंकि उस शेफ ने कभी ऐसा नहीं किया था।

यदि AI शेफ नया व्यंजन बनाने की कोशिश करता है, तो वह लहसुन के चरण पर अटक सकता है क्योंकि पुराने डेटा ने इसे कवर नहीं किया था। तकनीकी शब्दों में, इसे डिस्ट्रीब्यूशनल शिफ्ट (distributional shift) कहा जाता है। AI उस "रसोई" (स्टेट-स्पेस) के उन क्षेत्रों में कार्य करने की कोशिश कर रहा है जहाँ उसके ट्रेनिंग डेटा ने कभी कदम नहीं रखा। इससे AI जंगली अंदाज़े लगाने लगता है, अपनी योजना की अच्छाई को बढ़ा-चढ़ाकर बताता है, और अंततः विफल हो जाता है।

समाधान: ZOL (जीरो-शॉट ऑफ-पॉलिसी लर्निंग)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे ZOL कहा जाता है। उन्होंने महसूस किया कि दो अवधारणाओं के बीच एक छिपा हुआ गणितीय संबंध है:

  1. सक्सेसर मेजर्स (Successor Measures): यह अनुमान लगाने का एक तरीका कि "यदि मैं यह क्रिया करता हूँ तो मैं कहाँ पहुँच जाऊँगा?"
  2. स्टेशनरी डेंसिटी रेश्यो (Stationary Density Ratios): यह मापने का एक तरीका कि "मेरी नई योजना में यह क्रिया मेरे पुराने बुक्स की तुलना में कितनी अधिक (या कम) संभावित है?"

रचनात्मक उपमा: "लोकप्रियता का मानचित्र" (The Popularity Map)

कल्पना कीजिए कि पुराना डेटा (कुकबुक) एक शहर के मानचित्र की तरह है जहाँ कुछ सड़कें ट्रैफिक से भरी हैं (डेटा में अत्यधिक विज़िट की गई) और कुछ खाली कच्ची सड़कें हैं (शायद ही कभी देखी गई)।

  • पुराना AI: जब इसे एक नया गंतव्य दिया जाता है, तो AI बस वहां तक जाने के लिए एक सीधी रेखा खींच देता है। यदि वह रेखा किसी खाली कच्ची सड़क से होकर गुजरती है, तो AI मान लेता है कि वहां जाना ठीक है, भले ही उसे उसका कोई अनुभव न हो। फिर वह दुर्घटनाग्रस्त हो जाता है।
  • ZOL (नया AI): ZOL पुराने बुक्स के आधार पर एक "लोकप्रियता मानचित्र" (डensity ratio) बनाता है। अपनी योजना पर प्रतिबद्ध होने से पहले, वह पूछता है: "क्या इस योजना के लिए मुझे ऐसी कच्ची सड़क पर गाड़ी चलाने की आवश्यकता है जिसे मैंने पहले कभी नहीं देखा?"

यदि उत्तर हाँ है, तो ZOL केवल "नहीं" नहीं कहता। इसके बजाय, यह योजना को री-वेट (re-weight) करता है। यह कहता है, "ठीक है, मैं अभी भी गंतव्य तक जा सकता हूँ, लेकिन मुझे अपना रास्ता बदलने की ज़रूरत है ताकि मैं उन व्यस्त, अच्छी तरह से पक्की सड़कों के करीब रहूँ जिन्हें मैं जानता हूँ, जबकि लक्ष्य को भी प्राप्त कर सकूँ।"

यह कैसे काम करता है (जादुई ट्रिक)

पेपर का दावा है कि AI के आंतरिक "मस्तिष्क" (विशेष रूप से एक फ्रेमवर्क जिसे फॉरवर्ड-बैकवर्ड रिप्रेजेंटेशन कहा जाता है) में पहले से ही इस "लोकप्रियता मानचित्र" का रहस्य मौजूद है।

  1. कोई नया प्रशिक्षण नहीं: AI को खाना बनाने का अभ्यास करने के लिए बाहर जाने की आवश्यकता नहीं है (कोई ऑनलाइन इंटरेक्शन नहीं)। यह अपने प्रारंभिक "पढ़ने" के चरण के दौरान सीखे गए गणित का उपयोग करता है।
  2. तत्काल समायोजन: जब एक नया कार्य आता है, तो ZOL एक सरल सुधार कारक (correction factor) की गणना करता है। यह प्रभावी रूप से AI को बताता है: "उन हिस्सों को अनदेखा करें जो आपके पास मौजूद डेटा पर निर्भर करते हैं, और उन हिस्सों पर ध्यान केंद्रित करें जो आपके अनुभव द्वारा समर्थित हैं।"
  3. परिणाम: AI एक नया, इष्टतम पथ खोजता जो सुरक्षित है (उस डेटा के भीतर रहता है जिसे वह जानता है) लेकिन फिर भी लक्ष्य को प्राप्त करता है।

यह क्यों महत्वपूर्ण है

लेखकों ने विभिन्न "रोबोटिक" कार्यों पर इसका परीक्षण किया, जैसे कि एक आभासी मानव को चलना, दौड़ना या भूलभुलैया सुलझाना।

  • परीक्षण: उन्होंने AI को एक नया कार्य दिया (जैसे, "पीछे की ओर चलना") जो उसने पहले कभी नहीं देखा था।
  • तुलना: अन्य तरीकों ने अनुमान लगाने की कोशिश की और अक्सर विफल रहे या गलत बातें बनाईं (hallucinations)।
  • ZOL की जीत: ZOL ने लगातार बेहतर समाधान खोजे। इसने केवल अनुमान नहीं लगाया; इसने बुद्धिमानी से अपनी रणनीति को अपने "लाइब्रेरी" की सीमाओं के अनुरूप समायोजित किया और फिर भी पहेली को हल किया।

संक्षेप में

यह पेपर एक ऐसे तरीके को पेश करता है जिससे AI बिना अभ्यास किए तुरंत नए कार्यों के अनुकूल हो सकता है। यह गणितीय रूप से यह जाँच करके करता है कि क्या नया कार्य AI को "अपरिचित क्षेत्र" (जहाँ उसके पास कोई डेटा नहीं है) में कदम रखने की आवश्यकता है। यदि ऐसा है, तो ZOL AI को धीरे से वापस सुरक्षित, परिचित जमीन की ओर धकेलता है, जिससे यह सुनिश्चित होता है कि AI अनजाने में दुर्घटनाग्रस्त न हो। यह एक ऐसे GPS की तरह है जो जानता है कि कौन सी सड़कें पक्की हैं और कौन सी कच्ची, और यह सुनिश्चित करने के लिए आपको तुरंत मार्ग बदल देता है कि आप बिना कभी मानचित्र छोड़े सुरक्षित रूप से अपने गंतव्य तक पहुँचें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →