← नवीनतम पेपर
🤖 machine learning

An Information-Theoretic Definition for Open-Ended Learning

यह शोध पत्र रिवॉर्ड प्राप्ति के लिए आवश्यक सूचना को मापने के लिए "बिट-इक्विवेलेंट" (bit-equivalent) की अवधारणा पर आधारित ओपन-एंडेड लर्निंग की एक सूचना-सैद्धांतिक परिभाषा प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इस मीट्रिक में रैखिक वृद्धि ओपन-एंडेड वातावरण को क्लासिकल बैंडिट्स से अलग करती है और एक ऐसे एल्गोरिदम को प्रस्तुत करती है जो इस तरह की लर्निंग प्राप्त करता है।

मूल लेखक: Wanqiao Xu, Yifan Zhu, Benjamin Van Roy

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wanqiao Xu, Yifan Zhu, Benjamin Van Roy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं। एक सामान्य गेम में, एक अंतिम बॉस (final boss), एक हाई स्कोर और जीत का एक स्पष्ट रास्ता होता है। एक बार जब आप बॉस को हरा देते हैं, तो गेम "सुलझ" (solved) जाता है। आप इसमें बहुत बेहतर नहीं हो सकते क्योंकि सीखने के लिए कुछ नया नहीं बचा है।

अब, एक अलग तरह के गेम की कल्पना करें। एक ऐसा गेम जहाँ, आप जितना अधिक खेलते हैं, गेम नए स्तर, नई तकनीकें और नई चुनौतियाँ प्रकट करता जाता है जिन्हें आपने पहले कभी सोचा भी नहीं होगा। यह गेम कभी खत्म नहीं होता, और आप कभी सीखना बंद नहीं करते। यही वह चीज़ है जिसे लेखक ओपन-एंडेड लर्निंग (Open-Ended Learning) कहते हैं।

Xu, Zhu, और Van Roy का पेपर इस पेचीदा सवाल का जवाब देने की कोशिश करता है: हमें कैसे पता चलेगा कि एक AI वास्तव में एक ऐसे गेम में है जो कभी खत्म नहीं होता, बनाम सिर्फ एक बहुत लंबे, उबाऊ गेम में?

यहाँ उनके विचारों का सरल उपमाओं (analogies) के माध्यम से विवरण दिया गया है।

1. समस्या: "नयापन" (Novelty) पर्याप्त नहीं है

पहले, लोग सोचते थे कि कोई वातावरण "ओपन-एंडेड" है यदि वह AI को लगातार नई, अजीब और दिलचस्प चीजें करने के लिए देता रहता है। लेखक कहते हैं, "इतना जल्दी नहीं।"

एक रोबोट की कल्पना करें जो लगातार अजीब, रैंडम चित्र बनाता रहता है। वे सभी "नए" (novel) हैं और आप उन्हें पहचानने के लिए "सीख" (learn) सकते हैं। लेकिन क्या रोबोट वास्तव में चित्र बनाने में बेहतर हो रहा है? नहीं। वह बस शोर (noise) पैदा कर रहा है।

लेखक तर्क देते हैं कि वास्तविक ओपन-एंडेडनेस केवल नई चीजें बनाने के बारे में नहीं है; यह इस बारे में है कि बेहतर होने के लिए आपको लगातार नई जानकारी सीखने की आवश्यकता क्यों होती है। यदि आप कुछ भी नया सीखे बिना हाई स्कोर प्राप्त कर सकते हैं, तो गेम ओपन-एंडेड नहीं है।

2. नया टूल: "बिट-इक्विवेलेंट" (Bit-Equivalent)

इसे मापने के लिए, लेखकों ने एक नई अवधारणा बनाई जिसे बिट-इक्विवेलेंट कहा जाता है।

"बिट्स" को सूचना की मुद्रा (currency) के रूप में सोचें।

  • अवधारणा: एक इनाम का "बिट-इक्विवेलेंट" उस जानकारी की न्यूनतम मात्रा है जिसे आपको उस विशिष्ट इनाम को अर्जित करने के लिए दुनिया को समझने की आवश्यकता है।
  • उपमा: कल्पना कीजिए कि आप एक छिपे हुए खजाने को खोजने की कोशिश कर रहे हैं।
    • यदि खजाना फुटपाथ पर रखा $1 का नोट है, तो आपको इसे खोजने के लिए शून्य बिट्स की जानकारी चाहिए। आप बस नीचे देखते हैं।
    • यदि खजाना एक विशाल गुफा में छिपा हीरा है जिसमें एक जटिल नक्शा है, तो आपको उसे खोजने के लिए कई बिट्स की जानकारी (नक्शा, लेआउट, सुराग) की आवश्यकता होती है।

लेखक एक वातावरण को केवल तभी ओपन-एंडेड परिभाषित करते हैं यदि, बेहतर पुरस्कार प्राप्त करने के लिए, AI को लगातार अधिक जानकारी (बिट्स) एक स्थिर, रैखिक (linear) गति से एकत्र करने की आवश्यकता हो। यदि AI बिना नई जानकारी सीखे पुरस्कार प्राप्त करना जारी रख सकता है, तो वह "क्लोज्ड" (closed) है।

3. परीक्षण: पुराने गेम्स क्यों विफल होते हैं

लेखकों ने इस परिभाषा का परीक्षण "क्लासिकल" AI गेम्स (जिन्हें बैंडिट एनवायरनमेंट कहा जाता है) पर किया। उन्होंने पाया कि लगभग सभी ओपन-एंडेड टेस्ट में विफल हो जाते हैं।

  • फाइनाइट गेम्स (The Finite-Armed Bandit): एक स्लॉट मशीन की कल्पना करें जिसमें 10 लीवर हैं। एक बार जब आप समझ जाते हैं कि कौन सा लीवर सबसे अधिक भुगतान करता है, तो आप बस उसे हमेशा के लिए खींचते रहते हैं। आप सीखना बंद कर देते हैं। "बिट-इक्विवेलेंट" बढ़ना बंद हो जाता है।
  • इनफिनिट गेम्स (The Infinite-Armed Bandit): एक स्लॉट मशीन की कल्पना करें जिसमें अनंत लीवर हैं, लेकिन प्रत्येक लीवर पूरी तरह से रैंडम और एक-दूसरे से असंबंधित है। आप हर बार एक नया लीवर खींच सकते हैं और एक नया इनाम पा सकते हैं, लेकिन आप कोई पैटर्न नहीं सीख रहे हैं। आप मशीन की गहरी समझ नहीं बना रहे हैं। आपके द्वारा प्राप्त की गई जानकारी भविष्य में बेहतर इनाम पाने में मदद नहीं करती है।

दोनों मामलों में, AI एक ऐसी दीवार से टकरा जाता है जहाँ वह बिना अधिक सीखे बेहतर नहीं हो सकता, लेकिन वातावरण उस निरंतर सीखने की अनुमति नहीं देता है।

4. समाधान: "इन्सेशिएबल" (Insatiable) गेम

लेखकों ने फिर एक नया, कस्टम गेम बनाया जिसे इन्सेशिएबल लीनियर बैंडिट (Insatiable Linear Bandit) कहा गया।

  • सेटअप: एक विशाल, अनंत पंक्ति वाले लाइट स्विच की कल्पना करें। प्रत्येक स्विच आपके स्कोर के एक छोटे से हिस्से को नियंत्रित करता है। कुछ स्विच खराब हैं (जो आपके स्कोर को कम करते हैं), और कुछ अच्छे हैं (जो आपके स्कोर को बढ़ाते हैं)।
  • चुनौती: आप नहीं जानते कि कौन से स्विच अच्छे हैं। आपको यह जानने के लिए उन्हें घुमाना (flip) होगा।
  • यह क्यों काम करता है: क्योंकि पंक्ति अनंत है, हमेशा स्विचों का एक नया, अनएक्सप्लोर्ड हिस्सा होता है जो अच्छा हो सकता है। उच्च स्कोर प्राप्त करने के लिए, आपको लगातार अधिक स्विचों को घुमाना होगा और पैटर्न को सीखना होगा कि कौन से काम करते हैं। आप गेम को कभी "सुलझा" नहीं सकते क्योंकि गेम अनंत गहराई वाला है।

5. रणनीति: "ट्रंकेटेड थॉमसन सैंपलिंग" (Truncated Thompson Sampling)

लेखकों ने यह भी कोशिश की कि एक AI को इस नए गेम को खेलना कैसे सिखाया जाए। उन्होंने पाया कि मानक AI रणनीतियाँ विफल हो गईं:

  • बहुत लालची (Too greedy): यदि AI एक साथ पूरे अनंत पंक्ति को सीखने की कोशिश करता है, तो वह अभिभूत हो जाता है और ऐसी गलतियाँ करता है जिससे उसके स्कोर को नुकसान पहुँचता है।
  • बहुत छोटा (Too small): यदि AI केवल पहले 10 स्विचों को देखता है और बाकी को अनदेखा करता है, तो वह कुछ समय बाद सुधार करना बंद कर देता है।

जीतने वाली रणनीति: लेखकों ने ट्रंकेटेड थॉमसन सैंपलिंग (TTS) नामक एक विधि बनाई।

  • उपमा: कल्पना कीजिए कि आप एक विशाल, अनंत विश्वकोश (encyclopedia) पढ़ रहे हैं।
    • एक दिन में पूरी किताब पढ़ने की कोशिश न करें (आप असफल हो जाएंगे)।
    • केवल पहले पन्ने को हमेशा के लिए न पढ़ें (आप कुछ नया नहीं सीखेंगे)।
    • TTS का तरीका: पहला अध्याय पढ़ें। उसमें महारत हासिल करें। फिर, दूसरे अध्याय पर जाएँ। फिर तीसरे पर। आप अपने सीखने के वक्र (learning curve) से आगे रहने के लिए अपने "रीडिंग विंडो" का विस्तार करते रहें।

अपनी सीखने की सीमा को धीरे-धीरे बढ़ाकर, AI हमेशा नए "अच्छे स्विच" खोजने में सक्षम होता है, और उसका स्कोर (और उसके पास मौजूद जानकारी) रैखिक रूप से बढ़ता रहता है।

सारांश

पेपर का दावा है कि:

  1. वास्तविक ओपन-एंडेडनेस (True Open-Endedness) का अर्थ एक ऐसा वातावरण है जहाँ बेहतर होने के लिए आपको एक स्थिर गति से नई जानकारी सीखते रहना आवश्यक है।
  2. वर्तमान AI गेम्स में से अधिकांश ओपन-एंडेड नहीं हैं क्योंकि अंततः आप पुरस्कार प्राप्त करने के लिए सीखना बंद कर देते हैं।
  3. उन्होंने एक नया गेम बनाया (इन्सेशिएबल लीनियर बैंडित) जहाँ बेहतर होने के लिए आपको लगातार सीखना ही होगा।
  4. उन्होंने एक नई AI रणनीति बनाई (ट्रंकेटेड थॉमसन सैंपलिंग) जो इस गेम को सफलतापूर्वक खेलती है, यह सिद्ध करते हुए कि सही परिस्थितियों में ओपन-एंडेड लर्निंग संभव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →