← नवीनतम पेपर
🤖 AI

A Model-Free Universal AI

यह शोध पत्र AIQI को प्रस्तुत करता है, जो वितरण संबंधी एक्शन-वैल्यू फंक्शन्स (distributional action-value functions) पर यूनिवर्सल इंडक्शन (universal induction) को निष्पादित करके सामान्य सुदृढीकरण शिक्षण (reinforcement learning) में एसिम्प्टोटिक ε\varepsilon-ऑप्टिमैलिटी (asymptotic ε\varepsilon-optimality) प्राप्त करने वाला पहला सिद्ध मॉडल-मुक्त यूनिवर्सल एजेंट है, साथ ही यह इन प्रमाण तकनीकों को सेल्फ-AIXI (Self-AIXI) की इष्टतमता स्थापित करने के लिए विस्तारित भी करता है।

मूल लेखक: Yegon Kim, Juho Lee

प्रकाशित 2026-06-16
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yegon Kim, Juho Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "A Model-Free Universal AI" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

मुख्य विचार: सोचने से नहीं, बल्कि करके सीखना

कल्पना कीजिए कि आप एक जटिल वीडियो गेम खेलना सीखने की कोशिश कर रहे हैं। इसे करने के दो मुख्य तरीके हैं:

  1. "मैप-मेकर" दृष्टिकोण (Model-Based): आप अपना सारा समय गेम के कोड को पढ़ने, दुनिया का एक सटीक नक्शा बनाने और वास्तव में बटन दबाने से पहले अपने दिमाग में हर संभावित चाल का अनुकरण (simulate) करने में बिताते हैं। प्रसिद्ध सैद्धांतिक AI जिसे AIXI कहा जाता है, इसी तरह काम करता है। यह अपनी चालों की योजना बनाने के लिए पूरे ब्रह्मांड का एक मानसिक मॉडल बनाता है। समस्या क्या है? इस तरह का पूर्ण नक्शा बनाना अक्सर असंभव होता है या इसमें बहुत अधिक कंप्यूटिंग पावर लगती है।
  2. "ट्रायल-एंड-एरर" दृष्टिकोण (Model-Free): आप बस खेलना शुरू कर देते हैं। आप बटन दबाते हैं, देखते हैं कि क्या होता है, याद रखते हैं कि किन चालों से आपको अंक मिले, और धीरे-धीरे सीखते हैं कि क्या काम करता है। आप यह समझने की कोशिश नहीं करते कि क्यों गेम काम करता है; आप बस यह सीखते हैं कि क्या काम करता है। अधिकांश आधुनिक वीडियो गेम AI और मानव शिक्षार्थी इसी तरह काम करते हैं।

समस्या: लंबे समय तक वैज्ञानिकों का मानना था कि एक "परफेक्ट" या "यूनिवर्सल" लर्नर (एक ऐसा जो केवल वीडियो गेम ही नहीं, बल्कि किसी भी वातावरण में महारत हासिल कर सके) बनने के लिए, आपको "मैप-मेकर" दृष्टिकोण का उपयोग करना ही होगा। उनका मानना था कि "ट्रायल-एंड-एरर" दृष्टिकोण को गणितीय रूप से परफेक्ट साबित करना बहुत कठिन है।

बड़ी उपलब्धि: यह पेपर AIQI (Q-Induction के साथ यूनिवर्सल AI) पेश करता है। यह पहला एजेंट है जो "ट्रायल-एंड-एरर" दृष्टिकोण का उपयोग करता है, लेकिन गणितीय रूप से यह सिद्ध किया गया है कि यह किसी भी कार्य में अंततः पूर्ण (perfect) हो जाएगा, ठीक उसी तरह जैसे "मैप-मेकर" AIXI होता है।


AIQI कैसे काम करता है: "क्रिस्टल बॉल" की उपमा

दुनिया का नक्शा बनाने के बजाय, AIQI एक क्रिस्टल बॉल की तरह काम करता है जो भविष्य के स्कोर की भविष्यवाणी करता है।

  1. लक्ष्य: किसी भी खेल में, आप समय के साथ अपने कुल स्कोर को अधिकतम करना चाहते हैं।
  2. तरीका: AIQI यह नहीं पूछता, "दुनिया क्या कर रही है?" इसके बजाय, वह पूछता है, "यदि मैं अभी क्रिया X करता हूँ, तो मेरा कुल स्कोर क्या होगा?"
  3. भविष्यवाणी: यह भविष्य के स्कोर के वितरण (distribution) का अनुमान लगाने के लिए एक विशेष लर्निंग मशीन (जिसे "प्रेडिक्टर" कहा जाता है) का उपयोग करता है। यह सटीक स्कोर का अनुमान नहीं लगाता (जो कठिन है), बल्कि यह स्कोर को "चंक्स" (chunks) में अनुमानित करता है (जैसे यह अनुमान लगाना कि स्कोर शीर्ष 10%, मध्य 10%, आदि में होगा)।
  4. लूप (Loop):
    • AIQI अपने इतिहास को देखता है।
    • वह क्रिस्टल बॉल से पूछता है: "यदि मैं A करता हूँ, तो स्कोर क्या होगा? यदि मैं B करता हूँ, तो स्कोर क्या होगा?"
    • वह उस क्रिया को चुनता है जिसका अनुमानित स्कोर सबसे अधिक होता है।
    • वह खेलता है, परिणाम प्राप्त करता है, और अगली बार अधिक सटीक होने के लिए क्रिस्टल बॉल को अपडेट करता है।

समय के साथ, क्रिस्टल बॉल इतना सटीक हो जाता है कि AIQI हमेशा सबसे अच्छी चाल चुनता है, जिससे वह बिना कोई नक्शा बनाए गेम का जीनियस बन जाता है।

"डिलेड फीडबैक" (Delayed Feedback) की पहेली

एक पेचीदा समस्या थी जिसे लेखकों को हल करना था। कई खेलों में, आपको तुरंत इनाम नहीं मिलता है। आप एक बटन दबा सकते हैं, 10 कदम प्रतीक्षा कर सकते हैं, और फिर आपको एक अंक मिलता है।

यदि आप अभी स्कोर की भविष्यवाणी करने की कोशिश करते हैं, तो आप नहीं कर सकते क्योंकि इनाम अभी तक हुआ ही नहीं है। पिछले तरीके इस "देरी" (delay) के कारण संघर्ष करते थे।

समाधान: लेखकों ने इतिहास में "खाली जगहों को भरने" का एक चतुर तरीका निकाला। कल्पना कीजिए कि आप एक डायरी लिख रहे हैं। आमतौर पर आप लिखते हैं: क्रिया -> अवलोकन -> क्रिया -> अवलोकन
AIQI लिखता है: क्रिया -> अवलोकन -> स्कोर भविष्यवाणी -> क्रिया -> अवलोकन -> स्कोर भविष्यवाणी...

यह हर कुछ चरणों के बाद इतिहास में एक "स्कोर भविष्यवाणी" डाल देता है। यह AI को भविष्य जाने बिना अपनी क्रियाओं और विलंबित पुरस्कारों (delayed rewards) के बीच संबंध सीखने की अनुमति देता है। यह अपने भविष्य के स्वयं के लिए एक नोट छोड़ने जैसा है कि "मुझे लगता है कि मुझे यहाँ एक अंक मिलेगा," और फिर बाद में यह जाँचता है कि क्या वह सही था।

"ग्रेन ऑफ ट्रुथ" (Grain of Truth) की आवश्यकता

पेपर यह सिद्ध करता है कि AIQI अंततः पूर्ण होगा, लेकिन एक शर्त है: "क्रिस्टल बॉल" को सत्य सीखने में सक्षम होना चाहिए।

इसे एक छात्र की तरह समझें जो परीक्षा दे रहा है। यदि छात्र इतना समझदार है कि सही उत्तर सीख सके, तो वह अंततः 100% प्राप्त करेगा। लेकिन यदि छात्र प्रश्न समझने के लिए बहुत कम बुद्धिमान है, तो वह कभी भी सही नहीं हो पाएगा।
पेपर "ग्रेन ऑफ ट्रुथ" की स्थिति मानता है: AI की सीखने की विधि को खेल के वास्तविक नियमों को सीखने में सक्षम होना चाहिए (भले ही खेल जटिल हो)। यदि यह शर्त पूरी होती है, तो AIQI को सर्वोत्तम रणनीति की ओर बढ़ने (converge होने) की गारंटी है।

"सेल्फ-AIXI" के बारे में क्या?

पेपर Self-AIXI का भी उल्लेख करता है, जो एक पिछला विचार है जहाँ एक AI खुद का और दुनिया का मॉडल सीखने की कोशिश करता है। लेखक बताते हैं कि उनकी नई प्रमाण तकनीकें Self-AIXI को भी ठीक कर सकती हैं, जिससे इसे अजीब, बनावटी धारणाओं के बिना अधिक विश्वसनीय बनाया जा सके।

सावधानी: यह "सेल्फ-ऑप्टिमाइज़िंग" नहीं है

पेपर एक महत्वपूर्ण अंतर बताता है। AIQI On-Policy है, जिसका अर्थ है कि यह उन क्रियाओं के आधार पर सीखता है जो यह वर्तमान में ले रहा है।

  • उपमा: कल्पना कीजिए कि एक छात्र केवल उस पाठ्यपुस्तक को पढ़ता है जिसे वह वर्तमान में पढ़ रहा है। यदि वह एक खराब पाठ्यपुस्तक पढ़ना शुरू करता है, तो वह गलत चीजें सीख जाएगा।
  • सीमा: यदि आप AIQI को किसी और को खेल खेलते हुए देखने के लिए मजबूर करते हैं (एक "हिस्टोरिक पॉलिसी"), तो यह भ्रमित हो सकता है और सर्वोत्तम रणनीति खोजने में विफल हो सकता है। यह अपने स्वयं के अनुभव से सीखने में बहुत अच्छा है, लेकिन दूसरों की गलतियों से सीखने में आवश्यक रूप से अच्छा नहीं है। यह AIXI से अलग है, जो सैद्धांतिक रूप से किसी भी स्रोत से सीख सकता है।

सारांश

  • यह क्या है? AIQI एक नए प्रकार का AI है जो दुनिया का मॉडल बनाने के बजाय सीधे भविष्य के पुरस्कारों की भविष्यवाणी करके सीखता है।
  • यह क्यों विशेष है? यह पहला "मॉडल-फ्री" AI है जो किसी भी वातावरण के लिए लंबे समय में गणितीय रूप से पूर्ण होने के लिए सिद्ध है।
  • यह कैसे काम करता है? यह भविष्य के स्कोर का अनुमान लगाने के लिए "क्रिस्टल बॉल" का उपयोग करता है, वास्तविक परिणामों के आधार पर अपने अनुमानों को अपडेट करता है, और उच्चतम अनुमानित स्कोर वाली क्रिया चुनता है।
  • परिणाम: यह सिद्ध करता है कि पूर्ण शिक्षक बनने के लिए आपको दुनिया के मानसिक नक्शे की आवश्यकता नहीं है; आपको बस भविष्य के स्कोर की भविष्यवाणी करने का एक अच्छा तरीका चाहिए।

यह कार्य "यूनिवर्सल एजेंट्स" के परिवार का विस्तार करता है, यह दिखाते हुए कि "यूनिवर्सल" बनने के कई तरीके हैं, न कि केवल "मैप-मेकर" वाला तरीका।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →