ASH: Agents that Self-Hone via Embodied Learning
यह शोध पत्र ASH को प्रस्तुत करता है, जो एक स्व-सुधार करने वाला एजेंटिक सिस्टम है जो अनलेबल इंटरनेट वीडियो से एम्बोडीड पॉलिसीज़ (embodied policies) सीखता है, जिसमें अपनी विफलताओं से पर्यवेक्षण (supervision) निकालने के लिए एक इनवर्स डायनेमिक्स मॉडल का लाभ उठाया जाता है, जिससे यह पोकेमोन और ज़ेल्डा जैसे जटिल खेलों में लंबी अवधि के कार्यों (long-horizon tasks) को सफलतापूर्वक पूरा करने में सक्षम होता है जहाँ मौजूदा बेसलाइन विफल हो जाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप कोई बहुत लंबा और जटिल वीडियो गेम खेलना सीखना चाह रहे हैं, जैसे कि Pokémon या The Legend of Zelda, लेकिन आपके पास कोई निर्देश पुस्तिका (instruction manual) नहीं है, कोई शिक्षक नहीं है, और न ही कोई यह बताने वाला है कि कौन से बटन दबाने हैं। अधिकांश कंप्यूटर प्रोग्राम जो ऐसा करने की कोशिश करते हैं, वे कुछ घंटों के बाद अटक जाते हैं क्योंकि वे पहले से लिखे गए नियमों या डेटा की विशाल मात्रा पर निर्भर करते हैं जिसे मनुष्यों ने सावधानीपूर्वक लेबल किया होता है।
यह शोध पत्र एक नई प्रणाली पेश करता है जिसे ASH (Agents that Self-Hone via Embodied Learning) कहा जाता है। ASH को एक ऐसे रोबोट के रूप में न सोचें जो किसी स्क्रिप्ट का पालन करता है, बल्कि इसे एक जिज्ञासु मानव खिलाड़ी के रूप में समझें जिसे Google चलाना आता है।
ASH कैसे काम करता है, यहाँ इसके सरल चरणों में विवरण दिया गया है:
1. "अटक जाने" का क्षण (The "Stuck" Moment)
ASH गेम खेलना शुरू करता है। इसके पास एक अल्पकालिक स्मृति (पिछले 30 सेकंड में क्या हुआ) और एक दीर्घकालिक स्मृति (महत्वपूर्ण क्षण जो इसने पहले देखे हैं) होती है। यह तब तक खेलता रहता है जब तक कि यह किसी बाधा से टकरा न जाए। शायद इसे नहीं पता कि किसी राक्षस से कैसे लड़ना है, या इसे नहीं पता कि भूलभुलैया में कौन सा रास्ता लेना है। शोध के शब्दों में, यह "अटक" जाता है।
2. "Google सर्च" (The "Google Search")
जब ASH अटक जाता है, तो वह हार नहीं मानता। इसके बजाय, यह स्क्रीन पर जो कुछ भी अभी देखा है उसे देखता है और इंटरनेट पर (विशेष रूप से, YouTube वीडियो के एक विशाल संग्रह में) दूसरे लोगों को गेम खेलते हुए खोजने के लिए बाहर निकलता है। यह उन वीडियो को खोजता है जो बिल्कुल उसी क्षण के समान दिखते हैं जिसमें यह वर्तमान में अटका हुआ है।
3. "स्मार्ट फ़िल्टर" (The "Smart Filter")
इंटरनेट शोर से भरा है। ASH केवल रैंडम वीडियो नहीं देखता; यह मुख्य क्षणों को खोजने के लिए एक विशेष टूल का उपयोग करता है। कल्पना कीजिए कि आप किसी के गेम खेलने का 20 घंटे का वीडियो देख रहे हैं; आपको बॉस से लड़ने की रणनीति सीखने के लिए पूरा वीडियो देखने की आवश्यकता नहीं है। आपको बस उन विशिष्ट 30 सेकंड को देखने की आवश्यकता है जहाँ वे रणनीति का पता लगाते हैं। ASH स्वचालित रूप से इन "हाइलाइट रील्स" को खोजता है और उन्हें अपनी दीर्घकालिक स्मृति में सहेज लेता है।
4. "रिवर्स इंजीनियरिंग" (The "Reverse Engineering")
यहाँ पेचीदा हिस्सा है: ASH द्वारा खोजे गए इंटरनेट वीडियो आमतौर पर केवल स्क्रीन दिखाते हैं, बटन दबाने की क्रिया नहीं। इसके पास एक "अनुवादक" (जिसे इनवर्स डायनेमिक्स मॉडल कहा जाता है) है जो वीडियो को देखता है और अनुमान लगाता है, "ठीक है, इस स्क्रीन से उस स्क्रीन तक पहुँचने के लिए, खिलाड़ी ने 'A' और फिर 'Up' दबाया होगा।" यह मूक वीडियो को निर्देशों के एक सेट में बदल देता है।
5. "स्व-सुधार" लूप (The "Self-Improvement" Loop)
अब, ASH उन नए निर्देशों को लेता है और उनका अभ्यास करता है। यह अपने स्वयं के मस्तिष्क (अपनी पॉलिसी) को अपडेट करता है ताकि अगली बार जब यह अटके, तो इसे पता हो कि क्या करना है। फिर यह वापस गेम खेलने में लग जाता है। यदि यह बाद में किसी अन्य समस्या पर फिर से अटक जाता है, तो यह पूरी प्रक्रिया को दोहराता है: अटकना, इंटरनेट पर खोजना, ट्रिक सीखना, और चलते रहना।
परिणाम: यह क्यों महत्वपूर्ण है
शोधकर्ताओं ने ASH का परीक्षण दो बहुत अलग खेलों में किया:
- Pokémon Emerald: एक रणनीतिक गेम जहाँ आप यात्रा करते हैं, राक्षसों को पकड़ते हैं और लड़ाई करते हैं।
- The Legend of Zelda: The Minish Cap: एक एक्शन गेम जहाँ आप वास्तविक समय में दौड़ते हैं, कूदते हैं, पहेलियाँ सुलझाते हैं और दुश्मनों से लड़ते हैं।
उन्होंने ASH की तुलना अन्य AI विधियों से की:
- "पाठ्यपुस्तक" सीखने वाला (The "Textbook" Learner): ये सिस्टम पहले से लेबल किए गए मूव्स के एक विशाल डेटासेट से सीखने की कोशिश करते हैं। वे जल्दी ही अटक जाते क्योंकि वे उन नई स्थितियों को नहीं संभाल पाते जो उन्होंने पहले नहीं देखी थीं।
- "प्रतिभाशाली" मॉडल (The "Genius" Model): ये विशाल AI मॉडल हैं जो बिना प्रशिक्षण के उत्तर का अनुमान लगाने की कोशिश करते हैं। वे अक्सर "हैलुसिनेट" करते हैं (चीजें बना लेते हैं) और दीवारों से टकरा जाते हैं या गैर-मौजूद पात्रों के बारे में बात करने लगते हैं।
- ASH: ASH बेहतर होता गया। जबकि अन्य सिस्टम लगभग 6 घंटे के बाद प्रगति करना बंद कर देते हैं, ASH 8 घंटे तक चलता रहा, नए कौशल सीखता रहा जैसे कि लड़ना, राक्षसों को पकड़ना और पहेलियाँ सुलझाना। इसने दोनों खेलों में लगभग सभी प्रमुख लक्ष्यों को पूरा किया।
बड़ी तस्वीर (The Big Picture)
यह शोध पत्र दावा करता है कि ASH यह सिद्ध करता है कि आपको AI को एक लंबे, जटिल कार्य सिखाने के लिए किसी मनुष्य द्वारा रिवॉर्ड सिस्टम लिखने या हर एक वीडियो को लेबल करने की आवश्यकता नहीं है। इसके बजाय, यदि आप एक AI को अटकने, इंटरनेट पर मदद खोजने और उससे सीखने की क्षमता देते हैं, तो यह खुद को लंबे, खुले अंत वाले रोमांचों में महारत हासिल करने के लिए सिखा सकता है।
यह एक बच्चे को साइकिल चलाना सिखाने जैसा है—मैनुअल लिखकर नहीं, बल्कि उसे गिरने देना, किसी और को साइकिल चलाते हुए वीडियो देखने देना, और फिर से प्रयास करने देना। ASH पहला ऐसा सिस्टम है जो सफलतापूर्वक इस लूप को जटिल वीडियो गेम में स्वचालित रूप से पूरा करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।