← नवीनतम पेपर
🤖 machine learning

ASH: Agents that Self-Hone via Embodied Learning

यह शोध पत्र ASH को प्रस्तुत करता है, जो एक स्व-सुधार करने वाला एजेंटिक सिस्टम है जो अनलेबल इंटरनेट वीडियो से एम्बोडीड पॉलिसीज़ (embodied policies) सीखता है, जिसमें अपनी विफलताओं से पर्यवेक्षण (supervision) निकालने के लिए एक इनवर्स डायनेमिक्स मॉडल का लाभ उठाया जाता है, जिससे यह पोकेमोन और ज़ेल्डा जैसे जटिल खेलों में लंबी अवधि के कार्यों (long-horizon tasks) को सफलतापूर्वक पूरा करने में सक्षम होता है जहाँ मौजूदा बेसलाइन विफल हो जाते हैं।

मूल लेखक: Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कोई बहुत लंबा और जटिल वीडियो गेम खेलना सीखना चाह रहे हैं, जैसे कि Pokémon या The Legend of Zelda, लेकिन आपके पास कोई निर्देश पुस्तिका (instruction manual) नहीं है, कोई शिक्षक नहीं है, और न ही कोई यह बताने वाला है कि कौन से बटन दबाने हैं। अधिकांश कंप्यूटर प्रोग्राम जो ऐसा करने की कोशिश करते हैं, वे कुछ घंटों के बाद अटक जाते हैं क्योंकि वे पहले से लिखे गए नियमों या डेटा की विशाल मात्रा पर निर्भर करते हैं जिसे मनुष्यों ने सावधानीपूर्वक लेबल किया होता है।

यह शोध पत्र एक नई प्रणाली पेश करता है जिसे ASH (Agents that Self-Hone via Embodied Learning) कहा जाता है। ASH को एक ऐसे रोबोट के रूप में न सोचें जो किसी स्क्रिप्ट का पालन करता है, बल्कि इसे एक जिज्ञासु मानव खिलाड़ी के रूप में समझें जिसे Google चलाना आता है

ASH कैसे काम करता है, यहाँ इसके सरल चरणों में विवरण दिया गया है:

1. "अटक जाने" का क्षण (The "Stuck" Moment)

ASH गेम खेलना शुरू करता है। इसके पास एक अल्पकालिक स्मृति (पिछले 30 सेकंड में क्या हुआ) और एक दीर्घकालिक स्मृति (महत्वपूर्ण क्षण जो इसने पहले देखे हैं) होती है। यह तब तक खेलता रहता है जब तक कि यह किसी बाधा से टकरा न जाए। शायद इसे नहीं पता कि किसी राक्षस से कैसे लड़ना है, या इसे नहीं पता कि भूलभुलैया में कौन सा रास्ता लेना है। शोध के शब्दों में, यह "अटक" जाता है।

2. "Google सर्च" (The "Google Search")

जब ASH अटक जाता है, तो वह हार नहीं मानता। इसके बजाय, यह स्क्रीन पर जो कुछ भी अभी देखा है उसे देखता है और इंटरनेट पर (विशेष रूप से, YouTube वीडियो के एक विशाल संग्रह में) दूसरे लोगों को गेम खेलते हुए खोजने के लिए बाहर निकलता है। यह उन वीडियो को खोजता है जो बिल्कुल उसी क्षण के समान दिखते हैं जिसमें यह वर्तमान में अटका हुआ है।

3. "स्मार्ट फ़िल्टर" (The "Smart Filter")

इंटरनेट शोर से भरा है। ASH केवल रैंडम वीडियो नहीं देखता; यह मुख्य क्षणों को खोजने के लिए एक विशेष टूल का उपयोग करता है। कल्पना कीजिए कि आप किसी के गेम खेलने का 20 घंटे का वीडियो देख रहे हैं; आपको बॉस से लड़ने की रणनीति सीखने के लिए पूरा वीडियो देखने की आवश्यकता नहीं है। आपको बस उन विशिष्ट 30 सेकंड को देखने की आवश्यकता है जहाँ वे रणनीति का पता लगाते हैं। ASH स्वचालित रूप से इन "हाइलाइट रील्स" को खोजता है और उन्हें अपनी दीर्घकालिक स्मृति में सहेज लेता है।

4. "रिवर्स इंजीनियरिंग" (The "Reverse Engineering")

यहाँ पेचीदा हिस्सा है: ASH द्वारा खोजे गए इंटरनेट वीडियो आमतौर पर केवल स्क्रीन दिखाते हैं, बटन दबाने की क्रिया नहीं। इसके पास एक "अनुवादक" (जिसे इनवर्स डायनेमिक्स मॉडल कहा जाता है) है जो वीडियो को देखता है और अनुमान लगाता है, "ठीक है, इस स्क्रीन से उस स्क्रीन तक पहुँचने के लिए, खिलाड़ी ने 'A' और फिर 'Up' दबाया होगा।" यह मूक वीडियो को निर्देशों के एक सेट में बदल देता है।

5. "स्व-सुधार" लूप (The "Self-Improvement" Loop)

अब, ASH उन नए निर्देशों को लेता है और उनका अभ्यास करता है। यह अपने स्वयं के मस्तिष्क (अपनी पॉलिसी) को अपडेट करता है ताकि अगली बार जब यह अटके, तो इसे पता हो कि क्या करना है। फिर यह वापस गेम खेलने में लग जाता है। यदि यह बाद में किसी अन्य समस्या पर फिर से अटक जाता है, तो यह पूरी प्रक्रिया को दोहराता है: अटकना, इंटरनेट पर खोजना, ट्रिक सीखना, और चलते रहना।

परिणाम: यह क्यों महत्वपूर्ण है

शोधकर्ताओं ने ASH का परीक्षण दो बहुत अलग खेलों में किया:

  • Pokémon Emerald: एक रणनीतिक गेम जहाँ आप यात्रा करते हैं, राक्षसों को पकड़ते हैं और लड़ाई करते हैं।
  • The Legend of Zelda: The Minish Cap: एक एक्शन गेम जहाँ आप वास्तविक समय में दौड़ते हैं, कूदते हैं, पहेलियाँ सुलझाते हैं और दुश्मनों से लड़ते हैं।

उन्होंने ASH की तुलना अन्य AI विधियों से की:

  • "पाठ्यपुस्तक" सीखने वाला (The "Textbook" Learner): ये सिस्टम पहले से लेबल किए गए मूव्स के एक विशाल डेटासेट से सीखने की कोशिश करते हैं। वे जल्दी ही अटक जाते क्योंकि वे उन नई स्थितियों को नहीं संभाल पाते जो उन्होंने पहले नहीं देखी थीं।
  • "प्रतिभाशाली" मॉडल (The "Genius" Model): ये विशाल AI मॉडल हैं जो बिना प्रशिक्षण के उत्तर का अनुमान लगाने की कोशिश करते हैं। वे अक्सर "हैलुसिनेट" करते हैं (चीजें बना लेते हैं) और दीवारों से टकरा जाते हैं या गैर-मौजूद पात्रों के बारे में बात करने लगते हैं।
  • ASH: ASH बेहतर होता गया। जबकि अन्य सिस्टम लगभग 6 घंटे के बाद प्रगति करना बंद कर देते हैं, ASH 8 घंटे तक चलता रहा, नए कौशल सीखता रहा जैसे कि लड़ना, राक्षसों को पकड़ना और पहेलियाँ सुलझाना। इसने दोनों खेलों में लगभग सभी प्रमुख लक्ष्यों को पूरा किया।

बड़ी तस्वीर (The Big Picture)

यह शोध पत्र दावा करता है कि ASH यह सिद्ध करता है कि आपको AI को एक लंबे, जटिल कार्य सिखाने के लिए किसी मनुष्य द्वारा रिवॉर्ड सिस्टम लिखने या हर एक वीडियो को लेबल करने की आवश्यकता नहीं है। इसके बजाय, यदि आप एक AI को अटकने, इंटरनेट पर मदद खोजने और उससे सीखने की क्षमता देते हैं, तो यह खुद को लंबे, खुले अंत वाले रोमांचों में महारत हासिल करने के लिए सिखा सकता है।

यह एक बच्चे को साइकिल चलाना सिखाने जैसा है—मैनुअल लिखकर नहीं, बल्कि उसे गिरने देना, किसी और को साइकिल चलाते हुए वीडियो देखने देना, और फिर से प्रयास करने देना। ASH पहला ऐसा सिस्टम है जो सफलतापूर्वक इस लूप को जटिल वीडियो गेम में स्वचालित रूप से पूरा करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →