← नवीनतम पेपर
🤖 machine learning

Automatic Generation of High-Performance RL Environments

यह शोध पत्र एक क्लोज्ड-लूप कार्यप्रणाली प्रस्तुत करता है जो जेनेरिक प्रॉम्प्ट्स, पदानुक्रमित सत्यापन (hierarchical verification) और पुनरावृत्ति सुधार (iterative repair) का उपयोग करके न्यूनतम कंप्यूट लागत के साथ उच्च-प्रदर्शन वाले सुदृढीकरण लर्निंग (reinforcement learning) वातावरण को स्वचालित रूप से उत्पन्न करता है ताकि प्रत्यक्ष अनुवाद, प्रदर्शन समानता सत्यापन और नवीन वातावरण निर्माण सहित विविध वर्कफ़्लो में समानता सुनिश्चित की जा सके।

मूल लेखक: Seth Karten, Rahul Dev Appapogu, Chi Jin

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seth Karten, Rahul Dev Appapogu, Chi Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं। आमतौर पर, रोबोट अपना 90% समय बस अगले फ्रेम के लोड होने का इंतज़ार करने में बिता देता है, जैसे कोई छात्र शिक्षक द्वारा ब्लैकबोर्ड पर नया सवाल लिखने का इंतज़ार कर रहा हो। वास्तविक "सोचने" (सीखने) की प्रक्रिया एक पलक झपकते ही होती है, लेकिन "खेलना" बेहद धीमा होता है।

द दशकों से, यदि आप चाहते थे कि वह गेम रोबोट के लिए तेज़ चले, तो आपको एक विशेषज्ञ इंजीनियरों की टीम को काम पर रखना पड़ता था जो उस गेम के कोड को शुरू से फिर से लिखने के लिए तैयार करती। यह ऐसा था जैसे किसी घर के दरवाज़ों को तेज़ी से खोलने के लिए एक कुशल बढ़ई को घर को ईंट-दर-ईंट फिर से बनाने के लिए नियुक्त करना। इसमें महीनों लग जाते थे और बहुत पैसा खर्च होता था।

यह पेपर इसे करने का एक नया तरीका पेश करता है: एक "स्व-मरम्मत करने वाला अनुवादक" (self-repairing translator) जो मिनटों में, महीनों के बजाय, रोबोट के लिए हाई-स्पीड वीडियो गेम बनाता है।

उन्होंने इसे कैसे किया, यहाँ सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "स्लो मोशन" की बाधा

रिनफोर्समेंट लर्निंग (RL) में, रोबोट लाखों राउंड खेलकर सीखता है। यदि गेम इंजन (सिमुलेटर) किसी धीमी भाषा (जैसे Python या मानक वेब कोड) में लिखा गया है, तो रोबोट 90% समय खाली बैठा रहता है। पेपर इसे "एनवायरनमेंट बॉटलनेक" (environment bottleneck) कहता है। यह एक फेरारी इंजन (AI) को गो-कार्ट चेसिस (धीमे गेम) में फँसा देने जैसा है।

2. समाधान: "क्लोज्ड-लूप ट्रांसलेटर"

लेखकों ने एक ऐसा सिस्टम बनाया है जहाँ एक AI कोडिंग एजेंट एक अनुवादक के रूप में कार्य करता है। यह मूल, धीमे गेम कोड को लेता है और उसे एक सुपर-फास्ट भाषा (जैसे JAX या Rust) में फिर से लिख देता है।

लेकिन यहाँ एक पेंच है: यदि आप केवल AI से "इस गेम को फिर से लिखो" कहेंगे, तो हो सकता है कि वह एक छोटी सी गलती कर दे। गेम में, एक छोटी सी गलती (जैसे एक सिक्के की कीमत 1 के बजाय 2 होना) एक राउंड के लिए मायने नहीं रख सकती है, लेकिन 10,000 राउंड के बाद, रोबोट गलत नियम सीख जाता है और पूरी तरह विफल हो जाता है। इसे "साइलेंट एरर" (silent error) कहा जाता है।

इसे ठीक करने के लिए, लेखकों ने एक चार-स्तरीय "सेफ्टी नेट" बनाया है जो एक सख्त गुणवत्ता नियंत्रण निरीक्षक की तरह कार्य करता है:

  • स्तर 1: घटक की जाँच (ईंटें)
    AI गेम का एक छोटा सा हिस्सा (जैसे गेंद के उछलने का भौतिक विज्ञान) अनुवादित करता है और तुरंत उसे अलग से टेस्ट करता है। यह यह जाँचने जैसा है कि दीवार बनाने से पहले क्या एक अकेली ईंट सीधी और चौकोर है।
  • स्तर 2: इंटरेक्शन की जाँच (दीवार)
    AI जाँचता है कि हिस्से एक साथ कैसे काम करते हैं। क्या गेंद पैडल से सही ढंग से टकराती है? यह सुनिश्चित करता है कि "ईंटें" आपस में सही ढंग से फिट बैठती हैं।
  • स्तर 3: रोलआउट चेक (पूरा गेम)
    AI मूल धीमे संस्करण और नए तेज़ संस्करण दोनों में, बिल्कुल एक ही चालों का उपयोग करके, एक पूरा गेम खेलता है। यदि स्कोर या गेम की स्थिति में थोड़ा भी अंतर आता है, तो AI को पता चल जाता है कि कुछ गलत है और वह इसे ठीक करने के लिए वापस जाता है।
  • स्तर 4: "सिम-टू-सिम" ट्रांसफर (अंतिम परीक्षा)
    यह सबसे चतुर हिस्सा है। AI नए, तेज़ संस्करण में एक रोबोट को खेलना सिखाता है। फिर, वह उस प्रशिक्षित रोबोट को पुराने, धीमे संस्करण में डालता है ताकि यह देखा जा सके कि क्या वह अभी भी अच्छी तरह खेल पा रहा है। यदि रोबोट पुराने संस्करण में भी उतना ही अच्छा प्रदर्शन करता है, तो यह साबित होता है कि नया संस्करण एक सटीक प्रतिलिपि है। यदि रोबोट खराब खेलता है, तो सिस्टम को पता चल जाता है कि अनुवाद दोषपूर्ण है और वह फिर से शुरू कर देता है।

3. परिणाम: "इंतज़ार" से "उड़ान" तक

टीम ने पांच बहुत अलग वातावरणों पर इसका परीक्षण किया, जिसमें एक गेम बॉय एमुलेटर से लेकर एक जटिल पोकेमोन बैटल सिम्युलेटर तक शामिल है।

  • "पोकेमोन" का उदाहरण: उन्होंने एक पोकेमोन बैटल सिम्युलेटर लिया जो वेब कोड (TypeScript) में लिखा गया था। यह धीमा था, जो प्रति सेकंड लगभग 681 युद्ध (battles) संभाल सकता था। उनके AI ने इसे एक उच्च-प्रदर्शन वाली भाषा (JAX) में अनुवादित किया। परिणाम? यह प्रति सेकंड 15.2 मिलियन युद्ध संभाल सकता था। यह 22,000 गुना तेज़ है।
  • "गेम बॉय" का उदाहरण: उन्होंने एक गेम बॉय एमुलेटर को अनुवादित किया। नया संस्करण 1.5 गुना तेज़ था, लेकिन इससे भी महत्वपूर्ण बात यह थी कि इसने रोबोट को एक ही कंप्यूटर पर एक साथ 128 गेम इंस्टेंस चलाने की अनुमति दी, जबकि पुराना संस्करण केवल 32 ही चला सकता था।
  • "TCG" का उदाहरण: उन्होंने केवल एक वेबसाइट से नियम पढ़कर और उन्हें कोड में अनुवादित करके, एक बिल्कुल नया पोकेमोन कार्ड गेम वातावरण भी बनाया।

4. निचोड़ (The Bottom Line)

पेपर का दावा है कि इस पद्धति के साथ:

  1. गति: रोबोट के लिए "इंतज़ार का समय" कुल प्रशिक्षण समय के 50-90% से घटकर 4% से भी कम हो गया। रोबोट अब लगभग सारा समय सोचने में बिता रहा है, इंतज़ार करने में नहीं।
  2. सटीकता: चार-स्तरीय सेफ्टी नेट के कारण, नए तेज़ गेम मूल धीमे गेम्स के गणितीय रूप से समान हैं। तेज़ संस्करणों पर प्रशिक्षित रोबोट ठीक वैसा ही प्रदर्शन करते हैं जैसा धीमे संस्करणों पर प्रशिक्षित रोबोट करते हैं।
  3. लागत: मानव इंजीनियरिंग के महीनों के बजाय, अनुवाद में कंप्यूटर समय के कुछ डॉलर और कुछ घंटे लगते हैं।

संक्षेप में: उन्होंने एक ऐसी मशीन बनाई है जो एक धीमे, बोझिल वीडियो गेम को तुरंत एक हाई-स्पीड रेसिंग वर्जन में फिर से बना सकती है, जिसमें एक अंतर्निहित निरीक्षक (inspector) है जो गारंटी देता है कि नियम बदले नहीं हैं, जिससे AI रोबोट हजारों गुना तेज़ी से सीख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →