← नवीनतम पेपर
🤖 AI

Distilling Game Code World Model Generation into Lightweight Large Language Models

यह शोध पत्र एक स्केलेबल पोस्ट-ट्रेनिंग पाइपलाइन का प्रस्ताव करता है जो सुपरवाइज्ड फाइन-ट्यूनिंग और वेरिफिएबल रिवॉर्ड्स के साथ रिइन्फोर्समेंट लर्निंग को जोड़ता है ताकि फ्रंटियर मॉडल्स से गेम कोड वर्ल्ड मॉडल जनरेशन क्षमताओं को एक हल्के 3B-पैरामीटर वाले LLM में डिस्टिल किया जा सके, जिससे यह प्राकृतिक भाषा के नियमों से सटीक रूप से निष्पादन योग्य (executable) गेम वातावरण उत्पन्न करने में सक्षम हो सके।

मूल लेखक: Tyrone Serapio, Arjun Prakash, Haoyang Xu, Kevin Wang, Amy Greenwald

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tyrone Serapio, Arjun Prakash, Haoyang Xu, Kevin Wang, Amy Greenwald

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसा रोबोट बनाना चाहते हैं जो आपके द्वारा बताए गए किसी भी बोर्ड गेम को खेल सके, जैसे कि चेस से लेकर पोकर तक। इसे करने के लिए, रोबोट को एक "नियम पुस्तिका" (rulebook) की आवश्यकता होगी जो उसे ठीक से बताए कि खेल कैसे काम करता है: मोहरे कैसे चलते हैं, जीत किसे माना जाता है, और यदि कोई खिलाड़ी गलती करता है तो क्या होता है।

अतीत में, इन नए खेलों के लिए नियम पुस्तिकाएं बनाना ऐसा था जैसे हर बार कोड को शून्य से लिखने के लिए विशेषज्ञ इंजीनियरों की एक टीम को काम पर रखना। यह धीमा, महंगा और बहुत स्मार्ट (और बहुत महंगी) कंप्यूटरों की आवश्यकता वाला काम था ताकि वे विवरणों को समझ सकें।

यह शोध पत्र इस कार्य को करने का एक नया तरीका प्रस्तावित करता है: एक छोटे, सस्ते कंप्यूटर को खुद नियम पुस्तिकाएं लिखना सिखाना।

यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "प्रतिभाशाली शिक्षक" बनाम "शिक्षु" (The "Genius Tutor" vs. The "Apprentice")

वर्तमान में, यदि आप चाहते हैं कि कोई कंप्यूटर खेल के नियम उत्पन्न करे (जिसे लेखक गेम कोड वर्ल्ड मॉडल कहते हैं), तो आपको एक "प्रतिभाशाली शिक्षक" (एक विशाल, महंगी AI जैसे GPT-4 या Gemini) से पूछना पड़ता है।

  • पुराना तरीका: आप प्रतिभाशाली शिक्षक से पूछते हैं, "इस नए खेल के नियम लिखो।" यदि वह कोई गलती करता है, तो आप कोड की जांच करते हैं, त्रुटि बताते हैं, और प्रतिभाशाली शिक्षक से फिर से प्रयास करने के लिए कहते हैं। आपको यह चक्र दर्जनों बार करना पड़ सकता है। यह एक विश्व स्तरीय शेफ को एक साधारण सैंडविच बनाने के लिए काम पर रखने जैसा है, लेकिन आपको बार-बार उसे चखना पड़ता है और रसोई में वापस भेजना पड़ता है जब तक कि वह एकदम सही न हो जाए। यह काम करता है, लेकिन यह धीमा है और इसमें बहुत पैसा खर्च होता है।

2. समाधान: ज्ञान का आसवन (Distilling the Knowledge)

लेखक देखना चाहते थे कि क्या वे एक छोटे, हल्के AI (एक "शिक्षु") को बिना प्रतिभाशाली शिक्षक की मदद के यह काम करने के लिए प्रशिक्षित कर सकते हैं। वे इस प्रक्रिया को "डिस्टिलिंग" (Distilling) कहते हैं।

इसे ऐसे समझें जैसे एक मास्टर शेफ (बड़ी AI) एक जूनियर शेफ (छोटी AI) को खाना बनाना सिखा रहा हो। ऐसा नहीं कि जूनियर शेफ हर बार प्याज काटते समय मास्टर से मदद मांगे, बल्कि मास्टर जूनियर शेफ को तब तक प्रशिक्षित करता है जब तक कि जूनियर शेफ अपने दम पर व्यंजन को पूरी तरह से बनाना न सीख जाए।

3. प्रशिक्षण प्रक्रिया: दो चरण

लेखकों ने छोटे AI (Qwen2.5-3B) को गेम-रूल विशेषज्ञ में बदलने के लिए दो-चरणीय प्रशिक्षण पाइपलाइन का उपयोग किया:

  • चरण 1: सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) - "कुकबुक"
    उन्होंने छोटे AI को 30 अलग-अलग खेल (जैसे टिक-टैक-टो, पोकर और ब्लैकजैक) और उन खेलों के काम करने के सही कोड दिखाए। यह शिक्षु को रेसिपी की एक स्टैक देने जैसा है और कहने जैसा है, "इन रेसिपीज़ को याद कर लो।"

    • परिणाम: AI टाइपिंग की गलतियों या सिंटैक्स त्रुटियों (जैसे कॉमा या ब्रैकेट भूल जाना) के बिना कोड लिखने में बहुत बेहतर हो गया।
  • चरण 2: सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण सीखना (RLVR) - "स्वाद परीक्षण"
    केवल रेसिपी याद करना ही काफी नहीं है; भोजन का स्वाद भी सही होना चाहिए। लेखकों ने एक स्वचालित "स्वाद परीक्षक" (वेरिफिकेशन फ्रेमवर्क) बनाया।

    • AI एक गेम नियम पुस्तिका लिखने की कोशिश करता है।
    • "स्वाद परीक्षक" कोड को चलाता है। क्या गेम क्रैश हो रहा है? क्या नियम समझ में आ रहे हैं? क्या खेल सही ढंग से समाप्त होता है?
    • यदि कोड परीक्षण पास कर लेता है, तो AI को एक "पुरस्कार" (पॉइंट्स) मिलता है। यदि वह विफल होता है, तो उसे दंड मिलता है।
    • AI बार-बार प्रयास करता है, इन पुरस्कारों से सीखता है कि ऐसा कोड कैसे लिखा जाए जो वास्तव में काम करे, न कि केवल वह कोड जो दिखने में सही लगे।

4. परिणाम: क्या काम किया और क्या नहीं

लेखकों ने अपने प्रशिक्षित "शिक्षु" का परीक्षण उन खेलों पर किया जिन्हें उसने पहले कभी नहीं देखा था (Out-of-Distribution गेम्स)।

  • अच्छी खबर: प्रशिक्षित छोटा AI वैध गेम कोड लिखने में काफी बेहतर हो गया। इसने सिंटैक्स त्रुटियों से बचना सीख लिया और गेम के नियमों के बुनियादी ढांचे का पालन करना बहुत बेहतर तरीके से सीखा। इसने साबित कर दिया कि आप एक छोटे मॉडल को यह काम करने के लिए प्रशिक्षित कर सकते हैं, बिना हर एक लाइन की जांच के लिए महंगी "प्रतिभाशाली शिक्षक" की आवश्यकता के।
  • बुरी खबर: AI अभी भी सबसे जटिल खेलों के साथ संघर्ष कर रहा था, विशेष रूप से वे जिनमें छिपी हुई जानकारी (जैसे पोकर, जहाँ आपको नहीं पता कि आपके प्रतिद्वंद्वी के पास कौन से कार्ड हैं) होती है।
    • उपमा: शिक्षु एक बेहतरीन ग्रिल्ड चीज़ सैंडविच (सरल खेल) और यहाँ तक कि एक जटिल लाज़ानिया (पूर्ण जानकारी वाले खेल) भी बना सकता है। लेकिन जब उसे वह व्यंजन बनाने के लिए कहा जाता है जिसमें दूसरे व्यक्ति के विचारों का अनुमान लगाना शामिल हो (अपूर्ण जानकारी वाले खेल), तो शिक्षु भ्रमित हो जाता है और कभी-कभी बस हार मान लेता है या एक सरल, गलत संस्करण लिख देता है।
    • दिलचस्प बात यह है कि "प्रतिभाशाली शिक्षक" (GPT-4) भी इन जटिल छिपी हुई जानकारी वाले खेलों के साथ संघर्ष कर रहा था, जो यह दर्शाता है कि यह सभी वर्तमान AI के लिए एक बहुत कठिन समस्या है।

5. निष्कर्ष (The Bottom Line)

यह शोध पत्र दिखाता है कि हम महंगी, विशाल AI मॉडलों की जटिल गेम नियम उत्पन्न करने की क्षमता को प्रशिक्षण के माध्यम से एक छोटे, सस्ते मॉडल में "डिस्टिल" कर सकते हैं।

  • पहले: आपको एक गेम इंजन बनाने के लिए सुपरकंप्यूटर और बहुत अधिक समय की आवश्यकता थी।
  • अब: आप एक छोटा, कुशल मॉडल प्रशिक्षित कर सकते हैं, बशर्ते खेल बहुत अधिक जटिल न हो।

लेखक निष्कर्ष निकालते हैं कि हालांकि यह छोटा मॉडल अभी भी पूर्ण नहीं है (विशेष रूप से गुप्त सूचनाओं वाले कठिन खेलों के लिए), यह AI एजेंटों के खेलने के लिए डिजिटल दुनिया को स्वचालित रूप से बनाने में आसान और सस्ता बनाने की दिशा में एक बड़ा कदम है। उन्होंने यह दावा नहीं किया कि यह चिकित्सा निदान, वित्तीय व्यापार या अन्य वास्तविक दुनिया के अनुप्रयोगों के लिए काम करता है, बल्कि केवल गेम वातावरण का अनुकरण करने वाले कोड को उत्पन्न करने के लिए है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →