← नवीनतम पेपर
🤖 machine learning

Knowledge-Conditioned, Single-Pass LLM Synthesis of Executable Unity Game Scenes: A Compiler Error Census across 26 Goal Playable Concepts

यह शोध पत्र बिना किसी पुनरावृत्ति सुधार के, एक ही बार में निष्पादन योग्य यूनिटी सी# (Unity C#) कोड उत्पन्न करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि विभिन्न मॉडलों और स्थितियों में 10,400 जनरेशन का परीक्षण करने के बावजूद, इंजन-विशिष्ट ज्ञान की मौलिक कमी के कारण कोई भी सफलतापूर्वक संकलित (compile) नहीं हो सका, जहाँ त्रुटियों को विशिष्ट गेम अवधारणा के आधार पर या तो ग्राउंडिंग संबंधी मुद्दों (बनाई गई API) या स्वच्छता संबंधी मुद्दों (संरचनात्मक दोषों) के रूप में वर्गीकृत किया गया है।

मूल लेखक: Hugh Xuechen Liu, Kıvanç Tatar

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hugh Xuechen Liu, Kıvanç Tatar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट से यूनिटी (एक लोकप्रिय गेम इंजन) में पूरी तरह से खेलने योग्य वीडियो गेम लेवल बनाने के लिए कहते हैं। बिना किसी "ओह, मुझे फिर से कोशिश करने दो" वाले लूप के। बिना किसी इंसान द्वारा टाइपिंग की गलतियों को ठीक किए। बस एक ड्राफ्ट, और बस इतना ही।

यही वह काम है जो इस शोध पत्र (paper) ने किया। शोधकर्ताओं ने चार अलग-अलग AI मॉडल्स से 26 विभिन्न प्रकार के गेम लक्ष्यों (जैसे "स्टेल्थ/Stealth," "रेस्क्यू/Rescue," या "कैप्चर/Capture") के लिए कोड लिखने को कहा। उन्होंने यह प्रयोग 10,400 बार चलाया।

बड़ा आश्चर्य: शून्य सफलताएँ
यहाँ वह कड़वा सच है जो इस पेपर ने पाया: एक भी प्रयास सफल नहीं हुआ। एक भी प्रयास रन करने योग्य गेम सीन में कंपाइल नहीं हुआ। रोबोट ने केवल कुछ गलतियाँ नहीं कीं; वह हर बार पूरी तरह से विफल रहा।

यह पेपर इस विचार को स्पष्ट रूप से खारिज करता है कि "बड़े मॉडल्स" या "बेहतर निर्देश" एक ही बार में (single pass) इसे ठीक कर देंगे। यहाँ तक कि सबसे बड़े मॉडल (30-बिलियन पैरामीटर वाला AI) और सबसे विस्तृत निर्देश गाइड (जिन्हें 'स्कीमा/schemas' कहा जाता है) भी एक भी गेम शुरू करने में सफल नहीं रहे। लेखकों ने इसे 26 अलग-अलग गेम कॉन्सेप्ट्स और प्रत्येक के लिए 20 रैंडम वेरिएशन्स के माध्यम से व्यापक रूप से मापा, ताकि कोई संदेह न रहे: एक सिंगल-शॉट प्रयास में, वर्तमान AI शून्य से एक वर्किंग यूनिटी गेम नहीं बना सकता।

गलतियों के दो प्रकार: "ग्राउंडिंग/Grounding" बनाम "हाइजीन/Hygiene"
चूंकि हर एक प्रयास विफल रहा, इसलिए शोधकर्ताओं ने केवल विफलताओं को नहीं गिना; उन्होंने उन 90,673 एरर मैसेजों का सूक्ष्म विश्लेषण किया जो कंप्यूटर ने दिए थे। उन्होंने इन एरर्स को दो मजेदार श्रेणियों में बांटा:

  1. हाइजीन एरर्स (The "Messy Room" Problems - बिखरे हुए कमरे वाली समस्याएँ): ये बुनियादी कोडिंग गलतियाँ हैं जिनका वीडियो गेम से कोई लेना-देना नहीं है। जैसे मिसिंग सेमीकोलन (semicolons), अनमैच्ड कर्ली ब्रेसेस {} या सिंटैक्स एरर्स। यह वैसा ही है जैसे कोई कहानी लिखने की कोशिश कर रहा हो लेकिन वाक्य के अंत में पूर्ण विराम लगाना भूल गया हो। AI ने बस व्याकरण (grammar) गलत कर दिया।
  2. ग्राउंडिंग एरर्स (The "Fake Dictionary" Problems - नकली डिक्शनरी वाली समस्याएँ): यह हिस्सा दिलचस्प है। ये त्रुटियाँ तब होती हैं जब AI ऐसी चीजें बना देता है जो अस्तित्व में ही नहीं हैं। यह GuardAI नामक यूनिटी टूल या DetectInvisibility नामक फंक्शन का उपयोग करके कोड लिख देता, लेकिन वे टूल्स गेम इंजन में वास्तव में मौजूद नहीं हैं। यह वैसा ही है जैसे कोई शेफ एक रेसिपी लिखे जिसमें "जादुई आटे" या "अनऑब्टेनीयम" (unobtainium) की आवश्यकता हो। AI जानता है कि वह क्या करना चाहता है (एक गार्ड को आपको डिटेक्ट करना चाहिए), लेकिन उसे यह नहीं पता कि इंजन में उस काम को करने के लिए असली टूल का नाम क्या है।

"एक-आकार-सभी-के-लिए" (One-Size-Fits-All) का मिथक टूट गया
पेपर इस तर्क के विरुद्ध है कि आप सब कुछ ठीक करने के लिए AI को केवल एक बेहतर "स्कीमा" (कोड लिखने का एक सख्त टेम्पलेट) दे सकते हैं।

  • उन्होंने AI को बिना स्कीमा के एक सख्त टेम्पलेट, एक न्यूनतम (minimal) स्कीमा, और एक पूर्ण, विस्तृत स्कीमा देकर परीक्षण किया।
  • परिणाम: सख्त टेम्पलेट्स ने कुछ मॉडल्स के लिए चीजों को वास्तव में बदतर बना दिया। इनके कारण AI भ्रमित हो गया और कोड लिखना ही बंद कर दिया (कंपाइल करने की कोशिश करने से पहले ही रिजेक्ट हो गया)। जिन मॉडल्स ने कोशिश की, उनके लिए सख्त टेम्पलेट्स ने केवल "हाइजीन" (व्याकरण) की गलतियों को साफ किया, लेकिन "ग्राउंडिंग" (नकली टूल) की गलतियों को अछूता छोड़ दिया। AI अभी भी नकली टूल्स बना रहा था, बस अब वह उन्हें एक साफ-सुथरे फॉर्मेट में कर रहा था।

कुछ गेम्स दूसरों की तुलना में कठिन क्यों थे
शोधकर्ताओं ने एक पैटर्न देखा जो इस बात पर आधारित था कि गेम को क्या करना चाहिए।

  • "फिजिक्स और सेंस" वाले गेम्स: कॉन्सेप्ट्स जैसे स्टेल्थ (बिना देखे आगे बढ़ना), रेस्क्यू (किसी को बचाना), और एक्सप्लोरेशन (चीजों को खोजना) सबसे कठिन थे। ये गेम इंजन के "परसेप्शन" (अनुभूति) और "फिजिक्स" सिस्टम पर बहुत अधिक निर्भर करते हैं। ये यहाँ मुख्य रूप से ग्राउंडिंग एरर्स के साथ विफल हुए। AI ने "विज़न कोन्स" या "पाथफाइंडिंग" के लिए जटिल, नकली सिस्टम बनाने की कोशिश की क्योंकि उसे नहीं पता था कि उन चीजों के लिए यूनिटी के असली टूल्स के नाम क्या हैं।
  • "सिंपल लॉजिक" वाले गेम्स: कॉन्सेप्ट्स जैसे कैप्चर (किसी वस्तु का स्वामित्व लेना) अजीब तरह से "आसान" थे। वे मुख्य रूप से हाइजीन एरर्स के साथ विफल हुए। AI ने लॉजिक तो सही समझा (मुझे ट्रैक करना होगा कि किसके पास यह आइटम है) लेकिन बुनियादी कोड स्ट्रक्चर में गलती कर दी। उसे नकली इंजन टूल्स बनाने की जरूरत नहीं पड़ी क्योंकि लॉजिक इतना सरल था कि इसे बेसिक वेरिएबल्स के साथ किया जा सकता था।

"साइज" का जाल (The "Size" Trap)
आप सोच सकते हैं, "शायद एक बड़ा दिमाग असली टूल के नाम जान लेगा!" पेपर ने 7 बिलियन से 30 बिलियन पैरामीटर्स तक के मॉडल्स का परीक्षण किया।

  • निष्कर्ष: बड़ा होने का मतलब बेहतर होना नहीं था। 30-बिलियन मॉडल भी 7-बिलियन मॉडल की तरह ही वर्किंग गेम नहीं बना पाया। इसने बस अलग तरह की गलतियाँ कीं। बड़े मॉडल्स सख्त टेम्पलेट्स का पालन करने में बेहतर थे, लेकिन वे अभी भी असली इंजन टूल्स के बीच के अंतर को पाटने में असमर्थ थे।

डिजाइनर्स के लिए सीख (The Takeaway for Designers)
पेपर निष्कर्ष निकालता है कि बाधा (bottleneck) यह नहीं है कि AI "मूर्ख" है या निर्देश खराब थे। बाधा ज्ञान की कमी है। AI के पास यूनिटी गेम इंजन का विशिष्ट, अपडेटेड डिक्शनरी (शब्दकोश) नहीं है।

यदि आप चाहते हैं कि कोई AI एक ही शॉट में गेम बनाए, तो आप केवल उसे "अधिक मेहनत करने" या "टेम्पलेट का पालन करने" के लिए नहीं कह सकते। आपको उसे गेम इंजन का वास्तविक मैनुअल देना होगा। जब तक ऐसा नहीं होता, AI "जादुई ईंटों" से महल बनाने की कोशिश करता रहेगा जो वास्तव में मौजूद ही नहीं हैं। पेपर सुझाव देता है कि फिलहाल, इंसानों को ही ब्लूप्रिंट थामे रखना होगा, AI का उपयोग उसके कठिन हिस्सों में मदद के लिए करना होगा, लेकिन एक ही ड्राफ्ट में उससे पूरा घर बनाने की उम्मीद नहीं करनी चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →