← नवीनतम पेपर
🤖 AI

WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis

यह शोध पत्र WorldCoder-Bench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसमें 2,026 विशेषज्ञ-क्यूरेटेड कार्य और StateProbe निष्पादन-आधारित प्रोटोकॉल शामिल हैं, ताकि ब्राउज़र-नेटिव वातावरण में भौतिक रूप से आधारित, संवादात्मक 3D दुनिया को संश्लेषित करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन और सत्यापन किया जा सके, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल स्टेट कंसिस्टेंसी (अवस्था निरंतरता) और इंटरेक्शन चेन्स (परस्पर क्रिया श्रृंखलाओं) को बनाए रखने में काफी संघर्ष करते हैं।

मूल लेखक: Shuo Lu, Yinuo Xu, Kecheng Yu, Siru Jiang, Yongcan Yu, Yubin Wang, Haitao Yang, Yuxiang Zhang, Bin Wang, Ran He, Jian Liang

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuo Lu, Yinuo Xu, Kecheng Yu, Siru Jiang, Yongcan Yu, Yubin Wang, Haitao Yang, Yuxiang Zhang, Bin Wang, Ran He, Jian Liang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट आर्किटेक्ट को एक आभासी खेल का मैदान (virtual playground) बनाने के लिए काम पर रख रहे हैं, जो आपके द्वारा दिए गए एक सरल विवरण पर आधारित हो, जैसे कि "एक बास्केटबॉल गेम बनाओ जहाँ गेंद वास्तविक रूप से उछले।"

अतीत में, यदि आप किसी AI को एक वेबसाइट बनाने के लिए कहते थे, तो आप बस स्क्रीन को देख सकते थे। यदि बटन सही दिखते थे और रंग अच्छे थे, तो आप मान लेते थे कि वह काम कर रहा है। लेकिन एक वेब ब्राउज़र के भीतर एक 3D दुनिया (जैसे कि एक वीडियो गेम या भौतिकी सिम्युलेटर) बनाना अलग है। यह एक ऐसा घर बनाने जैसा है जिसकी दीवारें अदृश्य कांच की बनी हैं। आप बाहर देख सकते हैं, लेकिन आप केवल एक तस्वीर देखकर यह नहीं बता सकते कि नींव मजबूत है, या दरवाजे वास्तव में खुलते हैं, या गुरुत्वाकर्षण (gravity) सही ढंग से काम कर रहा है।

यह पेपर WorldCoder-Bench पेश करता है, जो यह परीक्षण करने का एक नया तरीका है कि क्या AI वास्तव में इन कामकाजी 3D दुनियाओं को बना सकता है, न कि केवल उनकी सुंदर तस्वीरें।

यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) के साथ विवरण दिया गया है:

1. समस्या: "ब्लैक बॉक्स" कैनवास

जब एक AI एक 3D दुनिया बनाता है, तो वह ऐसा कोड लिखता है जो ब्राउज़र के एक छिपे हुए क्षेत्र में चलता है जिसे <canvas> कहा जाता है।

  • पुराना तरीका: पिछले परीक्षण एक ऐसे आलोचक को काम पर रखने जैसा था जो केवल खेल के मैदान की तस्वीर देखता है। वे कह सकते हैं, "फिसलने वाला झूला नीला दिखता है, इसलिए यह अच्छा है!" लेकिन वे यह नहीं देख सकते कि क्या झूला वास्तव में जमीन से जुड़ा हुआ है या क्या गेंद किनारे से लुढ़क जाती है।
  • वास्तविकता: AI एक आदर्श दिखने वाला बास्केटबॉल हूप (hoop) बना सकता है, लेकिन यदि कोड गलत है, तो गेंद बिना स्कोर किए हूप के आर-पार तैर सकती है, या छूने पर हूप गायब हो सकता है। पुराने परीक्षणों ने इन "अदृश्य" विफलताओं को मिस कर दिया।

2. समाधान: "स्टेट प्रोब" (द इनविजिबल इंस्पेक्टर)

लेखकों ने StateProbe नामक एक नया टूल बनाया है। केवल एक फोटो लेने के बजाय, यह टूल एक अदृश्य निरीक्षक (inspector) की तरह है जो आभासी दुनिया के अंदर चलता है।

  • यह कैसे काम करता है: इस निरीक्षक के पास मानव विशेषज्ञों द्वारा लिखा गया एक गुप्त चेकलिस्ट ("कॉन्ट्रैक्ट") है। यह केवल दृश्य को नहीं देखता; यह दुनिया के "वाइटल साइन्स" (vital signs) की जांच करने के लिए कोड के अंदर तक पहुँचता है।
  • यह क्या जाँचता है:
    • भौतिकी (Physics): क्या गेंद वास्तव में सही गति से गिर रही है?
    • परस्पर क्रिया (Interaction): जब मैं बटन पर क्लिक करता हूँ, तो क्या गेम वास्तव में क्लिक को रजिस्टर करता है, या बटन सिर्फ एक ड्राइंग है?
    • स्थिति (State): यदि मैं एक अंक प्राप्त करता हूँ, तो क्या स्कोर काउंटर वास्तव में बढ़ता है, या वह शून्य पर अटका हुआ है?

यह सुनिश्चित करने के लिए कि निरीक्षक सख्त हो, उन्होंने म्यूटेशन टेस्टिंग (Mutation Testing) नामक एक ट्रिक का उपयोग किया। उन्होंने जानबूझकर AI के कोड को छोटे तरीकों से बिगाड़ा (जैसे गुरुत्वाकर्षण को बहुत कमजोर करना या स्कोर बटन को छिपा देना) यह देखने के लिए कि क्या निरीक्षक गलती पकड़ पाता है। यदि निरीक्षक चूक गया, तो उन्होंने निरीक्षक को ठीक किया। यह सुनिश्चित करता है कि परीक्षण सख्त और निष्पक्ष है।

3. परीक्षण: WorldCoder-Bench

उन्होंने 2,026 विभिन्न चुनौतियों के साथ एक विशाल परीक्षण सूट बनाया है।

  • कार्य: ये सरल चीजों (जैसे गेंद को उछालना) से लेकर जटिल चीजों (जैसे रासायनिक प्रतिक्रियाओं का अनुकरण करना या एक ऐसा गेम बनाना जहाँ आपको बास्केटबॉल निशाना लगाना हो) तक फैले हुए हैं।
  • नियम: AI को एक प्राकृतिक भाषा निर्देश मिलता है (जैसे, "एक गेम बनाओ...") और उसे एक एकल वेब पेज बनाना होता है। उसे गुप्त चेकलिस्ट या निरीक्षक के नियमों को देखने का मौका नहीं मिलता।

4. परिणाम: AI अभी भी सीख रहा है

उन्होंने दुनिया के शीर्ष 9 AI मॉडलों का परीक्षण किया। परिणाम आश्चर्यजनक थे:

  • स्कोर: सर्वश्रेष्ठ AI भी केवल लगभग 28% परीक्षणों को पास कर सका।
  • भ्रम (The Illusion): कई AI ने ऐसी दुनिया बनाई जो स्क्रीनशॉट में एकदम सही दिखती थी लेकिन "अदृश्य निरीक्षक" के परीक्षण में विफल रही। उन्होंने दृश्य तो बनाए लेकिन भौतिकी के नियमों या बटनों को गेम लॉजिक से जोड़ने के तरीके को भूल गए।
  • मुख्य गलतियाँ: AI आमतौर पर "लुक" को सही रखता था लेकिन इसमें विफल रहा:
    • स्कीमा ड्रिफ्ट (Schema Drift): AI ने निरीक्षक को बताए बिना खेल के नियम बदल दिए (उदाहरण के लिए, गेंद लाल होनी चाहिए, लेकिन AI ने उसे नीला बना दिया और स्कोर को अपडेट नहीं किया)।
    • टूटी हुई कड़ियाँ (Broken Chains): AI ने एक दरवाजा बनाया, लेकिन उसने हैंडल को दरवाजे से नहीं जोड़ा, जिससे वह खुल नहीं सका।

5. "वैल्यू" चेक: क्या यह पैसे के लायक है?

लेखकों ने यह भी गणना की कि क्या इन AI का उपयोग करने से मानव डेवलपर को काम पर रखने की तुलना में पैसा बचता है।

  • ट्विस्ट: भले ही AI अक्सर विफल होते हैं, लेकिन वे इतने सस्ते और तेज़ हैं कि सरल कार्यों के लिए, वे अभी भी बहुत पैसा बचाते हैं। यह एक बहुत ही सस्ते, बहुत तेज़ प्रशिक्षु (apprentice) को रखने जैसा है जो आसान काम जल्दी से कर देता है लेकिन जटिल कार्यों के लिए उसे इंसान की जरूरत होती है।
  • मेट्रिक: उन्होंने एक "रिटर्न ऑन ऑटोमेशन" स्कोर बनाया। आसान कार्यों (जैसे एक शानदार विजुअल इफेक्ट बनाना) के लिए, AI एक बेहतरीन सौदा है। कठिन कार्यों (जैसे जटिल भौतिकी) के लिए, AI अभी भी इंसान की जगह लेने के लिए बहुत अविश्वसनीय है।

सारांश

WorldCoder-Bench AI के लिए एक वास्तविकता की जाँच (reality check) है। यह हमें सुंदर तस्वीरों से धोखा देने से रोकता है और AI को यह साबित करने के लिए मजबूर करता है कि उसकी 3D दुनिया वास्तव में अंदर से काम करती है। अभी, सर्वश्रेष्ठ AI मॉडल उन प्रतिभाशाली कलाकारों की तरह हैं जो कार की एक आदर्श तस्वीर तो पेंट कर सकते हैं लेकिन इंजन बनाना नहीं जानते जो वास्तव में चलता हो। हम करीब पहुँच रहे हैं, लेकिन इससे पहले कि वे अपने आप पूरी तरह कार्यात्मक, इंटरैक्टिव दुनिया बना सकें, अभी एक लंबा रास्ता तय करना बाकी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →